OpenAI의 Astra for Law는 새 모델이 아니다, 2억 3000만 URL 법률 색인이다

법률 전용 코퍼스를 붙인 GPT-6 Astra 구성이 Vals AI 리걸 리서치 벤치 정확도를 38.7%에서 54%로 끌어올렸다. 파트너 플러그인 26종과 Am Law 200 대상 접근 프로그램도 함께 나왔다

|5분 읽기0
OpenAI's Astra for Law replaces open web search with a curated corpus of US case law, statutes and regulations spanning more than 230 million URLs
OpenAI's Astra for Law replaces open web search with a curated corpus of US case law, statutes and regulations spanning more than 230 million URLs

OpenAI가 9월 17일 로펌과 리걸테크 업체를 겨냥한 Astra for Law를 내놨다. GPT-6 Astra 모델을 법률 업무에 맞춰 구성한 제품이다. 회사는 Astra for Law 발표문에서 새로 학습한 모델은 없다고 못 박았다. 실제로 내놓은 것은 2억 3000만 개가 넘는 URL을 담은 법률 검색 색인과 도메인 전용 지시문, 응답 설정, 그리고 기존 프런티어 모델을 감싼 도구다.

핵심 요약

  • Vals AI가 운영하는 리걸 리서치 벤치의 비공개 검증 세트 200문항에서 Astra for Law는 종합 정확도 54%를 기록했다. 일반 웹 검색을 쓴 GPT-6 Astra는 38.7%에 그쳐, 15.3%포인트 차이이자 상대적으로 40% 앞섰다.
  • 법률 검색 색인은 미국 판례법과 제정법, 규정, 법원 규칙, 행정 결정을 아우르며 비영리단체 Free Law Project의 CourtListener를 토대로 삼았다.
  • 이용은 Am Law 200 로펌을 겨냥한 Trusted Access 프로그램을 통해 열린다. API는 데이터를 저장하지 않고, ChatGPT Enterprise 사용분은 사람의 검토 대상에서 빠진다.

벤치마크 수치가 실제로 말하는 것

이번 비교는 같은 모델끼리 맞붙인 결과다. 양쪽 모두 추론 강도를 최고로 놓았을 때, 법률 색인을 붙인 쪽은 문항의 54%에서 정확도 검증을 통과했고 일반 웹 검색을 쓴 동일 모델은 38.7%에 머물렀다. 판례 문항에서는 참조 판례를 24% 더 찾아냈고, 같은 추론 강도에서 정확한 판결문 속 관련 구절을 최대 54% 더 끌어왔다. 답변 길이는 평균 두 배가량 길었다.

이 구도는 유용한 동시에 한계가 뚜렷하다. 개방형 웹 검색 대비 근거 기반 검색 증강의 가치를 떼어내 보여준다는 점에서 정직한 측정이다. 다만 같은 벤치마크에서 Harvey나 Legora, CoCounsel과 견주면 어떤지는 말해주지 않는다. 정확도 54%는 리서치 답변 두 건 중 한 건이 평가 기준을 통과하지 못했다는 뜻이기도 하다.

색인이 곧 제품인 이유

OpenAI가 지난 6월 법률 제품 총괄로 영입한 Ironclad 공동창업자 제이슨 뵘히그는 LawSites가 전한 기자 브리핑에서 이것은 새 모델이 아니라 모델 구성이라고 선을 그었다. 법률 문서 작성용 도메인 지시문, 응답 길이 같은 제어 장치, 앞으로 넓혀갈 법률 전용 도구가 핵심이라는 설명이다. 제품을 이끄는 엔지니어 셔윈 우는 장애 차별 소송에 휘말린 병원의 소 각하 신청서 작성, 졸속 자산 매각을 문제 삼은 주주 이의 제기, 판매 약정 분쟁 처리를 시연했다.

전략적 함의는 로펌과 업체가 더는 법률 코퍼스를 직접 구축하고 관리하지 않아도 된다는 데 있다. 리걸 AI 스타트업들이 차별점으로 삼아온 계층을 정면으로 파고든 셈이다. 게다가 그 스타트업들이 고객이 되는 구도다. Harvey와 Legora는 자신들의 검색 계층을 플랫폼 기본 기능으로 내놓은 제품의 API 고객으로 이름을 올렸다.

플러그인과 파트너, 그 위에 올라탄 로펌들

OpenAI는 출시와 함께 Thomson Reuters, Harvey, Legora, iManage 등이 만든 파트너 플러그인 26종과 리걸 엔지니어들이 개발한 커뮤니티 플러그인 9종을 함께 공개했다. 회사가 직접 만들지 않고 법률 분야 헤비 유저들이 만들었다고 밝힌 맞춤 스킬 47종도 포함됐다. ChatGPT for Word도 정식 출시되면서, 실제 법률 문서 작업이 이뤄지는 문서 안에서 교정과 수정 제안을 받을 수 있게 됐다.

이미 여러 로펌이 OpenAI 엔지니어를 현장에 상주시키며 ChatGPT Enterprise 위에 시스템을 쌓았다. Sullivan & Cromwell은 자체 협상 플레이북과 선례를 반영한 계약서 분석 도구를, Ropes & Gray는 소속 변호사들이 데이터룸을 다루는 방식에 맞춘 M&A 실사 도구를, Cooley는 IPO 준비용 자본시장 시스템을 만들었다. Latham & Watkins는 정보 접근 권한과 윤리적 차단벽, 로펌 감독 체계를 놓고 OpenAI와 협업 중이다.

벤치마크와 나란히 읽으면 플러그인 목록은 OpenAI가 남은 가치를 어디에 두는지 드러낸다. 검색은 플랫폼 기능으로 범용화되고, 사건 맥락과 문서 관리, 청구 연동은 파트너 몫으로 남았다. 더 나은 법률 코퍼스를 차별점으로 삼았던 업체들은 이제 그 차별점을 모델 제작사가 서 있지 않은 자리로 옮겨야 한다.

로펌이 실제로 따질 대목

데이터를 남기지 않는다는 약속에 예외가 있느냐는 질문에 뵘히그는 그 한 문장이 약 30쪽짜리 접근 계약서를 요약한 것이며, 문장이 주는 인상보다 복잡하지만 요구 수준은 충족한다고 답했다. 이를 검토하는 사내 법무 책임자에게는 이 답변이 핵심이다. 전문직 책임 의무는 제품 소개 페이지가 아니라 계약서에 붙기 때문이다. 로펌은 제품 페이지를 근거로 비밀 유지 의무를 다했다고 말할 수 없고, 예외 조항은 그 30쪽 안에 있다.

경쟁 구도의 배경에는 앞서 나온 Anthropic의 Claude for Legal이 있다. 이제 패턴은 익숙하다. 프런티어 모델을 가져와 선별한 코퍼스와 도메인 지시문을 붙이고 버티컬 제품으로 판다. OpenAI는 금융에서도 ChatGPT의 월스트리트 구성을 내놓으며 같은 수를 뒀다. 다음 몇 개도 같은 방식으로 나올 것으로 보인다. 비싼 부분이 더는 모델이 아니기 때문이다.

자주 묻는 질문

Astra for Law는 OpenAI의 새 모델인가?

아니다. OpenAI는 GPT-6 Astra를 법률 업무에 맞춰 구성한 제품이라고 설명한다. 기존 모델에 법률 전용 검색 색인과 도메인 지시문, 법률 도구를 결합했다. 뵘히그는 기자 브리핑에서 이 구분을 분명히 했다.

지금 누가 Astra for Law를 쓸 수 있나?

Harvey와 Legora를 포함한 API 고객에게 제공될 예정이며, Am Law 200 로펌을 대상으로 한 Trusted Access 프로그램을 통해 선정된 로펌에 열린다. 해당 로펌은 ChatGPT와 Codex의 모델 선택 목록에서 쓸 수 있다. 개인 변호사가 곧바로 쓸 수 있는 제품은 아니다.

법률 검색 색인은 어디서 왔나?

미국 판례법과 제정법, 규정, 법원 규칙, 행정 결정을 담은 2억 3000만 개 이상의 URL로 이뤄졌고 출처는 계속 추가된다. OpenAI는 비영리단체 Free Law Project가 운영하는 리서치 라이브러리 CourtListener를 활용했다고 밝혔다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

OpenAI, 데이터 에이전트와 월스트리트용 ChatGPT를 하루에 함께 내놨다
LLM & Chatbots

OpenAI, 데이터 에이전트와 월스트리트용 ChatGPT를 하루에 함께 내놨다

OpenAI가 같은 목요일에 ChatGPT Work용 Data 에이전트와 Morgan Stanley·Evercore가 함께 만든 ChatGPT for Financial Services를 공개했다.

Seung Jung8일 전
업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다
LLM & Chatbots

업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다

OpenAI의 GPT-6 Astra가 컴퓨터 사용 기능과 100만 토큰 컨텍스트, 10/50달러 가격으로 기업 사용자에게 풀린다. 대표 점수에는 하네스 단서가 붙는다.

Seung Jung8일 전
ChatGPT Images 2.5, 생성 속도 두 배로… 스케치 캔버스도 붙였다
LLM & Chatbots

ChatGPT Images 2.5, 생성 속도 두 배로… 스케치 캔버스도 붙였다

OpenAI가 ChatGPT Images 2.5를 내놨다. 지연 시간을 최대 50% 줄이고 Sketch 캔버스와 템플릿, 고정 댓글, API 모델 두 종을 함께 공개했다.

Seung Jung7일 전
ChatGPT는 쇼핑 답변 79%에서 콕 집어 추천한다, Gemini는 7%
LLM & Chatbots

ChatGPT는 쇼핑 답변 79%에서 콕 집어 추천한다, Gemini는 7%

AI 쇼핑 답변 1,536건 감사에서 ChatGPT는 79%가 1인칭 선호를 밝힌 반면 Gemini는 7%에 그쳤다. 인용 출처도 거의 겹치지 않았다.

Seung Jung어제
iOS 27 코드, Siri 서버 모델을 Claude·GPT-5.6으로 교체할 수 있다
LLM & Chatbots

iOS 27 코드, Siri 서버 모델을 Claude·GPT-5.6으로 교체할 수 있다

iOS 27과 macOS 27 Golden Gate의 비공개 프레임워크에서 Model Delegation API와 Inference Provider 프로토콜이 발견됐다. Siri의 플래너를 Claude에 넘길 수 있는 구조다.

Seung Jung그저께
Claude는 성인 전용, 그런데 연령 감지기가 성인까지 차단한다
LLM & Chatbots

Claude는 성인 전용, 그런데 연령 감지기가 성인까지 차단한다

Anthropic이 Claude의 18세 이상 정책 집행 방식을 공개했다. 분류기가 미성년자 의심 계정을 비활성화하고, 잘못 걸린 성인은 Yoti 검증으로 계정을 되찾는다.

Seung Jung7일 전