기업들이 자사 비공개 소스코드를 AI 평가 데이터로 팔기 시작했다

Specific Labs가 소비자 제품 기업과 핀테크 플랫폼에 대가를 치르고 저장소 접근권을 확보했다. 크롤링으로는 만들 수 없는 평가 자산이다

|5분 읽기0
Production source code of the kind Specific Labs now licenses from operating businesses to evaluate AI coding agents
Production source code of the kind Specific Labs now licenses from operating businesses to evaluate AI coding agents

이용자 20만 명을 넘긴 소비자 제품 기업과 은행 거래내역서 10만 건 이상을 처리한 핀테크 플랫폼이 자사 비공개 저장소를 두고 이례적인 선택을 했다. 평가 전문 기업에 라이선스를 내준 것이다. Y Combinator의 투자를 받은 Specific Labs는 이 코드베이스들을 모아 Real-SWE를 만들었고, 그 과정에서 독점 코드는 AI 업계가 돈을 주고 사는 상품이 됐다.

핵심 요약

  • Specific Labs는 오픈소스 프로젝트를 긁어모으는 대신 실제 영업 중인 기업의 프로덕션 저장소를 라이선스해, 어떤 모델도 사전학습 단계에서 읽었을 리 없는 평가 자료를 확보했다.
  • 이 회사는 실제 기업 내부 토큰의 99%가 프런티어 모델에게 보이지 않는다고 추산한다. 라이선스 시장이 존재하는 이유가 바로 이 공급 공백이다.
  • 검증기는 채점 시점에만 주입되며 각 코드베이스에 이미 있는 테스트 스위트에서 가져온다. 따라서 라이선스 계약은 코드뿐 아니라 테스트까지 아울러야 한다.

셈법은 말로 풀어놓고 보면 단순하다. 공개된 평가 자료에는 유통기한이 있다. 공개된 것은 결국 학습 코퍼스에 들어가고, 그 순간부터 암기와 추론을 구분해내지 못하기 때문이다. 비공개 코드에는 그런 감가가 없다. 대신 주인이 있고, 손에 넣으려면 크롤링이 아니라 협상을 해야 한다.

라이선스한 코드베이스가 담아야 할 것

소스 접근권만으로는 평가를 만들지 못한다. Specific Labs는 각 에이전트를 격리된 샌드박스에서 돌리고, 과제는 Harbor 포맷으로 저장하며, 채점 시점에 검증기를 주입한다. 이 검증기는 코드베이스에 이미 있던 테스트에서 착안하거나 그대로 가져온 것이다. 쓸 만한 라이선스라면 저장소와 테스트 스위트, 그리고 과제를 현실적으로 만들어주는 이슈 이력까지 함께 넘겨야 한다.

그렇게 나온 과제는 잘 다듬은 퍼즐과는 거리가 멀다. 하나는 청구서마다 해당 기업 고유의 세금 모드로 흘려보내는 과제로, 세무 당국 제공자를 거치는 도착지 기준 가격 책정까지 포함한다. 다른 하나는 상품과 사용량의 소유권을 서비스에서 고객으로 옮기면서 기존 읽기 동작을 깨뜨리지 않는 과제다. 세 번째는 활성화된 AWS 리전을 전부 찾아내 블록 스토리지 인벤토리를 훑되, 리전 하나가 실패해도 전체가 무너지지 않게 하는 과제다.

기업마다 고유한 규칙과 코드 작성 방식이 있다. 에이전트는 그 관행을 이해하고, 이미 있는 것과 맞물려 돌아가는 변경을 내놓아야 한다.

범위도 여기서 따라 나온다. Real-SWE 해법이 손대는 파일은 중앙값 11개로, FrontierCode나 DeepSWE 같은 공개 스위트의 중앙값 6개의 거의 두 배다. 사업이 돌아가는 방식을 바꾸는 변경이 서비스 하나 안에 머무는 경우는 드물다.

라이선스 데이터가 드러낸 것

첫 결과는 라이선스를 내준 쪽에도 내세울 거리를 준다. Claude Code에서 돌린 Claude Fable 5.1이 38.8%로 선두였고, Codex CLI의 GPT-6 Astra가 33.8%, Gemini CLI의 Gemini 3.8 Flash가 31.2%로 뒤를 이었다. 해결률은 과제당 독립 실행 8회를 평균한 pass@1이며 95% 신뢰구간과 함께 공개됐다.

비슷한 계약을 검토하는 쪽이라면 짚고 넘어가야 할 대목이 있다. 이 점수는 모델만이 아니라 하네스에 묶여 있다. Real-SWE는 각 시스템을 자체 도구와 짝지어 평가하는데, 기업 엔지니어가 일하는 방식이 그렇기 때문이다. 결국 라이선스한 저장소가 재는 것은 모델과 스캐폴드, IDE 관행을 묶은 워크플로 전체다. 같은 가중치라도 다른 스캐폴드에 태우면 결과는 전혀 달라질 수 있다.

이 시장이 커질 수밖에 없는 이유

AI 코딩 어시스턴트를 사는 쪽은 리더보드 숫자가 자사 시스템에서도 버텨줄지 확인할 방법이 마땅치 않고, 파는 쪽은 그걸 확인해줄 시험을 만들 이유가 없다. 비공개 코드에 값을 치르는 독립 기관은 그 사이에 자리를 잡는다. 공개 벤치마크가 붐빌수록 그 자리의 값어치는 올라간다. Anthropic과 OpenAI, Google 모두 이 리더보드에 모델을 올려두고 있지만, 그 뒤의 데이터를 쥔 곳은 어디도 없다.

유보할 대목도 분명하다. 과제 10개는 작은 표본이고, 이 시도만으로 공개 벤치마크가 오염 탓에 부풀려졌다고 증명되지는 않는다. 라이선스 방식은 계약을 감당할 수 있는 쪽에 평가 권한을 몰아주기도 한다. 외부에서 내용물을 들여다볼 수 없는 벤치마크는 공개 데이터셋과는 다른 종류의 신뢰를 요구한다. 방법론만 공개하고 결과는 내놓지 않은 최근의 다른 에이전트 벤치마크에서도 같은 긴장이 보인다.

자주 묻는 질문

기업이 왜 비공개 소스코드를 라이선스하나?

비공개 코드는 한 번도 공개된 적이 없다는 바로 그 이유로 평가 기업에 가치가 있다. 모델 학습 데이터로 새어 들어갔을 수 없기 때문이다. 평가 기업이 값을 치르는 대상이 그 희소성이고, 라이선스를 내준 쪽은 오픈소스로 풀지 않고도 대가를 받는다.

Real-SWE는 라이선스한 코드를 공개하나?

공개하지 않는다. 코드와 참조 해법을 비공개로 두는 것이 이 벤치마크의 전제다. Specific Labs는 저장소 대신 과제 설명과 점수를 공개한다.

Real-SWE에서 가장 높은 점수를 낸 모델은?

Claude Code로 구동한 Claude Fable 5.1이 38.8%로 1위였고, Codex CLI의 GPT-6 Astra가 33.8%, Gemini CLI의 Gemini 3.8 Flash가 31.2%로 뒤를 이었다. 시험한 모든 시스템이 과제 절반 이상을 풀지 못했다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

OpenAI "자체 모델이 Jalapeño 설계를 9개월로 줄였다"
Tech & Business

OpenAI "자체 모델이 Jalapeño 설계를 9개월로 줄였다"

AI가 작성한 커널이 OpenAI 전문가의 구현을 최대 1.8배 앞섰다. Jalapeño의 첫 InferenceX 벤치마크 결과가 공개됐다.

Seung Jung23일 전
AI 에이전트가 RubyGems에 패키지 2,000개를 쏟아냈다. 신규 가입은 나흘간 막혔다
Developer Tools

AI 에이전트가 RubyGems에 패키지 2,000개를 쏟아냈다. 신규 가입은 나흘간 막혔다

포렌식 보고서가 5월 GemStuffer 캠페인을 재구성했다. AI 에이전트가 gem 2,000개 이상을 올려 RubyGems가 나흘간 신규 가입을 동결하게 만든 사건이다.

Seung Jung6일 전
Shopify, 테일윈드랩스 인수… AI 코딩 도구가 무너뜨린 프레임워크 사업
Developer Tools

Shopify, 테일윈드랩스 인수… AI 코딩 도구가 무너뜨린 프레임워크 사업

Shopify가 Tailwind CSS 개발사 테일윈드랩스를 인수했다. 프레임워크는 MIT 라이선스를 유지하는 대신 Tailwind Plus와 ui.sh는 신규 가입을 받지 않는다.

Seung Jung6일 전
LLM 버그 수정기, 멀쩡한 코드를 고친 것보다 열 배 더 망가뜨렸다
Developer Tools

LLM 버그 수정기, 멀쩡한 코드를 고친 것보다 열 배 더 망가뜨렸다

arXiv 연구에서 LLM 수리 루프의 정상 코드 손상률은 0.261, 버그 코드 수리율은 0.023으로 나왔다. 연구진은 이를 몰고 가는 내부 방향까지 찾아냈다.

Seung Jung5일 전
GitHub 하이드라퓨전, 모델을 고르지 않는다. 워크플로를 짠다
Developer Tools

GitHub 하이드라퓨전, 모델을 고르지 않는다. 워크플로를 짠다

GitHub의 프로젝트 하이드라퓨전은 Copilot 코딩 요청마다 다중 모델 실행 계획을 짠다. 단일 모델의 단순함을 내주고 비용을 크게 낮췄다.

Seung Jung5일 전
OpenAI, 말하면서 듣는 음성 모델을 분당 5센트에 개발자에게 개방
Developer Tools

OpenAI, 말하면서 듣는 음성 모델을 분당 5센트에 개발자에게 개방

OpenAI의 풀듀플렉스 음성 모델 GPT-Live-1이 분당 0.05달러로 API에 공개됐다. Tau3 벤치마크에서 86.2%를 기록해 이전 모델 45.7%를 크게 앞섰다.

Seung Jung7일 전