Anthropic이 28일(현지시간) Claude Sonnet 5.5를 공개했다. 주목할 숫자는 가격이 아니라, 저렴한 모델이 비싼 모델을 이긴 벤치마크다. Anthropic이 직접 공개한 성적표를 보면 Sonnet 5.5는 에이전틱 코딩 평가인 Terminal-Bench 4.0에서 70.6%를 기록했다. Claude Opus 5.5는 66.4%였다. 출시 3개월째인 Sonnet 5는 같은 시험에서 10.3%에 그쳤다.
Key takeaways
- Sonnet 5.5는 Terminal-Bench 4.0에서 70.6%를 받아 더 비싼 Opus 5.5의 66.4%를 앞섰다.
- 가격은 Sonnet 5와 동일한 100만 입력 토큰당 2달러, 출력 토큰당 10달러다. 비용 절감은 단가 인하가 아니라 토큰을 덜 쓰는 데서 나온다.
- Balyasny Asset Management는 Sonnet 5가 답변 하나에 49만 7000토큰을 쓰던 작업을 12만 1000토큰으로 처리했다고 밝혔다.
비용 30% 절감은 어디서 나오는가
Anthropic이 앞세운 수치는 생성 속도 30% 이상 향상, 작업당 비용 최대 30% 절감이다. 두 번째 숫자는 오해하기 쉽다. 표시 가격은 움직이지 않았다. 입력은 100만 토큰당 2달러, 출력은 10달러 그대로이고 캐시 읽기는 0.20달러, 캐시 쓰기는 2.50달러다. 절감은 모델이 더 적은 토큰과 더 적은 도구 호출로 작업을 끝내는 데서 생긴다. 성격이 다른 개선이며, 워크로드가 에이전틱할 때만 청구서에 나타난다.
Anthropic이 함께 공개한 고객사 수치가 이를 구체적으로 보여준다. Slack은 거의 모든 평가에서 Sonnet 5와 같거나 더 나은 결과를 더 적은 단계로 얻었고 출력 토큰은 약 14% 줄었다고 전했다. Box는 결과가 2.4배 빨라지고 전체 토큰은 12% 줄었다고 측정했다. Lovable은 도구 호출이 3분의 1, 셸 실행이 절반 가까이 줄었다고 밝혔다. 가장 두드러진 수치는 Balyasny Asset Management에서 나왔다. Sonnet 5가 49만 7000토큰을 태웠던 답변을 12만 1000토큰으로 끝냈다.
벤치마크 표를 읽는 법
Sonnet 5.5는 거의 모든 항목에서 Opus 5.5에 근접하고, 한 곳에서 앞선다. OSWorld 2.1에서는 80.1%로 Opus 5.5의 81.8%에 미치지 못했지만 Sonnet 5의 57.0%에서는 크게 올랐다. Humanity's Last Exam은 64.5% 대 67.7%다. GDPval-AA v2.1은 1844와 1846으로 사실상 동률이고, AA-Briefcase v1.1은 1811 대 1822로 차이가 작다. Terminal-Bench는 Anthropic이 에이전틱 코딩으로 분류한 세 시험 중 Sonnet 5.5가 이긴 유일한 항목이다. CursorBench 4.0은 Opus 5.5가 57.8% 대 55.5%로, FrontierCode 1.1은 54.4% 대 46.2%로 앞선다. Anthropic은 FrontierCode에서 Sonnet 5.5가 Xhigh보다 Max 설정에서 점수가 낮다고 설명했다. Max에서는 코드 리뷰 스킬을 더 자주 실행해 범위를 벗어난 수정과 타임아웃을 만들었고, 벤치마크가 이를 감점하기 때문이다.
주의해서 볼 대목은 Sonnet 5 열이다. Terminal-Bench 4.0에서 10.3%에서 70.6%로, Chartography에서 15.6%에서 61.6%로 뛴 수치는 능력이 일곱 배 늘었다는 뜻이 아니다. 이전 세대가 해당 하네스를 제대로 다루지 못했다는 사실을 말해준다. 같은 조건의 비교는 Sonnet 5.5와 Opus 5.5다. 그 비교에서 읽히는 것은 중급 모델이 대부분의 작업에서 플래그십과 몇 점 차이로 붙었다는 점, 그리고 같은 예산으로 더 많은 에이전트를 동시에 돌릴 수 있다는 점이다.
Anthropic이 폴백으로 묶어둔 것
Sonnet 5.5에는 이전 세대에 없던 제약이 붙었다. Anthropic은 위험도가 높은 사이버보안 작업에서는 모델이 Sonnet 5로 눈에 보이게 폴백한다고 설명했다. 거부가 아니라 명시적인 하향이다. TechCrunch는 이로써 Sonnet이 그동안 Opus와 Fable에만 적용됐던 사이버 안전장치 아래 놓이는 첫 중급 모델이 됐다고 전했다. 사이버 역량이 이제 Opus 5 수준에 이르렀다는 판단이 근거다. 경쟁사가 추론 과정을 빼내 증류하는 것을 막는 분류기를 달고 출시된 첫 Sonnet이기도 하다. 생물학 안전장치는 Sonnet 5의 기준을 그대로 유지한다.
맥락: 승부는 중급에서 갈린다
플래그십 가격으로 경쟁하는 곳은 이제 없다. OpenAI는 지난주 Sol과 Luna를 내놓으며 중급 토큰 가격을 절반으로 내렸고, Meta는 스마트 글래스 기능을 구동할 모델을 발표했다. Anthropic의 답은 더 싼 가격표가 아니라 그 가격표를 덜 쓰는 모델이다. 프롬프트 캐싱으로 최대 90%, 배치 처리로 50%를 더 아낄 수 있다.
전망
Sonnet 5.5는 Claude.ai에서 쓸 수 있고, 개발자는 Claude Platform과 Amazon Web Services, Google Cloud, Microsoft Azure에서 claude-sonnet-5-5 식별자로 호출할 수 있다. 개편된 Haiku는 몇 주 안에 나올 예정이며 날짜는 확정되지 않았다. 남은 질문은 Opus 5.5의 용도다. 저렴한 모델이 터미널 코딩 벤치마크를 가져가고 지식 노동에서 동률을 만든다면, 플래그십에 남는 근거는 벤치마크로 재기 어려운 문제에서의 판단력뿐이다.
FAQ · 자주 묻는 질문
Claude Sonnet 5.5는 Sonnet 5보다 비싼가
아니다. 가격은 같다. 100만 입력 토큰당 2달러, 출력 토큰당 10달러이고 캐시 읽기는 0.20달러, 캐시 쓰기는 2.50달러다. 작업당 비용을 최대 30% 낮췄다는 Anthropic의 설명은 단가 인하가 아니라 모델이 토큰과 도구 호출을 덜 쓴다는 뜻이다.
Sonnet 5.5가 정말 Opus 5.5를 이겼는가
에이전틱 코딩 평가인 Terminal-Bench 4.0에서는 그렇다. 70.6% 대 66.4%이고, Anthropic은 Opus 5.5의 이 수치가 최고 성능 설정에서 나온 것이라고 밝혔다. 다만 Anthropic이 공개한 에이전틱 코딩 벤치마크 세 개 중 Sonnet 5.5가 앞선 것은 이 하나뿐이다. CursorBench 4.0과 FrontierCode 1.1은 Opus 5.5가 앞선다. OSWorld 2.1과 Humanity's Last Exam에서도 Opus 5.5가 1~3점 차로 우위를 지킨다.
개발자는 Sonnet 5.5를 어디서 쓸 수 있는가
Claude Platform에서 기본 제공되며 Amazon Web Services, Google Cloud, Microsoft Azure를 통해서도 claude-sonnet-5-5 식별자로 호출할 수 있다. 일반 사용자는 Claude.ai에서 쓸 수 있다.






