Anthropic Sonnet 5.5, 에이전틱 코딩서 Opus 5.5 앞질렀다

중급 모델이 Sonnet 5의 100만 입력 토큰당 2달러 가격을 유지한 가운데, Anthropic은 속도 30% 향상과 작업당 비용 최대 30% 절감을 내세웠다

|5분 읽기0
A user working with a conversational AI assistant, the everyday task profile Anthropic says Sonnet 5.5 is tuned for.
A user working with a conversational AI assistant, the everyday task profile Anthropic says Sonnet 5.5 is tuned for.

Anthropic이 28일(현지시간) Claude Sonnet 5.5를 공개했다. 주목할 숫자는 가격이 아니라, 저렴한 모델이 비싼 모델을 이긴 벤치마크다. Anthropic이 직접 공개한 성적표를 보면 Sonnet 5.5는 에이전틱 코딩 평가인 Terminal-Bench 4.0에서 70.6%를 기록했다. Claude Opus 5.5는 66.4%였다. 출시 3개월째인 Sonnet 5는 같은 시험에서 10.3%에 그쳤다.

Key takeaways

  • Sonnet 5.5는 Terminal-Bench 4.0에서 70.6%를 받아 더 비싼 Opus 5.5의 66.4%를 앞섰다.
  • 가격은 Sonnet 5와 동일한 100만 입력 토큰당 2달러, 출력 토큰당 10달러다. 비용 절감은 단가 인하가 아니라 토큰을 덜 쓰는 데서 나온다.
  • Balyasny Asset Management는 Sonnet 5가 답변 하나에 49만 7000토큰을 쓰던 작업을 12만 1000토큰으로 처리했다고 밝혔다.

비용 30% 절감은 어디서 나오는가

Anthropic이 앞세운 수치는 생성 속도 30% 이상 향상, 작업당 비용 최대 30% 절감이다. 두 번째 숫자는 오해하기 쉽다. 표시 가격은 움직이지 않았다. 입력은 100만 토큰당 2달러, 출력은 10달러 그대로이고 캐시 읽기는 0.20달러, 캐시 쓰기는 2.50달러다. 절감은 모델이 더 적은 토큰과 더 적은 도구 호출로 작업을 끝내는 데서 생긴다. 성격이 다른 개선이며, 워크로드가 에이전틱할 때만 청구서에 나타난다.

Anthropic이 함께 공개한 고객사 수치가 이를 구체적으로 보여준다. Slack은 거의 모든 평가에서 Sonnet 5와 같거나 더 나은 결과를 더 적은 단계로 얻었고 출력 토큰은 약 14% 줄었다고 전했다. Box는 결과가 2.4배 빨라지고 전체 토큰은 12% 줄었다고 측정했다. Lovable은 도구 호출이 3분의 1, 셸 실행이 절반 가까이 줄었다고 밝혔다. 가장 두드러진 수치는 Balyasny Asset Management에서 나왔다. Sonnet 5가 49만 7000토큰을 태웠던 답변을 12만 1000토큰으로 끝냈다.

벤치마크 표를 읽는 법

Sonnet 5.5는 거의 모든 항목에서 Opus 5.5에 근접하고, 한 곳에서 앞선다. OSWorld 2.1에서는 80.1%로 Opus 5.5의 81.8%에 미치지 못했지만 Sonnet 5의 57.0%에서는 크게 올랐다. Humanity's Last Exam은 64.5% 대 67.7%다. GDPval-AA v2.1은 1844와 1846으로 사실상 동률이고, AA-Briefcase v1.1은 1811 대 1822로 차이가 작다. Terminal-Bench는 Anthropic이 에이전틱 코딩으로 분류한 세 시험 중 Sonnet 5.5가 이긴 유일한 항목이다. CursorBench 4.0은 Opus 5.5가 57.8% 대 55.5%로, FrontierCode 1.1은 54.4% 대 46.2%로 앞선다. Anthropic은 FrontierCode에서 Sonnet 5.5가 Xhigh보다 Max 설정에서 점수가 낮다고 설명했다. Max에서는 코드 리뷰 스킬을 더 자주 실행해 범위를 벗어난 수정과 타임아웃을 만들었고, 벤치마크가 이를 감점하기 때문이다.

주의해서 볼 대목은 Sonnet 5 열이다. Terminal-Bench 4.0에서 10.3%에서 70.6%로, Chartography에서 15.6%에서 61.6%로 뛴 수치는 능력이 일곱 배 늘었다는 뜻이 아니다. 이전 세대가 해당 하네스를 제대로 다루지 못했다는 사실을 말해준다. 같은 조건의 비교는 Sonnet 5.5와 Opus 5.5다. 그 비교에서 읽히는 것은 중급 모델이 대부분의 작업에서 플래그십과 몇 점 차이로 붙었다는 점, 그리고 같은 예산으로 더 많은 에이전트를 동시에 돌릴 수 있다는 점이다.

Anthropic이 폴백으로 묶어둔 것

Sonnet 5.5에는 이전 세대에 없던 제약이 붙었다. Anthropic은 위험도가 높은 사이버보안 작업에서는 모델이 Sonnet 5로 눈에 보이게 폴백한다고 설명했다. 거부가 아니라 명시적인 하향이다. TechCrunch는 이로써 Sonnet이 그동안 Opus와 Fable에만 적용됐던 사이버 안전장치 아래 놓이는 첫 중급 모델이 됐다고 전했다. 사이버 역량이 이제 Opus 5 수준에 이르렀다는 판단이 근거다. 경쟁사가 추론 과정을 빼내 증류하는 것을 막는 분류기를 달고 출시된 첫 Sonnet이기도 하다. 생물학 안전장치는 Sonnet 5의 기준을 그대로 유지한다.

맥락: 승부는 중급에서 갈린다

플래그십 가격으로 경쟁하는 곳은 이제 없다. OpenAI는 지난주 Sol과 Luna를 내놓으며 중급 토큰 가격을 절반으로 내렸고, Meta는 스마트 글래스 기능을 구동할 모델을 발표했다. Anthropic의 답은 더 싼 가격표가 아니라 그 가격표를 덜 쓰는 모델이다. 프롬프트 캐싱으로 최대 90%, 배치 처리로 50%를 더 아낄 수 있다.

전망

Sonnet 5.5는 Claude.ai에서 쓸 수 있고, 개발자는 Claude Platform과 Amazon Web Services, Google Cloud, Microsoft Azure에서 claude-sonnet-5-5 식별자로 호출할 수 있다. 개편된 Haiku는 몇 주 안에 나올 예정이며 날짜는 확정되지 않았다. 남은 질문은 Opus 5.5의 용도다. 저렴한 모델이 터미널 코딩 벤치마크를 가져가고 지식 노동에서 동률을 만든다면, 플래그십에 남는 근거는 벤치마크로 재기 어려운 문제에서의 판단력뿐이다.

FAQ · 자주 묻는 질문

Claude Sonnet 5.5는 Sonnet 5보다 비싼가

아니다. 가격은 같다. 100만 입력 토큰당 2달러, 출력 토큰당 10달러이고 캐시 읽기는 0.20달러, 캐시 쓰기는 2.50달러다. 작업당 비용을 최대 30% 낮췄다는 Anthropic의 설명은 단가 인하가 아니라 모델이 토큰과 도구 호출을 덜 쓴다는 뜻이다.

Sonnet 5.5가 정말 Opus 5.5를 이겼는가

에이전틱 코딩 평가인 Terminal-Bench 4.0에서는 그렇다. 70.6% 대 66.4%이고, Anthropic은 Opus 5.5의 이 수치가 최고 성능 설정에서 나온 것이라고 밝혔다. 다만 Anthropic이 공개한 에이전틱 코딩 벤치마크 세 개 중 Sonnet 5.5가 앞선 것은 이 하나뿐이다. CursorBench 4.0과 FrontierCode 1.1은 Opus 5.5가 앞선다. OSWorld 2.1과 Humanity's Last Exam에서도 Opus 5.5가 1~3점 차로 우위를 지킨다.

개발자는 Sonnet 5.5를 어디서 쓸 수 있는가

Claude Platform에서 기본 제공되며 Amazon Web Services, Google Cloud, Microsoft Azure를 통해서도 claude-sonnet-5-5 식별자로 호출할 수 있다. 일반 사용자는 Claude.ai에서 쓸 수 있다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

Opus 5.5, 최대 추론 설정에서 첫 토큰까지 682초 걸렸다
LLM & Chatbots

Opus 5.5, 최대 추론 설정에서 첫 토큰까지 682초 걸렸다

Artificial Analysis가 측정한 Claude Opus 5.5 최대 추론 설정의 첫 토큰 도달 시간은 682.71초다. 동급 모델 중간값은 3.79초다.

Seung Jung19시간 전
Anthropic, 인포스틸러 악성코드가 유료 Claude 계정 사용량을 빼간다 경고
LLM & Chatbots

Anthropic, 인포스틸러 악성코드가 유료 Claude 계정 사용량을 빼간다 경고

Anthropic이 인포스틸러 악성코드에 로그인 세션을 도난당한 Claude 이용자들에게 경고 메일을 보내고 있다. 공격자는 비밀번호 없이 유료 사용량을 태운다.

Seung Jung19일 전
Mercury 2.5, 초당 1,107토큰에 100만 토큰당 4센트로 나왔다
LLM & Chatbots

Mercury 2.5, 초당 1,107토큰에 100만 토큰당 4센트로 나왔다

전화 에이전트 스타트업은 Mercury가 최악의 응답 시간을 수 분에서 1초로 줄였다고 밝혔다. Inception Labs의 새 디퓨전 모델은 그런 숫자를 겨냥해 만들어졌다.

Seung Jung15일 전
Claude는 성인 전용, 그런데 연령 감지기가 성인까지 차단한다
LLM & Chatbots

Claude는 성인 전용, 그런데 연령 감지기가 성인까지 차단한다

Anthropic이 Claude의 18세 이상 정책 집행 방식을 공개했다. 분류기가 미성년자 의심 계정을 비활성화하고, 잘못 걸린 성인은 Yoti 검증으로 계정을 되찾는다.

Seung Jung17일 전
Claude Opus 5.5, 20% 싸졌다…단 일부 요청은 구형 모델이 대신 처리한다
LLM & Chatbots

Claude Opus 5.5, 20% 싸졌다…단 일부 요청은 구형 모델이 대신 처리한다

Claude Opus 5.5가 100만 토큰당 4/20달러에 나왔다. 캐시 읽기는 60% 내렸고, 일부 작업을 구형 Claude 모델로 넘기는 안전장치가 함께 적용된다.

Seung Jung6일 전
OpenAI 새 정신건강 벤치마크, 최고 점수가 57.3%
LLM & Chatbots

OpenAI 새 정신건강 벤치마크, 최고 점수가 57.3%

22개국 임상의 80여 명이 함께 만든 OpenAI MentalHealthBench에서 GPT-6 Astra가 57.3%로 1위에 올랐다. Claude Opus 5.5는 52.4%였다.

Seung Jung23시간 전