Claude Opus 5.5, 20% 싸졌다…단 일부 요청은 구형 모델이 대신 처리한다

표시 가격보다 캐시 읽기 인하가 더 크고, 벤치마크 각주 하나가 내 요청이 언제부터 Opus 5.5의 답이 아니게 되는지를 알려준다

|5분 읽기0
Server racks of the kind that serve frontier model inference, where cache-read pricing decides the cost of long-running Claude Opus 5.5 agent sessions.
Server racks of the kind that serve frontier model inference, where cache-read pricing decides the cost of long-running Claude Opus 5.5 agent sessions.

Anthropic의 Claude Opus 5.5 공개에서 가장 중요한 숫자는 대부분의 보도가 앞세운 그 숫자가 아니다. 입력·출력 토큰 가격이 20% 내려 100만 토큰당 4달러와 20달러가 된 것은 맞다. 그러나 캐시 읽기는 60% 떨어져 100만 토큰당 0.20달러가 됐다. 이 모델이 겨냥한 장시간 에이전트 세션에서 청구서를 결정하는 항목이 바로 이것이다.

핵심 요약

  • Claude Opus 5.5의 가격은 100만 입력 토큰당 4달러, 100만 출력 토큰당 20달러다. 캐시 읽기는 100만 토큰당 0.20달러로 Opus 5보다 60% 낮다.
  • Anthropic은 이 모델에 프로덕션 안전장치를 걸어 배포한다. 안전장치가 작동하면 사이버보안 작업은 Claude Opus 4.8이, 생물학과 프런티어 모델 개발 작업은 Claude Opus 5가 처리한다.
  • Opus 5.5는 Terminal-Bench 4.0에서 66.4%, GDPval-AA v2.1에서 1846 Elo를 기록해 Claude Fable 5.1과 OpenAI의 GPT-6 Astra를 모두 앞섰다.

에이전트 경제성을 캐시 가격이 결정하는 이유

밤새 코드베이스를 다루는 AI 에이전트는 매 턴 새 컨텍스트를 보내지 않는다. 같은 시스템 프롬프트, 같은 도구 정의, 같은 파일을 계속 다시 흘려보낸다. 이렇게 재전송되는 접두부가 캐시 읽기이고, 초가 아니라 시간 단위로 이어지는 세션에서는 이 항목이 계량기를 지배한다.

Anthropic도 캐시 읽기가 에이전트·코딩 작업 비용의 대부분을 차지한다고 설명하며 같은 인식을 드러냈다. 그렇다면 여기서의 60% 인하가 밤샘 마이그레이션에 주는 효과는 신규 입력 20% 인하가 줄 수 있는 것보다 훨씬 크다. Opus 5 예산을 출력 토큰만으로 잡아온 팀은 엉뚱한 변수를 모델링해온 셈이다.

처리량도 같은 방향으로 움직였다. 출력 생성 속도는 Opus 5보다 30% 이상 빨라졌다. Claude Code와 Claude Platform 안의 별도 Fast 모드는 100만 토큰당 8달러와 40달러로 가격과 지연시간을 맞바꾸며 최대 2.5배 속도를 내세운다. Pro·Max·Team과 좌석 기반 Enterprise 요금제의 5시간 사용 한도가 올라갔고, 구독자는 이제 사용량 한도 초기화분을 모아뒀다가 마감이 급할 때 쓸 수 있다.

내 요청이 Opus 5.5가 아니게 되는 지점

구매를 검토한다면 각주 하나는 두 번 읽어야 한다. Opus 5.5가 생물학과 사이버보안 역량에서 Claude Mythos 5.1에 근접하는 탓에, Anthropic은 Fable 5.1용으로 만든 안전장치를 걸어 이 모델을 내보낸다. 안전장치가 작동해도 요청이 실패하지는 않는다. 다른 모델이 대신 끝낸다.

사이버보안 작업은 Claude Opus 4.8이, 생물학과 프런티어 LLM 개발 작업은 Claude Opus 5가 완료했다.

숨긴 것이 아니라 공개한 내용이고, 방어할 만한 안전 설계이기도 하다. 동시에 프런티어급 요금을 내고 쓰는 제품 안에서 성능이 조용히 바뀌는 일이기도 하다. API 위에 보안 도구를 만드는 쪽이라면 트래픽 일부가 두 세대 전 모델의 답으로 돌아온다고 가정해야 한다. 실무의 물음은 이 대체 처리가 정당한가가 아니다. 응답이 여느 응답과 똑같은 모습으로 도착하는 만큼, 평가 환경이 안전장치가 언제 작동했는지 알려줄 수 있느냐가 관건이다.

이 구조는 점수표도 왜곡한다. Zapier는 대체 모델을 설정하지 않은 채 AutomationBench를 돌렸고, 그래서 안전장치 개입이 전부 실패로 기록됐다. Opus 5.5가 40.0%로 GPT-6 Astra의 41.4%에 뒤진 배경이다. Anthropic은 실제 배포 환경이라면 이 점수를 잃지 않는다고 반박한다. OpenAI가 내놓은 경쟁 차트는 같은 장치를 반대편에서 보여준다. Opus 5를 대체 모델로 설정한 Fable 5.1 구성이 31.4%를 기록했는데, OpenAI는 해당 비용 수치가 과제 약 40%에서 작동한 대체 처리를 제외한 값이라고 인정했다.

테스터들이 실제로 측정한 것

Anthropic이 공개한 근거는 대부분 영리함이 아니라 물량에 관한 것이다. 한 테스터는 68만 줄짜리 코드 마이그레이션을 하루 안에 끝냈다. 다른 테스터는 20만 줄 코드베이스를 3시간 안에 감사하고 수리했다. Opus 5는 같은 작업에 20시간 넘게, 토큰은 2.5배를 썼다. HAProxy를 C에서 Rust로 옮긴 내부 작업은 Fable 5.1의 12시간 대비 9.5시간에 끝났고 비용은 51% 낮았다.

어느 것도 지능에 관한 주장이 아니다. 전부 처리량에 관한 주장이고, 모델 교체를 예산 항목으로 바꾸는 것이 바로 처리량이다. 고객사 수치도 같은 패턴을 반복한다. 단계는 줄고, 출력은 짧아지고, 결과는 같거나 낫다. Deloitte는 이 모델을 가장 낮은 추론 강도로 돌렸을 때 코드 리뷰에서 알려진 버그의 72%를 잡아냈다고 밝혔다. 같은 시험에서 높은 강도의 Opus 5는 56%였다. Hebbia는 전문가가 채점한 금융 워크플로에서 86.6% 커버리지를 매겼고, Opus 5는 60.3%였다. 공개 벤치마크에서 Opus 5.5는 Terminal-Bench 4.0 66.4%, GDPval-AA v2.1 1846 Elo를 기록했다. 같은 지표에서 Fable 5.1은 1735, GPT-6 Astra는 1542다.

CEO 스스로 너무 빠르다고 말한 속도

불편한 대목은 달력이다. The Register의 집계에 따르면 Fable 5.1과 Opus 5.5 사이는 21일, Opus 5와 Fable 5.1 사이는 39일이다. 다리오 아모데이 CEO가 역량 향상 속도를 늦춰야 한다고 공개 발언한 것은 이번 공개 열흘 전이었다. Anthropic은 OpenAI가 GPT-6 Sol과 Luna를 내놓은 바로 그날 아침에 출시했고, 이는 GPT-6 Astra가 기업 고객에게 풀린 지 3주 만이다. 자세한 내용은 Anthropic 공식 발표문에 있다. Sonnet 5.5와 Haiku 5.5는 몇 주 안에 뒤따를 예정인데, 캐시 읽기 인하가 가장 많은 워크로드에 의미를 갖는 시점도 그때다.

FAQ — 자주 묻는 질문

Claude Opus 5.5의 가격은 얼마인가?

Opus 5.5는 100만 입력 토큰당 4달러, 100만 출력 토큰당 20달러로 Opus 5보다 20% 낮다. 캐시 읽기는 100만 토큰당 0.20달러로 60% 내려갔다. Claude Code와 Claude Platform의 별도 Fast 모드는 100만 토큰당 8달러와 40달러이며 최대 2.5배 속도를 제공한다.

Anthropic이 내 Opus 5.5 요청을 구형 모델로 넘길 수 있나?

좁은 범위에서 그렇다. Anthropic은 Opus 5.5의 프로덕션 안전장치가 개입할 경우 사이버보안 작업은 Claude Opus 4.8이, 생물학과 프런티어 모델 개발 작업은 Claude Opus 5가 완료한다고 밝혔다. 검증을 거친 조직은 Anthropic의 Life Sciences Verification Program에 신청할 수 있고, Cyber Verification Program도 몇 주 안에 확대된다.

Opus 5.5가 GPT-6 Astra보다 나은가?

작업에 따라 다르다. Opus 5.5는 Terminal-Bench 4.0(66.4% 대 57.9%)과 GDPval-AA v2.1(1846 Elo 대 1542)에서 앞선다. Astra는 AutomationBench(41.4% 대 40.0%)와 Terminal-Bench-Science 0.1(64.6% 대 58.7%)에서 앞선다. 두 회사가 서로 다른 평가 환경과 추론 강도로 측정한 결과라 격차를 직접 비교하기는 어렵다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

OpenAI, 중급 모델 토큰 가격 반토막…벤치마크 두 곳은 여전히 GPT-5.6이 앞선다
Developer Tools

OpenAI, 중급 모델 토큰 가격 반토막…벤치마크 두 곳은 여전히 GPT-5.6이 앞선다

OpenAI가 화요일 중급 모델 두 종을 내놓으면서 설득 논리를 거의 전부 가격에 걸었다. GPT-6 Sol은 100만 입력 토큰당 2달러, 출력 100만 토큰당 10달러다.

Seung Jung8시간 전
업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다
LLM & Chatbots

업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다

OpenAI의 GPT-6 Astra가 컴퓨터 사용 기능과 100만 토큰 컨텍스트, 10/50달러 가격으로 기업 사용자에게 풀린다. 대표 점수에는 하네스 단서가 붙는다.

Seung Jung13일 전
메타 뮤즈, 당신의 메일함과 일정 그리고 신용카드를 노린다
LLM & Chatbots

메타 뮤즈, 당신의 메일함과 일정 그리고 신용카드를 노린다

메타가 개인 AI 에이전트 뮤즈를 공개했다. 미국에서 iOS·안드로이드·웹·왓츠앱을 통해 여행 예약과 요금 납부, 쇼핑을 대신 처리한다.

Seung Jung12일 전
Anthropic, 인포스틸러 악성코드가 유료 Claude 계정 사용량을 빼간다 경고
LLM & Chatbots

Anthropic, 인포스틸러 악성코드가 유료 Claude 계정 사용량을 빼간다 경고

Anthropic이 인포스틸러 악성코드에 로그인 세션을 도난당한 Claude 이용자들에게 경고 메일을 보내고 있다. 공격자는 비밀번호 없이 유료 사용량을 태운다.

Seung Jung13일 전
Claude는 성인 전용, 그런데 연령 감지기가 성인까지 차단한다
LLM & Chatbots

Claude는 성인 전용, 그런데 연령 감지기가 성인까지 차단한다

Anthropic이 Claude의 18세 이상 정책 집행 방식을 공개했다. 분류기가 미성년자 의심 계정을 비활성화하고, 잘못 걸린 성인은 Yoti 검증으로 계정을 되찾는다.

Seung Jung12일 전
OpenAI, 데이터 에이전트와 월스트리트용 ChatGPT를 하루에 함께 내놨다
LLM & Chatbots

OpenAI, 데이터 에이전트와 월스트리트용 ChatGPT를 하루에 함께 내놨다

OpenAI가 같은 목요일에 ChatGPT Work용 Data 에이전트와 Morgan Stanley·Evercore가 함께 만든 ChatGPT for Financial Services를 공개했다.

Seung Jung13일 전