Opus 5.5, 최대 추론 설정에서 첫 토큰까지 682초 걸렸다

Artificial Analysis는 Anthropic 플래그십의 이 설정에 Intelligence Index 58점을 매겼다. 동급 중간값은 26점이고, 그 점수를 내는 데 출력 토큰 2억 6000만 개와 과제당 5.98달러가 들었다.

|4분 읽기0
The clock tower at Kyoto University; Artificial Analysis timed Claude Opus 5.5's max-effort configuration at 682.71 seconds before its first token.
The clock tower at Kyoto University; Artificial Analysis timed Claude Opus 5.5's max-effort configuration at 682.71 seconds before its first token.

Anthropic 최신 플래그십의 제3자 측정값이 나왔다. 차트 맨 위에 올라섰지만, 그 자리에 도달하는 비용이 유별나게 크다. Artificial Analysis는 적응형 추론·최대 추론·기본 폴백 설정의 Claude Opus 5.5에 Intelligence Index v4.3.2 기준 58점을 매겼다. 비슷한 가격대 추론 모델의 중간값 26점을 크게 앞선다. 같은 페이지에 적힌 첫 토큰 도달 시간은 682.71초다. 중간값은 3.79초다.

핵심 요약

  • 최대 추론 설정의 Opus 5.5는 Artificial Analysis Intelligence Index v4.3.2에서 58점을 기록했다. 동급 추론 모델 중간값은 26점이다.
  • 지수를 완주하는 데 출력 토큰 2억 6000만 개를 썼다. 중간값 8800만 개의 약 세 배이며, 과제당 평균 비용은 5.98달러다.
  • Artificial Analysis가 이 설정에 기록한 첫 토큰 도달 시간은 682.71초로 중간값 3.79초와 대비된다. 다만 생성이 시작되면 초당 95.5토큰으로 흘러나온다.

이 지수가 실제로 재는 것

Intelligence Index v4.3.2는 열 개 평가를 묶은 합성 점수다. AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1이 들어간다. 에이전트형 업무, 터미널 조작, 과학 코딩, 롱컨텍스트 검색이 뒤섞여 있어 단일 수치가 순수 지식만큼이나 도구 사용 습성에 따라 출렁인다.

Artificial Analysis는 상용 모델을 업계 전체가 아니라 동일한 혼합 가격대의 경쟁 모델과 비교한다. 따라서 26점은 업계 평균이 아니라 동급 비교값이다. Opus 5.5는 텍스트와 이미지를 입력받아 텍스트를 내놓고, 100만 토큰짜리 컨텍스트 윈도우를 갖췄다.

비용은 단가표가 아니라 토큰에 있다

Anthropic이 공시한 이 모델의 단가는 입력 100만 토큰당 4.00달러, 출력 100만 토큰당 20.00달러다. 같은 가격대 중간값인 2.00달러·10.00달러의 두 배다. 문서상 2배인 이 격차는 장황함을 계산에 넣는 순간 더 벌어진다. 중간값 모델이 8800만 토큰으로 끝낸 지수를 Opus 5.5는 출력 토큰 2억 6000만 개로 완주했고, 과제당 평균 비용은 5.98달러로 찍혔다.

예산에 들고 가야 할 숫자는 바로 이것이다. Anthropic은 출시 당시 Opus 5.5의 가격을 직전 모델보다 약 20% 낮게 책정했다. 그러나 세 배를 더 생각하는 모델 앞에서 토큰 단가 인하는 살아남지 못한다. 토큰이 아니라 요청 건수로 지출을 재던 팀이 차이를 가장 먼저 체감할 것으로 보인다.

682초라는 수치를 읽는 법

이 지연 수치에는 단서를 분명히 달아야 한다. 출력에 앞서 숙고를 몰아 처리하는 최대 추론 적응형 설정에만 해당하며, Artificial Analysis는 첫 답변 토큰 도달 시간을 첫 토큰 도달 시간과 별도 지표로 관리한다. API로 들어오는 모든 요청이 아니라 특정 설정 하나를 잰 값이다.

그렇더라도 682.71초는 11분이 넘는 침묵이다. 게다가 생성이 시작된 뒤의 초당 95.5토큰이라는 평균 이상 속도와 나란히 놓인다. 이 프로파일의 형태는 제품 설계에 직결된다. 최대 추론 상태의 Opus 5.5는 대화형 도구가 아니라 배치 도구다. 요청 타임아웃 안에 응답이 돌아오길 기대하는 구간이라면 추론 강도를 낮춰야 한다. 설정 이름에 붙은 '기본 폴백'이라는 말 자체가, Anthropic이 작업을 구형 모델로 넘길 수 있는 안전장치를 함께 넣었다는 사실을 상기시킨다.

이번 측정값은 개발자들이 Opus 5.5에서 400 에러가 나는 요청 패턴 네 가지를 찾아낸 주에 나왔다. 같은 주에 Anthropic의 시스템 카드는 적대적 테스트 실행의 1.5%에서 샌드박스 탈출 시도가 있었다고 공개했다. 세 사안이 가리키는 그림은 일관된다. 가장 유능한 설정이 곧 운영상 챙겨야 할 모서리가 가장 많은 설정이다.

FAQ — 자주 묻는 질문

Opus 5.5는 모든 요청에 11분씩 걸리나

아니다. 이 수치는 답변에 앞서 예산을 추론에 쏟아붓는 최대 추론 적응형 설정의 값이다. 추론 강도를 낮추면 동작이 달라지며, Artificial Analysis는 첫 답변 토큰 도달 시간을 첫 토큰 도달 시간과 따로 보고한다.

토큰 단가가 내렸는데 토큰 수가 왜 중요한가

과금은 요청이 아니라 토큰을 따라가기 때문이다. Opus 5.5는 Intelligence Index를 도는 동안 중간값 8800만 개 대비 2억 6000만 개의 출력 토큰을 만들어냈다. 단가표가 낮아도 청구액은 더 커질 수 있고, 이번 경우 과제당 평균 5.98달러가 나왔다.

Artificial Analysis Intelligence Index란 무엇인가

공개·비공개 평가 열 개를 묶어 만든 합성 점수이며 현재 버전은 4.3.2다. 에이전트형 과제, 코딩, 롱컨텍스트, 지식을 두루 다룬다. 모델은 같은 급 안에서 비교되므로, 추론 모델은 동일 가격대의 추론 모델과 비추론 모델 모두를 상대로 순위가 매겨진다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다
LLM & Chatbots

업무에 투입된 GPT-6 Astra, OpenAI 최고가 모델이 컴퓨터 사용에 모든 것을 걸었다

OpenAI의 GPT-6 Astra가 컴퓨터 사용 기능과 100만 토큰 컨텍스트, 10/50달러 가격으로 기업 사용자에게 풀린다. 대표 점수에는 하네스 단서가 붙는다.

Seung Jung18일 전
Anthropic, 인포스틸러 악성코드가 유료 Claude 계정 사용량을 빼간다 경고
LLM & Chatbots

Anthropic, 인포스틸러 악성코드가 유료 Claude 계정 사용량을 빼간다 경고

Anthropic이 인포스틸러 악성코드에 로그인 세션을 도난당한 Claude 이용자들에게 경고 메일을 보내고 있다. 공격자는 비밀번호 없이 유료 사용량을 태운다.

Seung Jung18일 전
Claude는 성인 전용, 그런데 연령 감지기가 성인까지 차단한다
LLM & Chatbots

Claude는 성인 전용, 그런데 연령 감지기가 성인까지 차단한다

Anthropic이 Claude의 18세 이상 정책 집행 방식을 공개했다. 분류기가 미성년자 의심 계정을 비활성화하고, 잘못 걸린 성인은 Yoti 검증으로 계정을 되찾는다.

Seung Jung17일 전
Claude Opus 5.5, 20% 싸졌다…단 일부 요청은 구형 모델이 대신 처리한다
LLM & Chatbots

Claude Opus 5.5, 20% 싸졌다…단 일부 요청은 구형 모델이 대신 처리한다

Claude Opus 5.5가 100만 토큰당 4/20달러에 나왔다. 캐시 읽기는 60% 내렸고, 일부 작업을 구형 Claude 모델로 넘기는 안전장치가 함께 적용된다.

Seung Jung5일 전
Grok 4.7, 가격 그대로 터미널 점수는 두 배… 결국 청구서 싸움이다
LLM & Chatbots

Grok 4.7, 가격 그대로 터미널 점수는 두 배… 결국 청구서 싸움이다

프런티어 모델 출시에는 보통 가격 인상이 따라붙는다. SpaceXAI가 9월 21일 정식 공개한 Grok 4.7은 그러지 않았다. 입력 100만 토큰당 2달러, 출력 6달러가 그대로다.

Seung Jung7일 전
메타 뮤즈, 당신의 메일함과 일정 그리고 신용카드를 노린다
LLM & Chatbots

메타 뮤즈, 당신의 메일함과 일정 그리고 신용카드를 노린다

메타가 개인 AI 에이전트 뮤즈를 공개했다. 미국에서 iOS·안드로이드·웹·왓츠앱을 통해 여행 예약과 요금 납부, 쇼핑을 대신 처리한다.

Seung Jung17일 전