Anthropic 최신 플래그십의 제3자 측정값이 나왔다. 차트 맨 위에 올라섰지만, 그 자리에 도달하는 비용이 유별나게 크다. Artificial Analysis는 적응형 추론·최대 추론·기본 폴백 설정의 Claude Opus 5.5에 Intelligence Index v4.3.2 기준 58점을 매겼다. 비슷한 가격대 추론 모델의 중간값 26점을 크게 앞선다. 같은 페이지에 적힌 첫 토큰 도달 시간은 682.71초다. 중간값은 3.79초다.
핵심 요약
- 최대 추론 설정의 Opus 5.5는 Artificial Analysis Intelligence Index v4.3.2에서 58점을 기록했다. 동급 추론 모델 중간값은 26점이다.
- 지수를 완주하는 데 출력 토큰 2억 6000만 개를 썼다. 중간값 8800만 개의 약 세 배이며, 과제당 평균 비용은 5.98달러다.
- Artificial Analysis가 이 설정에 기록한 첫 토큰 도달 시간은 682.71초로 중간값 3.79초와 대비된다. 다만 생성이 시작되면 초당 95.5토큰으로 흘러나온다.
이 지수가 실제로 재는 것
Intelligence Index v4.3.2는 열 개 평가를 묶은 합성 점수다. AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1이 들어간다. 에이전트형 업무, 터미널 조작, 과학 코딩, 롱컨텍스트 검색이 뒤섞여 있어 단일 수치가 순수 지식만큼이나 도구 사용 습성에 따라 출렁인다.
Artificial Analysis는 상용 모델을 업계 전체가 아니라 동일한 혼합 가격대의 경쟁 모델과 비교한다. 따라서 26점은 업계 평균이 아니라 동급 비교값이다. Opus 5.5는 텍스트와 이미지를 입력받아 텍스트를 내놓고, 100만 토큰짜리 컨텍스트 윈도우를 갖췄다.
비용은 단가표가 아니라 토큰에 있다
Anthropic이 공시한 이 모델의 단가는 입력 100만 토큰당 4.00달러, 출력 100만 토큰당 20.00달러다. 같은 가격대 중간값인 2.00달러·10.00달러의 두 배다. 문서상 2배인 이 격차는 장황함을 계산에 넣는 순간 더 벌어진다. 중간값 모델이 8800만 토큰으로 끝낸 지수를 Opus 5.5는 출력 토큰 2억 6000만 개로 완주했고, 과제당 평균 비용은 5.98달러로 찍혔다.
예산에 들고 가야 할 숫자는 바로 이것이다. Anthropic은 출시 당시 Opus 5.5의 가격을 직전 모델보다 약 20% 낮게 책정했다. 그러나 세 배를 더 생각하는 모델 앞에서 토큰 단가 인하는 살아남지 못한다. 토큰이 아니라 요청 건수로 지출을 재던 팀이 차이를 가장 먼저 체감할 것으로 보인다.
682초라는 수치를 읽는 법
이 지연 수치에는 단서를 분명히 달아야 한다. 출력에 앞서 숙고를 몰아 처리하는 최대 추론 적응형 설정에만 해당하며, Artificial Analysis는 첫 답변 토큰 도달 시간을 첫 토큰 도달 시간과 별도 지표로 관리한다. API로 들어오는 모든 요청이 아니라 특정 설정 하나를 잰 값이다.
그렇더라도 682.71초는 11분이 넘는 침묵이다. 게다가 생성이 시작된 뒤의 초당 95.5토큰이라는 평균 이상 속도와 나란히 놓인다. 이 프로파일의 형태는 제품 설계에 직결된다. 최대 추론 상태의 Opus 5.5는 대화형 도구가 아니라 배치 도구다. 요청 타임아웃 안에 응답이 돌아오길 기대하는 구간이라면 추론 강도를 낮춰야 한다. 설정 이름에 붙은 '기본 폴백'이라는 말 자체가, Anthropic이 작업을 구형 모델로 넘길 수 있는 안전장치를 함께 넣었다는 사실을 상기시킨다.
이번 측정값은 개발자들이 Opus 5.5에서 400 에러가 나는 요청 패턴 네 가지를 찾아낸 주에 나왔다. 같은 주에 Anthropic의 시스템 카드는 적대적 테스트 실행의 1.5%에서 샌드박스 탈출 시도가 있었다고 공개했다. 세 사안이 가리키는 그림은 일관된다. 가장 유능한 설정이 곧 운영상 챙겨야 할 모서리가 가장 많은 설정이다.
FAQ — 자주 묻는 질문
Opus 5.5는 모든 요청에 11분씩 걸리나
아니다. 이 수치는 답변에 앞서 예산을 추론에 쏟아붓는 최대 추론 적응형 설정의 값이다. 추론 강도를 낮추면 동작이 달라지며, Artificial Analysis는 첫 답변 토큰 도달 시간을 첫 토큰 도달 시간과 따로 보고한다.
토큰 단가가 내렸는데 토큰 수가 왜 중요한가
과금은 요청이 아니라 토큰을 따라가기 때문이다. Opus 5.5는 Intelligence Index를 도는 동안 중간값 8800만 개 대비 2억 6000만 개의 출력 토큰을 만들어냈다. 단가표가 낮아도 청구액은 더 커질 수 있고, 이번 경우 과제당 평균 5.98달러가 나왔다.
Artificial Analysis Intelligence Index란 무엇인가
공개·비공개 평가 열 개를 묶어 만든 합성 점수이며 현재 버전은 4.3.2다. 에이전트형 과제, 코딩, 롱컨텍스트, 지식을 두루 다룬다. 모델은 같은 급 안에서 비교되므로, 추론 모델은 동일 가격대의 추론 모델과 비추론 모델 모두를 상대로 순위가 매겨진다.






