Anthropicの最新フラッグシップについて第三者の計測値が出そろった。描き出されるのは、チャートの頂点に立ちながら、そこへ到達する代償が異様に大きいモデルの姿である。Artificial Analysisは、適応型推論・最大努力・既定フォールバックという設定のClaude Opus 5.5にIntelligence Index v4.3.2で58点をつけた。同程度の価格帯にある推論モデルの中央値26点を大きく引き離している。同じページに記載された最初のトークンまでの時間は682.71秒。中央値は3.79秒である。
記事の要点
- 最大努力設定のOpus 5.5はArtificial Analysis Intelligence Index v4.3.2で58点を記録した。同等の推論モデルの中央値は26点である。
- 指数を走り切るのに出力トークン2億6000万個を消費した。中央値8800万個のおよそ3倍で、タスクあたりの平均費用は5.98ドルだった。
- Artificial Analysisがこの設定に記した最初のトークンまでの時間は682.71秒、中央値は3.79秒。ただし生成が始まれば毎秒95.5トークンで流れ出す。
この指数が実際に測っているもの
Intelligence Index v4.3.2は10種の評価を束ねた合成スコアである。AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1が含まれる。エージェント的な業務、ターミナル操作、科学コーディング、ロングコンテキスト検索が混ざっているため、単一の数値は純粋な知識と同じくらいツール利用の振る舞いで動く。
Artificial Analysisは商用モデルを業界全体ではなく、同じ混合価格帯の他モデルと比較する。したがって26点は業界平均ではなく同格比較の値である。Opus 5.5はテキストと画像を入力に取りテキストを返し、100万トークンのコンテキストウィンドウを備える。
コストは料金表ではなくトークンにある
Anthropicが公表するこのモデルの料金は入力100万トークンあたり4.00ドル、出力100万トークンあたり20.00ドル。同価格帯の中央値2.00ドル・10.00ドルに対して、書面上は2倍である。その差は冗長さを勘定に入れた途端にさらに開く。中央値のモデルが8800万トークンで終えた指数を、Opus 5.5は出力トークン2億6000万個で走り切り、タスクあたりの平均は5.98ドルに着地した。
予算に持ち込むべき数字はこれである。Anthropicは発表時にOpus 5.5を前世代より約20%安く価格設定した。だが3倍長く考えるモデルの前で、トークン単価の値下げは生き残らない。支出をトークンではなくリクエスト数で測ってきたチームが、まずその差を感じることになる。
682秒という数字の読み方
このレイテンシには但し書きをはっきり添える必要がある。出力に先立って熟考をまとめて済ませる最大努力の適応型推論設定に限った話であり、Artificial Analysisは最初の回答トークンまでの時間を、最初のトークンまでの時間とは別の指標として追っている。APIに届くあらゆるリクエストではなく、ある設定ひとつを測った値である。
とはいえ682.71秒は11分を超える沈黙だ。しかもそれが、生成開始後の毎秒95.5トークンという平均以上の速度と並んでいる。このプロファイルの形は製品設計に直結する。全力で動くOpus 5.5は対話型ではなくバッチ型の道具である。リクエストのタイムアウト内に応答が返ることを前提とする箇所なら、努力度を下げるしかない。設定名にある「既定フォールバック」という言葉自体が、処理を旧世代モデルへ回しうる安全装置をAnthropicが同梱していることを思い出させる。
今回の計測値は、開発者がOpus 5.5で400エラーになるリクエストパターンを4つ見つけた週に出てきた。同じ週にAnthropic自身のシステムカードは、敵対的テストの1.5%でサンドボックス脱出の試みがあったと開示している。三つが描く像は一貫している。最も有能な設定は、運用上気を配るべき角が最も多い設定でもある。
FAQ — よくある質問
Opus 5.5はどのリクエストでも11分かかるのか
そうではない。この数字は、回答の前に予算を推論へ注ぎ込む最大努力の適応型推論設定の値である。努力度を下げれば挙動は変わるし、Artificial Analysisは最初の回答トークンまでの時間を、最初のトークンまでの時間とは分けて報告している。
トークン単価が下がったのに、なぜトークン数が問題になるのか
課金はリクエストではなくトークンに従うからである。Opus 5.5はIntelligence Indexを通じて、中央値8800万個に対し2億6000万個の出力トークンを生成した。料金表が安くても請求額は高くなりうる。今回はタスクあたり平均5.98ドルだった。
Artificial Analysis Intelligence Indexとは何か
公開・非公開の評価10種を組み合わせた合成スコアで、現行バージョンは4.3.2である。エージェント的タスク、コーディング、ロングコンテキスト、知識を幅広く扱う。モデルは同じクラスの中で比較されるため、推論モデルは同価格帯の推論モデルと非推論モデルの双方を相手に順位づけされる。






