Opus 5.5、最大努力設定では最初のトークンまで682秒待たされた

Artificial AnalysisはAnthropicのフラッグシップのこの設定にIntelligence Index 58点をつけた。同価格帯の中央値は26点で、その点数には出力トークン2億6000万個とタスクあたり5.98ドルを要した。

|4分で読める0
The clock tower at Kyoto University; Artificial Analysis timed Claude Opus 5.5's max-effort configuration at 682.71 seconds before its first token.
The clock tower at Kyoto University; Artificial Analysis timed Claude Opus 5.5's max-effort configuration at 682.71 seconds before its first token.

Anthropicの最新フラッグシップについて第三者の計測値が出そろった。描き出されるのは、チャートの頂点に立ちながら、そこへ到達する代償が異様に大きいモデルの姿である。Artificial Analysisは、適応型推論・最大努力・既定フォールバックという設定のClaude Opus 5.5にIntelligence Index v4.3.2で58点をつけた。同程度の価格帯にある推論モデルの中央値26点を大きく引き離している。同じページに記載された最初のトークンまでの時間は682.71秒。中央値は3.79秒である。

記事の要点

  • 最大努力設定のOpus 5.5はArtificial Analysis Intelligence Index v4.3.2で58点を記録した。同等の推論モデルの中央値は26点である。
  • 指数を走り切るのに出力トークン2億6000万個を消費した。中央値8800万個のおよそ3倍で、タスクあたりの平均費用は5.98ドルだった。
  • Artificial Analysisがこの設定に記した最初のトークンまでの時間は682.71秒、中央値は3.79秒。ただし生成が始まれば毎秒95.5トークンで流れ出す。

この指数が実際に測っているもの

Intelligence Index v4.3.2は10種の評価を束ねた合成スコアである。AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1が含まれる。エージェント的な業務、ターミナル操作、科学コーディング、ロングコンテキスト検索が混ざっているため、単一の数値は純粋な知識と同じくらいツール利用の振る舞いで動く。

Artificial Analysisは商用モデルを業界全体ではなく、同じ混合価格帯の他モデルと比較する。したがって26点は業界平均ではなく同格比較の値である。Opus 5.5はテキストと画像を入力に取りテキストを返し、100万トークンのコンテキストウィンドウを備える。

コストは料金表ではなくトークンにある

Anthropicが公表するこのモデルの料金は入力100万トークンあたり4.00ドル、出力100万トークンあたり20.00ドル。同価格帯の中央値2.00ドル・10.00ドルに対して、書面上は2倍である。その差は冗長さを勘定に入れた途端にさらに開く。中央値のモデルが8800万トークンで終えた指数を、Opus 5.5は出力トークン2億6000万個で走り切り、タスクあたりの平均は5.98ドルに着地した。

予算に持ち込むべき数字はこれである。Anthropicは発表時にOpus 5.5を前世代より約20%安く価格設定した。だが3倍長く考えるモデルの前で、トークン単価の値下げは生き残らない。支出をトークンではなくリクエスト数で測ってきたチームが、まずその差を感じることになる。

682秒という数字の読み方

このレイテンシには但し書きをはっきり添える必要がある。出力に先立って熟考をまとめて済ませる最大努力の適応型推論設定に限った話であり、Artificial Analysisは最初の回答トークンまでの時間を、最初のトークンまでの時間とは別の指標として追っている。APIに届くあらゆるリクエストではなく、ある設定ひとつを測った値である。

とはいえ682.71秒は11分を超える沈黙だ。しかもそれが、生成開始後の毎秒95.5トークンという平均以上の速度と並んでいる。このプロファイルの形は製品設計に直結する。全力で動くOpus 5.5は対話型ではなくバッチ型の道具である。リクエストのタイムアウト内に応答が返ることを前提とする箇所なら、努力度を下げるしかない。設定名にある「既定フォールバック」という言葉自体が、処理を旧世代モデルへ回しうる安全装置をAnthropicが同梱していることを思い出させる。

今回の計測値は、開発者がOpus 5.5で400エラーになるリクエストパターンを4つ見つけた週に出てきた。同じ週にAnthropic自身のシステムカードは、敵対的テストの1.5%でサンドボックス脱出の試みがあったと開示している。三つが描く像は一貫している。最も有能な設定は、運用上気を配るべき角が最も多い設定でもある。

FAQ — よくある質問

Opus 5.5はどのリクエストでも11分かかるのか

そうではない。この数字は、回答の前に予算を推論へ注ぎ込む最大努力の適応型推論設定の値である。努力度を下げれば挙動は変わるし、Artificial Analysisは最初の回答トークンまでの時間を、最初のトークンまでの時間とは分けて報告している。

トークン単価が下がったのに、なぜトークン数が問題になるのか

課金はリクエストではなくトークンに従うからである。Opus 5.5はIntelligence Indexを通じて、中央値8800万個に対し2億6000万個の出力トークンを生成した。料金表が安くても請求額は高くなりうる。今回はタスクあたり平均5.98ドルだった。

Artificial Analysis Intelligence Indexとは何か

公開・非公開の評価10種を組み合わせた合成スコアで、現行バージョンは4.3.2である。エージェント的タスク、コーディング、ロングコンテキスト、知識を幅広く扱う。モデルは同じクラスの中で比較されるため、推論モデルは同価格帯の推論モデルと非推論モデルの双方を相手に順位づけされる。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

業務に就くGPT-6 Astra、OpenAI最高価格モデルはコンピュータ操作に懸ける
LLM & Chatbots

業務に就くGPT-6 Astra、OpenAI最高価格モデルはコンピュータ操作に懸ける

OpenAIのGPT-6 Astraが法人向けに提供開始。コンピュータ操作、100万トークンのコンテキスト、10/50ドルの料金に加え、目玉スコアにはハーネスの但し書きが付きます。

Seung Jung18 日前
Anthropic、インフォスティーラーが有料Claudeアカウントの利用枠を食い潰していると警告
LLM & Chatbots

Anthropic、インフォスティーラーが有料Claudeアカウントの利用枠を食い潰していると警告

Anthropicが、インフォスティーラーにログインセッションを盗まれたClaude利用者へ警告メールを送っている。攻撃者はパスワードを見ずに有料の利用枠を消費している。

Seung Jung18 日前
Claudeは成人限定、しかし年齢判定が成人まで締め出している
LLM & Chatbots

Claudeは成人限定、しかし年齢判定が成人まで締め出している

AnthropicがClaudeの18歳以上ルールの運用を公開した。分類器が未成年と疑われるアカウントを停止し、誤判定された成人はYotiの確認で復旧できる。

Seung Jung17 日前
Claude Opus 5.5、価格2割引き下げ ただし一部のリクエストは旧モデルが処理する
LLM & Chatbots

Claude Opus 5.5、価格2割引き下げ ただし一部のリクエストは旧モデルが処理する

Claude Opus 5.5が100万トークンあたり4/20ドルで登場した。キャッシュ読み出しは6割下がり、一部の作業を旧世代のClaudeモデルへ回す安全機構が併せて適用される。

Seung Jung5 日前
Grok 4.7は価格据え置きでターミナル性能が倍増、争点は依然「請求額」
LLM & Chatbots

Grok 4.7は価格据え置きでターミナル性能が倍増、争点は依然「請求額」

フロンティアモデルの発表には通常、値上げがついて回る。SpaceXAIが9月21日に一般提供を始めたGrok 4.7は違った。入力は100万トークンあたり2ドル、出力は6ドルのままだ。

Seung Jung7 日前
Metaの「Muse」、あなたの受信箱とカレンダーとクレジットカードを狙う
LLM & Chatbots

Metaの「Muse」、あなたの受信箱とカレンダーとクレジットカードを狙う

Metaがパーソナルエージェント「Muse」を公開。米国のiOS、Android、ウェブ、WhatsAppで旅行予約や請求の支払い、買い物を代行する。

Seung Jung17 日前