Anthropic が28日(現地時間)、Claude Sonnet 5.5 を公開した。注目すべき数字は価格ではなく、安いモデルが高いモデルを上回ったベンチマークである。Anthropic 自身が公開したスコアカードによると、Sonnet 5.5 はエージェント型コーディングの評価である Terminal-Bench 4.0 で70.6%を記録した。Claude Opus 5.5 は66.4%である。公開から3か月の Sonnet 5 は、同じテストで10.3%にとどまっていた。
Key takeaways
- Sonnet 5.5 は Terminal-Bench 4.0 で70.6%を獲得し、より高価な Opus 5.5 の66.4%を上回った。
- 価格は Sonnet 5 と同じく100万入力トークンあたり2ドル、出力トークンあたり10ドル。コスト削減は単価の引き下げではなく、消費トークンの減少から生じている。
- Balyasny Asset Management は、Sonnet 5 が回答1件に49万7000トークンを費やしていた処理を12万1000トークンで終えたと報告した。
30%のコスト削減はどこから来るのか
Anthropic が掲げる数字は、生成速度が30%以上向上し、タスクあたりのコストが最大30%下がるという2点である。後者は誤読しやすい。表示価格は動いていない。入力は100万トークンあたり2ドル、出力は10ドルのままで、キャッシュ読み取りは0.20ドル、キャッシュ書き込みは2.50ドルである。削減はモデルがより少ないトークンとツール呼び出しで作業を終えることから生まれる。性質の異なる改善であり、ワークロードがエージェント型である場合にだけ請求書に現れる。
Anthropic が併せて示した顧客企業の数字が、それを具体的に裏づけている。Slack はほぼすべての評価で Sonnet 5 と同等以上の結果をより少ないステップで得て、出力トークンは約14%減ったと述べた。Box は結果が2.4倍速くなり、総トークンが12%減ったと計測した。Lovable はタスク完了までのツール呼び出しが3分の1減り、シェル実行はおよそ半分になったとしている。最も鮮明な数字は Balyasny Asset Management のものだ。Sonnet 5 が49万7000トークンを消費していた回答を、12万1000トークンで仕上げた。
ベンチマーク表の読み方
Sonnet 5.5 はほぼすべての項目で Opus 5.5 に迫り、1か所で追い越している。OSWorld 2.1 では80.1%で、Opus 5.5 の81.8%には届かないが、Sonnet 5 の57.0%からは大きく伸びた。Humanity's Last Exam は64.5%対67.7%である。GDPval-AA v2.1 は1844と1846で実質的に同点、AA-Briefcase v1.1 は1811対1822と差は小さい。Terminal-Bench は、Anthropic がエージェント型コーディングに分類した3つのテストのうち Sonnet 5.5 が勝った唯一の項目でもある。CursorBench 4.0 は Opus 5.5 が57.8%対55.5%、FrontierCode 1.1 は54.4%対46.2%で先行する。Anthropic は、FrontierCode で Sonnet 5.5 が Xhigh より Max 設定のほうが低いスコアになると説明している。Max ではコードレビューのスキルをより頻繁に実行し、範囲外の編集やタイムアウトを生じさせるため、ベンチマークがそれを減点するからだ。
注意して見るべきは Sonnet 5 の列である。Terminal-Bench 4.0 で10.3%から70.6%へ、Chartography で15.6%から61.6%へという跳躍は、能力が7倍になったことを意味しない。前世代が特定のハーネスをうまく扱えなかったという事実を示している。同条件で比べるべきは Sonnet 5.5 と Opus 5.5 であり、そこから読み取れるのは、中位モデルが大半の作業で旗艦モデルと数ポイント差に並んだこと、そして同じ予算でより多くのエージェントを並列に動かせることである。
Anthropic がフォールバックの下に置いたもの
Sonnet 5.5 には、前世代になかった制約がついている。Anthropic によると、リスクの高いサイバーセキュリティ関連のタスクでは、モデルが目に見える形で Sonnet 5 にフォールバックする。拒否ではなく、明示的な格下げである。TechCrunch は、これにより Sonnet が、従来 Opus と Fable に限られていたサイバー領域の安全措置の対象となる初の中位モデルになったと報じた。サイバー能力が Opus 5 と同等の水準に達したという判断が根拠である。競合が推論の過程を抽出して蒸留するのを防ぐ分類器を搭載して出荷された初の Sonnet でもある。生物学分野の安全措置は Sonnet 5 から変更なく引き継がれる。
背景:勝負は中位で決まる
旗艦モデルの価格で競う企業はもういない。OpenAI は先週 Sol と Luna を投入して中位モデルのトークン価格を半額にし、Meta はスマートグラス機能を動かすモデルを発表した。Anthropic の答えは安い価格表ではなく、その価格表をより少なく消費するモデルである。プロンプトキャッシュで最大90%、バッチ処理で50%の追加削減も可能だ。
今後の見通し
Sonnet 5.5 は Claude.ai で利用でき、開発者は Claude Platform に加えて Amazon Web Services、Google Cloud、Microsoft Azure でも claude-sonnet-5-5 という識別子で呼び出せる。刷新された Haiku は数週間以内に登場する見込みだが、日程は確定していない。残る問いは Opus 5.5 の役割である。安いモデルがターミナルでのコーディングのベンチマークを取り、知識労働で同点に持ち込むのなら、旗艦モデルに残る根拠はベンチマーク化しにくい問題での判断力だけになる。
FAQ・よくある質問
Claude Sonnet 5.5 は Sonnet 5 より高いのか
いいえ。価格は同じである。100万入力トークンあたり2ドル、出力トークンあたり10ドルで、キャッシュ読み取りは0.20ドル、キャッシュ書き込みは2.50ドルだ。タスクあたりのコストが最大30%下がるという Anthropic の説明は、単価の引き下げではなく、モデルがトークンとツール呼び出しをより少なく使うことを指している。
Sonnet 5.5 は本当に Opus 5.5 を上回ったのか
エージェント型コーディングの評価である Terminal-Bench 4.0 では上回った。70.6%対66.4%で、Anthropic は Opus 5.5 のこの数字が最高性能の設定によるものだとしている。ただし Anthropic が公開したエージェント型コーディングのベンチマーク3つのうち、Sonnet 5.5 が先行したのはこれ1つだけだ。CursorBench 4.0 と FrontierCode 1.1 では Opus 5.5 が上回る。OSWorld 2.1 と Humanity's Last Exam でも Opus 5.5 が1〜3ポイント差で優位を保っている。
開発者はどこで Sonnet 5.5 を使えるのか
Claude Platform でネイティブに提供され、Amazon Web Services、Google Cloud、Microsoft Azure 経由でも claude-sonnet-5-5 という識別子で利用できる。一般利用者は Claude.ai から使える。






