Anthropic の Sonnet 5.5、エージェント型コーディングで Opus 5.5 を上回る

中位モデルは Sonnet 5 の100万入力トークンあたり2ドルという価格を維持しつつ、Anthropic は速度30%向上とタスクあたり最大30%のコスト削減を掲げる

|5分で読める0
A user working with a conversational AI assistant, the everyday task profile Anthropic says Sonnet 5.5 is tuned for.
A user working with a conversational AI assistant, the everyday task profile Anthropic says Sonnet 5.5 is tuned for.

Anthropic が28日(現地時間)、Claude Sonnet 5.5 を公開した。注目すべき数字は価格ではなく、安いモデルが高いモデルを上回ったベンチマークである。Anthropic 自身が公開したスコアカードによると、Sonnet 5.5 はエージェント型コーディングの評価である Terminal-Bench 4.0 で70.6%を記録した。Claude Opus 5.5 は66.4%である。公開から3か月の Sonnet 5 は、同じテストで10.3%にとどまっていた。

Key takeaways

  • Sonnet 5.5 は Terminal-Bench 4.0 で70.6%を獲得し、より高価な Opus 5.5 の66.4%を上回った。
  • 価格は Sonnet 5 と同じく100万入力トークンあたり2ドル、出力トークンあたり10ドル。コスト削減は単価の引き下げではなく、消費トークンの減少から生じている。
  • Balyasny Asset Management は、Sonnet 5 が回答1件に49万7000トークンを費やしていた処理を12万1000トークンで終えたと報告した。

30%のコスト削減はどこから来るのか

Anthropic が掲げる数字は、生成速度が30%以上向上し、タスクあたりのコストが最大30%下がるという2点である。後者は誤読しやすい。表示価格は動いていない。入力は100万トークンあたり2ドル、出力は10ドルのままで、キャッシュ読み取りは0.20ドル、キャッシュ書き込みは2.50ドルである。削減はモデルがより少ないトークンとツール呼び出しで作業を終えることから生まれる。性質の異なる改善であり、ワークロードがエージェント型である場合にだけ請求書に現れる。

Anthropic が併せて示した顧客企業の数字が、それを具体的に裏づけている。Slack はほぼすべての評価で Sonnet 5 と同等以上の結果をより少ないステップで得て、出力トークンは約14%減ったと述べた。Box は結果が2.4倍速くなり、総トークンが12%減ったと計測した。Lovable はタスク完了までのツール呼び出しが3分の1減り、シェル実行はおよそ半分になったとしている。最も鮮明な数字は Balyasny Asset Management のものだ。Sonnet 5 が49万7000トークンを消費していた回答を、12万1000トークンで仕上げた。

ベンチマーク表の読み方

Sonnet 5.5 はほぼすべての項目で Opus 5.5 に迫り、1か所で追い越している。OSWorld 2.1 では80.1%で、Opus 5.5 の81.8%には届かないが、Sonnet 5 の57.0%からは大きく伸びた。Humanity's Last Exam は64.5%対67.7%である。GDPval-AA v2.1 は1844と1846で実質的に同点、AA-Briefcase v1.1 は1811対1822と差は小さい。Terminal-Bench は、Anthropic がエージェント型コーディングに分類した3つのテストのうち Sonnet 5.5 が勝った唯一の項目でもある。CursorBench 4.0 は Opus 5.5 が57.8%対55.5%、FrontierCode 1.1 は54.4%対46.2%で先行する。Anthropic は、FrontierCode で Sonnet 5.5 が Xhigh より Max 設定のほうが低いスコアになると説明している。Max ではコードレビューのスキルをより頻繁に実行し、範囲外の編集やタイムアウトを生じさせるため、ベンチマークがそれを減点するからだ。

注意して見るべきは Sonnet 5 の列である。Terminal-Bench 4.0 で10.3%から70.6%へ、Chartography で15.6%から61.6%へという跳躍は、能力が7倍になったことを意味しない。前世代が特定のハーネスをうまく扱えなかったという事実を示している。同条件で比べるべきは Sonnet 5.5 と Opus 5.5 であり、そこから読み取れるのは、中位モデルが大半の作業で旗艦モデルと数ポイント差に並んだこと、そして同じ予算でより多くのエージェントを並列に動かせることである。

Anthropic がフォールバックの下に置いたもの

Sonnet 5.5 には、前世代になかった制約がついている。Anthropic によると、リスクの高いサイバーセキュリティ関連のタスクでは、モデルが目に見える形で Sonnet 5 にフォールバックする。拒否ではなく、明示的な格下げである。TechCrunch は、これにより Sonnet が、従来 Opus と Fable に限られていたサイバー領域の安全措置の対象となる初の中位モデルになったと報じた。サイバー能力が Opus 5 と同等の水準に達したという判断が根拠である。競合が推論の過程を抽出して蒸留するのを防ぐ分類器を搭載して出荷された初の Sonnet でもある。生物学分野の安全措置は Sonnet 5 から変更なく引き継がれる。

背景:勝負は中位で決まる

旗艦モデルの価格で競う企業はもういない。OpenAI は先週 Sol と Luna を投入して中位モデルのトークン価格を半額にし、Meta はスマートグラス機能を動かすモデルを発表した。Anthropic の答えは安い価格表ではなく、その価格表をより少なく消費するモデルである。プロンプトキャッシュで最大90%、バッチ処理で50%の追加削減も可能だ。

今後の見通し

Sonnet 5.5 は Claude.ai で利用でき、開発者は Claude Platform に加えて Amazon Web Services、Google Cloud、Microsoft Azure でも claude-sonnet-5-5 という識別子で呼び出せる。刷新された Haiku は数週間以内に登場する見込みだが、日程は確定していない。残る問いは Opus 5.5 の役割である。安いモデルがターミナルでのコーディングのベンチマークを取り、知識労働で同点に持ち込むのなら、旗艦モデルに残る根拠はベンチマーク化しにくい問題での判断力だけになる。

FAQ・よくある質問

Claude Sonnet 5.5 は Sonnet 5 より高いのか

いいえ。価格は同じである。100万入力トークンあたり2ドル、出力トークンあたり10ドルで、キャッシュ読み取りは0.20ドル、キャッシュ書き込みは2.50ドルだ。タスクあたりのコストが最大30%下がるという Anthropic の説明は、単価の引き下げではなく、モデルがトークンとツール呼び出しをより少なく使うことを指している。

Sonnet 5.5 は本当に Opus 5.5 を上回ったのか

エージェント型コーディングの評価である Terminal-Bench 4.0 では上回った。70.6%対66.4%で、Anthropic は Opus 5.5 のこの数字が最高性能の設定によるものだとしている。ただし Anthropic が公開したエージェント型コーディングのベンチマーク3つのうち、Sonnet 5.5 が先行したのはこれ1つだけだ。CursorBench 4.0 と FrontierCode 1.1 では Opus 5.5 が上回る。OSWorld 2.1 と Humanity's Last Exam でも Opus 5.5 が1〜3ポイント差で優位を保っている。

開発者はどこで Sonnet 5.5 を使えるのか

Claude Platform でネイティブに提供され、Amazon Web Services、Google Cloud、Microsoft Azure 経由でも claude-sonnet-5-5 という識別子で利用できる。一般利用者は Claude.ai から使える。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

Opus 5.5、最大努力設定では最初のトークンまで682秒待たされた
LLM & Chatbots

Opus 5.5、最大努力設定では最初のトークンまで682秒待たされた

Artificial Analysisの計測では、Claude Opus 5.5の最大努力設定は最初のトークンまで682.71秒かかった。同等モデルの中央値は3.79秒である。

Seung Jung19 時間前
Anthropic、インフォスティーラーが有料Claudeアカウントの利用枠を食い潰していると警告
LLM & Chatbots

Anthropic、インフォスティーラーが有料Claudeアカウントの利用枠を食い潰していると警告

Anthropicが、インフォスティーラーにログインセッションを盗まれたClaude利用者へ警告メールを送っている。攻撃者はパスワードを見ずに有料の利用枠を消費している。

Seung Jung19 日前
Mercury 2.5、毎秒1,107トークンで100万トークン4セント
LLM & Chatbots

Mercury 2.5、毎秒1,107トークンで100万トークン4セント

電話エージェントのスタートアップは、Mercuryによって最悪時の応答が数分から1秒に縮んだと述べています。Inception Labsの新しい拡散モデルは、その種の数字を軸に設計されています。

Seung Jung15 日前
Claudeは成人限定、しかし年齢判定が成人まで締め出している
LLM & Chatbots

Claudeは成人限定、しかし年齢判定が成人まで締め出している

AnthropicがClaudeの18歳以上ルールの運用を公開した。分類器が未成年と疑われるアカウントを停止し、誤判定された成人はYotiの確認で復旧できる。

Seung Jung17 日前
Claude Opus 5.5、価格2割引き下げ ただし一部のリクエストは旧モデルが処理する
LLM & Chatbots

Claude Opus 5.5、価格2割引き下げ ただし一部のリクエストは旧モデルが処理する

Claude Opus 5.5が100万トークンあたり4/20ドルで登場した。キャッシュ読み出しは6割下がり、一部の作業を旧世代のClaudeモデルへ回す安全機構が併せて適用される。

Seung Jung6 日前
OpenAIの新メンタルヘルス指標、最高スコアは57.3%
LLM & Chatbots

OpenAIの新メンタルヘルス指標、最高スコアは57.3%

22カ国の臨床家80人超と作ったOpenAIのMentalHealthBenchで、首位のGPT-6 Astraが57.3%。Claude Opus 5.5は52.4%だった。

Seung Jung23 時間前