Claude Sonnet 5.5の発表資料で最も危ういのは性能スコアではなく、ルーティング規則である。分類器がサイバーセキュリティ要請をブロックすると、プラットフォームは旧世代のSonnet 5にその要請を回して応答させることがあり、Anthropic自身のプロンプトインジェクション試験では、こうして回されたトラフィックがはるかに容易に突破された。ClaudeアプリとAPIで挙動がどう異なるかは、The New Stackが最初に整理している。
要点
- Claudeアプリはブロックしたサイバー要請を自動でSonnet 5へ回すが、API利用者は自らフォールバックを有効にする必要がある。無効のままなら、ブロックされた要請は回されずにそのまま失敗する。
- Anthropicのコーディング環境テストでは、回された要請の12.01%が突破された。Sonnet 5.5が自ら処理した5,901件では4件にとどまる。おおよそ100倍規模の開きだ。
- Sonnet 5.5は、AnthropicがこれまでOpusにのみ適用してきたサイバー方針を初めて適用したSonnet級モデルである。
リクエスト経路で何が変わったか
新しい点は二つあるが、モデルカードに現れるのは一方だけだ。第一はブロックそのものである。狭く定義されたサイバー要請群に加え、特定のMLアクセラレータ向けカーネル作業のようにフロンティアモデル開発と接する少数の領域が、そのまま拒否されうる。
第二はその後の挙動だ。Anthropicのアプリでは拒否されたサイバー要請がSonnet 5で再試行され、どのモデルが応答したかが利用者に表示される。APIでは、開発者が有効にするまでこの再試行は存在しない。今回のリリースを設定ファイルのバージョン番号を書き換えるだけの作業と捉える向きには、ここが落とし穴になる。Sonnet 5で動いていたパイプラインが、同じセキュリティ隣接のプロンプトに対して失敗を返し始めかねない。
フォールバックは可用性ではなくセキュリティの判断だ
フォールバックを有効にすることは、一見すると可用性を得る選択に見える。Anthropicが示した数字は別の話をしている。コーディング環境のプロンプトインジェクション試験では、Sonnet 5.5に向けた要請の4分の1がサイバー分類器に引っかかり、Sonnet 5へ回された。ディスクを消去せよ、ファイルを削除せよという注入命令が、分類器が止めようとしている振る舞いそのものに似ているためだ。
回された分のうち12.01%が実際に突破された。Sonnet 5.5が自ら処理した場合は5,901回の試行中4回、約0.07%である。端的に言えば、フォールバックを有効にした瞬間、敵対的トラフィックの4分の1が、開発者が選んだモデルよりインジェクション試験の失敗率が100倍以上高いモデルへ流れうる。ただしガードレールベンダーGray Swanの間接インジェクションベンチマークでは、フォールバックを有効にしてもスコアは下がらず、影響はすべての試験群で一様ではない。
方針を引き出した性能の跳躍
これらは当て推量で適用されたわけではない。Anthropicが公開した数値では、Sonnet 5.5はエージェント型コーディング試験Terminal-Bench 4.0で70.6%を記録した。Sonnet 5は10.3%、より高価なOpus 5.5は66.4%である。価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルで据え置かれた。
攻撃的セキュリティ面の伸びはさらに急だ。安全策を切った状態で、システムカードはExploitBenchの410回中178回で任意コード実行が完遂したと記録している。IrregularのCyScenarioBenchでは、Sonnet 5が0.7%にとどまった課題を46.1%完了し、GoogleのOSS-Fuzzコーパスから作られたバイナリ脆弱性ベンチマークでは制御フロー乗っ取りを50回成立させた。Sonnet 5は3回である。Anthropicは依然としてこのモデルのサイバー能力をOpus 5.5より下に位置づける。ただし前世代Sonnetとの差が、Opus級の方針を一段下の価格帯まで引き下げるほど大きかった。
ブロックはどう執行されるか
三つの構成要素が判断する。プローブがモデル内部の活性を検査し、軽量な分類器がSonnet 5.5上で動き、別途訓練されたLLM分類器がプローブの判定を勘案したうえで会話が打ち切られる。Anthropicはサイバー検知の水準をOpus 5と同等とし、脱獄防御は意図的に緩めていると説明する。そのうえで、正当なセキュリティ業務を含めSonnet 5より拒否が増えると利用者に予告している。同社関係者は、ペネトレーションテスト、エクスプロイト生成、バイナリ脆弱性スキャンを適用対象の例として挙げた。
移行前に決めておくこと
- フォールバック設定を再試行ポリシーではなくセキュリティ上の選択として意識的に決め、その旨を文書に残す。
- 要請ごとにどのモデルが応答したかを記録する。Anthropicによれば、回された応答は自らその旨を示す。
- 名目上選んだモデルだけでなく、Sonnet 5に対してもインジェクション試験をやり直す。
誤検知を減らすための分類器の調整は続いており、検証済みの防御側には拡大されたCyber Verification Programを通じてより緩やかなアクセスが与えられる見込みだ。Sonnet 5.5は公開時点でこのプログラムに加わっていなかった。同じリリースのベンチマーク面は先の記事で扱っている。
FAQ よくある質問
Sonnet 5へのフォールバックは既定で有効か
APIでは有効ではない。AnthropicのClaudeアプリはブロックしたサイバー要請を自動でSonnet 5に再試行するが、API開発者は自らフォールバックを有効にする必要があり、サードパーティのプラットフォームはさらに異なる挙動を取りうる。無効のままなら、ブロックされた要請は回されずに失敗する。
通常のコーディング作業もこの安全策に触れるのか
Anthropicは大半は触れず、日常的なソフトウェア開発は影響を受けないとしている。方針が狙うのはペネトレーションテストやエクスプロイト生成といった高リスクのサイバーセキュリティ作業だ。ただし同社は、正当なセキュリティ業務でもSonnet 5より拒否が増えうると警告している。
Sonnet 5.5はSonnet 5より高価か
高くはない。価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルで同一である。Anthropicは、課題あたりに必要なトークンが概して減るため、実質コストは前世代より最大30%低くなるとしている。






