Sonnet 5.5、ブロックしたサイバー要請をSonnet 5へ差し戻す — APIでは開発者がオプトイン

Anthropic自身のテストでは、差し戻されたトラフィックのインジェクション成功率がSonnet 5.5の直接応答時の約175倍に達した

|5分で読める0
A user interacting with a chat assistant, the interface layer where Anthropic's Claude apps display a notice when a blocked request falls back to Sonnet 5
A user interacting with a chat assistant, the interface layer where Anthropic's Claude apps display a notice when a blocked request falls back to Sonnet 5

Claude Sonnet 5.5の発表資料で最も危ういのは性能スコアではなく、ルーティング規則である。分類器がサイバーセキュリティ要請をブロックすると、プラットフォームは旧世代のSonnet 5にその要請を回して応答させることがあり、Anthropic自身のプロンプトインジェクション試験では、こうして回されたトラフィックがはるかに容易に突破された。ClaudeアプリとAPIで挙動がどう異なるかは、The New Stackが最初に整理している。

要点

  • Claudeアプリはブロックしたサイバー要請を自動でSonnet 5へ回すが、API利用者は自らフォールバックを有効にする必要がある。無効のままなら、ブロックされた要請は回されずにそのまま失敗する。
  • Anthropicのコーディング環境テストでは、回された要請の12.01%が突破された。Sonnet 5.5が自ら処理した5,901件では4件にとどまる。おおよそ100倍規模の開きだ。
  • Sonnet 5.5は、AnthropicがこれまでOpusにのみ適用してきたサイバー方針を初めて適用したSonnet級モデルである。

リクエスト経路で何が変わったか

新しい点は二つあるが、モデルカードに現れるのは一方だけだ。第一はブロックそのものである。狭く定義されたサイバー要請群に加え、特定のMLアクセラレータ向けカーネル作業のようにフロンティアモデル開発と接する少数の領域が、そのまま拒否されうる。

第二はその後の挙動だ。Anthropicのアプリでは拒否されたサイバー要請がSonnet 5で再試行され、どのモデルが応答したかが利用者に表示される。APIでは、開発者が有効にするまでこの再試行は存在しない。今回のリリースを設定ファイルのバージョン番号を書き換えるだけの作業と捉える向きには、ここが落とし穴になる。Sonnet 5で動いていたパイプラインが、同じセキュリティ隣接のプロンプトに対して失敗を返し始めかねない。

フォールバックは可用性ではなくセキュリティの判断だ

フォールバックを有効にすることは、一見すると可用性を得る選択に見える。Anthropicが示した数字は別の話をしている。コーディング環境のプロンプトインジェクション試験では、Sonnet 5.5に向けた要請の4分の1がサイバー分類器に引っかかり、Sonnet 5へ回された。ディスクを消去せよ、ファイルを削除せよという注入命令が、分類器が止めようとしている振る舞いそのものに似ているためだ。

回された分のうち12.01%が実際に突破された。Sonnet 5.5が自ら処理した場合は5,901回の試行中4回、約0.07%である。端的に言えば、フォールバックを有効にした瞬間、敵対的トラフィックの4分の1が、開発者が選んだモデルよりインジェクション試験の失敗率が100倍以上高いモデルへ流れうる。ただしガードレールベンダーGray Swanの間接インジェクションベンチマークでは、フォールバックを有効にしてもスコアは下がらず、影響はすべての試験群で一様ではない。

方針を引き出した性能の跳躍

これらは当て推量で適用されたわけではない。Anthropicが公開した数値では、Sonnet 5.5はエージェント型コーディング試験Terminal-Bench 4.0で70.6%を記録した。Sonnet 5は10.3%、より高価なOpus 5.5は66.4%である。価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルで据え置かれた。

攻撃的セキュリティ面の伸びはさらに急だ。安全策を切った状態で、システムカードはExploitBenchの410回中178回で任意コード実行が完遂したと記録している。IrregularのCyScenarioBenchでは、Sonnet 5が0.7%にとどまった課題を46.1%完了し、GoogleのOSS-Fuzzコーパスから作られたバイナリ脆弱性ベンチマークでは制御フロー乗っ取りを50回成立させた。Sonnet 5は3回である。Anthropicは依然としてこのモデルのサイバー能力をOpus 5.5より下に位置づける。ただし前世代Sonnetとの差が、Opus級の方針を一段下の価格帯まで引き下げるほど大きかった。

ブロックはどう執行されるか

三つの構成要素が判断する。プローブがモデル内部の活性を検査し、軽量な分類器がSonnet 5.5上で動き、別途訓練されたLLM分類器がプローブの判定を勘案したうえで会話が打ち切られる。Anthropicはサイバー検知の水準をOpus 5と同等とし、脱獄防御は意図的に緩めていると説明する。そのうえで、正当なセキュリティ業務を含めSonnet 5より拒否が増えると利用者に予告している。同社関係者は、ペネトレーションテスト、エクスプロイト生成、バイナリ脆弱性スキャンを適用対象の例として挙げた。

移行前に決めておくこと

  1. フォールバック設定を再試行ポリシーではなくセキュリティ上の選択として意識的に決め、その旨を文書に残す。
  2. 要請ごとにどのモデルが応答したかを記録する。Anthropicによれば、回された応答は自らその旨を示す。
  3. 名目上選んだモデルだけでなく、Sonnet 5に対してもインジェクション試験をやり直す。

誤検知を減らすための分類器の調整は続いており、検証済みの防御側には拡大されたCyber Verification Programを通じてより緩やかなアクセスが与えられる見込みだ。Sonnet 5.5は公開時点でこのプログラムに加わっていなかった。同じリリースのベンチマーク面は先の記事で扱っている。

FAQ よくある質問

Sonnet 5へのフォールバックは既定で有効か

APIでは有効ではない。AnthropicのClaudeアプリはブロックしたサイバー要請を自動でSonnet 5に再試行するが、API開発者は自らフォールバックを有効にする必要があり、サードパーティのプラットフォームはさらに異なる挙動を取りうる。無効のままなら、ブロックされた要請は回されずに失敗する。

通常のコーディング作業もこの安全策に触れるのか

Anthropicは大半は触れず、日常的なソフトウェア開発は影響を受けないとしている。方針が狙うのはペネトレーションテストやエクスプロイト生成といった高リスクのサイバーセキュリティ作業だ。ただし同社は、正当なセキュリティ業務でもSonnet 5より拒否が増えうると警告している。

Sonnet 5.5はSonnet 5より高価か

高くはない。価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルで同一である。Anthropicは、課題あたりに必要なトークンが概して減るため、実質コストは前世代より最大30%低くなるとしている。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

Claude Code Projectsが刷新、並列クラウドスレッドを束ねる調整役に
Developer Tools

Claude Code Projectsが刷新、並列クラウドスレッドを束ねる調整役に

刷新されたClaude Code Projectsは、作業スレッドの上に調整役を置きます。各スレッドは自前のブランチで動く完全なクラウドセッションで、メモリを共有します。

Seung Jung12 日前
7 カ月でエージェントスキル 100 万件 — その半数近くはインストール 1 回きり
Developer Tools

7 カ月でエージェントスキル 100 万件 — その半数近くはインストール 1 回きり

Vercel の skills.sh が 7 カ月でエージェントスキル 100 万件を突破した。半数近くはインストール 1 回きりで、375 件が全インストールの 62% を占める。

Seung Jung3 日前
フォーラムの画像不具合から、研究者がOpenAI社内リポジトリに到達
Developer Tools

フォーラムの画像不具合から、研究者がOpenAI社内リポジトリに到達

Hacktron AIがlibheifのヒープオーバーフローとOpenAIのSSO不備を連鎖させ、従業員のCodexアカウントとopenai/openaiモノレポに到達した。両方の不具合は修正済み。

Seung Jung11 日前
Claude Opus 5.5で400を返すようになったOpus 5のリクエスト4パターン
Developer Tools

Claude Opus 5.5で400を返すようになったOpus 5のリクエスト4パターン

Claude Opus 5.5はOpus 5より20%安い一方、Opus 5が通していた4つのリクエストにHTTP 400を返す。5つ目の変更はエージェントの進捗表示を黙らせる。

Seung Jung昨日
マージ3000件、ロールバック0件 — Anthropicの2週間スピード集中作戦
Developer Tools

マージ3000件、ロールバック0件 — Anthropicの2週間スピード集中作戦

Anthropicは8月の集中作戦でclaude.aiのp75入力可能時間を3.1秒から0.55秒に短縮。CIを命令数で止める仕組みにより、3000件をロールバックなしでマージした。

Seung Jung5 日前
Bun の Zig から Rust への移植は 11 日、並列エージェント 64 体
Developer Tools

Bun の Zig から Rust への移植は 11 日、並列エージェント 64 体

Bun のランタイムが 11 日間のエージェント移植で Zig から Rust へ移った。メモリ安全性のバグは消えたが、意味のバグは残った。

Seung Jung9 日前