Claude Sonnet 5.5 發表資料中最危險的一段不是能力分數,而是一條路由規則:分類器擋下資安請求後,平台可能改由舊版 Sonnet 5 代為回覆,而 Anthropic 自家的提示詞注入測試發現,這些被轉走的流量遠比原本容易攻破。The New Stack 率先整理了 Claude 應用程式與 API 在此行為上的差異。
重點摘要
- Claude 應用程式會自動把被擋下的資安請求轉給 Sonnet 5,API 呼叫方則必須自行開啟備援;關閉時,被擋下的請求不會轉走,而是直接失敗。
- 在 Anthropic 的程式開發環境測試中,被轉走的請求有 12.01% 遭到攻破;Sonnet 5.5 自行處理的 5,901 次請求中只有 4 次被攻破,差距約達百倍。
- Sonnet 5.5 是 Sonnet 等級中第一款套用該資安政策的模型,此前 Anthropic 只在 Opus 上採用。
請求路徑上改了什麼
新增的有兩項,但只有一項會寫進模型卡。第一項是攔截本身:範圍收得很窄的一組資安請求,加上少數與前沿模型開發相關的類別,例如針對特定 ML 加速器的核心程式工作,可能被直接拒絕。
第二項是接下來發生的事。在 Anthropic 自家應用程式中,被拒絕的資安請求會改由 Sonnet 5 重試,使用者會看到一則說明是哪一款模型回答的提示。在 API 上,開發者不開啟就沒有這道重試。對於把這次發布當成設定檔裡換個版號的人來說,陷阱就在這裡:原本在 Sonnet 5 上跑得好好的流程,面對同一批貼近資安主題的提示詞,可能開始直接回傳失敗。
備援是資安決策,不是可用性決策
開啟備援看起來只是換來可用性的划算選擇,Anthropic 的數字卻不這麼說。在程式開發環境的提示詞注入測試中,針對 Sonnet 5.5 的請求有四分之一觸發資安分類器後被轉給 Sonnet 5,原因往往是注入指令要求清空磁碟或刪除檔案,這正好與分類器要攔下的行為極為相似。
被轉走的這一部分中,12.01% 遭到成功攻破。Sonnet 5.5 自行處理時,5,901 次嘗試中被攻破 4 次,約 0.07%。講白一點:開啟備援等於可能把四分之一的對抗性流量,送進一款注入測試失敗率比你所選模型高出百倍以上的模型。不過護欄廠商 Gray Swan 的另一項間接注入基準測試顯示,開啟備援後分數並未下滑,可見這個效應在各套測試中並不一致。
促成新政策的能力躍升
這些措施並非憑空加上。根據 Anthropic 公布的數據,Sonnet 5.5 在代理式程式開發測試 Terminal-Bench 4.0 拿下 70.6%,Sonnet 5 為 10.3%,價格更高的 Opus 5.5 則是 66.4%;定價維持每百萬輸入 token 2 美元、每百萬輸出 token 10 美元。
攻擊性資安方面的進步更明顯。在關閉防護的情況下,系統卡記錄 ExploitBench 的 410 次執行中有 178 次完成完整的任意程式碼執行。在 Irregular 的 CyScenarioBench 上,Sonnet 5 只完成 0.7% 的挑戰,這款模型完成了 46.1%;在以 Google OSS-Fuzz 語料為基礎的二進位漏洞利用基準上,它產出 50 次控制流劫持,Sonnet 5 則為 3 次。Anthropic 仍把它的資安能力排在 Opus 5.5 之下,只是它與前一代 Sonnet 的落差,大到足以把 Opus 等級的政策一路拉到低一階的價格帶。
攔截如何執行
由三個元件共同判斷。一個探針檢視模型的內部活化值,一個輕量分類器在 Sonnet 5.5 上運作,另有一個獨立訓練的 LLM 分類器在切斷對話前權衡探針的判定。Anthropic 表示,其資安偵測水準與 Opus 5 相當,但越獄防護刻意放寬,同時預先告知使用者拒絕次數會比 Sonnet 5 多,正當的資安工作也包含在內。該公司一名代表舉出滲透測試、漏洞利用程式生成與二進位漏洞掃描,作為納入範圍的例子。
升級前該敲定的事
- 審慎決定備援設定,並把它寫成資安選擇而非重試政策。
- 記錄每一次請求由哪款模型回答;Anthropic 表示被轉走的回應會自行標示。
- 不只針對名義上選定的模型,也要對 Sonnet 5 重跑注入測試。
為降低誤判的分類器調校仍在進行,通過驗證的防禦方可望透過擴大後的 Cyber Verification Program 取得較寬鬆的存取權限,而 Sonnet 5.5 在發布時尚未納入該計畫。同一次發布的基準測試面向,本站先前已有報導。
FAQ 常見問題
Sonnet 5 備援是預設開啟的嗎?
在 API 上並非如此。Anthropic 的 Claude 應用程式會自動把被擋下的資安請求交給 Sonnet 5 重試,但 API 開發者必須自行開啟備援,第三方平台的作法也可能再有不同。關閉時,被擋下的請求不會轉走,而是直接失敗。
一般的程式開發工作會碰到這些防護嗎?
Anthropic 表示多數請求不會,日常軟體開發不受影響。這項政策針對的是滲透測試、漏洞利用程式生成等高風險資安任務,不過該公司也提醒,正當的資安工作被拒絕的次數會比 Sonnet 5 時期更多。
Sonnet 5.5 比 Sonnet 5 貴嗎?
不貴。定價完全相同,每百萬輸入 token 2 美元、每百萬輸出 token 10 美元;Anthropic 並表示這款模型每項任務所需的 token 通常更少,實際成本最多可比前一代低 30%。






