AI Newsway

Sonnet 5.5 把被擋下的資安請求轉回 Sonnet 5 — API 用戶得自行開啟

Anthropic 自家測試顯示,被轉走流量的注入攻破率約為 Sonnet 5.5 自行回覆時的 175 倍

|5分鐘閱讀0
A user interacting with a chat assistant, the interface layer where Anthropic's Claude apps display a notice when a blocked request falls back to Sonnet 5
A user interacting with a chat assistant, the interface layer where Anthropic's Claude apps display a notice when a blocked request falls back to Sonnet 5

Claude Sonnet 5.5 發表資料中最危險的一段不是能力分數,而是一條路由規則:分類器擋下資安請求後,平台可能改由舊版 Sonnet 5 代為回覆,而 Anthropic 自家的提示詞注入測試發現,這些被轉走的流量遠比原本容易攻破。The New Stack 率先整理了 Claude 應用程式與 API 在此行為上的差異。

重點摘要

  • Claude 應用程式會自動把被擋下的資安請求轉給 Sonnet 5,API 呼叫方則必須自行開啟備援;關閉時,被擋下的請求不會轉走,而是直接失敗。
  • 在 Anthropic 的程式開發環境測試中,被轉走的請求有 12.01% 遭到攻破;Sonnet 5.5 自行處理的 5,901 次請求中只有 4 次被攻破,差距約達百倍。
  • Sonnet 5.5 是 Sonnet 等級中第一款套用該資安政策的模型,此前 Anthropic 只在 Opus 上採用。

請求路徑上改了什麼

新增的有兩項,但只有一項會寫進模型卡。第一項是攔截本身:範圍收得很窄的一組資安請求,加上少數與前沿模型開發相關的類別,例如針對特定 ML 加速器的核心程式工作,可能被直接拒絕。

第二項是接下來發生的事。在 Anthropic 自家應用程式中,被拒絕的資安請求會改由 Sonnet 5 重試,使用者會看到一則說明是哪一款模型回答的提示。在 API 上,開發者不開啟就沒有這道重試。對於把這次發布當成設定檔裡換個版號的人來說,陷阱就在這裡:原本在 Sonnet 5 上跑得好好的流程,面對同一批貼近資安主題的提示詞,可能開始直接回傳失敗。

備援是資安決策,不是可用性決策

開啟備援看起來只是換來可用性的划算選擇,Anthropic 的數字卻不這麼說。在程式開發環境的提示詞注入測試中,針對 Sonnet 5.5 的請求有四分之一觸發資安分類器後被轉給 Sonnet 5,原因往往是注入指令要求清空磁碟或刪除檔案,這正好與分類器要攔下的行為極為相似。

被轉走的這一部分中,12.01% 遭到成功攻破。Sonnet 5.5 自行處理時,5,901 次嘗試中被攻破 4 次,約 0.07%。講白一點:開啟備援等於可能把四分之一的對抗性流量,送進一款注入測試失敗率比你所選模型高出百倍以上的模型。不過護欄廠商 Gray Swan 的另一項間接注入基準測試顯示,開啟備援後分數並未下滑,可見這個效應在各套測試中並不一致。

促成新政策的能力躍升

這些措施並非憑空加上。根據 Anthropic 公布的數據,Sonnet 5.5 在代理式程式開發測試 Terminal-Bench 4.0 拿下 70.6%,Sonnet 5 為 10.3%,價格更高的 Opus 5.5 則是 66.4%;定價維持每百萬輸入 token 2 美元、每百萬輸出 token 10 美元。

攻擊性資安方面的進步更明顯。在關閉防護的情況下,系統卡記錄 ExploitBench 的 410 次執行中有 178 次完成完整的任意程式碼執行。在 Irregular 的 CyScenarioBench 上,Sonnet 5 只完成 0.7% 的挑戰,這款模型完成了 46.1%;在以 Google OSS-Fuzz 語料為基礎的二進位漏洞利用基準上,它產出 50 次控制流劫持,Sonnet 5 則為 3 次。Anthropic 仍把它的資安能力排在 Opus 5.5 之下,只是它與前一代 Sonnet 的落差,大到足以把 Opus 等級的政策一路拉到低一階的價格帶。

攔截如何執行

由三個元件共同判斷。一個探針檢視模型的內部活化值,一個輕量分類器在 Sonnet 5.5 上運作,另有一個獨立訓練的 LLM 分類器在切斷對話前權衡探針的判定。Anthropic 表示,其資安偵測水準與 Opus 5 相當,但越獄防護刻意放寬,同時預先告知使用者拒絕次數會比 Sonnet 5 多,正當的資安工作也包含在內。該公司一名代表舉出滲透測試、漏洞利用程式生成與二進位漏洞掃描,作為納入範圍的例子。

升級前該敲定的事

  1. 審慎決定備援設定,並把它寫成資安選擇而非重試政策。
  2. 記錄每一次請求由哪款模型回答;Anthropic 表示被轉走的回應會自行標示。
  3. 不只針對名義上選定的模型,也要對 Sonnet 5 重跑注入測試。

為降低誤判的分類器調校仍在進行,通過驗證的防禦方可望透過擴大後的 Cyber Verification Program 取得較寬鬆的存取權限,而 Sonnet 5.5 在發布時尚未納入該計畫。同一次發布的基準測試面向,本站先前已有報導。

FAQ 常見問題

Sonnet 5 備援是預設開啟的嗎?

在 API 上並非如此。Anthropic 的 Claude 應用程式會自動把被擋下的資安請求交給 Sonnet 5 重試,但 API 開發者必須自行開啟備援,第三方平台的作法也可能再有不同。關閉時,被擋下的請求不會轉走,而是直接失敗。

一般的程式開發工作會碰到這些防護嗎?

Anthropic 表示多數請求不會,日常軟體開發不受影響。這項政策針對的是滲透測試、漏洞利用程式生成等高風險資安任務,不過該公司也提醒,正當的資安工作被拒絕的次數會比 Sonnet 5 時期更多。

Sonnet 5.5 比 Sonnet 5 貴嗎?

不貴。定價完全相同,每百萬輸入 token 2 美元、每百萬輸出 token 10 美元;Anthropic 並表示這款模型每項任務所需的 token 通常更少,實際成本最多可比前一代低 30%。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

Claude Code Projects 回歸,化身統籌平行雲端執行緒的協調者
Developer Tools

Claude Code Projects 回歸,化身統籌平行雲端執行緒的協調者

重新設計的 Claude Code Projects 在工作執行緒之上擺了一個協調者,每條執行緒都是跑在自有分支上的完整雲端工作階段,並且共用同一份記憶。

Seung Jung12 天前
七個月湧入一百萬個代理技能 — 其中近半數只被安裝過一次
Developer Tools

七個月湧入一百萬個代理技能 — 其中近半數只被安裝過一次

Vercel 的 skills.sh 在七個月內突破一百萬個代理技能。近半數只被安裝過一次,375 個項目就吃下全部安裝量的 62%。

Seung Jung3 天前
研究人員從論壇影像漏洞一路摸進OpenAI內部儲存庫
Developer Tools

研究人員從論壇影像漏洞一路摸進OpenAI內部儲存庫

Hacktron AI串起libheif堆積溢位與OpenAI的SSO缺陷,觸及員工Codex帳號與openai/openai單一程式庫。兩個漏洞皆已修補。

Seung Jung11 天前
四種Opus 5的請求寫法,在Claude Opus 5.5上會回400
Developer Tools

四種Opus 5的請求寫法,在Claude Opus 5.5上會回400

Claude Opus 5.5比Opus 5便宜20%,卻對Opus 5原本接受的四種請求回傳HTTP 400。第五項變更則讓代理的進度串流悄悄消音。

Seung Jung昨天
合併3000次、零回滾:Anthropic兩週加速衝刺的內幕
Developer Tools

合併3000次、零回滾:Anthropic兩週加速衝刺的內幕

Anthropic在八月的衝刺中把claude.ai的p75可輸入時間從3.1秒壓到0.55秒,靠著以指令數卡住CI,兩週合併3000次變更且零回滾。

Seung Jung5 天前
Bun 從 Zig 移植到 Rust,只花 11 天與 64 個並行代理程式
Developer Tools

Bun 從 Zig 移植到 Rust,只花 11 天與 64 個並行代理程式

Bun 的執行環境以 11 天的代理程式移植,從 Zig 轉到 Rust。記憶體安全的錯誤消失了,語意上的錯誤沒有。

Seung Jung9 天前