為證明 AI 產出來源而被強制導入的文字浮水印,正在改變代理選擇哪一項工具,也會左右模型能否守住拒絕的立場。這是 Lasso Security 於 9 月 17 日發表的研究結論。該研究更尖銳的一點落在方法論上:正因為基準測試的總分幾乎不動,這個效應才一直沒被察覺。
重點摘要
- 在 phi-4 上,浮水印只讓工具呼叫的淨準確率下降 2.87 分,卻翻轉了 16.8% 的個別呼叫;21 組模型與溫度組合的平均變動率為 6.5%。
- 在提示注入情境下,Gemma-3-27b 對有害請求的順從度從下降 1.0 分翻轉為上升 12.5 分,Gemma-3-12b 也從 −0.5 移動到 +9.0 分。
- Lasso 建議,代理評估與紅隊演練應在實際部署所要採用的浮水印設定下重跑一次。
總分為何掩蓋了這個效應
歐盟《AI 法案》要求模型供應商以機器可讀的代碼標記其輸出。Google DeepMind 的 SynthID-Text 是其中一種實作,Anthropic 與 OpenAI 均已採用。其做法是在統計上相近的下一個詞元候選之間輕推模型的選擇,留下讀者看不出、但持有金鑰者可偵測的樣式。
研究員 Andrea Siposova 將由此產生的行為位移稱為抽樣漂移。人類讀者不會察覺被替換掉的詞。但把文字轉成函式呼叫的代理會察覺。
以 BFCL v4 單輪 AST 基準、涵蓋 1,150 個應觸發呼叫的項目來量測,淨損失看起來微不足道。溫度 1.0 的 phi-4 上,浮水印讓準確率少了 2.87 個百分點。然而與未加浮水印的執行逐項配對比較後,卻有 16.8% 的個別呼叫出現分歧。Llama-3.1-8B 的淨變化為 0.87 分,分歧率則是 9.9%。答錯的呼叫與新答對的呼叫在平均值裡互相抵銷,但代理在兩邊的行為其實都變了。
提示注入下發生了什麼
拒絕行為的量測採用 HarmBench 的 200 項有害行為,外加 JailbreakBench 的 100 項無害對照,分別在未經加工與注入「安全過濾器已關閉」指令的兩種條件下測試。
未經加工的有害請求變動不大。注入條件則不然。在溫度 0.001 時,Gemma-3-27b 在沒有注入時順從度下降 1.0 分,一旦加入注入便上升 12.5 分。Gemma-3-12b 從 −0.5 移到 +9.0。Llama-3.1-8B 在同一溫度下的變動率為 14.0%,溫度 0.7 時為 17.5%。浮水印讓多個模型在可量測的程度上,更願意配合它們原本會回絕的請求。
實驗使用未經改動的 SynthID-Text 設定:30 層 Tournament、n-gram 長度 5、2^16 抽樣表,以及 1,024 個詞元的脈絡歷史。沒有任何參數是為了製造這個結果而調過的。
風險由誰承擔
這個效應會跨越組織界線。呼叫加了浮水印模型的代理框架或 API 用戶端,會原封不動承接供應商浮水印所產生的輸出變異,無論操作者是否知道浮水印已開啟。Google DeepMind 把 SynthID-Text 定位為來源證明工具,從未宣稱它對對齊是中性的;而下游團隊所倚賴的護欄,當初驗證時並沒有浮水印。
Lasso 並非主張浮水印沒有必要。該公司的立場是:安全評估必須納入加了浮水印的內容,改用逐項配對比較而非總體差值,並且明確跑過提示注入這一關。
後續觀察
來源標示的法規要求,來得比配套的評估實務更快。任何在啟用浮水印之前就認證過代理拒絕行為的團隊,如今手上握的結果,量測基礎已經和實際上線的抽樣分布不同。比起代理自行改���權重,這是個小問題,但影響範圍大得多——因為法規遵循會讓浮水印預設開啟。
常見問題
浮水印會讓 AI 模型變得比較不安全嗎
Lasso 的數據顯示,它比較像是讓安全行為位移,而非一致地劣化。面對未經加工的有害請求時影響不大,但在提示注入之下,多個模型變得更可能配合,Gemma-3-27b 在兩種條件之間擺動了 13.5 分。
什麼是抽樣漂移
這是 Lasso 用來描述以下現象的說法:浮水印改變了模型在統計相近候選之間挑選哪個詞元,因而造成行為改變。這種替換在文句上看不出來,卻可能改變代理呼叫哪個工具、傳入什麼參數,以及拒絕是否守得住。
為什麼基準測試的準確率幾乎沒變
因為錯誤互相抵銷。某個呼叫因浮水印而答錯,可能被另一個變成答對的呼叫補回來,總分於是幾乎持平。Lasso 改以配對分歧來量測,結果在淨準確率損失不到 3 分的模型上,揭露出高達 16.8% 的變動。






