AI Newsway

跨對話漏洞讓 OpenAI 模型自行解開加密推論

OpenAI 表示,操作者把加密的推論資料從一段對話複製到另一段,再要求模型把內容抄寫出來。漏洞已修補,但該公司說同樣的路徑在別處也存在。

|5分鐘閱讀0
The office building at 1515 Third Street in San Francisco's Mission Bay neighborhood, which has housed OpenAI's headquarters.
The office building at 1515 Third Street in San Francisco's Mission Bay neighborhood, which has housed OpenAI's headquarters.

OpenAI 本週描述的攻擊,並沒有破解加密本身。操作者從一段對話複製出加密的推論資料,另開一段新對話,要求模型把那串資料解開並以純文字寫出來,模型照做了。OpenAI 週三發布一份未具名的行動報告,把這套手法定位為新型態,並說造成跨對話跳接的漏洞已經修好。

重點摘要

  • 手法是把加密推論在對話之間搬移,再用模型本身當解碼器,過程未觸及金鑰、資料庫或已儲存的對話。
  • 7 月 24 至 25 日為尖峰,4000 名使用者發出的 1 萬 6000 則提示符合單一萃取模式;可疑帳號叢集到 7 月 28 日擴大到 1 萬 5000 個。
  • OpenAI 封住跨對話解密路徑,收緊註冊與基礎設施控管,擴大網路監控,並表示這個弱點並非自家模型獨有。

被隱藏的推論為何值得偷

前沿實驗室只交出答案,卻把產生答案的思維鏈軌跡藏起來。理由是競爭而非美觀:那些中間步驟是對手最可能拿去訓練的高價值監督訊號,因此在送達用戶端之前就先加密。

加密的前提,是密文對每個接觸到它的人都維持不透明。這次的缺陷在於,一個夠強的模型並不算在「每個人」裡面。把密文交到一個握有還原手段的情境裡,剩下的就由模型的樂於助人完成。真正的防線從來不是密碼,而是「使用者邊界內沒有任何元件能把它倒推回去」這個假設。

OpenAI 自己的措辭很克制,值得精確引述:操作者沒有破解加密、沒有入侵資料庫,也沒有直接取得已儲存的使用者對話。他們做的是操縱與模型的互動,讓受保護的推論以請求方看得見的形式被重現,而且是大規模進行,違反服務條款。

時間線透露了什麼

根據 CyberScoop 的報導,低強度試探從 7 月 1 日開始,之後緩步攀升。暴增出現在 7 月 24 與 25 日,約 4000 名使用者送出的 1 萬 6000 則提示吻合同一套萃取模式。後續分析把相關提示的叢集擴大到 1 萬 5000 個帳號,OpenAI 說整起行動在 7 月 28 日完全瓦解。

有兩個細節比原始數字更值得注意。第一,外部研究者在 8 月向 OpenAI 通報了類似漏洞,當時這波行動早已被切斷,顯示這條路徑可以被獨立發現,不需要內部資訊。第二,在觸發偵測的暴增之前,流量已經連續近三週緩慢上升;只盯著量體的濫用監控,會錯過這段安靜的助跑。

沒有公開證據的歸因

OpenAI 把核心叢集歸給替 Moonshot AI 工作的個人,該公司是 Kimi 系列開源 LLM 的開發商;同時也說,不確定所有觀察到的活動是否彼此相關。這篇貼文沒有提出支持該歸因的技術證據,公司並以資安為由拒絕向記者多做說明。Anthropic 今年稍早也採取類似做法,點名實驗室卻不公開背後訊號。

讀者應把手法與歸因視為證據份量不同的兩種主張。跨對話解密路徑可以驗證:它被修補了,第三方也找得到。至於帳號背後是誰,目前仍只是斷言。

對其他業者的影響

OpenAI 表示,基於這種操縱並非自家系統獨有,已透過前沿模型論壇與同業分享事件資訊。任何一家既加密推論、又讓通用模型接觸使用者輸入文字的業者,都會繼承同一種形狀的問題。

後續觀察

防守端的反應預料會落在身分與流量控管,而不是模型本身:更嚴格的註冊驗證、更緊的單帳號上限、跨帳號的模式偵測——因為現成的槓桿就是這些。結構性問題依舊沒解。一個順從到會遵照任意輸入指示的模型,同樣會遵照「把受保護的輸入變成可讀」的指示,傳輸層的加密再厚也改變不了這點。

FAQ 常見問題

OpenAI 遭到入侵了嗎

沒有。OpenAI 表示沒有任何加密被破解、沒有資料庫遭入侵,也沒有已儲存的使用者對話被存取。操作者是按產品設計的方式使用它,把加密推論在對話間搬移並要求模型呈現為可讀內容,公司將此認定為違反服務條款。

漏洞修好了嗎

OpenAI 說已修補那個讓某段對話取得的加密資料能在另一段對話中被解密的特定漏洞,同時收緊註冊與基礎設施控管、擴大網路監控,並因為認為同樣的弱點不只存在於自家模型,透過前沿模型論壇與其他實驗室分享細節。

什麼是對抗式蒸餾

指未經授權、有系統地取用某個模型的輸出或內部推論,用來訓練、複製或改良另一個模型。蒸餾自己擁有的模型是常規工程,對抗式的版本則是透過公開介面收割競爭對手受保護的軌跡。

對這篇文章有什麼感想?

SJ
載入中...

相關文章