迄今為止美軍內部揭露過最嚴重的一起 AI 失誤,禍首不是失控的系統,而是一道排版工序。一名特種作戰分析人員向聊天機器人提問,得到錯誤的答案,接著又請 AI 把那個答案整理成看起來像正式情報產品的文件。CNN 週五引述四名消息人士報導,這份文件在今年春天實際啟動了對一艘中國船舶的武裝攔檢行動,官員發現錯誤已是之後的事。
重點摘要
- 一名特種作戰司令部分析人員為了把公開來源資料與機密訊號情報整合在一起而向聊天機器人提問,模型對中國船舶的貨物做出了錯誤結論。
- 同一名分析人員接著第二次使用 AI,把這項判斷整理成標準情報產品格式,文件就這樣毫無質疑地在指揮體系內流通。
- CNN 的消息人士表示,這並非孤立事件,而且全美軍並沒有一套統一標準規範 AI 生成情報該如何查證。
為何第二次用 AI 比第一次更關鍵
大家的目光都會落在幻覺上,但那其實是比較不有趣的一半。模型持續不斷地編造內容,與模型共事的分析人員本來就預期要丟棄輸出。
真正抹掉這份預期的是包裝。當那項說法被套進標準報告格式,它就不再像是聊天機器人的回答,而像是完成的情報。指揮鏈上每一位後續讀者拿到的,都是一份外形暗示著某套查證流程、而那套流程從未發生的文件。
最初的載貨清單報告來自位於夏威夷的美軍太平洋特種作戰司令部。聊天機器人把它與機密訊號情報結合,斷定該船載有核武零組件。CNN 一名消息人士稱這份報告完全不實,說它差點挑起一場戰爭。
事情推進到什麼地步
時機讓這個錯誤格外危險。報告送達時正值與伊朗的戰事,任何拖延的空間都很有限。
武裝人員已準備登船,飛機也已升空。阻止行動的,只有一次遲來的原始來源複查。CNN 無法確認貨物究竟是什麼,並表示五角大廈與太平洋特種作戰司令部都未回應置評請求。
美國對一艘懸掛中國國旗的船舶採取行動,其升高衝突的風險本身就與貨物內容關係不大。這正是為什麼單單一段錯誤的文字,確實可能演變成兩個核武國家之間的交火事件。
沒有人負責的查證空白
官員形容,這套系統的推行是分散式的。各司令部自行挑選工具,依照各自的命令與安全標準運作。沒有任何共同規則告訴人們該如何查證模型產出的內容。
一名熟悉這類系統的前高階官員向 CNN 給出直白評價:政府內部的工具大多就是塗了口紅的商業產品。這個說法直接戳破了「部署在機密環境就必然比消費級聊天機器人可靠」的假設。
其餘的部分由運作機制解釋。大型語言模型不論其中的說法是否有依據,都會產出流暢而結構完整的文字。幻覺沒有任何外顯跡象。文字裡的篤定,不是關於真實世界的證據。一名消息人士把整個動態濃縮成一句話:AI 讓你更快抵達一個糟糕的想法。
政策背景
速度是明白揭示的目標,不是意外。國防部長皮特·赫格塞斯在一月發布人工智慧加速戰略,承諾要鬆綁實驗、清除官僚障礙。隨附的備忘錄提出要讓 AI 普及到整個國防部,把模型交到各機密層級共三百萬名文職與軍職人員手上。
這些模型都是商業產品。五角大廈的首席數位與人工智慧辦公室已分別向 Anthropic、OpenAI、Google 與 xAI 發出每筆最高 2 億美元的原型合約。這層關係並非毫��摩擦——聯邦法官近日撤銷了五角大廈加諸 Anthropic 的供應鏈風險標記。與此同時,消息人士指出,AI 在目標選定上的運用持續擴大,卻沒有實質指引說明「人在迴路中」該如何避免平民傷亡或誤擊友軍。
後續觀察
GovAI 研究員、前美國陸軍軍官傑克·斯特克勒向 TechCrunch 表示,軍人必須理解這些系統帶有的不確定性,而涉及可能動用武力的決策時,這一點最為尖銳。他並不把這起事件解讀為應該完全不用 AI 的理由,他的警告方向恰恰相反:只顧追求導入速度,終將製造出摧毀信任的事故,而不信任拖慢採用的力道,遠比謹慎更強。
眼下最便宜的解法屬於流程而非技術。只要 AI 協助產生的判斷在整條指揮鏈上都被標示出來,複查者至少會知道哪些說法需要重新推導一遍。
常見問題
是哪一款 AI 聊天機器人產出了這份不實報告?
CNN 報導指出,目前不清楚該工具是市售聊天機器人還是美國政府產品。一名前高階官員說,政府內部工具大多是重新包裝的商業模型,這使得兩者的區別在實務上意義不大。
這起事件有人受傷嗎?
沒有。官員檢視報告的來源、發現它是在 AI 協助下產生之後,原定的攔檢在美方人員登船前就已中止。任何針對中國船舶的行動,都可能升高為兩國之間的武裝對抗。
這是美國情報工作中第一起 AI 幻覺案例嗎?
根據 CNN 一名消息人士的說法,並不是。自從這類工具開始擴散,情報體系內就陸續出現類似幻覺,只是這是第一起公開報導、且推進到實際執行階段的案例。






