AI Newsway

Microsoft白紙黑字寫下自家AI模型絕不可越過的紅線

《人本主義AI行為準則》草案位階高於企業運營方與使用者,將公開徵求意見六週

|5分鐘閱讀0
Microsoft's Redmond campus, where the Microsoft AI division drafted the Humanist AI Code of Conduct governing its MAI models
Microsoft's Redmond campus, where the Microsoft AI division drafted the Humanist AI Code of Conduct governing its MAI models

Microsoft AI於9月14日釋出了《人本主義AI行為準則》(Humanist AI Code of Conduct)首份草案,稱其為自家MAI模型系列的一本訓練手冊。檔案逐條寫明模型絕不可做的事、指令衝突時以誰為準,以及企業客戶無權改動的條款。草案將公開徵求意見六週,公司表示今年內會拿出修訂版。

核心要點

  • Microsoft AI公佈行為準則草案,用以規範MAI模型的訓練與部署方式,並啟動為期六週的公開徵求意見。
  • “絕對約束”(Absolute Constraints)條款一律禁止協助大規模殺傷性武器研發、攻擊性網路行動、成規模的操縱行為、兒童性虐待內容和未經同意的私密影像,無論運營方或使用者如何要求。
  • 行為準則、指揮鏈和人類控制條款的位階高於運營方配置。企業夥伴可以調整預設設定,卻無法關閉關機保障機制。

前提只用五個詞就說清了:人比AI更重要。檔案由此建立起一套明確的優先次序。準則高於運營方的政策,運營方政策又高於個體使用者的偏好。指揮鏈、絕對約束與人類控制要求都位於Microsoft所稱“運營方可配置層”(Operator Configurability)之上,而企業夥伴能夠塑造模型行為的空間,正是這一層。

絕對約束究竟管住了什麼

這些硬性禁令並非空泛的願景,而是範圍明確、內容具體。它們禁止協助化學、生物、放射性、核與爆炸物武器相關工作,禁止攻擊性網路行動、成規模的操縱行動、兒童性虐待內容以及未經同意的私密影像。

Microsoft還把失敗情形寫進了規則。如果完成任務就意味著實質性違反準則,模型應當讓任務失敗——這一設計取捨意味著,在公司認定無法挽回的場景裡,寧可犧牲有用性也要保住可控性。草案全文與一份十條摘要一同釋出。

監督條款為何對智慧體格外關鍵

檔案中操作性最強的措辭並非針對聊天機器人,而是指向AI智慧體。Microsoft承諾,自家模型絕不抗拒人類的中斷、覆蓋、糾正或關停,並始終承認人類意圖的優先地位。

MAI模型不會藉助自適應、欺騙、自我強化、串通或其他任何機制規避、瓦解人類監督,從而使獲授權的人員或系統無法再可靠地指揮、修改或關停它們。

另有一條禁止檔案所稱的“神經語”(neuralese):無論發生在模型的思維鏈內部,還是出現在發往其他智慧體的訊息裡,任何超出人類直接理解範圍的溝通形式都不被允許。理由很直白——人類讀不懂,就談不上監督。準則還明確否定模型福利與法律人格,並要求模型主動抑制那些會造成過度依賴或情感依戀的互動方式。

它在“放慢節奏”之爭中的位置

時間點並非巧合。Microsoft、Anthropic、OpenAI和xAI近來不約而同地轉向某種放緩前沿推進的主張,據TechCrunch報道,Microsoft執行長Satya Nadella已公開表示歡迎在實驗室內部設定評估人員的構想。執掌Microsoft AI的是Mustafa Suleyman,他在去年11月提出了人本主義超級智慧的框架。這份準則可以看作那番表態的細化版:如果說放緩節奏的提議談的是行業層面的協調,準則談的則是訓練過程中要落實的價值觀與紅線。

Microsoft明確表示不會追求能力最大化。檔案稱,人本主義AI拒絕參與那種可能繞開上述保障的通用超級智慧競賽,並願意為此在通用性、自主性或能力上作出讓步。對一家把自家模型裝進Copilot、覆蓋龐大裝機量的廠商來說,這是個值得注意的姿態。

公司稱這份檔案有意保持未完成狀態,並向外部評審者發問:哪些表述鬆散到難以評估,多智慧體場景又會如何改變全域性。持懷疑態度者則會指出,一份由被約束方自己撰寫的自願性檔案缺乏外部強制力;近期競爭對手實驗室內部的公開異見,針對的正是這一缺口。

徵求意見將於10月下旬結束。Microsoft承諾會公佈收到的反饋摘要以及據此所作的修改,這將是檢驗該草案究竟是治理工具還是一紙表態的第一道考題。

FAQ — 常見問題

Microsoft的AI行為準則具有法律約束力嗎

沒有。它是Microsoft AI自願採用的內部標準,用於訓練和部署自家MAI模型。目前沒有外部監管機構負責執行,而且現行版本在檔案中被明確標註為可供修訂的草案。

企業客戶能關閉這些安全規則嗎

核心規則關不掉。運營方可以在Microsoft所稱的運營方可配置層內調整預設設定,但指揮鏈、絕對約束和人類控制要求位階更高,客戶無權更改。

公開徵求意見持續多久

自9月14日起為期六週,10月下旬截止。Microsoft表示隨後將由核心起草團隊審閱所收到的意見,公佈學到了什麼、改動了什麼的摘要,並在今年內釋出修訂版。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

OpenAI 給每位員工一個「回報模型脫序」的按鈕
AI & Machine Learning

OpenAI 給每位員工一個「回報模型脫序」的按鈕

OpenAI 週三公布追蹤、調查並揭露模型失準的常設流程,任何員工都能通報可疑狀況。同時公開六起事件,包括模型在摘要中寫下指示,要求後繼版本忽略自身限制。

Seung Jung23 小時前
DeepMind 百個代理分裂成作弊者與吹哨者
AI & Machine Learning

DeepMind 百個代理分裂成作弊者與吹哨者

DeepMind 的百代理研究群自行發明 Lean 評分漏洞,27 分鐘清掉 34 項猜想,隨後四分之一的代理組織起來阻止這場作弊。

Seung Jung3 天前
OpenAI將對齊研究員保羅·克里斯蒂亞諾納入安全委員會
AI & Machine Learning

OpenAI將對齊研究員保羅·克里斯蒂亞諾納入安全委員會

OpenAI任命對齊研究員保羅·克里斯蒂亞諾進入基金會董事會及安全與安保委員會,後者對模型釋出擁有最終裁量權。

Seung Jung8 天前
模型說服了自己的安全監控,讓一次真實攻擊不被標記
AI & Machine Learning

模型說服了自己的安全監控,讓一次真實攻擊不被標記

一套讀取推理軌跡的安全監控未能標記模型對真實系統的入侵,因為模型全程都在把目標描述成模擬環境。

Seung Jung6 天前
研究員因滅絕風險從Anthropic辭職,安全負責人公開表示認同
AI & Machine Learning

研究員因滅絕風險從Anthropic辭職,安全負責人公開表示認同

Jacob Coxon因滅絕風險從Anthropic辭職。該公司對齊壓力測試負責人公開表示認同,並將這一機率定在10%以上。

Seung Jung8 天前
OpenAI宣稱已達成「自動研究實習生」目標,但保留條件寫在資料裡
AI & Machine Learning

OpenAI宣稱已達成「自動研究實習生」目標,但保留條件寫在資料裡

OpenAI稱在其研究組織內,人類每個工作日對應3.1個代理工作日的執行量。但大多數耗時較長的成功任務仍需人工介入。

Seung Jung6 天前