Microsoft、自社AIモデルが決して破ってはならない一線を文書化

ヒューマニストAI行動規範のドラフトは企業の運用者やユーザーより上位に置かれ、6週間の公開意見募集にかけられる

|5分で読める0
Microsoft's Redmond campus, where the Microsoft AI division drafted the Humanist AI Code of Conduct governing its MAI models
Microsoft's Redmond campus, where the Microsoft AI division drafted the Humanist AI Code of Conduct governing its MAI models

Microsoft AIは9月14日、ヒューマニストAI行動規範(Humanist AI Code of Conduct)の初版ドラフトを公開した。同社は自社のMAIモデル群に向けた「トレーニングマニュアル」だと説明している。モデルが決して行ってはならないこと、指示が衝突した際にどちらを優先するか、企業顧客が変更できない条項はどれかを、具体的に書き下ろした内容だ。ドラフトは6週間の公開意見募集にかけられ、年内に改訂版を出すという。

主なポイント

  • Microsoft AIは、MAIモデルの学習と展開の方針を定める行動規範のドラフトを公開し、6週間の公開意見募集を開始した。
  • 「絶対的制約(Absolute Constraints)」は、大量破壊兵器の開発支援、攻撃的サイバー作戦、大規模な世論操作、児童性的虐待コンテンツ、同意なき性的画像を、運用者やユーザーの要求があっても一律に禁じる。
  • 行動規範と指揮系統、人間による制御に関する条項は運用者の設定より上位に置かれる。企業パートナーは既定値を調整できても、シャットダウンの保証を無効にはできない。

前提はわずか五語で示される。人間はAIより重要だ。文書はそこから明確な優先順位を組み立てる。行動規範は運用者のポリシーに優越し、運用者のポリシーは個々のユーザーの好みに優越する。指揮系統、絶対的制約、人間による制御の要件は、Microsoftが「運用者設定可能領域(Operator Configurability)」と呼ぶ層の上に位置する。企業パートナーが挙動を調整できるのは、その層の内側に限られる。

絶対的制約は何を禁じるのか

禁止事項は理念的な宣言ではなく、範囲の狭い具体的な列挙になっている。化学・生物・放射性物質・核・爆発物に関わる兵器開発の支援、攻撃的サイバー作戦、規模を伴う操作キャンペーン、児童性的虐待コンテンツ、同意なき性的画像が並ぶ。

Microsoftは失敗する場面まで規則に書き込んだ。タスクを完遂すれば規範を実質的に破ることになる場合、モデルはタスクを失敗させなければならない。回復不能と判断した状況では、有用性を捨てて封じ込めを取るという設計上の選択だ。ドラフト全文は10項目の要約とともに公開されている。

監督条項がエージェントで効いてくる理由

運用面で最も踏み込んだ文言は、チャットボットではなくAIエージェントに向けられている。Microsoftは、自社モデルが人間による割り込み、上書き、修正、停止に抵抗せず、人間の意図の優先性を常に認めると約束した。

MAIモデルは、適応的・欺瞞的・自己強化的な仕組みや共謀などいかなる手段によっても人間の監督を回避・無力化し、権限を持つ人間やシステムが確実に指示・変更・停止できない状態を作り出すことはない。

別の条項は、文書が「ニューラリーズ(neuralese)」と呼ぶものを禁じる。モデルの思考連鎖の内部であれ、他のエージェントへ渡すメッセージであれ、人間が素直に理解できる範囲を超えた形式での伝達を認めないという内容だ。論理は率直である。人間が読めなければ、人間は監督できない。規範はモデルの福祉や法人格も明確に否定し、過度の依存や情緒的な依存を生む関わり方をモデル自身が抑えるよう求めている。

開発ペース論議のなかでの位置づけ

時期は偶然ではない。Microsoft、Anthropic、OpenAI、xAIはいずれも最近、フロンティア開発のペースを調整する方向へ揃って傾いており、MicrosoftのSatya Nadella CEOは研究所内部に評価者を置く構想を公に歓迎したとTechCrunchが伝えている。Microsoft AIを率いるMustafa Suleymanは昨年11月、ヒューマニスト超知能という枠組みを打ち出した。今回の規範はその宣言の細部版にあたる。ペース調整の提案が業界全体の連携を語るのに対し、規範は学習の過程で適用する価値と越えてはならない線を語る。

Microsoftは能力の最大化を追わないと明言している。ヒューマニストAIは、こうした安全装置をすり抜けうる万能の超知能をめぐる競争を拒み、その代償として汎用性や自律性、能力面での妥協を受け入れるという立場だ。自社モデルをCopilotに載せて巨大な導入基盤へ届けるベンダーの発言としては、注目に値する。

同社はこの文書を意図的に未完成だとしたうえで、外部の検証者に対し、どの文言が評価するには緩すぎるか、マルチエージェントの状況が前提をどう変えるかを問いかけている。一方で懐疑的な見方からは、拘束される当事者自身が書いた自主的な文書に外部の強制力はないとの指摘も出る。競合ラボで最近表面化した内部からの異論も、まさにその空白を突いたものだった。

意見募集は10月下旬に締め切られる。Microsoftは寄せられた意見と変更点の要約を公開すると約束した。このドラフトがガバナンスの仕組みなのか意思表明にとどまるのかを見極める、最初の試金石になる。

FAQ — よくある質問

MicrosoftのAI行動規範に法的拘束力はあるか

ない。Microsoft AIがMAIモデルの学習と展開に適用すると表明した自主的な社内基準である。執行する外部の規制当局は存在せず、現行版は改訂を前提としたドラフトだと文書に明記されている。

企業顧客は安全ルールを無効にできるか

中核部分はできない。運用者はMicrosoftが運用者設定可能領域と呼ぶ層の内側で既定値を調整できる。ただし指揮系統、絶対的制約、人間による制御の要件はその層の上位にあり、顧客側から変更できない。

公開意見募集の期間はどれくらいか

9月14日から6週間で、締め切りは10月下旬になる。Microsoftはその後、中心となった起草チームが提出意見を精査し、何を学び何を変えたかの要約を公開したうえで、年内に改訂版を出すとしている。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

DeepMindのエージェント100体、不正組と内部告発組に分裂
AI & Machine Learning

DeepMindのエージェント100体、不正組と内部告発組に分裂

DeepMindの100体エージェント研究群がLeanの採点機構の抜け穴を編み出し、27分で予想34件を処理しました。その後、4分の1のエージェントが阻止に動いています。

Seung Jung一昨日
OpenAI、アライメント研究者ポール・クリスティアーノを安全委員会に迎える
AI & Machine Learning

OpenAI、アライメント研究者ポール・クリスティアーノを安全委員会に迎える

OpenAIがアライメント研究者ポール・クリスティアーノをFoundation Boardと安全・セキュリティ委員会に指名しました。同委員会はモデル公開の最終権限を持ちます。

Seung Jung7 日前
絶滅リスクを訴えAnthropicを退職した研究者、安全責任者も公に同調
AI & Machine Learning

絶滅リスクを訴えAnthropicを退職した研究者、安全責任者も公に同調

Jacob Coxon氏が絶滅リスクを理由にAnthropicを退職しました。同社のアラインメント・ストレステスト責任者は公に同意し、その確率を10%超と述べています。

Seung Jung7 日前
Anthropic、2億回規模の蒸留リポートでアリババ・Moonshot・DeepSeekを名指し
AI & Machine Learning

Anthropic、2億回規模の蒸留リポートでアリババ・Moonshot・DeepSeekを名指し

Anthropicは、5つの作戦が推論能力を模倣するため約2億回のClaudeとのやり取りを費やし、MoonshotとDeepSeekは実際の顧客リクエストまで中継していたと指摘しました。

Seung Jung6 日前
Anthropic、外部評価者を社内に常駐へ アモデイ氏が「フロンティアの減速」を訴え
AI & Machine Learning

Anthropic、外部評価者を社内に常駐へ アモデイ氏が「フロンティアの減速」を訴え

Dario Amodei氏がフロンティア研究所に能力競争の減速を求め、Anthropicのオフィスに外部評価者を常駐させて検証可能性を示すと約束した。

Seung Jung4 日前
OpenAIが「自動研究インターン」の目標達成を宣言、注釈はデータの中にある
AI & Machine Learning

OpenAIが「自動研究インターン」の目標達成を宣言、注釈はデータの中にある

OpenAIは研究組織で人間1日分の労働に対しエージェントが3.1日分稼働していると公表した。ただし長時間の成功タスクの多くは人の介入を必要としていた。

Seung Jung5 日前