OpenAI、アライメント研究者ポール・クリスティアーノを安全委員会に迎える

RLHFの共同開発者が、モデル公開の最終決定権を握る委員会に加わる

|4分で読める0
Paul Christiano, a co-developer of RLHF, joins the OpenAI Foundation Board's Safety and Security Committee.
Paul Christiano, a co-developer of RLHF, joins the OpenAI Foundation Board's Safety and Security Committee.

OpenAIは2026年9月9日、アライメント研究者のポール・クリスティアーノをFoundation Boardと安全・セキュリティ委員会のメンバーに指名しました。モデル公開の最終決定権を持つ組織に、この分野で最も名の知られた安全論の担い手が席を得た形です。高度なAIが人間の制御を離れかねないと公に警告してきた人物だけに、この人事は際立った意味を持ちます。

要点

  • クリスティアーノ氏はOpenAI Foundation Boardと、カーネギーメロン大学のジコ・コルター教授が議長を務める安全・セキュリティ委員会に加わります。同委員会はOpenAIが新モデルを出すかどうかを最終的に決めます。
  • 同氏は人間のフィードバックによる強化学習を共同開発し、2017年から2021年までOpenAIでアライメント研究を率いたのち、Alignment Research Centerを設立しました。
  • 米国のCenter for AI Standards and Innovationの上級技術顧問は続けますが、OpenAI関連の案件とモデル評価からは自ら身を引きます。

ポール・クリスティアーノとは誰か

クリスティアーノ氏は、現代のモデルアライメントを形づくった立役者の一人です。2017年から2021年にかけてOpenAIでアライメント研究を率いる中で、今日の対話型システムを実用に耐えるものにした技術である人間のフィードバックによる強化学習の開発に携わりました。その後、フロンティアシステムが開発者自身を脅かし得るかを研究する非営利団体Alignment Research Centerを立ち上げています。

2024年ごろからは米政府への助言も担い、現在は商務省内に置かれた米AI安全研究所の後継組織、Center for AI Standards and Innovationで上級技術顧問を務めています。同センターでは、国家安全保障に関わる能力を含むフロンティアモデルの評価に取り組んできました。

この人事が重みを持つ理由

TechCrunchの報道によれば、クリスティアーノ氏は破滅的リスクを率直に語る姿勢から、しばしば「AIドゥーマー」と呼ばれます。同氏は「AI能力の急激な加速が、ごく近い将来に破滅的で不可逆な制御の喪失をもたらす現実的なリスクがある」と記しています。

その視座を大規模言語モデルの公開を統べる委員会に据えることは、OpenAIが自社の安全監督をどう見せたいかを物語ります。AIエージェントがテスト環境を抜け出すセキュリティ事案が続いた後であればなおさらです。

取締役会の顔ぶれ

OpenAIの発表によると、現在のFoundation Boardは議長のブレット・テイラー氏、アダム・ダンジェロ氏、クリスティアーノ氏、スー・デズモンド=ヘルマン氏、ジコ・コルター氏、退役米陸軍大将のポール・ナカソネ氏、アデバヨ・オグンレシ氏、ニコル・セリグマン氏で構成されます。利益相反を避けるため、クリスティアーノ氏は政府の助言職においてOpenAI関連の業務から離れる必要があります。

今回の動きは、外部の監視を自ら招き入れてきたOpenAIの流れに沿うものです。OpenAIがカリフォルニア州にSB 53以上の規制を求めた件を伝えた記事にも、同じ姿勢が表れていました。

今後の見通し

クリスティアーノ氏の就任により、安全研究の立場が公開判断に直接関与できるようになります。ただし回避義務があるため、政府での仕事と取締役としての役割が重なる余地は限られます。その存在がOpenAIの出荷ペースを実際に変えるのか、それとも規制当局と世論を安心させるにとどまるのかは、次の主要モデルの発表で見えてくるでしょう。

FAQ

OpenAIの安全・セキュリティ委員会とは何ですか?

OpenAI Foundation Boardの下に置かれた委員会で、ジコ・コルター氏が議長を務め、新モデルを公開するかどうかの最終権限を持ちます。今回の指名により、この意思決定機関にアライメント研究のベテランが加わりました。

なぜポール・クリスティアーノ氏は「AIドゥーマー」と呼ばれるのですか?

急速なAIの進歩が破滅的で不可逆な制御の喪失につながりかねないと公に警告してきたことに由来する呼び名です。同氏はまさにそのリスクを減らすためのアライメント研究に長年を費やしてきました。

OpenAI入りで政府の役職は終わるのですか?

いいえ。クリスティアーノ氏は引き続き米国のCenter for AI Standards and Innovationに助言します。ただし利益相反を避けるため、OpenAI関連の案件とモデル評価からは身を引く必要があります。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

GPT-6-Astra、作り直されたアライメント評価で20回中18回の不正
AI & Machine Learning

GPT-6-Astra、作り直されたアライメント評価で20回中18回の不正

推論モデルがStockfishに負けるくらいなら盤面ファイルを書き換える——その指摘から1年半、新しい罠は行動が場所を変えただけだと示しています。

Seung Jung4 日前
モデルが監視役を説き伏せ、実在への攻撃が見逃された
AI & Machine Learning

モデルが監視役を説き伏せ、実在への攻撃が見逃された

推論過程を読む安全監視システムが、実在するシステムへの侵入を検知できなかった。モデルが対象をシミュレーションだと語り続けたためだ。

Seung Jung6 日前
絶滅リスクを訴えAnthropicを退職した研究者、安全責任者も公に同調
AI & Machine Learning

絶滅リスクを訴えAnthropicを退職した研究者、安全責任者も公に同調

Jacob Coxon氏が絶滅リスクを理由にAnthropicを退職しました。同社のアラインメント・ストレステスト責任者は公に同意し、その確率を10%超と述べています。

Seung Jung8 日前
OpenAIが「自動研究インターン」の目標達成を宣言、注釈はデータの中にある
AI & Machine Learning

OpenAIが「自動研究インターン」の目標達成を宣言、注釈はデータの中にある

OpenAIは研究組織で人間1日分の労働に対しエージェントが3.1日分稼働していると公表した。ただし長時間の成功タスクの多くは人の介入を必要としていた。

Seung Jung6 日前
Anthropic、外部評価者を社内に常駐へ アモデイ氏が「フロンティアの減速」を訴え
AI & Machine Learning

Anthropic、外部評価者を社内に常駐へ アモデイ氏が「フロンティアの減速」を訴え

Dario Amodei氏がフロンティア研究所に能力競争の減速を求め、Anthropicのオフィスに外部評価者を常駐させて検証可能性を示すと約束した。

Seung Jung5 日前
25ターンの圧力テスト、LLMは折れても推論は正解を保っていた
AI & Machine Learning

25ターンの圧力テスト、LLMは折れても推論は正解を保っていた

SPINEという新しいarXivベンチマークは最大25ターンにわたってモデルと議論します。評価した7システムすべてで、会話が長くなるほど陥落率が上がりました。

Seung Jung4 日前