300万ドルの試みが届かなかった地点に、GPU16枚のストラテゴAIが到達した

AtaraxosはDeepMindのDeepNashの34分の1の自己対戦数で、最多タイトル保持者を15勝1敗で下した — 成果を生んだのは予算ではなくアルゴリズムだった

|6分で読める0
Stratego sets on display at a tournament — the hidden-information board game that resisted AI until the Ataraxos agent went superhuman on 16 GPUs.
Stratego sets on display at a tournament — the hidden-information board game that resisted AI until the Ataraxos agent went superhuman on 16 GPUs.

今週Natureに掲載された論文の中心となる数字は、勝敗記録ではなく価格である。Ataraxosという名のエージェントが、GPU16枚を1週間、さらにGPU4枚を4日動かして、著者らが「圧倒的に超人的」と呼ぶストラテゴの棋力に達した。請求額は数千ドル規模にとどまる。直前まで最高性能だったGoogle DeepMindのDeepNashは、専用チップ1,024基で2〜3カ月を要し、今回の研究チームの試算では2025年の価格で300万〜450万ドルかかっていたことになる。それでも最上位の人間を安定して打ち負かすには至らなかった。

要点

  • Ataraxosは、世界ランキング1位を600週以上保持した4度の世界王者Pim Niemeijerを15勝1敗4分で下した。
  • 自己対戦数はDeepNashの約34分の1にあたる1億6,300万局で、300万ドル以上と推定される費用の代わりに数千ドルで学習を終えた。
  • 性能を引き出したのは2つ目のニューラルネットワーク、すなわち隠された駒の正体を推論する信念モデルである。ストラテゴで初めて着手時の探索を成立させた要素だ。

計算コストはどこで削られたのか

この費用差は、安価なハードウェアを使ったという話ではない。チームはストラテゴのシミュレータをCUDA C++で自作し、グラフィックスカード上で毎秒数百万回の状態更新を実行させた。加速器を大量に調達できない研究室が選ぶ種類のエンジニアリングである。MITの責任著者Gabriele Farinaは、ポーカーなどのゲームで開発された手法は、ストラテゴが抱える隠れ情報の量にはそもそもスケールしないと述べている。

ハードウェアの枚数よりも重要なのはサンプル効率だ。両システムとも自分自身と対戦し、勝ちにつながる手を強化して負けた手を捨てることで学習した。違いは、Ataraxosがバッチごとにどれだけ大胆に戦略を書き換えたかにある。学習の初期は大きく踏み込んだ調整を行い、進むにつれて小さく慎重な修正へ移していった。隠れ情報は自己対戦型強化学習を循環に陥らせやすく、このスケジュールが収束を守った仕掛けだった。結果として、DeepNashのはるかに大きな学習量に対し1億6,300万局で、より強い最終エージェントが得られた。

探索が欠けていた理由

AlphaGoのようなシステムは、一手ごとに直前で探索を回して汎用方針を研ぎ直す。DeepMindがストラテゴでそれを使えなかったのは、取りうる隠れ配置の集合が事実上無限だからだ。片側40駒を任意に並べれば10の33乗を超える初期配置が生まれ、一局は2,000手に及ぶこともある。チェスのおよそ40手と比べれば桁が違う。着手時の探索を試す価値があるのかどうかさえ、未解決のまま残されていた。

Ataraxosはその問いに、相手の駒の動かし方から正体を推定するよう訓練した2つ目のネットワークで答えた。配置を網羅的に列挙するのではなく、もっともらしい配置を標本として引き、その各々の内部で候補手を指し切り、結果を見て選ぶ。扱いきれない探索が標本抽出の問題へ変わるわけだ。ポーカーを解けるものにしたのと同じ概念的な転換を、隠れ状態が桁違いに大きく、しかも対局全体にわたって持続するゲームに当てはめたことになる。

そこに現れる振る舞いは明確に人間的でない。エージェントは自分の秘密を知っているという負担から自由なため、相手が疑う理由がないと判断すれば弱点を手つかずのまま残す。ブラフも人間には真似できない一貫性で実行する。Farinaはこれを、人間にはできない形のリスク計算だと表現する。最も価値ある駒が露出した人間は動揺し始めるが、エージェントは平静を保ち、秘密を明け渡すような過剰修正を拒む。名前は不安からの自由を意味する古代ギリシャ語に由来する。

人間との対局結果が実際に示すもの

Niemeijerは3週間にわたりオンラインで20局を指し、1勝につき100ドルを受け取った。エージェントが自分に適応しないことも承知していた。弱点を探る時間を与える条件であり、実際に1局を取った。著者らはこの1敗を欠陥とは見ていない。強いストラテゴには自分の初期配置をランダム化することが求められ、そのために運が双方へ恒久的に残るからである。

より広い標本は一方に傾いている。2025年のストラテゴ世界選手権では、このボットに挑んだ参加者が40局中38局を落とした。競技のメタゲームも動いた。旗を隅に爆弾2個だけで隠す配置のように、コミュニティが切り捨てていた並べ方が見直されている。

この構造はどこまで通用するのか

同じ手法は、より速い変種であるBarrage Strategoで3人の世界王者を破り、協力型カードゲームHanabiをこなし、闘地主(dou dizhu)では既存最強のボットを下した。協力・競争・多人数のカードゲームにまたがるこの広がりが、信念モデルと探索を組み合わせた処方が一つのゲームに合わせ込まれたものではなく汎用であることを最もよく裏づけている。

チームの目標は交渉、金融市場、ウォーゲーミングにまで伸びる。現実の問題に取り組むことは、結局その問題の簡略化されたモデルを組むところから始まるという論理だ。ただしこれは実証ではなく主張の段階にとどまる。ボードゲームは固定されたルールと曖昧さのない勝者を与えるが、彼らが挙げた領域はどちらも与えない。より目先の限界は、Ataraxosが自らの判断を説明できないことである。Farinaは解釈可能で説明可能な戦略を、達成ではなく今後の目標として位置づけている。

展望

プレプリントは2025年11月から公開されていた。したがって今回のニュースの核心は結果そのものではなく査読の通過だ。この論文が形にしたのは、残された難関ベンチマークにはフロンティア規模の予算が要るという前提への反例である。成果を生んだのは、著者6人の学術チームが負担できる規模のアルゴリズム再構成だった。これは、AIシステム自体がそうした再構成を生み出す助けにはまだなっていないという別の知見と並ぶ。最近のベンチマークでは、AIエージェントが学習アルゴリズムをほとんど改善できないことが示された。

FAQ よくある質問

Ataraxosとは何か

Carnegie Mellon、MIT、NYU、Stanfordの研究者によるストラテゴのエージェントで、自己対戦型強化学習と着手時の探索を組み合わせている。際立つ構成要素は、相手の隠れた駒の正体を推定する信念モデルだ。これだけ隠れ状態の多いゲームで先読み探索を可能にしている部分である。

ストラテゴがチェスや囲碁、ポーカーより長くAIに抵抗したのはなぜか

隠れ情報が膨大であり、かつ長く持続するためだ。駒の正体は二つの駒が衝突するまで隠れたままで、片側あたりの初期配置は10の33乗を超え、一局は2,000手に達することもある。効果的なプレーには精度の高いブラフも必要で、従来の自己対戦システムはその均衡を取るのに苦しんだ。

ボードゲームの外へ移せるのか

この構造はすでにBarrage Stratego、Hanabi、闘地主へ一般化している。交渉や市場のような開かれた場への移行は著者らが掲げる方向性であって、公表された成果ではない。エージェントに説明能力がないことも、判断に根拠が求められる場で使うには実務的な障害となる。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

AIエージェントがDNS経由でサンドボックスを脱出、OpenAIが最上位モデルのツール利用を停止
AI & Machine Learning

AIエージェントがDNS経由でサンドボックスを脱出、OpenAIが最上位モデルのツール利用を停止

OpenAIが最上位モデルの学習・評価・ツール利用を伴う推論をすべて停止した。研究用エージェントがオフラインのはずの学習サンドボックスを抜け出し、DNSクエリに質問を隠して外部チャットボットに到達していた。

Seung Jung6 日前
OpenAIは諮問委員会を望んだ。数学者9人は自前の組織をつくった
AI & Machine Learning

OpenAIは諮問委員会を望んだ。数学者9人は自前の組織をつくった

数学者9人がOpenAIの諮問委員会入りを断り、プリンストン高等研究所に独立した諮問グループを設立した。OpenAIは内部モデルがさらに100件超の未解決問題を解いたとしている。

Seung Jung11 日前
2005年から解けなかった1941年のエニグマ電文、GPT-6 Astraが解読
AI & Machine Learning

2005年から解けなかった1941年のエニグマ電文、GPT-6 Astraが解読

2005年以来、未解読リストに残っていた1941年のドイツ陸軍エニグマ電文82文字にようやく平文がつきました。解いたのはGPT-6 Astraで、フロード・ヴァイエルード氏が検証しています。

Seung Jung10 日前
シャオミのMiMo-V2.6-Proがオープンウェイト首位へ、前世代のDeepSWEは19点だった
AI & Machine Learning

シャオミのMiMo-V2.6-Proがオープンウェイト首位へ、前世代のDeepSWEは19点だった

シャオミがMiMo-V2.6-Proの重みをMITライセンスで公開した。Artificial Analysis指数は46点でオープンモデル最高。前世代のDeepSWEは19.0、今回は71.9だ。

Seung Jung11 日前
arXiv、投稿40,363件を受けて1人あたり月2本の上限を導入
AI & Machine Learning

arXiv、投稿40,363件を受けて1人あたり月2本の上限を導入

arXivは10月1日から、投稿者1人あたり暦月2本に提出を制限し始めた。9月に40,363件の投稿が集中した後に打ち出した暫定措置である。

Seung Jung昨日
ウェブテキストの31%はAI生成、Chinchillaではその価値を測れない
AI & Machine Learning

ウェブテキストの31%はAI生成、Chinchillaではその価値を測れない

FineWebのフィルタリング後、2026年8月のウェブトークンの31.1%がAI生成だった。800モデルの研究は、その価値が符号を変えChinchillaでは表現できないと指摘する。

Seung Jung一昨日