今週Natureに掲載された論文の中心となる数字は、勝敗記録ではなく価格である。Ataraxosという名のエージェントが、GPU16枚を1週間、さらにGPU4枚を4日動かして、著者らが「圧倒的に超人的」と呼ぶストラテゴの棋力に達した。請求額は数千ドル規模にとどまる。直前まで最高性能だったGoogle DeepMindのDeepNashは、専用チップ1,024基で2〜3カ月を要し、今回の研究チームの試算では2025年の価格で300万〜450万ドルかかっていたことになる。それでも最上位の人間を安定して打ち負かすには至らなかった。
要点
- Ataraxosは、世界ランキング1位を600週以上保持した4度の世界王者Pim Niemeijerを15勝1敗4分で下した。
- 自己対戦数はDeepNashの約34分の1にあたる1億6,300万局で、300万ドル以上と推定される費用の代わりに数千ドルで学習を終えた。
- 性能を引き出したのは2つ目のニューラルネットワーク、すなわち隠された駒の正体を推論する信念モデルである。ストラテゴで初めて着手時の探索を成立させた要素だ。
計算コストはどこで削られたのか
この費用差は、安価なハードウェアを使ったという話ではない。チームはストラテゴのシミュレータをCUDA C++で自作し、グラフィックスカード上で毎秒数百万回の状態更新を実行させた。加速器を大量に調達できない研究室が選ぶ種類のエンジニアリングである。MITの責任著者Gabriele Farinaは、ポーカーなどのゲームで開発された手法は、ストラテゴが抱える隠れ情報の量にはそもそもスケールしないと述べている。
ハードウェアの枚数よりも重要なのはサンプル効率だ。両システムとも自分自身と対戦し、勝ちにつながる手を強化して負けた手を捨てることで学習した。違いは、Ataraxosがバッチごとにどれだけ大胆に戦略を書き換えたかにある。学習の初期は大きく踏み込んだ調整を行い、進むにつれて小さく慎重な修正へ移していった。隠れ情報は自己対戦型強化学習を循環に陥らせやすく、このスケジュールが収束を守った仕掛けだった。結果として、DeepNashのはるかに大きな学習量に対し1億6,300万局で、より強い最終エージェントが得られた。
探索が欠けていた理由
AlphaGoのようなシステムは、一手ごとに直前で探索を回して汎用方針を研ぎ直す。DeepMindがストラテゴでそれを使えなかったのは、取りうる隠れ配置の集合が事実上無限だからだ。片側40駒を任意に並べれば10の33乗を超える初期配置が生まれ、一局は2,000手に及ぶこともある。チェスのおよそ40手と比べれば桁が違う。着手時の探索を試す価値があるのかどうかさえ、未解決のまま残されていた。
Ataraxosはその問いに、相手の駒の動かし方から正体を推定するよう訓練した2つ目のネットワークで答えた。配置を網羅的に列挙するのではなく、もっともらしい配置を標本として引き、その各々の内部で候補手を指し切り、結果を見て選ぶ。扱いきれない探索が標本抽出の問題へ変わるわけだ。ポーカーを解けるものにしたのと同じ概念的な転換を、隠れ状態が桁違いに大きく、しかも対局全体にわたって持続するゲームに当てはめたことになる。
そこに現れる振る舞いは明確に人間的でない。エージェントは自分の秘密を知っているという負担から自由なため、相手が疑う理由がないと判断すれば弱点を手つかずのまま残す。ブラフも人間には真似できない一貫性で実行する。Farinaはこれを、人間にはできない形のリスク計算だと表現する。最も価値ある駒が露出した人間は動揺し始めるが、エージェントは平静を保ち、秘密を明け渡すような過剰修正を拒む。名前は不安からの自由を意味する古代ギリシャ語に由来する。
人間との対局結果が実際に示すもの
Niemeijerは3週間にわたりオンラインで20局を指し、1勝につき100ドルを受け取った。エージェントが自分に適応しないことも承知していた。弱点を探る時間を与える条件であり、実際に1局を取った。著者らはこの1敗を欠陥とは見ていない。強いストラテゴには自分の初期配置をランダム化することが求められ、そのために運が双方へ恒久的に残るからである。
より広い標本は一方に傾いている。2025年のストラテゴ世界選手権では、このボットに挑んだ参加者が40局中38局を落とした。競技のメタゲームも動いた。旗を隅に爆弾2個だけで隠す配置のように、コミュニティが切り捨てていた並べ方が見直されている。
この構造はどこまで通用するのか
同じ手法は、より速い変種であるBarrage Strategoで3人の世界王者を破り、協力型カードゲームHanabiをこなし、闘地主(dou dizhu)では既存最強のボットを下した。協力・競争・多人数のカードゲームにまたがるこの広がりが、信念モデルと探索を組み合わせた処方が一つのゲームに合わせ込まれたものではなく汎用であることを最もよく裏づけている。
チームの目標は交渉、金融市場、ウォーゲーミングにまで伸びる。現実の問題に取り組むことは、結局その問題の簡略化されたモデルを組むところから始まるという論理だ。ただしこれは実証ではなく主張の段階にとどまる。ボードゲームは固定されたルールと曖昧さのない勝者を与えるが、彼らが挙げた領域はどちらも与えない。より目先の限界は、Ataraxosが自らの判断を説明できないことである。Farinaは解釈可能で説明可能な戦略を、達成ではなく今後の目標として位置づけている。
展望
プレプリントは2025年11月から公開されていた。したがって今回のニュースの核心は結果そのものではなく査読の通過だ。この論文が形にしたのは、残された難関ベンチマークにはフロンティア規模の予算が要るという前提への反例である。成果を生んだのは、著者6人の学術チームが負担できる規模のアルゴリズム再構成だった。これは、AIシステム自体がそうした再構成を生み出す助けにはまだなっていないという別の知見と並ぶ。最近のベンチマークでは、AIエージェントが学習アルゴリズムをほとんど改善できないことが示された。
FAQ よくある質問
Ataraxosとは何か
Carnegie Mellon、MIT、NYU、Stanfordの研究者によるストラテゴのエージェントで、自己対戦型強化学習と着手時の探索を組み合わせている。際立つ構成要素は、相手の隠れた駒の正体を推定する信念モデルだ。これだけ隠れ状態の多いゲームで先読み探索を可能にしている部分である。
ストラテゴがチェスや囲碁、ポーカーより長くAIに抵抗したのはなぜか
隠れ情報が膨大であり、かつ長く持続するためだ。駒の正体は二つの駒が衝突するまで隠れたままで、片側あたりの初期配置は10の33乗を超え、一局は2,000手に達することもある。効果的なプレーには精度の高いブラフも必要で、従来の自己対戦システムはその均衡を取るのに苦しんだ。
ボードゲームの外へ移せるのか
この構造はすでにBarrage Stratego、Hanabi、闘地主へ一般化している。交渉や市場のような開かれた場への移行は著者らが掲げる方向性であって、公表された成果ではない。エージェントに説明能力がないことも、判断に根拠が求められる場で使うには実務的な障害となる。






