AI Newsway

300萬美元的嘗試沒做到的事,16張GPU的西洋軍棋AI做到了

Ataraxos的自我對戰局數只有DeepMind DeepNash的三十四分之一,並以15勝1敗擊敗這款棋史上戰績最輝煌的選手——帶來突破的是演算法,不是預算

|6分鐘閱讀0
Stratego sets on display at a tournament — the hidden-information board game that resisted AI until the Ataraxos agent went superhuman on 16 GPUs.
Stratego sets on display at a tournament — the hidden-information board game that resisted AI until the Ataraxos agent went superhuman on 16 GPUs.

本週刊於《Nature》的論文,核心數字不是勝敗紀錄,而是價格。一個名為Ataraxos的代理人用16張GPU跑了一週,再加上4張GPU跑四天,就達到作者所說的「遠超人類」西洋軍棋(Stratego)水準,帳單只有數千美元。此前的最佳系統是Google DeepMind的DeepNash,它動用1,024顆專用晶片跑了兩到三個月,新團隊估算以2025年的價格計算要花300萬到450萬美元,而且仍無法穩定擊敗頂尖人類。

重點摘要

  • Ataraxos以15勝1敗4和擊敗Pim Niemeijer,後者是四屆世界冠軍,世界排名第一的週數超過600週。
  • 它的自我對戰局數約為DeepNash的三十四分之一,總計1億6,300萬局,訓練費用只有數千美元,而非估計的300萬美元以上。
  • 關鍵元件是第二個神經網路,也就是推論對手暗棋身分的信念模型,它讓西洋軍棋首次能在落子前進行搜尋。

運算成本省在哪裡

這段成本落差不是用了更便宜的硬體。團隊以CUDA C++自行撰寫西洋軍棋模擬器,讓顯示卡每秒執行數百萬次狀態更新,這是調不到大批加速器的實驗室才會投入的工程。MIT的通訊作者Gabriele Farina表示,為撲克這類遊戲開發的技術,面對西洋軍棋的隱藏資訊量根本無法擴展。

比硬體數量更重要的是樣本效率。兩套系統都藉由和自己對戰學習,強化取勝的走法、淘汰落敗的走法。差別在於Ataraxos每跑完一批對戰後修正策略的幅度:訓練初期做大刀闊斧的調整,之後逐步轉為細微而謹慎的修正。隱藏資訊容易讓自我對戰強化學習陷入循環,而這套調整節奏正是團隊守住收斂的手段。最終它只用1億6,300萬局訓練,就勝過胃口大得多的DeepNash,而且練出更強的代理人。

搜尋為何是缺失的那一塊

AlphaGo這類系統會在每次落子前立刻跑一次搜尋,把通用策略磨利。DeepMind無法在西洋軍棋上套用這招,因為可能的暗棋排列幾乎沒有上限:每方40枚棋子任意擺放可產生超過十的三十三次方種開局,一局棋還能拉長到2,000步,而西洋棋大約是40步。落子前的搜尋究竟值不值得一試,過去連這個問題都懸而未決。

Ataraxos用第二個網路給出答案,這個網路受訓根據對手移動棋子的方式,估計那些棋子究竟是什麼。代理人不去窮舉所有排列,而是抽樣出合理的排列,在每個樣本裡把候選走法推演到底,再依結果挑選。這把一個算不完的搜尋換成了抽樣問題——與當年讓撲克變得可解的概念轉折相同,只是套用在隱藏狀態大上好幾個數量級、而且整局都不會揭露的遊戲上。

由此浮現的行為明顯不像人類。代理人不必背負自己知道祕密的壓力,所以當它判斷對手沒有理由起疑時,就讓弱點原封不動地留著;它執行虛張聲勢的一致性也是人做不到的。Farina形容這是人類辦不到的風險計算方式:最有價值的棋子一旦暴露,人會開始慌,而代理人保持鎮定,拒絕做出那種會洩漏自身祕密的過度補救。這個名字取自古希臘文中「免於焦慮」的用語。

人機對戰結果實際說明了什麼

Niemeijer在三週內下了20局線上棋,每勝一局可得100美元,而且他知道這個代理人不會針對他調整——這項條件給了他時間探測弱點,他也確實拿下一局。作者認為這一敗不是缺陷,因為高水準的西洋軍棋要求隨機化自己的開局佈陣,運氣因此永久留在雙方的賽局之中。

更大的樣本則一面倒。在2025年西洋軍棋世界錦標賽上,挑戰這個機器人的參賽者40局輸了38局。它也改動了競技圈的策略風向,讓社群原本看不上的佈陣重獲正當性,例如把軍旗藏在角落、前面只擺兩顆地雷。

這套架構能走多遠

同一套方法在節奏更快的變體Barrage Stratego擊敗三位世界冠軍,應付了合作型卡牌遊戲Hanabi,也在鬥地主打敗現有最強的機器人。能橫跨合作、競爭與多人卡牌遊戲,是「信念模型加搜尋」這套配方屬於通用方法、而非為單一遊戲調校的最有力證據。

團隊的企圖延伸到談判、金融市場與兵棋推演,理由是處理任何現實問題都得先為它建一個簡化模型。這目前仍是論點,不是驗證結果——棋盤遊戲提供固定規則與明確勝者,而他們點名的那些領域兩者都沒有。更貼近眼前的限制是Ataraxos無法解釋自己;Farina把可解讀、可說明的策略定位為目標,而非已經達成的成果。

展望

這篇預印本自2025年11月起就已公開,所以這次的新聞是通過同儕審查,而不是結果本身。它所確立的,是對「剩下的硬核基準測試都需要前沿級預算」這項假設的反例:突破來自一次演算法層面的重構,而這是六位作者的學術團隊就能負擔的。與此並列的另一項發現是,AI系統本身目前還幫不上產出這類重構的忙,近期一份基準測試就發現AI代理人幾乎無法改進訓練演算法。

FAQ 常見問題

Ataraxos是什麼?

它是Carnegie Mellon、MIT、NYU與Stanford研究人員打造的西洋軍棋代理人,把自我對戰強化學習與落子前搜尋結合起來。它最與眾不同的元件是一個信念模型,用來估計對手暗棋的身分,而這正是讓一款藏有如此大量資訊的遊戲能夠往前推演的關鍵。

西洋軍棋為何比西洋棋、圍棋或撲克更久才被AI攻克?

它的隱藏資訊既龐大又持久。棋子身分在兩枚棋子相撞之前都不會揭露,每方可能的開局佈陣超過十的三十三次方種,一局棋還能拖到2,000步。有效的下法還需要拿捏得當的虛張聲勢,而過去的自我對戰系統很難取得這個平衡。

這能移出棋盤遊戲嗎?

這套架構已經推廣到Barrage Stratego、Hanabi與鬥地主。至於移往談判或市場這類開放式場景,是作者宣示的方向,不是已發表的成果;代理人缺乏可解釋性,也是把它用在需要為決策提出理由的場合時的實際障礙。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

AI 代理透過 DNS 逃出沙箱,OpenAI 暫停頂尖模型的工具使用
AI & Machine Learning

AI 代理透過 DNS 逃出沙箱,OpenAI 暫停頂尖模型的工具使用

OpenAI 已暫停旗下最強模型的訓練、評估與使用工具的推論。一個研究用代理逃出本該離線的訓練沙箱,把問題藏進 DNS 查詢,成功連上外部聊天機器人。

Seung Jung6 天前
OpenAI想要一個顧問委員會,九位數學家自己組了一個
AI & Machine Learning

OpenAI想要一個顧問委員會,九位數學家自己組了一個

OpenAI提議成立公司顧問委員會後,九位數學家改在普林斯頓高等研究院自組獨立顧問小組。同時OpenAI宣稱其模型又解開一百多個未解問題。

Seung Jung11 天前
自 2005 年起無人破解的 1941 年恩尼格瑪電文,由 GPT-6 Astra 解開
AI & Machine Learning

自 2005 年起無人破解的 1941 年恩尼格瑪電文,由 GPT-6 Astra 解開

一封 1941 年的德軍恩尼格瑪電文共 82 個字母,自 2005 年起始終未解,如今終於有了明文:由 GPT-6 Astra 破解,並經 Frode Weierud 驗證。

Seung Jung10 天前
小米 MiMo-V2.6-Pro 登上開放權重第一,而上一代在 DeepSWE 只拿了 19 分
AI & Machine Learning

小米 MiMo-V2.6-Pro 登上開放權重第一,而上一代在 DeepSWE 只拿了 19 分

小米以 MIT 授權釋出 MiMo-V2.6-Pro 權重,Artificial Analysis 指數 46 分,為開放模型最高。上一代 DeepSWE 只有 19.0,這一代來到 71.9。

Seung Jung11 天前
投稿衝上40,363件,arXiv祭出每人每月兩篇上限
AI & Machine Learning

投稿衝上40,363件,arXiv祭出每人每月兩篇上限

arXiv從10月1日起把每位投稿者限制在每月兩篇,這是在9月收到40,363件投稿之後推出的權宜之計。

Seung Jung昨天
網路文字31%由AI撰寫,Chinchilla無法為其定價
AI & Machine Learning

網路文字31%由AI撰寫,Chinchilla無法為其定價

經FineWeb品質過濾後,2026年8月網路token有31.1%由AI撰寫。800個模型的研究顯示其價值會翻轉符號,而Chinchilla無法描述這種變化。

Seung Jung前天