이번 주 Nature에 실린 논문의 핵심 수치는 승패 기록이 아니라 가격이다. Ataraxos라는 에이전트가 GPU 16장으로 일주일, 여기에 GPU 4장을 나흘 더 돌려 저자들이 '압도적 초인'이라 부르는 스트라테고 실력에 도달했다. 청구서는 수천 달러 수준이다. 직전까지 최고 성능이던 Google DeepMind의 DeepNash는 전용 칩 1,024개로 두세 달을 돌렸고, 새 연구팀은 2025년 가격으로 300만~450만 달러가 들었을 것으로 추산한다. 그러고도 최상위 인간을 안정적으로 꺾지는 못했다.
핵심 요약
- Ataraxos는 세계 랭킹 1위를 600주 이상 유지한 4회 세계 챔피언 Pim Niemeijer를 15승 1패 4무로 눌렀다.
- 자가 대국 수는 DeepNash의 약 34분의 1인 1억 6,300만 판이었고, 300만 달러 이상으로 추산되는 비용 대신 수천 달러로 학습을 끝냈다.
- 성능을 끌어낸 장치는 두 번째 신경망, 즉 숨겨진 기물의 정체를 추론하는 신념 모델이다. 스트라테고에서 수 읽기 탐색을 처음으로 현실화한 요소다.
연산 비용은 어디서 줄었나
비용 격차는 하드웨어를 싸게 썼다는 이야기가 아니다. 연구팀은 스트라테고 시뮬레이터를 CUDA C++로 직접 작성해 그래픽카드에서 초당 수백만 번의 상태 갱신을 처리하게 만들었다. 가속기를 대량으로 끌어올 수 없는 연구실이 택하는 방식의 엔지니어링이다. MIT의 책임저자 Gabriele Farina는 포커 같은 게임에서 개발된 기법들이 스트라테고가 쏟아내는 은닉 정보의 양 앞에서는 아예 확장되지 않는다고 말했다.
하드웨어 수보다 중요한 것은 표본 효율이다. 두 시스템 모두 자기 자신과 대국하며 이긴 수를 강화하고 진 수를 버리는 방식으로 학습했다. 차이는 Ataraxos가 매 배치 이후 전략을 얼마나 과감하게 수정했는지에 있었다. 학습 초반에는 크고 대담하게 조정하고, 뒤로 갈수록 점점 작고 신중하게 다듬었다. 은닉 정보는 자가 대국 강화학습을 순환에 빠뜨리기 쉬운데, 이 조정 스케줄이 수렴을 지켜낸 장치였다. 그 결과 DeepNash의 훨씬 큰 학습량 대비 1억 6,300만 판으로 더 강한 최종 에이전트를 얻었다.
탐색이 빠진 조각이었던 이유
AlphaGo 계열 시스템은 매 수를 두기 직전 탐색을 돌려 범용 정책을 날카롭게 다듬는다. DeepMind는 스트라테고에 이 방식을 쓸 수 없었다. 가능한 은닉 배치의 집합이 사실상 무한에 가깝기 때문이다. 한쪽당 40개 기물을 임의로 배열하면 10의 33제곱을 넘는 초기 배치가 나오고, 한 판이 2,000수까지 늘어진다. 체스의 약 40수와 비교되는 수치다. 결정 시점 탐색을 시도할 가치가 있는지조차 열린 문제로 남아 있었다.
Ataraxos는 상대 기물의 움직임을 근거로 그 정체를 추정하도록 학습시킨 두 번째 신경망으로 답을 냈다. 가능한 배치를 전부 열거하는 대신 그럴듯한 배치를 표본으로 뽑고, 각 표본 안에서 후보 수를 끝까지 두어본 뒤 결과를 보고 선택한다. 다루기 불가능한 탐색이 표본 추출 문제로 바뀌는 것이다. 포커를 풀리게 만든 것과 같은 개념적 전환을, 은닉 상태가 몇 자릿수 더 크고 대국 전체에 걸쳐 유지되는 게임에 적용한 셈이다.
여기서 나타나는 행동은 분명히 인간과 다르다. 에이전트는 자기 비밀을 안다는 부담에서 자유롭기 때문에, 상대가 의심할 이유가 없다고 판단하면 약점을 그대로 방치한다. 블러프도 사람이 따라갈 수 없는 일관성으로 실행한다. Farina는 이를 사람이 할 수 없는 방식의 위험 계산이라고 표현한다. 가장 값진 기물이 노출된 인간은 당황하기 시작하지만, 에이전트는 흔들리지 않고 비밀을 내주는 식의 과잉 대응을 거부한다. 이름은 불안으로부터의 자유를 뜻하는 고대 그리스어에서 따왔다.
인간 대국 결과가 실제로 보여주는 것
Niemeijer는 3주에 걸쳐 온라인으로 20판을 뒀고 1승당 100달러를 받았다. 에이전트가 자신에게 적응하지 않는다는 사실도 알고 있었다. 약점을 탐색할 시간을 벌어주는 조건이었고, 실제로 한 판을 따냈다. 저자들은 이 1패가 결함이 아니라고 본다. 강한 스트라테고 실력은 자기 초기 배치를 무작위화하는 것을 전제로 하고, 그 때문에 양쪽 모두에게 운이 영구적으로 개입하기 때문이다.
더 넓은 표본은 한쪽으로 기울어 있다. 2025년 스트라테고 세계선수권에서 이 봇에 도전한 참가자들은 40판 중 38판을 졌다. 경쟁 메타게임도 움직였다. 깃발을 모서리에 폭탄 두 개만 붙여 숨기는 배치처럼 커뮤니티가 외면했던 전략이 재평가받고 있다.
이 구조는 어디까지 가나
같은 접근법은 속도가 빠른 변형인 Barrage Stratego에서 세계 챔피언 3명을 꺾었고, 협력형 카드 게임 Hanabi를 처리했으며, 두더우주(dou dizhu)에서 기존 최강 봇을 이겼다. 협력·경쟁·다인용 카드 게임을 가로지르는 이 범위가 신념 모델과 탐색을 결합한 조합이 한 게임에 맞춰진 것이 아니라 일반적이라는 가장 강한 근거다.
연구팀의 목표는 협상, 금융시장, 워게이밍까지 뻗어 있다. 실제 문제에 접근하는 일은 결국 그 문제의 단순화된 모형을 세우는 데서 시작한다는 논리다. 다만 이는 입증이 아니라 주장에 머물러 있다. 보드게임은 고정된 규칙과 명확한 승자를 제공하지만, 이들이 거론한 영역은 둘 다 제공하지 않는다. 더 당장의 한계는 Ataraxos가 자기 판단을 설명하지 못한다는 점이다. Farina는 해석 가능하고 설명 가능한 전략을 성취가 아니라 앞으로의 목표로 규정한다.
전망
사전 공개 논문은 2025년 11월부터 공개돼 있었다. 따라서 이번 소식의 핵심은 결과 자체가 아니라 동료 심사 통과다. 이 논문이 공식화한 것은 남아 있는 난제 벤치마크들이 프런티어급 예산을 필요로 한다는 전제에 대한 반례다. 성과를 만든 것은 저자 6명의 학계 연구팀이 감당할 수 있는 규모의 알고리즘 재구성이었다. 이는 AI 시스템 자체가 그런 재구성을 만들어내는 데는 아직 큰 도움이 되지 못한다는 별개의 결과와 나란히 놓인다. 최근 벤치마크에서 AI 에이전트가 학습 알고리즘을 거의 개선하지 못한다는 사실이 확인됐다.
FAQ 자주 묻는 질문
Ataraxos는 무엇인가?
Carnegie Mellon, MIT, NYU, Stanford 연구진이 만든 스트라테고 에이전트로, 자가 대국 강화학습과 결정 시점 탐색을 결합했다. 차별점은 상대의 숨겨진 기물 정체를 추정하는 신념 모델이다. 은닉 상태가 그만큼 많은 게임에서 앞을 읽는 탐색을 가능하게 만든 요소다.
스트라테고는 왜 체스·바둑·포커보다 오래 AI에 저항했나?
은닉 정보가 방대하면서 오래 유지되기 때문이다. 기물 정체는 두 기물이 부딪힐 때까지 감춰져 있고, 한쪽당 가능한 초기 배치가 10의 33제곱을 넘으며, 한 판이 2,000수까지 늘어진다. 효과적인 플레이에는 계산된 블러프도 필요한데, 기존 자가 대국 시스템은 이 균형을 잡는 데 어려움을 겪었다.
보드게임 밖으로 이전되나?
이 구조는 이미 Barrage Stratego, Hanabi, 두더우주로 일반화됐다. 협상이나 시장처럼 열린 환경으로의 이전은 저자들이 밝힌 방향이지 발표된 결과가 아니다. 에이전트가 설명 능력을 갖추지 못한 점도 판단에 근거가 필요한 영역에서 쓰기에는 실질적인 걸림돌이다.






