카네기멜론대학교와 매사추세츠 공과대학 등 연구팀이, 상대방의 폰(komā)의 정체(jeongchi)가 보이지 않는 군인(gunin) 족놀이(shōgi)형의 보드게임을 “스트라テゴ(Suratēgu)”에서, 탑 클래스(top keesu)의 인간(ningen)을 대폭(daebok)으로 회복(hwibok)하는 AI “아타라옥스(Ataraxos)”를 개발(kapyeol)했습니다. 아타라옥스(Ataraxos)는 세계(segi) 챔피언십(shenneung)에서 4회(ho) 우승(yunnap)한 핌(Pim) ニー메이어(Neimeyer) 씨(si)에 15승(seung) 1패(pae) 4무(mu)로 승리(surye)했으며, 연구팀(yeongyukteum)은 스트라テゴ(Suratēgu)에서 처음(cheoeum)으로 “초인적(chohinjeok)”한 성적(seongjeok)을 실현(siljeong)한 것으로 보입니다.
Scalable decision-making for games of imperfect information | Nature https://www.nature.com/articles/s41586-026-11036-y
가장 많은 정보가 숨겨진, 게임 전략은 AI에게—지금까지는—걸림돌이었지만, 이제는 - Ars Technica https://arstechnica.com/science/2026/10/ai-finally-beat-the-best-stratego-player-in-history-and-did-it-on-a-budget/
스트라テゴ(Suratēgu)는 10×10 마스의(maseu) 보드게임(boardgame)에서 40개(gae)의 콤(kom)을 움직이(umwoigi)고 상대방(sandaepang)의 깃발(gi)을 빼앗(ppaesaat)는 것을 목표(mokpyo)로 하는 2인용(pyojeong) 게임(game)입니다. 콤(kom)에는 대좌(daejo)와 최고사령관(choheesaryeonggwan), 스파이(spyai), 폭탄(poktan), 깃발(gi) 등(deung)의 종류(jongnyu)가 있지만, 전장(daejeon)에서 상대(sandae)에게는 콤(kom)의 종류(jongnyu)가 보이지 않습니다. 콤(kom)이 서로(sero) 전투(chungtu)를 하는 것(geot eu)까지 정답(jeongdaep)이 밝혀지지 않(bwachyeojji an)기 때문에, “상대방(sandaepang)의 콤(kom)이 무엇(mueot)인지”를 추측(chujeuk)하면서 싸워야(ssawoyo ya) 합니다.
단순(santan)한 규칙(gwallyuk)으로 상대(sandae)와 심리전(simirjeon)을 繰り広げ(kkuryeohwaje)旗(gi)를 빼앗(ppaesaat)는 보드게임(boardgame) “스트라テゴ(Suratēgu)” 플레이 리뷰(peulleireu) - GIGAZINE
체스나 바둑에서는 보판상의 정보가 양자에게 공개되어 있지만, 스트라テゴ와 같은 게임에서는 플레이어마다 알고 있는 정보가 다르므로 “불완전 정보 게임”이라고 불립니다. 예를 들어 상대방의 턴 수가 보이지 않는 포커도 불완전 정보 게임의 한 종이지만, 테키사스 홀덤에서 처음 배겨지는 2장의 턴 수는 1326가지의 경우에 비해 스트라テゴ에서는 초기 배치가만 1033개를 초과할 수 있습니다. 더욱이 대국이 매우 길어지는 경우도 있으며, 블러프를 사용해야 하는지 여부도 포함하여 판단해야 하므로 AI에게는 매우 어려운 게임이었습니다. 스트라テゴ를 플레이하는 AI로는 2022년에 구글 딥마인이 발표한 디프나쉬가 존재합니다. 디프나쉬는 온라인 대전 사이트 “그라폰”에서 평가되어 평가 대상이 된 50경의 턴 중 42경에 승리했습니다. 딥마인의 AI “디프나쉬”가 돌의 정체를 숨기는 군인 정석 “스트라テゴ”를 마스터했습니다.
소니앤샌디에 따르면, 연구팀에 따르면 이미 유력한 플레이어들의 상당수가 그라폰에서 활동을 중단했으며, 디펀내쉬가 대전한 상대는 탑 클래스 인간과는 크게 실력이 떨어졌다고 합니다. 또한, 2023년 스트라テゴ 세계 챔피언십에서 디펀내쉬를 인간과 대전시킨 결과 19승 9패를 기록했지만, 니메이어 씨를 포함한 상위 플레이어들의 다수에게 패배했습니다. 이 때문에, 디펀내쉬가 “인간을 초월하는 강함”에 도달했었다고 연구팀은 평가하지 않았습니다. 아타로스(Ataraxos)와 디펀내쉬는 모두 인간의 장고를 학습하는 대신, 자신과 자신과의 대결을 반복하는 “자기 대결”을 통해 전략을 학습하는 점에서는 공통적입니다. 그러나, 아타로스는 “실제 대국 중에 상대의 숨겨진 장고를 추측하고, 그 정보를 사용하여 다음의 전개를 탐색한 후에 수를 선택한다”는 점에서 디펀내쉬와 크게 다르다고 합니다. 디펀내쉬는 스트라テゴ의 방대한 탐색 공간을 다루는 데 어려움을 겪었기 때문에, 대국 중에 다음의 전개를 탐색하여 판단을 개선하는 시스템은 채택되지 않았습니다. 아타로스에는 자기 대결을 통해 수를 선택하고 승패를 예측하는 “정책-가치 네트워크”에 더하여, 상대의 숨겨진 장고를 추측하는 “믿음 네트워크”가 도입되었습니다. 아타로스는 수를 지을 전에 믿음 네트워크를 사용하여, 현재까지 확인된 정보에서 상대의 장고 배치로 어울리는 패턴을 생성합니다. 그 위에, 각 패턴에 대해 후보가 되는 수에서 다음의 전개를 시뮬레이션하고, 결과를 비교하여 실제 수를 선택합니다. 생각할 수 있는 모든 배열을 총동원하는 대신, 가장 가능성 있는 배열을 좁혀서 탐색함으로써, 스트라テゴ에서도 대국 중의 탐색을 실용적으로 했습니다.
또한 학습 방법에도 개선이 이루어졌습니다. 불완전 정보 게임에서는 자가 대전으로 인한 전략 업데이트가 순환하거나 불안정해지기 쉬우므로, 아타라옥스는 학습 초기 단계에 전략을 크게 업데이트하고 학습이 진행됨에 따라 업데이트를 신중하게 하는 메커니즘을 채택했습니다. 또한, 기물의 초기 배치를 학습하는 네트워크와 대국 중의 움직임을 학습하는 네트워크를 분리하면서 상호 연계시키고 있습니다. 더 나아가, 계산 비용 또한 DeepNash와의 큰 차이점입니다. DeepNash는 1024개의 TPU를 2~3개월 동안 사용하여 학습한 것으로 보고되었으며, 연구팀은 2025년 시점의 가격으로는 계산 비용이 약 300만 달러에서 450만 달러(약 4억 5천만 원에서 6억 7천 5백만 원)에 달한다고 추산했습니다. 또한, 학습한 자가 대전은 약 55억 판에 달합니다. 반면, 아타라옥스의 강화 학습에는 16개의 NVIDIA H100을 1주일 동안 사용하고, belief 네트워크의 학습에는 4개의 H100을 4일간 사용한 것 외에는 총 비용이 8,000달러(약 120만 원) 미만이었습니다. 자가 대전은 약 1억 6,300만 판으로, DeepNash보다 훨씬 적은 계산 자원과 학습 데이터를 사용하여 더 강력한 AI를 구현했습니다. 연구팀은 아타라옥스를 세계 챔피언십 4회, 네덜란드 국내 챔피언십 15회, 온라인 세계 챔피언십 2회 우승 경험을 가진 니메이어 씨와 20판 대전시켰습니다. 그 결과, 아타라옥스는 15승 1패 4무로, 무승부를 0.5승으로 계산한 실효 승률은 85%였습니다. 니메이어 씨에게 아타라옥스가 상대방에 맞춰 전략을 변경하지 않는다는 점도 사전에 전달되었으며, 이는 20판 동안 AI의 약점을 찾아 해결할 수 있는 조건이었습니다.
또한, 2025년 스트라テゴ 세계 챔피언십 경기장에서는 참가자들이 아타라옥스와 40국을 벌려, 아타라옥스가 38승 2패를 기록했다. 연구팀에 따르면, 인간과는 다른 전술이 관찰되었으며, 기물의 정체를 움직임에서 읽기 어렵게 하거나, 인간에게는 위험하다고 판단되는 블러프를 사용하거나, 불리한 상황에서도 끈질기게 싸워 승리나 무승부에 이를 수 있는 능력에 우수했다는 것이다. 더불어, 연구팀은 기물을 8개로 줄인 “배리지를 위한 스트라テゴ(Barrage Stratego)”로도 세계 챔피언 3명을 꺾었으며, 협력형 카드 게임 “화려한 불꽃(Hanabi)”에서는 기존 최고 수준을 능가하고, 중국에서 널리 즐겨지는 카드 게임 “투지주(闘地主)”에서도 기존 최강 클래스의 AI를 상회했다. 연구팀은 대량의 정보가 숨겨진 상황에서도 “자기 대전(Self-Play Reinforcement Learning)”, “숨겨진 정보를 추론하는 모델”, “행동 직전의 탐색”을 결합함으로써 고도화된 의사 결정이 가능하다는 것을 제시하고 있다.
연구팀은 Ataraxos로 개발된 기술이 보드 게임 외에도 응용될 가능성이 있다고 생각하고 있습니다. 현실 세계의 협상, 금융 시장, 군사 충돌 등은 스트라テゴ와는 달리 명확한 규칙이나 승패가 정해져 있지 않습니다. 그러나 공동 연구자 유진 비니츠키 박사는 현실적인 문제를 다룰 때에도 먼저 단순화된 모델을 구축하는 것이 좋다고 지적하며, “워게임은 일반적으로 행해지고 있는 것입니다. 여기서 개발된 기술을 사용하여 상황을 전개하고 강력한 상대가 자신의 행동에 어떻게 반응하는지 조사할 수 있습니다”라고 밝혔습니다. 반면, Ataraxos에는 “왜 그 수를 선택했는가”를 인간에게 설명할 수 없는 문제가 남아 있습니다. 공동 연구자 가브리에레 파리나 박사는 “단지 강한 것뿐만 아니라 그 전략을 인간에게 설명할 수 있는 단계에는 아직 도달하지 않았다고 생각합니다”라고 언급하며, 향후 연구 과제로 삼았습니다.
원문 보기 | 출처: Gigazine