불완전정보 게임 스트라테고를 16개 GPU로 정복한 AI 아타락소스
카네기멜런대, MIT, 뉴욕대, 스탠퍼드대 연구진이 불완전정보 보드게임 스트라테고에서 인간 최강자를 꺾는 AI '아타락소스(Ataraxos)'를 만들었다. 세계선수권 4회 우승에 세계 랭킹 1위를 600주 넘게 지킨 핌 니메이어를 상대로 20판에서 15승 1패 4무를 기록했다. 학습에는 GPU 16장과 일주일이 들었고, 비용은 수천 달러 수준이었다.
스트라테고는 양쪽이 40개의 말을 가지며 원수부터 첩자까지 계급, 폭탄, 깃발이 섞여 있다. 승리 조건은 상대 깃발을 잡는 것. 상대는 말의 위치는 보지만 정체는 모르고, 두 말이 충돌할 때만 계급이 드러난다. 텍사스 홀덤이 숨은 카드 두 장, 경우의 수 1,326가지로 끝나는 것과 달리 스트라테고는 40개 말의 배열 자체가 10의 33제곱을 넘는다. 한 판이 2,000수까지 늘어지는 것도 흔하다.
블러핑도 변수다. 약한 말을 원수인 척 밀어 상대를 물러나게 하는 식이다. 너무 자주 속이면 위협이 무력해지고, 전혀 속이지 않으면 읽힌다. 이 균형이 2022년 딥마인드의 DeepNash를 비롯한 기존 AI를 막아온 벽이었다.
아타락소스는 DeepNash처럼 자기대국으로 배웠다. 총 1억 6,300만 판이다. 이긴 수를 강화하는 방식은 같지만, 학습 중 전략을 바꾸는 폭을 조절한 점이 다르다. 숨은 정보가 많은 게임에서는 자기대국 학습이 같은 자리를 맴돌기 쉬워서, 초반에는 크게 흔들고 후반에는 미세하게 다듬는 스케줄을 썼다.
더 큰 차이는 수를 두기 전에 탐색을 한다는 점이다. 알파고 계열이 행동 직전 탐색으로 전략을 다듬듯, 아타락소스는 상대의 숨은 말을 추정하는 별도의 신경망인 belief 모델을 둔다. 상대가 어떤 식으로 움직여왔는지를 근거로 그럴듯한 배치를 샘플링하고, 각 배치마다 후보 수를 굴려 결과를 비교한다. 모든 배열을 나열하는 대신 가능성 높은 것만 골라 보는 방식이다.
자원 효율은 비교가 뚜렷하다. DeepNash는 구글 전용 칩 1,024개로 두세 달을 학습했고, 2025년 가격으로 300만~450만 달러가량이 들었을 것으로 추정된다. 아타락소스는 GPU 16장으로 일주일, belief 모델 학습에 4장을 나흘 더 썼다. 학습한 판 수는 DeepNash보다 34배가량 적으면서 성능은 더 높았다. 연구진은 GPU에서 초당 수백만 수를 돌리는 시뮬레이터를 직접 작성해 이 규모를 가능하게 했다.
이름은 고대 그리스어로 평정을 뜻한다. 감정이 없으니 승률 2% 상황에서도 흥분하지 않고 차분하게 판을 되돌린다는 의미다. 실제로 아타락소스는 상대가 약점을 눈치챌 이유가 없다고 판단하면 그 약점을 건드리지 않고 놔둔다. 양쪽 판을 다 보는 인간에게는 불가능에 가까운 선택이다.
2025년 스트라테고 세계선수권에서 아타락소스에 도전한 참가자들은 40판 중 38판을 내줬다. 깃발을 폭탄 두 개 뒤 구석에 숨기는 식의, 사람들이 잘 쓰지 않던 배치가 이후 메타를 바꿔놓기도 했다. 같은 구조는 다른 게임에서도 통했다. 8개 말로 줄인 배러지 스트라테고에서 세계 챔피언 세 명을 이겼고, 협력 카드게임 하나비와 중국 카드게임 더우디주에서도 최상위 봇을 넘어섰다.
개발자 입장에서 주목할 지점은 알고리즘 자체보다 자원 대비 성능이다. 불완전정보와 긴 시간 지평을 가진 의사결정 문제를 학계 수준의 GPU로 감당할 수 있는 비용에 학습시켰다. 협상, 금융 시장, 군사 시뮬레이션처럼 규칙이 고정되지 않은 영역도 단순화한 모델을 세우는 것에서 출발한다는 점에서 같은 기법을 적용할 여지가 있다는 게 연구진의 설명이다.
한계도 분명하다. 아타락소스는 지금 상태로는 왜 그런 수를 두는지 설명하지 못한다. 연구진은 해석 가능하고 설명 가능한 전략을 만드는 쪽으로 다음 단계를 잡고 있다. 또 실제 문제는 보드게임처럼 규칙이 고정되어 있지 않고 승자도 명확하지 않다. 논문은 Nature 2026에 실렸다.