숨겨진 정보 게임 스트래테고, AI가 인류 최강자 제압
원제 With most information hidden, the game Stratego had stumped AI until now
159 포인트댓글 75

Key Point
정보 은폐와 블러핑이 핵심인 게임을 AI가 처음 완벽히 정복했으며, 저예산으로 거대 기업 AI를 압도한 효율성이 향후 복합한 실제 문제 해결의 길을 열 수 있다.
핵심 요약
- 체스의 Deep Blue, 바둑의 AlphaGo에 이어 마침내 AI가 정보 은폐 게임 스트래테고를 정복했다.
- 카네기멜론, MIT, 뉴욕대, 스탠포드 연구팀이 개발한 Ataraxos가 역대 최강 플레이어 Pim Niemeijer를 15승 1패 4무로 꺾었다.
- 스트래테고는 포커와 같은 불완전정보게임이지만, 40개 기물이 1000경 개 이상의 배치가 가능하고 게임이 2000수까지 진행되며 블러핑이 중요한 게임이다.
- 기존 DeepMind의 DeepNash를 막았던 문제는 게임 중 인공지능이 순환 학습에 빠지고 탐색 공간이 너무 크다는 점이었다.
- Ataraxos는 학습 초기에 큰 전략 변화를 주고 후기에 작은 조정을 하는 방식으로 수렴 문제를 해결했다.
- 핵심 혁신은 상대의 숨겨진 기물을 추측하는 신경망(믿음 모델)을 별도로 훈련해 모든 배치를 탐색하지 않고 그럴듯한 경우들만 샘플링하는 기술이다.
- Ataraxos는 인간이 알 수 없는 약점을 무시하고 집중하는 등 인간의 편견 없이 이성적으로 플레이하며, 극복 불가능해 보이는 상황에서도 침착하게 역전을 시도한다.
- 20경기 매치에서 Niemeijer는 단 1승만 거뒀으며, 2025 스트래테고 세계대회에서는 40경기 중 38경기를 이겼다.
- DeepNash는 1024개 구글 칩으로 2~3개월 훈련에 300~450만 달러가 소요됐지만, Ataraxos는 16개 GPU로 1주일 훈련에 수천 달러만 들었다.
- 효율성은 수백만 수를 초당 처리하는 시뮬레이터 개발과 DeepNash의 1/34 게임으로 더 강한 성능을 달성한 빠른 학습으로 실현됐다.
- 같은 아키텍처로 Barrage Stratego 3명 세계챔피언, 협력 카드게임 Hanabi, 중국 카드게임 斗地主 최강 봇도 격파했다.
- 연구팀은 게임을 넘어 협상·금융시장·군사 시뮬레이션 같은 현실 문제에 적용하려 하며, 현재 Ataraxos는 의사결정 근거를 설명하지 못해 해석 가능한 전략 개발을 목표로 하고 있다.