AI 모델 스타크래프트 실력 평가, Codex Astra 압승

Key Point
현재의 LLM들이 실시간 전략 게임을 얼마나 잘 플레이할 수 있는지, 그리고 모델별로 어떤 약점(전술 구성, 경제 관리, 실시간 의사결정)이 있는지 직관적으로 보여준다.
핵심 요약
- 다양한 AI 모델을 스타크래프트 브루드 워에서 대결시켜 게임 실력을 평가한 벤치마크 결과를 공개했다.
- Codex Astra가 100% 승률로 1위를 차지했고, Claude Fable이 83.3% 승률로 3위에 올랐으나, Grok 모델은 11.1% 이하 낮은 성능을 보였다.
- 대부분의 모델이 초급 수준에 머물렀으며, 구체적으로는 기술 트리 발전 미흡, 유닛 개별 투입(한 번에 하나씩 보내기), 경제 운영 실패 등의 문제를 드러냈다.
- Codex는 재빠른 어택(치즈 전술)으로 상대를 혼란스럽게 했고, Claude Fable은 본격적인 기술 발전과 전략 수립을 시도한 반면, Grok는 장시간 추론 후 행동으로 옮기지 못하는 경향을 보였다.
- AI가 턴 기반처럼 오래 생각하는 사이 게임이 진행되는 시간 개념의 문제도 관찰됐다.