Hugging Face 논문AI · 머신러닝

게임 AI의 능력을 평가하는 대규모 벤치마크 공개

원제 GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay

추천 129댓글 3Yiran Wang, Xingyilang Yin, Junfu Pu 외
Key Point

게임을 통해 AI의 비전, 지시 분해, 계획, 제어 능력을 체계적으로 평가하는 첫 번째 대규모 표준화 벤치마크로, 멀티모달 AI 모델 발전의 객관적 척도가 된다.

핵심 요약

  • 게임 플레이 능력을 다양한 시간 범위에서 측정하는 GameHorizon Suite를 개발했다.
  • 21개 게임의 5,000시간 녹화본, 100명 전문가 플레이어의 행동, 다중 수준 지시문으로 구성된 대규모 데이터세트를 구축했다.
  • 오프라인 평가는 표준화된 문제로 재현 가능하고, 온라인 평가는 실제 게임플레이 능력을 검증한다.
  • 47개 모델을 100만 회 이상 평가한 결과, 작업 난이도 계층과 모델 간 성능 차이를 파악했다.
  • 자동화된 주석 처리 파이프라인, 데이터세트, 벤치마크를 모두 공개할 예정이다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗