월드 모델의 신뢰성을 측정하는 HappyWorld-Bench 공개
Key Point
월드 모델이 실제 환경처럼 동작하려면 상호작용 과정에서 일관성과 정확성을 유지해야 하는데, 이를 체계적으로 평가할 표준이 없었다—이 벤치마크는 현재 월드 모델들의 신뢰성 격차를 구체적으로 드러낸다.
핵심 요약
- 에이전트와의 상호작용 속에서 생성된 세계의 신뢰성을 평가하는 종합 벤치마크 HappyWorld-Bench를 소개한다.
- 영상 월드 모델, 공간 월드 모델, 신체화된 월드 모델 3가지 트랙에서 각각 1,138개 영상 프롬프트, 300개 공간 장면, 254개 신체화 테스트 케이스를 포함한다.
- 6단계 계층적 능력 체계(W1-W6)로 생성 구성부터 통합 월드 모델링까지 평가하며, 사람의 A/B 비교로 엘로 레이팅과 행동 정확성을 측정한다.
- 영상 모델은 긴 롤아웃과 재방문에서 일관성 감소, 공간 모델은 최대 70.14% 배치 정확도와 73.33% 편집 실행률, 신체화 모델은 다단계 행동 간 상태 보존 부족이 드러났다.
- 기존의 시각적 품질 평가 방식을 넘어 상태 일관성과 행동·개입에 대한 올바른 반응까지 측정할 필요가 있음을 제시한다.