프로그래밍 가능한 영상 생성 모델의 정확성을 테스트하는 벤치마크
원제 ROWBench: Do Video Models Render What the Program Specifies?
추천 57댓글 2
Key Point
프로그래밍 가능한 월드 모델이 실제로 프로그램의 명령을 정확히 시각화하는지 검증하는 첫 체계적 벤치마크로, 차세대 게임 엔진과 시뮬레이션 환경의 신뢰성 기준을 제시한다.
핵심 요약
- 프로그래밍 가능한 월드 모델은 시뮬레이션 엔진에서 실행되는 동작과 시각적 생성을 분리해 차세대 게임 엔진의 기반을 제시한다.
- 기존 벤치마크는 시각 품질, 제어 가능성, 명령어·물리 준수만 평가했으나 프로그램이 지정한 세부 이벤트에 대한 시각적 충실성은 거의 검증하지 않았다.
- 연구팀은 170개의 프로그래매틱 에피소드와 600개의 대리 영상으로 구성한 PROWBench를 제안했으며, 다양한 장면과 상호작용을 다룬다.
- 벤치마크는 엔티티 상태와 타임스탬프 이벤트를 로그에 기록하고(카메라 시야 밖의 이벤트 포함) 이를 재생 가능한 월드 레코드로 저장한 뒤 동기화된 시점에서 렌더링한다.
- 생성된 영상을 프로그램 실행의 관찰 가능한 결과와 비교 검증하며, 거친 3D와 바운딩 박스 등 다양한 표현 방식으로 각 카메라 뷰를 렌더링할 수 있다.
- 1인칭·3인칭 시점을 지원하고 일부 에피소드는 동기화된 다중 시점 관찰을 제공한다.
- Logic-Render Alignment와 Interaction Success Rate이라는 두 개의 VLM 기반 메트릭으로 엔티티 제어, 장기 메모리, 지정된 타임라인 준수, 엔진 기록 이벤트의 시각적 구현을 평가한다.