비디오 생성 모델의 현실적 목표 달성 능력 평가 벤치마크 공개
원제 Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation
추천 20댓글 1
Key Point
비디오 생성 모델을 로봇 학습이나 구체화된 AI에 활용하려면 물리적으로 타당한 다단계 조작을 정확히 모사해야 하는데, 이제 그 능력을 체계적으로 측정할 수 있는 벤치마크와 평가 도구가 나왔다.
핵심 요약
- 비디오 생성 모델을 구체화된 계획(embodied planning)과 학습의 시뮬레이터로 활용하려면 시각적 품질뿐 아니라 목표 지향적 행동에 따른 환경 변화 예측도 필요하지만, 기존 벤치마크는 단편적인 행동만 평가해 다단계 물리 추론이 부족했다.
- Ego2Act는 일상 환경에서 110개 과제의 2,640개 영상으로 구성된 벤치마크로, 초기 장면과 고수준 목표가 주어졌을 때 비디오 생성 모델이 목표 달성을 위해 손으로 물체를 조작하는 현실적인 1인칭 영상을 생성할 수 있는지 평가한다.
- 평가 자동화를 위해 Ego2ActJudge 파이프라인을 함께 공개했으며, 기존 방식보다 작업 완수율과 물리 타당성 평가가 인간 합의도와 더 잘 정렬된다.
- 현재 모델들은 단계를 건너뛰거나 부분 실행하는 경향을 보이며, 이로 인해 이후 단계가 필요한 상태를 잃고 최종 목표를 달성하지 못하고 있다.
- 특히 복잡한 물체 조작과 지속적인 세계 모델링에서 세밀한 물리 역학을 제대로 재현하지 못하는 문제가 발견되었다.