자동회귀 비디오 모델, 목표 지향적 추론으로 진화
원제 ProAR: Learning Prospective Reasoning with Autoregressive Video Models
추천 10댓글 1
Key Point
자동회귀 모델의 근본적 한계인 '근시안적 예측'을 명시적 목표 조건화와 미래 예측으로 해결하는 방식이 새로우며, 표준 모델보다 훨씬 적은 학습량으로 더 좋은 결과를 얻을 수 있다는 것이 효율성 관점에서 실무 적용 가치가 있다.
핵심 요약
- 자동회귀(AR) 비디오 생성 모델은 다음 청크 예측에 의존하면서 단기적·반응적 패러다임에 갇혀 있었고, 이는 목표 달성 과정이 중요한 추론 기반 생성 작업에서 한계였다.
- ProAR은 AR 비디오 생성을 목표 지향적 추론 과정으로 전환하는 프레임워크로, 비대칭 어텐션 마스크를 통해 예측된 목표 프레임(goal frame)을 자동회귀 루프에 통합해 중간 상태 생성을 안내한다.
- 두 번째 핵심은 미래 표현 자기정렬(future representation self-alignment)로, 현재 은닉 상태가 다음의 시간적 역학을 예측하도록 유도하며, 티처 포싱으로 깨끗한 미래 표현을 추출하고 경량 예측기로 정렬한다.
- 두 메커니즘이 명시적이고 희소한 목표 감독과 암묵적이고 조밀한 단계별 지도를 결합해 일관되고 목표 지향적인 추론 진행을 실현하면서 계산 비용은 낮다.
- 시각 추론 벤치마크 전반에서 ProAR의 두 요소가 성능을 일관되게 개선했으며, 표준 AR 모델을 완전히 학습한 것보다 25% 학습 단계로 더 나은 성능을 달성했다.
- 프레임워크는 신체 기반 추론 작업에도 적용 가능성을 보였다.