동영상 생성 모델의 정렬 문제, 첫 종합 가이드
원제 Video Generation Models: A Survey of Post-Training and Alignment
추천 31댓글 1
Key Point
동영상 생성 모델이 인간 의도를 제대로 따르지 못하는 근본적인 정렬 문제를 체계화한 첫 종합 가이드로, 앞으로의 동영상 생성 기술 개발 방향을 정리해준다.
핵심 요약
- 동영상 생성 기술이 저해상도 단편에서 고해상도 장시간 시퀀스로 급속도 발전했으나, 사전학습된 모델은 인간 의도 따르기·시간적 일관성 유지·물리법칙 준수에 실패하는 경우가 많다.
- 동영상 생성의 정렬(alignment)은 이미지·텍스트 생성보다 난제가 많은데, 누적 오차·움직임-외형 결합·다목적 트레이드오프·시간적 속성의 제한된 감독이 주요 과제다.
- 이 논문은 동영상 모델의 사후학습(post-training)과 정렬을 다룬 첫 종합 리뷰로, 정렬 신호 적용 방식에 따라 암묵적 정렬과 명시적 정렬로 구분한다.
- 기존 방식들을 네 가지로 분류했다: 감독학습 미세조정·자기학습 및 증류·선호도·보상 기반 방법·추론 시간 방법.
- 설문은 자주 쓰이는 데이터셋·벤치마크·평가 방식을 검토하고, 확장 가능한 보상 설계·장기 시간적 일관성·안정성-표현력 트레이드오프·안전 고려 생성 같은 미해결 과제를 지적한다.
- 구조화된 개념 토대와 조종 가능하고 신뢰할 수 있는 동영상 생성 모델 개발을 위한 실무 지침을 제공하는 것을 목표로 한다.