MLLM의 추론력으로 영상 편집을 정밀하게 제어하는 ThinkV2V
원제 ThinkV2V: Unleashing the Reasoning Capability of MLLMs for Instruction-Guided Video Editing
추천 25댓글 1
Key Point
MLLM의 추론 능력을 활용해 기존에 처리하지 못하던 복잡한 영상 편집 지시를 정확히 따르는 방법을 제시하며, 더 작은 모델로 더 큰 기준선을 능가하는 결과를 보였다.
핵심 요약
- 기존 영상 편집 방식은 MLLM을 의미 인코더로만 사용해 암묵적인 편집 지시를 제대로 처리하지 못했다.
- ThinkV2V는 MLLM의 사고 과정을 명시적으로 활성화한 뒤 영상 생성을 진행하는 추론 기반 프레임워크를 제안한다.
- MLLM-to-DiT 아키텍처로 영상과 지시에 대한 사고를 정제된 신호로 변환해 편집을 제어한다.
- 점진적 커리큘럼 학습으로 기본 편집에서 추론 중심 작업까지 단계적으로 학습하고, 추론 시점에 여러 후보를 반복 정제해 가장 신뢰성 높은 것을 선택한다.
- ThinkV2V-150K 데이터셋과 평가 벤치마크를 새로 구성했으며, 암묵적 의도와 인과 추론이 필요한 영상 편집에서 성능을 평가한다.
- 5B 규모 DiT 모델이 10B 기반선을 능가하면서 복잡하고 표준적인 편집 모두에서 최첨단 성능을 달성했다.