영화처럼 연출하는 AI, 비디오 프롬프트 생성 모델 WanPE
Key Point
텍스트-투-비디오 모델이 30초 길이의 영상까지 생성하면서 프롬프트 엔지니어링이 곧 영상 품질의 핵심이 되는데, WanPE는 일반인의 모호한 지문을 영화급 연출 지문으로 자동 변환해 현장에서 직접 활용 가능하다.
핵심 요약
- 텍스트 기반 비디오 생성에서 프롬프트 품질이 결과물을 좌우하는 만큼, 알리바바 연구진이 영화 감독 수준의 시네마틱 기획을 가능하게 하는 397억 파라미터 모델 WanPE를 공개했다.
- 105만 개의 실제 영상으로 학습한 WanPE는 사용자의 텍스트 입력을 장면별 영화적 연출 계획(shot-level cinematic plan)으로 변환하며, 비디오 데이터에서 역구성(reverse construction)을 거쳐 프롬프트를 개선한다.
- 의미적 일관성을 유지하는 GRPO 강화학습(SC-GRPO)을 통해 여러 장면에 걸쳐 사용자의 의도가 왜곡되지 않도록 보장한다.