Hugging Face 논문AI · 머신러닝오늘의 주요

영화처럼 연출하는 AI, 비디오 프롬프트 생성 모델 WanPE

원제 WanPE: Towards Cinematic Prompt Enhancement for Modern Text-to-Video Generation

추천 18댓글 0Yubo Zhu, Yawen Shao, Ziyun Dai 외
Key Point

텍스트-투-비디오 모델이 30초 길이의 영상까지 생성하면서 프롬프트 엔지니어링이 곧 영상 품질의 핵심이 되는데, WanPE는 일반인의 모호한 지문을 영화급 연출 지문으로 자동 변환해 현장에서 직접 활용 가능하다.

핵심 요약

  • 텍스트 기반 비디오 생성에서 프롬프트 품질이 결과물을 좌우하는 만큼, 알리바바 연구진이 영화 감독 수준의 시네마틱 기획을 가능하게 하는 397억 파라미터 모델 WanPE를 공개했다.
  • 105만 개의 실제 영상으로 학습한 WanPE는 사용자의 텍스트 입력을 장면별 영화적 연출 계획(shot-level cinematic plan)으로 변환하며, 비디오 데이터에서 역구성(reverse construction)을 거쳐 프롬프트를 개선한다.
  • 의미적 일관성을 유지하는 GRPO 강화학습(SC-GRPO)을 통해 여러 장면에 걸쳐 사용자의 의도가 왜곡되지 않도록 보장한다.
  • WanPEval이라는 평가 데이터셋을 새로 구축했는데, 5초부터 30초까지 다양한 길이의 영상에 대해 약 1만 1천 건의 맹검 비교평가를 포함한다.
  • Wan 3.0 비디오 생성기에 통합했을 때 5~15초 구간에서 기존 프롬프트 대비 인간 선호도가 10.66~18.84점 상승했으며, 30초 영상에서는 50.86점이나 상승했다.
  • 역구성 방식이 프롬프트 직접 재작성보다 월등히 우수했고, SC-GRPO가 모델 규모 전반에서 의미적 정확성을 견고히 유지했다는 게 실험으로 확인됐다.
  • 5~15초 구간에서 평가 대상 상용 모델 중 최고 성능을 보였으며, 30초에서는 Seedance 2.5와 경쟁력 있는 수준이다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗