동영상 AI가 글씨를 제대로 쓰지 못한다
원제 VTR-Bench: A Systematic Benchmark for Evaluating Visual Text Rendering in Video Generation
추천 10댓글 2
Key Point
동영상 생성 AI 모델들이 영상 품질은 우수하지만 장면 속 글씨 렌더링이라는 맹점을 가진 이유를 체계적으로 드러내며, 텍스트 기반 평가 기준이 필요함을 보여준다.
핵심 요약
- 최신 동영상 생성 모델들이 자연어 지시로 현실 같은 영상을 만들어내지만, 기존 평가 기준은 시각 품질과 물리적 타당성에만 집중해 장면 속 텍스트 렌더링을 제대로 평가하지 못하고 있다.
- 광고와 과학 영상 등 5가지 실제 사용 사례를 바탕으로 300개의 프롬프트로 구성된 VTR-Bench 벤치마크를 개발했으며, 텍스트 충실도를 평가하는 자동화 파이프라인과 인간 평가 기준을 포함한다.
- Director 에이전트가 이미지·동영상 생성과 시각 평가를 조율하며 반복적 개선을 진행하는 Keyframe-Guided Agentic Framework를 함께 제시한다.
- 11개 최신 모델 실험 결과 모든 모델이 장면 텍스트 렌더링에서 큰 어려움을 보였으며, 최고 성능 모델도 단어 오류율(WER) 0.250을 기록했다.
- 분석 결과 현재 동영상 생성 모델들이 텍스트 렌더링에서 공통적으로 겪는 문제점들을 파악했고, 개선 경로를 제시하는 실용적 방안을 제공한다.