입모양으로 더빙 품질 검증...음성 없이 영상만으로 판단
원제 Align Then Reason: A Multimodal Lip-Sync Judge for Dubbing
추천 11댓글 2
Key Point
더빙 품질을 자동으로 검증하는 기술이 높은 정확도로 개발되면 다국어 콘텐츠 제작의 품질 관리 비용과 시간을 크게 줄일 수 있기 때문이다.
핵심 요약
- 더빙 품질 관리를 위해 음성 없이 무음 영상과 텍스트만으로 화자의 입술 움직임과 후보 텍스트가 내용·타이밍 모두 일치하는지 판단하는 참조 모델 없는 검증기가 필요하다.
- 기존 시각적 음성 인식기와 영상-언어 모델은 입술 움직임에서 음성 내용은 복구하지만 시간 오차에는 민감하지 않아 이 작업에 부적합하다.
- 연구팀이 'Align Then Reason(ATR)'이라는 다국어 입모양 동기화 검증기를 개발했으며, 프레임 수준 입술 표현과 후보 텍스트의 음소 단위 사이에 단조 정렬을 먼저 확립한다.
- 정렬 점수매기자가 각 음소에 대한 국소 증거와 보정된 전역 정렬 점수를 LLM에 제공하여 내용과 타이밍을 함께 추론하게 한다.
- 7개 언어 벤치마크에서 ATR은 Qwen3.5 SFT 기준선 대비 평균 AUC를 2B·4B·9B 추론 모델에서 각각 59.4%·50.2%·50.8% 개선했다.
- 성능 개선이 LLaMA-3.1-8B와 Mistral-7B에서 최고 기준선 대비 평균 AUC 45.9%·46.6% 향상으로 LLM 계열에 걸쳐 일반화되며, 미처 본 MuAViC 언어 3개로도 전이된다.
- 더빙 라인 재정렬 작업에서 ATR-9B가 최고 입술 읽기 기준선을 52.0% 초과 달성했고, 스크립트-클립 할당 작업에서는 17.7% 개선했다.