음성 복제 TTS를 10배 빠르게, 자동회귀 대신 마스크 예측으로
원제 Tacit-TTS: From Autoregressive Decoding to Masked Prediction for Efficient Transcript-Free Voice Cloning
추천 10댓글 1
Key Point
음성 복제 음성합성의 속도와 유연성 문제를 동시에 해결하는 방식이 등장했으며, 텍스트 없는 조건화로 다국어·비음성 참조까지 지원하는 확장성이 실제 응용 시 의미가 있다.
핵심 요약
- 기존 음성 복제 TTS는 자동회귀 시맨틱 모델링으로 높은 품질과 표현력을 보였지만, 순차 디코딩으로 인한 높은 지연 시간이 문제였다.
- 논문은 Tacit-TTS라는 효율적인 음성 복제 시스템을 제안하며, IndexTTS2에서 증류(distillation)한 모델이다.
- 자동회귀 텍스트-시맨틱 디코딩을 마스크 기반 비자동회귀 생성으로 대체하고, 학습 없는 음성 길이 추정을 도입했다.
- ReFlow 증류를 통해 플로우 매칭 렌더러의 속도를 가속화했다.
- 영어 2개, 만다린 2개 데이터셋에서 IndexTTS2 대비 5초 이상 음성에서 10배 이상 빠른 생성 속도를 달성했다.
- 핵심은 텍스트 없이 음성 조건만으로 작동해 기존 시스템의 제약을 극복한다는 점이다.
- 8개 언어 음성, 영아 음성, 합성 음성(gibberish) 등을 참조로 사용할 수 있으며, 기존 ASR 기반 시스템이 실패하는 경우에도 동작한다.