Hugging Face 논문AI · 머신러닝

음성 복제 TTS를 10배 빠르게, 자동회귀 대신 마스크 예측으로

원제 Tacit-TTS: From Autoregressive Decoding to Masked Prediction for Efficient Transcript-Free Voice Cloning

추천 10댓글 1Jian Chen, You Zhang, Mark Vinton
Key Point

음성 복제 음성합성의 속도와 유연성 문제를 동시에 해결하는 방식이 등장했으며, 텍스트 없는 조건화로 다국어·비음성 참조까지 지원하는 확장성이 실제 응용 시 의미가 있다.

핵심 요약

  • 기존 음성 복제 TTS는 자동회귀 시맨틱 모델링으로 높은 품질과 표현력을 보였지만, 순차 디코딩으로 인한 높은 지연 시간이 문제였다.
  • 논문은 Tacit-TTS라는 효율적인 음성 복제 시스템을 제안하며, IndexTTS2에서 증류(distillation)한 모델이다.
  • 자동회귀 텍스트-시맨틱 디코딩을 마스크 기반 비자동회귀 생성으로 대체하고, 학습 없는 음성 길이 추정을 도입했다.
  • ReFlow 증류를 통해 플로우 매칭 렌더러의 속도를 가속화했다.
  • 영어 2개, 만다린 2개 데이터셋에서 IndexTTS2 대비 5초 이상 음성에서 10배 이상 빠른 생성 속도를 달성했다.
  • 핵심은 텍스트 없이 음성 조건만으로 작동해 기존 시스템의 제약을 극복한다는 점이다.
  • 8개 언어 음성, 영아 음성, 합성 음성(gibberish) 등을 참조로 사용할 수 있으며, 기존 ASR 기반 시스템이 실패하는 경우에도 동작한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗