Hugging Face 논문AI · 머신러닝

음성 합성에서 발화자와 억양 분리 제어하는 DEFINE 발표

원제 DEFINE: Exemplar-Guided Accent Control for Zero-Shot TTS

추천 12댓글 1Ambuj Mehrish, Abhinaba Roy, Alex Ivanov 외
Key Point

Zero-shot TTS에서 발화자와 억양을 독립적으로 제어하는 새로운 방식으로, 단일 모델로 학습 밖의 억양까지 처리할 수 있다는 점이 기술적 진전을 보여준다.

핵심 요약

  • Zero-shot TTS는 짧은 음성 샘플로 새로운 발화자를 재현할 수 있지만 발화자 정체성과 억양이 같은 샘플에 섞여 있는 문제가 있었다.
  • DEFINE은 발화자 정체성과 목표 억양을 각각 다른 음성 샘플로 조건화해 두 요소를 분리하는 프레임워크이다.
  • F5-TTS 기반이며 LoRA를 사용한 매개변수 효율적 적응으로 구현되었고, 짧은 억양 샘플을 조건화 공간으로 매핑하는 인코더를 학습된 억양 프로토타입으로 감독한다.
  • 추론 시 하나의 가중치로 억양 강도를 연속적으로 조절할 수 있으며 추론 시점에 억양 레이블이나 파형 변환이 필요하지 않다.
  • 학습된 억양에서 억양 제어 강도를 높이면 인식 정확도가 6.5%에서 19.6%로 향상된다.
  • 단일 DEFINE 모델은 학습 중 보지 못한 억양을 포함해 학습 세트 밖의 억양 제어로도 일반화된다.
  • 학습된 억양과 도메인 외 억양에서는 TTS-음성변환 캐스케이드 모델과 비슷한 억양 전이 성능을 달성하면서 발화자 유사도는 더 높고 음성 품질은 비슷하다.
  • 보류된 억양(모델이 전혀 보지 못한 억양)에서는 일반화되지 않는다는 한계가 있다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗