Hugging Face 논문AI · 머신러닝

감정 음성 생성, 재학습 없이 정밀도 높이는 기법

원제 EmoRES-TTS: Residual-Enhanced Vector Steering for Emotional Speech Generation

추천 17댓글 2Kuan-Po Huang, Haohe Liu, Puyuan Peng 외
Key Point

감정 음성합성에서 모델을 재학습하지 않고도 감정 표현 정확도를 최대 35% 향상시킬 수 있는 새 방법으로, 리소스가 제한된 음성 AI 개발에 실질적 이점을 제공한다.

핵심 요약

  • 감정 조건부 음성합성(TTS) 모델이 요청한 감정을 제대로 표현하지 못하는 문제를 해결하기 위해 재학습 없이 내부 표현을 수정하는 벡터 스티어링 기법을 연구했다.
  • 기존 CoCoEmo 방식은 감정 벡터를 하나의 단일 강도로 제어하는 방향으로만 보아 감정 정확도가 제한적이었다.
  • 연구팀은 감정 벡터가 음성을 중립 표현에서 벗어나게 하는 공유 성분과 요청한 감정으로 생성을 유도하는 잔여 성분으로 분해될 수 있음을 발견했다.
  • 이를 바탕으로 EmoRES(Emotion Residual-Enhanced Steering) 방법을 제안해 두 성분을 따로 제어하면서 백본 모델을 재학습하지 않는다.
  • IEMOCAP 데이터셋에서 IndexTTS-2 백본 대비 순위 상관계수가 26.13포인트 상승(118.8% 상대 이득), 감정 명중률이 12.95포인트 향상(20.1% 상대 이득)을 기록했다.
  • CosyVoice2 백본에서도 순위 상관계수 12.97포인트, 감정 명중률 6.92포인트 개선되어 각각 33.1%, 9.8%의 상대 이득을 달성했다.
  • 인간 평가 결과 청취자가 요청 감정을 정확히 식별하는 비율이 최대 35.0% 향상되었고, 음성 충실도는 17.3% 개선되었으며, 자연스러움에서는 쌍 비교 시 63.8%까지 EmoRES가 선호되었다.
  • 성분 제거 실험은 공유 성분을 유지하면서 감정 스티어링 벡터의 잔여 성분을 강화할 때 효과적인 제어가 이루어짐을 보여준다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗