감정 음성 생성, 재학습 없이 정밀도 높이는 기법
Key Point
감정 음성합성에서 모델을 재학습하지 않고도 감정 표현 정확도를 최대 35% 향상시킬 수 있는 새 방법으로, 리소스가 제한된 음성 AI 개발에 실질적 이점을 제공한다.
핵심 요약
- 감정 조건부 음성합성(TTS) 모델이 요청한 감정을 제대로 표현하지 못하는 문제를 해결하기 위해 재학습 없이 내부 표현을 수정하는 벡터 스티어링 기법을 연구했다.
- 기존 CoCoEmo 방식은 감정 벡터를 하나의 단일 강도로 제어하는 방향으로만 보아 감정 정확도가 제한적이었다.
- 연구팀은 감정 벡터가 음성을 중립 표현에서 벗어나게 하는 공유 성분과 요청한 감정으로 생성을 유도하는 잔여 성분으로 분해될 수 있음을 발견했다.