GitHub TrendingAI · 머신러닝

k2-fsa/OmniVoice

600개 언어 지원하는 제로샷 음성 복제 TTS 'OmniVoice' 공개

원제 k2-fsa/OmniVoice

스타 12,999당일 +534Python
Key Point

지금까지 가장 광범위한 언어 커버리지를 갖춘 제로샷 TTS 모델이 공개되어 다국어 음성 합성 애플리케이션 개발에 새로운 가능성을 열고 있다.

핵심 요약

  • K2-FSA가 600개 이상 언어를 지원하는 다중언어 제로샷 TTS 모델 OmniVoice를 공개했다.
  • 확산 언어 모델 기반 아키텍처로 설계되어 높은 음성 품질과 빠른 추론 속도(RTF 0.025, 실시간 40배)를 제공한다.
  • 참조 음성 클립(3~10초)으로 음성을 복제하거나 성별, 나이, 음역, 방언 등 속성으로 음성을 설계할 수 있다.
  • 웃음소리 등 비언어 기호와 병음·음소로 발음 교정을 지원하며, 음성 복제 모드는 안정적이지만 음성 설계는 중국어·영어 데이터로만 학습되었다.
  • HuggingFace Space, Google Colab, 로컬 웹 UI로 코딩 없이 테스트 가능하며, 다양한 하드웨어(NVIDIA, Apple Silicon, Intel Arc GPU)를 지원한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗