쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 11일 (금)까지270건
2건 · "TTS"조건 지우기 ×
001당일 +139음성 클론부터 AI 에이전트 연동까지, 로컬 기반 AI 음성 스튜디오오픈소스 AI 음성 스튜디오 Voicebox는 ElevenLabs와 Whisper Flow의 기능을 하나로 통합한 로컬 우선 솔루션으로, 모든 데이터가 기기에서만 처리된다.AI · 머신러닝 · jamiepine/voicebox · TypeScript
음성 클론부터 AI 에이전트 연동까지, 로컬 기반 AI 음성 스튜디오

Key Point클라우드 의존을 벗어나 개인 기기에서 음성 클론, 생성, 인식, AI 연동을 모두 제어할 수 있는 완전한 로컬 솔루션이 등장했기 때문이다.
핵심 요약
- 오픈소스 AI 음성 스튜디오 Voicebox는 ElevenLabs와 Whisper Flow의 기능을 하나로 통합한 로컬 우선 솔루션으로, 모든 데이터가 기기에서만 처리된다.
- 음성 클론, 음성 생성(23개 언어 지원), 딕테이션, AI 에이전트 음성 출력까지 완전한 음성 입출력 스택을 7개 TTS 엔진으로 제공한다.
- Qwen3-TTS, Qwen CustomVoice, LuxTTS, Chatterbox 시리즈, HumeAI TADA, Kokoro 등 각 엔진이 서로 다른 강점을 가지며, Chatterbox Turbo만 [laugh], [sigh] 같은 감정 태그를 해석한다.
- 피치 시프트, 리버브, 컴프레션 등 8가지 오디오 이펙트와 자동 청킹, 멀티트랙 에디터, 음성 기반 페르소나 시스템을 갖춘다.
- macOS(Apple Silicon/Intel), Windows, Linux, Docker 등 다양한 플랫폼을 지원하며, Tauri 기반으로 Electron이 아닌 네이티브 성능을 제공한다.
- REST API와 MCP 서버를 내장해 커스텀 앱과 에이전트(Claude Code, Cursor, Cline)에 음성 입출력을 통합할 수 있다.
002당일 +280600개 언어 지원하는 제로샷 음성 복제 TTS 'OmniVoice' 공개K2-FSA가 600개 이상 언어를 지원하는 다중언어 제로샷 TTS 모델 OmniVoice를 공개했다.AI · 머신러닝 · k2-fsa/OmniVoice · Python
600개 언어 지원하는 제로샷 음성 복제 TTS 'OmniVoice' 공개

Key Point지금까지 가장 광범위한 언어 커버리지를 갖춘 제로샷 TTS 모델이 공개되어 다국어 음성 합성 애플리케이션 개발에 새로운 가능성을 열고 있다.
핵심 요약
- K2-FSA가 600개 이상 언어를 지원하는 다중언어 제로샷 TTS 모델 OmniVoice를 공개했다.
- 확산 언어 모델 기반 아키텍처로 설계되어 높은 음성 품질과 빠른 추론 속도(RTF 0.025, 실시간 40배)를 제공한다.
- 참조 음성 클립(3~10초)으로 음성을 복제하거나 성별, 나이, 음역, 방언 등 속성으로 음성을 설계할 수 있다.
- 웃음소리 등 비언어 기호와 병음·음소로 발음 교정을 지원하며, 음성 복제 모드는 안정적이지만 음성 설계는 중국어·영어 데이터로만 학습되었다.
- HuggingFace Space, Google Colab, 로컬 웹 UI로 코딩 없이 테스트 가능하며, 다양한 하드웨어(NVIDIA, Apple Silicon, Intel Arc GPU)를 지원한다.