구글, 제미니 3.8 텍스트-음성 변환 모델 공개
원제 Gemini 3.8 text-to-speech
126 포인트댓글 65

Key Point
자연어만으로 완전히 새로운 음성 캐릭터를 만들 수 있고, 음성 복제 기능과 명확한 동의 검증 체계로 창작자와 음성 크리에이터를 보호하면서도 대규모 다국어 콘텐츠 제작을 가능하게 한다.
핵심 요약
- 구글이 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS 두 개의 새로운 텍스트-음성 변환 모델을 발표했다.
- Gemini 3.8 Flash TTS는 자연어 프롬프트로 완전히 새로운 음성을 창작하는 창의적 용도에, Gemini 3.8 Flash-Lite TTS는 대규모 더빙과 음성 에이전트에 최적화되어 있다.
- 사용자는 30초의 음성 샘플로부터 일관된 음성 프로필을 복제할 수 있으며, 음성 소유자의 명시적 동의 녹음을 통해 동의 검증이 이루어진다.
- 모델은 2,000개 이상의 프로덕션 준비된 음성을 제공하고, 100개 이상의 언어 및 방언을 지원하며, 멕시코 스페인어, 퀘벡 프랑스어, 스코틀랜드 영어 등 지역 변종을 포함한다.
- 줄 단위 정밀 제어를 통해 각 대사의 음성 연기, 속도, 방언, 백채널링을 지시할 수 있으며, 수 시간의 연속 오디오에서 스피커 드리프를 최소화하면서 품질을 유지한다.
- 네이티브 2인 장면 연출 기능으로 팟캐스트나 드라마틱 스토리텔링에서 다중 대화를 원활하게 제어할 수 있고, 웃음, 숨소리, 꿀꺽임 등 비언어적 신호로 현실적인 대화 텍스처를 추가할 수 있다.
- Gemini 3.8 Flash TTS는 Hume AI의 Voice Design Benchmark에서 1위(71.4점)를 차지했으며, Overall Quality Index에서도 Flash와 Flash-Lite가 각각 1, 2위를 기록했다.
- 모든 생성 오디오는 SynthID 워터마크로 표시되어 AI 생성 음성이 탐지 가능하도록 하며, C2PA 자격증명으로 개발자와 음성 크리에이터를 보호한다.
- Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook, Google Vids 등에서 시작되는 오늘부터 사용 가능하다.
- 개발자 플랫폼 Agora, LiveKit, Pipecat, Vercel 및 Figma, HeyGen, Linguana, Wondercraft 등의 기업들이 이 모델을 통합하고 있다.