실시간 음성·영상 대화 AI, 풀듀플렉스 상호작용 시스템 공개
Key Point
자연스러운 실시간 음성·영상 대화를 처리하는 시스템이 대규모 벤치마크에서 경쟁 모델을 앞선 성과를 보이고 있으며, 음성 중단과 배경음 같은 현실적 상황에서의 응답 능력이 실용성을 높입니다.
핵심 요약
- Hugging Face가 실시간 쌍방향 대화가 가능한 Realtime-Venus 시스템을 발표했다.
- 영상 상호작용용 Realtime-Venus-Omni과 음성 상호작용용 Realtime-Venus-Audio 두 개의 9B 모델로 구성되며, 각각 연속적 인지, 대화 제어, 음성 생성을 통합한다.
- 사용자 입력·모델 출력·작업 위임을 공유 타임라인으로 관리하며, 별도의 런타임이 백그라운드 작업을 비동기로 처리하면서 전면 상호작용을 이어간다.
- Realtime-Venus-Omni은 StreamingBench(70.2%), OVO-Bench(64.7%), Daily-Omni(81.3%) 등 6개 영상 벤치마크에서 최고 점수를 기록했다.
- 음성 벤치마크에서 MMAU(78.0%), Llama Questions(83.8%), Speech CMMLU(67.8%) 등에서 1위를 차지했으며, 사용자 중단의 75%에 응답하고 백채널·타인 발화·배경음 상황에서 각각 97%, 88%, 86% 지속율을 달성했다.