실시간 음성·영상 대화 AI, 풀듀플렉스 상호작용 시스템 공개
원제 Realtime-Venus: A full-duplex interaction system with asynchronous delegation
추천 10댓글 2
Key Point
자연스러운 실시간 음성·영상 대화를 처리하는 시스템이 대규모 벤치마크에서 경쟁 모델을 앞선 성과를 보이고 있으며, 음성 중단과 배경음 같은 현실적 상황에서의 응답 능력이 실용성을 높입니다.
핵심 요약
- Hugging Face가 실시간 쌍방향 대화가 가능한 Realtime-Venus 시스템을 발표했다.
- 영상 상호작용용 Realtime-Venus-Omni과 음성 상호작용용 Realtime-Venus-Audio 두 개의 9B 모델로 구성되며, 각각 연속적 인지, 대화 제어, 음성 생성을 통합한다.
- 사용자 입력·모델 출력·작업 위임을 공유 타임라인으로 관리하며, 별도의 런타임이 백그라운드 작업을 비동기로 처리하면서 전면 상호작용을 이어간다.
- Realtime-Venus-Omni은 StreamingBench(70.2%), OVO-Bench(64.7%), Daily-Omni(81.3%) 등 6개 영상 벤치마크에서 최고 점수를 기록했다.
- 음성 벤치마크에서 MMAU(78.0%), Llama Questions(83.8%), Speech CMMLU(67.8%) 등에서 1위를 차지했으며, 사용자 중단의 75%에 응답하고 백채널·타인 발화·배경음 상황에서 각각 97%, 88%, 86% 지속율을 달성했다.