음성 AI가 여럿이 말할 때 대답할지 침묵할지 판단하는 능력 측정
원제 Duplex-MPE: Benchmarking Multi-Party Interaction in Full-Duplex Dialogue
추천 82댓글 2
Key Point
다중 화자 상황에서 음성 AI의 현실적 문제(과도한 발화, 침묵 실패)를 체계적으로 측정하는 첫 벤치마크로서, 실제 대화 환경에서 AI 어시스턴트의 동작 능력 수준을 명확히 보여준다.
핵심 요약
- 실시간 전이중 음성 모델은 말하면서 동시에 들을 수 있어 엄격한 턴 교대 없이 자연스러운 상호작용을 가능하게 한다.
- 기존 벤치마크는 턴-테이킹, 끼어들기 처리, 다중 라운드 대화를 평가했지만 대부분 한 명의 지정된 사용자에 초점을 맞춰왔다.
- Duplex-MPE 벤치마크는 3~4명의 인간 화자와 1명의 어시스턴트가 나누는 2,000개 시나리오를 포함하며, 명시적·암시적 요청이 쌍을 이룬다.
- 모델은 전사록이나 턴 경계 정보 없이 연속된 대화 음성을 입력받는다.
- 새로운 응답 시작, 답변 정확도, 침묵 유지, 요청 해결 시 중단의 4가지 항목을 측정한다.
- MiniCPM-o 4.5, Moshi, FLM-Audio, Voila, Freeze-Omni 등 5개 오픈웨이트 음성 시스템을 평가했다.
- MiniCPM-o 4.5가 3개 항목에서 최고 성능을 기록했고, 다른 시스템들은 빈번한 발화가 부정확한 답변이나 침묵 실패와 공존하는 현상을 보였다.
- 전사 기반 Gemini 3.1 Pro 참조 모델은 명시적 요청에 암시적 요청보다 64.3 퍼센트포인트 더 자주 응답했으나, 음성 시스템들은 응답률에서 유의미한 차이가 없었다.