Hugging Face 논문AI · 머신러닝

음성 AI가 여럿이 말할 때 대답할지 침묵할지 판단하는 능력 측정

원제 Duplex-MPE: Benchmarking Multi-Party Interaction in Full-Duplex Dialogue

추천 82댓글 2Chengqian Ma, Wenhao Feng, Weixuan Jin 외
Key Point

다중 화자 상황에서 음성 AI의 현실적 문제(과도한 발화, 침묵 실패)를 체계적으로 측정하는 첫 벤치마크로서, 실제 대화 환경에서 AI 어시스턴트의 동작 능력 수준을 명확히 보여준다.

핵심 요약

  • 실시간 전이중 음성 모델은 말하면서 동시에 들을 수 있어 엄격한 턴 교대 없이 자연스러운 상호작용을 가능하게 한다.
  • 기존 벤치마크는 턴-테이킹, 끼어들기 처리, 다중 라운드 대화를 평가했지만 대부분 한 명의 지정된 사용자에 초점을 맞춰왔다.
  • Duplex-MPE 벤치마크는 3~4명의 인간 화자와 1명의 어시스턴트가 나누는 2,000개 시나리오를 포함하며, 명시적·암시적 요청이 쌍을 이룬다.
  • 모델은 전사록이나 턴 경계 정보 없이 연속된 대화 음성을 입력받는다.
  • 새로운 응답 시작, 답변 정확도, 침묵 유지, 요청 해결 시 중단의 4가지 항목을 측정한다.
  • MiniCPM-o 4.5, Moshi, FLM-Audio, Voila, Freeze-Omni 등 5개 오픈웨이트 음성 시스템을 평가했다.
  • MiniCPM-o 4.5가 3개 항목에서 최고 성능을 기록했고, 다른 시스템들은 빈번한 발화가 부정확한 답변이나 침묵 실패와 공존하는 현상을 보였다.
  • 전사 기반 Gemini 3.1 Pro 참조 모델은 명시적 요청에 암시적 요청보다 64.3 퍼센트포인트 더 자주 응답했으나, 음성 시스템들은 응답률에서 유의미한 차이가 없었다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗