음성 AI가 정말 듣고 행동할까? 음성 에이전트의 맥락 인식 검진
원제 Do Audio LLMs Listen Before They Act? Diagnosing Acoustic-Context Gating in Voice Agents
추천 12댓글 1
Key Point
음성 에이전트가 의도한 사용자의 명령만 수행하고 옆사람의 말은 무시해야 하는데, 현재 모델들이 대부분 이를 제대로 못 하고 있다는 점을 실증적으로 보여준다.
핵심 요약
- 음성 LLM은 음성 명령을 인식하고 도구를 실행할 수 있지만, 먼저 현재 음향 및 대화 맥락이 행동을 정당화하는지 판단해야 한다.
- 연구팀은 VGBench라는 1,018개 항목의 진단 벤치마크를 제시했으며, 옆에서의 대화, 혼잣말, 화자 전환 시나리오에서 행동 수준의 적절성을 평가한다.
- 각 항목은 침묵, 도구 호출, 자연어 응답으로 구성된 공유 행동 공간을 사용하며, 화자 전환 쌍은 음원 거리 및 시간 경계를 제어하면서 착용자에서 방관자로의 전환을 테스트한다.
- 6개의 기본 Audio LLM과 3개의 학습 없는 적응 방식은 대부분 목표 도구를 식별하지만 화자 전환 시 거의 행동을 보류하지 않아, 최고 전환 음소거율이 14%에 불과하다.
- VoxGate를 사례 연구로 사용한 결과, 지도 학습으로 전환된 명령의 91.3%를 음소거하면서도 근처 착용자 명령과 텍스트 전용 제어의 정확한 도구를 선택한다.
- 탐색적 GRPO 훈련 단계에서도 유사한 전환 성능을 보였으며, 옆 대화 정확도는 68.4%에서 70.9%로, 혼잣말 음소거는 52.0%에서 60.0%로 향상되었다.
- 인수분해된 제어는 독립적인 음원 변화 효과를 식별했으며, 원거리 조작에 대한 민감도는 음향 렌더링 방식에 따라 다양하게 나타난다.
- 벤치마크는 고립된 화자 식별이 아니라 복수 신호 음향 맥락 게이팅을 측정한다.