음성 AI가 정말 듣고 행동할까? 음성 에이전트의 맥락 인식 검진
Key Point
음성 에이전트가 의도한 사용자의 명령만 수행하고 옆사람의 말은 무시해야 하는데, 현재 모델들이 대부분 이를 제대로 못 하고 있다는 점을 실증적으로 보여준다.
핵심 요약
- 음성 LLM은 음성 명령을 인식하고 도구를 실행할 수 있지만, 먼저 현재 음향 및 대화 맥락이 행동을 정당화하는지 판단해야 한다.
- 연구팀은 VGBench라는 1,018개 항목의 진단 벤치마크를 제시했으며, 옆에서의 대화, 혼잣말, 화자 전환 시나리오에서 행동 수준의 적절성을 평가한다.
- 각 항목은 침묵, 도구 호출, 자연어 응답으로 구성된 공유 행동 공간을 사용하며, 화자 전환 쌍은 음원 거리 및 시간 경계를 제어하면서 착용자에서 방관자로의 전환을 테스트한다.