인간처럼 음향을 인식하는 로봇 등장
원제 OmniEcho: Spatial Audio Understanding for Embodied Agents
추천 15댓글 1
Key Point
로봇과 에이전트가 인간처럼 소리의 방향을 감지하고 환경과 상호작용하는 것이 현실에 가까워지고 있으며, 관련 벤치마크와 모델의 공개로 3D 공간 인식 AI 연구가 한 단계 진전되는 상황이다.
핵심 요약
- 인체착용 에이전트가 음원의 방향을 파악하고 시각 정보와 통합해 판단할 수 있도록 하는 OmniEchoBench 벤치마크를 공개했다.
- 실제 환경 197개 장면에서 수집한 6개 작업, 2,972개 Q&A 쌍, 900개 네비게이션 샘플과 1차 암비소닉(FOA) 오디오로 구성된다.
- 음원과 시각 관찰, 에이전트 궤적 간 기하학적 일관성을 유지하는 제어 가능한 공간 음향 렌더링 파이프라인을 개발했다.
- FOA 공간 인코더와 사전학습된 의미론적 오디오 경로를 갖춘 OmniEcho 모델은 공간 음향-시각 지각에서 최첨단 성능을 달성했다.
- 음성 안내 네비게이션 성능은 기존 비전-언어 네비게이션 수준에 접근했으나, 세밀한 공간 위치 파악과 거리 추정이 남은 과제다.