오디오와 비디오를 선택적으로 검색하는 추론 AI
원제 OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning
추천 11댓글 2
Key Point
더 긴 멀티미디어 콘텐츠를 효율적으로 분석하고 필요한 부분만 집중하는 AI의 접근 방식이 어떻게 작동하는지 보여주기 때문이다.
핵심 요약
- Omni-LLM을 기반으로 한 OmniSeek은 긴 오디오-비주얼 시퀀스를 통째로 처리하지 않고, 필요한 증거만 동적으로 선택해 검색하는 다중 턴 추론 에이전트이다.
- 모델은 언제 보고 언제 들을지, 어느 시간 구간을 살펴볼지를 스스로 결정하며, 검색한 원본 오디오나 비주얼 세그먼트를 다시 컨텍스트에 추가해 다음 단계 추론을 지원한다.
- 이 능력을 학습시키기 위해 교차 모달리티 증거를 포함한 다중 홉 사고의 연쇄 궤적 17만 개(OmniTraj-170K)로 구성된 데이터셋을 합성했다.
- 먼저 이 궤적들에서 감독 학습으로 모델을 훈련한 후, 두 단계의 강화 학습으로 정책을 최적화했으며, 음향-시각 필요성 목표(Audio-Visual Necessity objective)를 통해 양쪽 모달리티 모두 필요한 추론을 보상한다.
- 광범위한 벤치마크 실험에서 OmniSeek은 적응형 교차 모달 증거 탐색을 학습했으며 오디오-비주얼 추론 성능을 지속적으로 향상시켰다.