Hugging Face 논문AI · 머신러닝

오디오와 비디오를 선택적으로 검색하는 추론 AI

원제 OmniSeek: Native Tool Integration for Multi-turn Audio-Visual Reasoning

추천 11댓글 2Haibo Wang, Jiteng Mu, Jialu Li 외
Key Point

더 긴 멀티미디어 콘텐츠를 효율적으로 분석하고 필요한 부분만 집중하는 AI의 접근 방식이 어떻게 작동하는지 보여주기 때문이다.

핵심 요약

  • Omni-LLM을 기반으로 한 OmniSeek은 긴 오디오-비주얼 시퀀스를 통째로 처리하지 않고, 필요한 증거만 동적으로 선택해 검색하는 다중 턴 추론 에이전트이다.
  • 모델은 언제 보고 언제 들을지, 어느 시간 구간을 살펴볼지를 스스로 결정하며, 검색한 원본 오디오나 비주얼 세그먼트를 다시 컨텍스트에 추가해 다음 단계 추론을 지원한다.
  • 이 능력을 학습시키기 위해 교차 모달리티 증거를 포함한 다중 홉 사고의 연쇄 궤적 17만 개(OmniTraj-170K)로 구성된 데이터셋을 합성했다.
  • 먼저 이 궤적들에서 감독 학습으로 모델을 훈련한 후, 두 단계의 강화 학습으로 정책을 최적화했으며, 음향-시각 필요성 목표(Audio-Visual Necessity objective)를 통해 양쪽 모달리티 모두 필요한 추론을 보상한다.
  • 광범위한 벤치마크 실험에서 OmniSeek은 적응형 교차 모달 증거 탐색을 학습했으며 오디오-비주얼 추론 성능을 지속적으로 향상시켰다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗