Hugging Face 논문AI · 머신러닝

긴 영상 분석 AI의 기억력 문제를 푸는 'VideoLoop'

원제 VideoLoop: Looped Working Memory Against Semantic Thrashing in Long-Form Video Agents

추천 11댓글 2Jinfa Huang, Jianming Xu, Jingyang Lin 외
Key Point

긴 영상을 분석하는 AI 에이전트가 정보를 제대로 기억하지 못하는 근본적 문제와 그 해결책을 제시하는 논문으로, 실제 벤치마크에서 10%대의 정확도 차이를 만든다.

핵심 요약

  • 멀티모달 AI 에이전트가 긴 영상을 이해하려면 여러 추론 단계에서 증거를 반복 수집해야 하는데, 기존 방식은 '의미적 스래싱' 현상을 겪는다.
  • '의미적 스래싱'은 작업 메모리가 계속 늘어나면서 핵심 증거에 대한 주의가 흐릿해지고 이미 찾은 정보에 접근할 수 없는 문제다.
  • 연구팀은 추가 전용 메모리가 새로운 대상 증거는 통합할 수 있지만, 누적된 잡음을 제거하거나 컨텍스트 증가를 막으려면 메모리를 재작성하는 기능이 필수임을 수학적으로 보였다.
  • VideoLoop는 두 개의 연결된 루프로 작동한다: 외부 루프는 영상을 추론하고, 내부 루프는 각 단계마다 과거 관찰과 분석 결과를 저장한 무한 파일시스템에서 정보를 검색한 뒤 유한한 작업 메모리를 재작성한다.
  • VideoLoop는 Gemini, LLaVA 등 4개 주요 비전-언어 모델에 플러그인 방식으로 적용 가능하며, VideoMME(긴 영상) 벤치마크에서 기존 대비 평균 4.2% 포인트 향상을 보였다.
  • 의미적 스래싱 완화 효과는 명백했다: 가장 어려운 25% 문제에서 에이전트의 컨텍스트만 읽은 판정자가 81.1% 정확도를 얻은 반면, 추가 전용 메모리 방식은 60.9%에 머물렀다.
  • Gemini 3.1 Pro 모델을 사용할 때 VideoLoop는 VideoMME(긴 영상)에서 88.3%, VideoMMMU에서 88.8%, LongVideoBench(긴 영상)에서 80.9%의 성능을 달성했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗