긴 영상 분석 AI의 기억력 문제를 푸는 'VideoLoop'
원제 VideoLoop: Looped Working Memory Against Semantic Thrashing in Long-Form Video Agents
추천 11댓글 2
Key Point
긴 영상을 분석하는 AI 에이전트가 정보를 제대로 기억하지 못하는 근본적 문제와 그 해결책을 제시하는 논문으로, 실제 벤치마크에서 10%대의 정확도 차이를 만든다.
핵심 요약
- 멀티모달 AI 에이전트가 긴 영상을 이해하려면 여러 추론 단계에서 증거를 반복 수집해야 하는데, 기존 방식은 '의미적 스래싱' 현상을 겪는다.
- '의미적 스래싱'은 작업 메모리가 계속 늘어나면서 핵심 증거에 대한 주의가 흐릿해지고 이미 찾은 정보에 접근할 수 없는 문제다.
- 연구팀은 추가 전용 메모리가 새로운 대상 증거는 통합할 수 있지만, 누적된 잡음을 제거하거나 컨텍스트 증가를 막으려면 메모리를 재작성하는 기능이 필수임을 수학적으로 보였다.
- VideoLoop는 두 개의 연결된 루프로 작동한다: 외부 루프는 영상을 추론하고, 내부 루프는 각 단계마다 과거 관찰과 분석 결과를 저장한 무한 파일시스템에서 정보를 검색한 뒤 유한한 작업 메모리를 재작성한다.
- VideoLoop는 Gemini, LLaVA 등 4개 주요 비전-언어 모델에 플러그인 방식으로 적용 가능하며, VideoMME(긴 영상) 벤치마크에서 기존 대비 평균 4.2% 포인트 향상을 보였다.
- 의미적 스래싱 완화 효과는 명백했다: 가장 어려운 25% 문제에서 에이전트의 컨텍스트만 읽은 판정자가 81.1% 정확도를 얻은 반면, 추가 전용 메모리 방식은 60.9%에 머물렀다.
- Gemini 3.1 Pro 모델을 사용할 때 VideoLoop는 VideoMME(긴 영상)에서 88.3%, VideoMMMU에서 88.8%, LongVideoBench(긴 영상)에서 80.9%의 성능을 달성했다.