실시간 스트리밍 비디오에서 인식·기억·응답을 통합하는 OneStreamer
원제 OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction
추천 152댓글 1
Key Point
스트리밍 비디오 이해 작업에서 실시간 처리와 장기 기억 사이의 균형을 새롭게 푸는 방식을 제시하며, 8개 벤치마크에서 우수한 성능을 입증한 대규모 데이터셋과 모델을 공개합니다.
핵심 요약
- 스트리밍 비디오 LLM은 미래 작업의 중요성이 결정되기 전에 증거를 기억하고, 충분한 증거가 모였을 때 응답해야 한다.
- OneStreamer는 쿼리-독립적 증거 기록과 작업 응답을 공동으로 학습하되, 공유된 능동형 생성 과정을 통해 이룬다.
- Proactive Hierarchical Caption Memory(PHCM)는 시간-정박된 세부 사항 캡션과 완료된 이벤트의 요약을 생성하며, 훈련 중 관찰된 비디오 시작 부분의 해석을 감독한다.
- 추론 시 모델이 생성한 기록은 최근 시각 윈도우를 보완하고, 과거 시각 특징을 재방문하지 않고도 재사용 가능한 실제 맥락을 제공한다.
- Proactive State Transition Learning(PSTL)은 모든 출력 앵커에서 감독을 보존하고 대표적인 상태 변화·상태 지속 토큰을 선택해 반복 대기 상태의 지배를 줄인다.
- 스트리밍 데이터 합성 파이프라인은 출력 내용과 타이밍을 사용 가능한 증거와 맞춘다.
- 결과 생성 캡션과 QA를 정제된 오픈소스 데이터와 결합하면 OneStreamer-1M이라는 백만 개 이상의 기록을 포함한 다양한 작업 스트리밍 비디오 상호작용 데이터셋이 된다.
- 4B 모델은 평가된 8개 스트리밍 비디오 이해 벤치마크 전체에서 비교 대상 방법 중 최고 성능을 달성한다.
- 생성된 캡션을 유지하면 실시간 인식을 저하시키지 않으면서 과거 QA를 개선하는 것으로 나타났다.
- PSTL은 밀집 상태 감독과 비교해 우수하며, 주석 처리된 상태 토큰의 27.5%만 감독한다.