Hugging Face 논문AI · 머신러닝

카메라 재방문 장면 재현하는 스트리밍 비디오 세계모델 LOCI

원제 LOCI: Spatial Linear Memory for Streaming World Models

추천 10댓글 2Ji Xia, Tingting Liao, Xuezhi Liang 외
Key Point

비디오 세계모델이 카메라 재방문 시 과거 장면을 정확히 재현하면서도 메모리를 효율적으로 사용하는 구조의 필요성이 커지고 있기 때문이다.

핵심 요약

  • 카메라가 이전에 관찰한 영역을 다시 방문할 때 비디오 세계모델이 그 장면을 정확히 재현해야 하는데, 과거 관찰을 기억하면서도 현재 시점에 맞는 정보를 검색하는 것이 핵심 과제다.
  • 기존 방식의 한계: 키-밸류 캐시는 시각적 세부사항을 잘 보존하지만 비디오 길이가 길어질수록 메모리가 증가하고, 순환 메모리는 메모리 효율적이지만 역사를 고정 크기 상태로 압축해 개별 과거 관찰에 직접 접근 불가능하다.
  • LOCI는 두 표현 방식을 모두 유지하는 하이브리드 공간 메모리 구조로, 트랜스포머 블록의 절반에서는 키-밸류 캐시로 과거 관찰을 유지하고, 나머지 절반에서는 현재 청크에만 제한하면서 순환 선형 주의 메모리를 보완한다.
  • 순환 메모리의 읽기와 쓰기는 투영 카메라 기하학에 기반해 조건이 지어지므로, 카메라 시점이 메모리 주소 지정과 저장된 내용 모두에 영향을 미친다.
  • 순환 읽기는 이후 캐시 기반 블록으로 흐르고 쿼리에 누적된 장면 맥락을 공급한다.
  • MIND 메모리 벤치마크와 기록된 궤적 테스트에서 LOCI는 기존 세계모델과 동일한 방식의 풀 소프트맥스 모델보다 재방문 콘텐츠를 더 정확하게 재현했다.
  • 전체 히스토리 기준으로 풀 소프트맥스 대비 피크 메모리를 같은 길이에서 약 30% 감소시켰다.
  • 제한된 관찰 뱅크로 장시간 비디오를 일정한 메모리에서 스트리밍할 수 있으며, 동일한 메모리 예산 하에서도 풀 소프트맥스보다 높은 충실도를 유지한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗