영상 세계 모델의 긴 문맥 처리, 효율적 어텐션으로 해결
원제 WorldAttention: An Efficient Attention Architecture for Interactive Video World Models
추천 19댓글 1
Key Point
대화형 비디오 생성에서 긴 문맥을 유지하면서 계산 효율을 동시에 확보하려는 세계 모델 연구의 핵심 기술 개선이다.
핵심 요약
- 텍스트 조건부 대화형 비디오 세계 모델은 텍스트 지시에 따라 시간적으로 일관된 환경을 시뮬레이션한다.
- 기존 프레임워크는 슬라이딩 윈도우로 계산 복잡도를 제한하면서도 과거 문맥을 잃어 장기 상호작용 능력이 떨어진다.
- 전체 히스토리 캐시는 어텐션의 이차 복잡도와 KV 캐시의 선형 증가로 인해 계산 및 메모리 과부하가 심하다.
- WorldAttention은 전문화된 어텐션 커널과 계층형 KV 캐시 관리의 공동 설계를 통해 효율성을 달성한다.
- Hybrid Sparse Attention(HSA)은 선형 전역 어텐션을 헤드별 적응형 희소 어텐션으로 보완한다.
- Hierarchical KV Cache(HKV)는 과거 KV 쌍을 의미론적 인덱스를 가진 페이지로 다중 계층 메모리에 구성해 세밀한 검색과 GPU 메모리 관리를 가능하게 한다.
- VBench-Long에서 주체 일관성 점수 0.9472, InterVBench에서 0.9668을 달성해 기존 최고 수준 방법을 초월한다.