Hugging Face 논문AI · 머신러닝

동영상 생성 자동회귀 확산 모델의 캐시 재사용으로 1.7배 고속화

원제 In-Flight KV Cache with Clean Anchors for Faster Autoregressive Video Diffusion

추천 18댓글 1Yikai Wang, Xiao Han, Mengmeng Xu 외
Key Point

프롬프트-기반 동영상 생성 서비스 개발 시 캐시 재사용과 양방향 조건부 생성으로 생성 속도를 높이는 구체적인 기술적 해법을 제시하므로, 장시간 영상 생성이 필요한 실무 개발자에게 실질적 개선 방안을 보여준다.

핵심 요약

  • 자동회귀 비디오 확산 모델은 동영상을 시간 단위 청크로 나누어 여러 단계의 노이즈 제거를 거쳐 생성하는데, 이미 생성한 청크를 기억하기 위해 기존 방식들은 별도의 순전파를 통해 깨끗한 KV 캐시를 재구성해야 했다.
  • FlashForward는 각 노이즈 제거 단계 중에 자동으로 생성되는 현재 청크의 KV 캐시를 다음 청크에서 직접 재사용해 캐시 업데이트 전용 순전파를 제거한다.
  • 이 방식은 여러 GPU를 각 단계에 할당해 서로 다른 청크가 동시에 서로 다른 단계를 점유하도록 해 병렬 처리 효율을 높인다.
  • 조기에 이용 가능한 캐시는 노이즈가 섞여 있어 청크 간 화면과 움직임 편차 문제가 발생하므로, FlashForward는 해당 영역 생성 전에 희소한 깨끗한 앵커 잠재변수를 미리 생성해 양방향 조건부 생성으로 안정화한다.
  • 두 메모리는 서로 다른 시간 규모로 작동한다: 희소 앵커 KV는 넓고 먼 거리의 구조 지도를 제공하고, 밀집한 단계별 이력은 미세하고 최근의 진화를 보존한다.
  • 최대 4개 GPU 사용 시 480p와 720p 해상도에서 20초 이상 16 FPS 동영상 생성 시 HiAR보다 1.16~1.69배, Self-Forcing보다 1.42~2.92배 빠르다.
  • VBench 평가에서 480p 1.3B 모델은 더 높은 점수를 기록했으며 20초, 35초, 65초 길이의 동영상에서 시간 일관성을 유지하면서 생성 속도를 크게 향상했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗