동영상 생성 모델의 '일괄 증류' 기술 공개
원제 LongLive-Plug: Once-for-All Distillation for Video Generation
추천 13댓글 1
Key Point
동영상 생성 모델 특화로 인한 반복 학습 비용을 획기적으로 줄이는 기술로, 실제 배포된 54개 모델에서 검증되었기 때문에 현실성 있는 효율화 방안을 제시한다.
핵심 요약
- 동영상 확산 모델이 다양한 작업에 특화되면서 각각 증류 단계를 반복하는 비효율이 발생하고 있다.
- LongLive-Plug는 한 번의 학습으로 여러 모델에 재사용 가능한 기능을 LoRA로 학습하는 일괄 증류 프레임워크다.
- 단일 패스 분류기 없는 가이던스, 소수 단계 샘플링, 자동회귀 생성의 장기 맥락 오류 보정 기능을 제공한다.
- 학습된 어댑터는 하류 모델이 조건부 분기를 추가하거나 출력 채널을 확장해도 재사용 가능하다.
- 고정된 가이던스 스케일로 학습했지만 CFG LoRA의 추론 가중치를 조정하면 텍스트 가이던스 제어가 가능하다.
- 소수 단계 LoRA와 함께 결합하면 하류 작업에서 소수 단계 생성과 CFG 제어성을 동시에 유지한다.
- 세 개 백본 패밀리 54개 하류 모델에서 학습 없이 배포 가능함을 검증했으며, 세계 모델링·로봇공학·편집·멀티모달 생성 등 8개 작업 범주를 포함한다.
- 각 기능을 백본 패밀리별로 한 번만 증류하고 대상별 재학습 없이 재사용할 수 있다.