사전학습 확산 모델로 스트리밍 비디오 실시간 편집
Key Point
비디오 편집의 실시간 스트리밍 처리가 GPU 한 개에서 15 FPS로 구현되면서 실제 응용 가능성이 높아졌으며, 사전학습 모델 활용으로 학습 비용을 줄인 점이 산업 적용의 진입장벽을 낮춘다.
핵심 요약
- SVEET은 사전학습된 양방향 비디오 확산 모델을 활용하면서 자회귀 방식으로 고품질 스트리밍 비디오 편집을 지원하는 프레임워크다.
- 기존 비디오-투-비디오 확산 방식을 재검토해 스트리밍 적응의 두 가지 핵심 원칙을 도출했다: 백본 특징 분리와 조건부 프레임 독립성.
- 보조 모델 브랜치가 시간 독립적 자기 주의로 소스 비디오를 인코딩하고, 중간 특징을 백본 블록에 주입해 스트리밍 호환 제어를 구현한다.