비디오 확산 모델이 물리법칙을 위반하는 이유
Key Point
비디오 생성 AI의 핵심 약점인 물리법칙 위반을 어텐션 메커니즘 수준에서 진단하고, 모델 재설계 없이 적용 가능한 경량 해법을 제시한다.
핵심 요약
- 텍스트-투-비디오 확산 모델이 우수한 화질에도 불구하고 현실 물리법칙을 위반하는 영상을 생성한다.
- 연구팀이 모션 계획 과정을 분석해 초기 노이징 제거 단계에서 동작 궤적이 형성되는 방식을 규명했다.
- Rotary Position Embedding(RoPE)이 과도한 공간 주의 감소를 야기해 초기 후보 영역이 물리적으로 불가능한 위치에 조기 고정되는 것을 발견했다.
- RoPE 주파수를 노이징 제거 단계별로 조정하는 경량 아키텍처 수정안을 제안해 주의 감소를 줄이고 일관된 물리적 동작 탐색을 돕는다.
- 학습 없이 적용하는 방식과 재학습 기반 실험 모두 생성 영상의 물리 상식성을 향상시키는 효과를 확인했다.