예측 가능한 의미 토큰으로 영상 생성 가속화
원제 SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation
추천 10댓글 2
Key Point
자동회귀 영상 생성에서 모델 크기 대비 성능 효율이 3배 이상 개선되면서, 비용 효율적인 고품질 영상 생성 시스템 구축이 가능해진다.
핵심 요약
- 최근 영상 생성 모델들은 자기회귀 예측의 확장성과 확산 모델의 시각적 품질을 결합하고 있으며, 이 과정에서 장면 토크나이저의 선택이 핵심이다.
- 기존 유연한 토크나이저들은 초기 디코더 숨김층에만 표현 정렬(REPA) 손실을 적용하는데, 디코더가 노이즈 입력에서 이를 부분적으로만 충족할 수 있다는 문제가 있다.
- SemanTok은 고정된 DINO 특징을 인코더에 입력하고 각 토큰 접두사에서 이들을 재구성하는 경량 헤드를 추가한 유연한 영상 토크나이저다.
- 201M 파라미터의 SemanTok 자기회귀 모델은 VideoFlexTok의 3.4배 크기 모델과 동등하거나 이를 능가하며, 더 큰 모델은 시각적 충실도를 더욱 개선한다.
- SemanTok은 분포 밖의 클래스에서도 의미 정렬을 유지하고, 순수 노이즈를 포함한 모든 노이즈 수준에서 디코더의 의미 정렬을 향상시킨다.
- 재구성과 생성 모두에서 우수하며, 짧은 토큰 접두사는 예측 비용이 적고 더 나은 생성 충실도를 제공하면서 픽셀 세부사항은 이후 토큰으로 미룬다.