이미지·영상 이해와 생성을 한 번에, 픽셀 기반 통합 모델 등장
원제 PixelUMM: Encoder-Free Unified Image and Video Understanding and Generation
추천 13댓글 1
Key Point
인코더를 제거하고 픽셀 공간에서 직접 작동하는 통합 접근법은 시각-언어 파이프라인의 복잡도를 낮추면서도 이미지·영상 작업을 한 모델으로 처리하는 새로운 패러다임을 보여준다.
핵심 요약
- 기존 통합 멀티모달 모델들은 이해와 생성을 위해 서로 다른 시각 표현을 사용해 시각 컨텍스트 길이를 늘리고 복잡도를 높여왔다.
- PixelUMM은 인코더 없이 픽셀 공간에서 이미지와 영상의 이해·생성을 통합하는 모델이다.
- 이미지를 공간 패치로, 영상을 시공간 튜블릿으로 표현해 원본 픽셀을 공유 백본에 단층 선형 투영으로 연결한다.
- Mixture-of-Transformers 아키텍처는 공유 어텐션과 작업별 파라미터를 결합하고, 픽셀 공간 생성에 클린 픽셀 예측을 확장하며 자회귀 텍스트 예측과 픽셀 공간 플로우 매칭을 함께 지원한다.
- 이미지·영상 이해 및 생성 과제에서 경쟁력 있는 성능을 달성했다.
- 디코더 설계와 공간-시간 패치 크기 등 주요 설계 선택에 대한 실증 연구를 통해 향후 픽셀 기반 통합 멀티모달 모델 설계에 대한 통찰을 제시한다.