Hugging Face 논문AI · 머신러닝

이미지·영상 이해와 생성을 한 번에, 픽셀 기반 통합 모델 등장

원제 PixelUMM: Encoder-Free Unified Image and Video Understanding and Generation

추천 13댓글 1Cong Wei, Xuanchi Ren, Bryan Chu 외
Key Point

인코더를 제거하고 픽셀 공간에서 직접 작동하는 통합 접근법은 시각-언어 파이프라인의 복잡도를 낮추면서도 이미지·영상 작업을 한 모델으로 처리하는 새로운 패러다임을 보여준다.

핵심 요약

  • 기존 통합 멀티모달 모델들은 이해와 생성을 위해 서로 다른 시각 표현을 사용해 시각 컨텍스트 길이를 늘리고 복잡도를 높여왔다.
  • PixelUMM은 인코더 없이 픽셀 공간에서 이미지와 영상의 이해·생성을 통합하는 모델이다.
  • 이미지를 공간 패치로, 영상을 시공간 튜블릿으로 표현해 원본 픽셀을 공유 백본에 단층 선형 투영으로 연결한다.
  • Mixture-of-Transformers 아키텍처는 공유 어텐션과 작업별 파라미터를 결합하고, 픽셀 공간 생성에 클린 픽셀 예측을 확장하며 자회귀 텍스트 예측과 픽셀 공간 플로우 매칭을 함께 지원한다.
  • 이미지·영상 이해 및 생성 과제에서 경쟁력 있는 성능을 달성했다.
  • 디코더 설계와 공간-시간 패치 크기 등 주요 설계 선택에 대한 실증 연구를 통해 향후 픽셀 기반 통합 멀티모달 모델 설계에 대한 통찰을 제시한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗