Hugging Face 논문AI · 머신러닝

이미지·텍스트 동시 생성하는 연속형 확산 모델 공개

원제 Multimodal Flow: Unified Flow Modeling of Language and Vision in Embedding Spaces

추천 20댓글 1Hongyuan Tao, Xinggang Wang, Lianghui Zhu 외
Key Point

텍스트와 이미지를 진정으로 통합되는 한 가지 방식으로 모두 생성할 수 있다면, 멀티모달 모델의 아키텍처가 단순해지고 더 나은 성능을 낼 수 있다는 점을 실증한다.

핵심 요약

  • Multimodal Flow는 텍스트와 이미지를 모두 연속적으로 생성하는 통합 생성 모델로, 기존 모델처럼 이미지를 양자화하거나 텍스트·이미지 생성 과정을 달리할 필요가 없다.
  • 텍스트 블록과 이미지를 순서가 있는 연속적 하이퍼청크로 구성하며, Flow Matching을 통해 이들 위의 단일 벡터장을 학습한다.
  • 크로스 모달 상호작용을 위해 공동 어텐션을 사용하고, 각 모달리티별 피드포워드 네트워크로 처리한다.
  • 학습 중에는 여러 타겟 청크를 병렬로 예측하고, 추론 시에는 하이퍼청크를 순차적으로 생성한다.
  • 0.6B, 1.2B, 1.6B 규모로 사전학습한 MF-1 모델은 150B 토큰으로 GenEval과 DPG-Bench에서 평균 82.8점, VQAv2·MMBench·POPE에서 75.3점을 달성했다.
  • 이는 훨씬 더 많은 데이터로 학습한 기존 통합 모델들과 경쟁 수준이며, 동일한 데이터·최적화·파라미터 조건에서는 하이브리드·이산형 모델들을 능가한다.
  • 코드와 모델이 GitHub에 공개되었다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗