Hugging Face 논문AI · 머신러닝

비전 인코더 제거해도 될까, 스케일링 법칙으로 본 멀티모달 학습

원제 How Far Are We from Removing the Visual Encoder? Scaling Laws for Encoder-Free Multimodal Pretraining

추천 54댓글 1Lin Chen, Bolin Ni, Qi Yang 외
Key Point

현재 멀티모달 모델의 구조적 선택지가 스케일에 따라 어떻게 바뀌는지 정량적으로 보여주는 논문으로, 미래 모델 아키텍처 설계의 방향성을 결정하는 근거가 된다.

핵심 요약

  • 기존 멀티모달 대규모 언어모델(MLLM)은 사전학습된 비전 인코더를 기반으로 하지만, 인코더가 없는 모델은 원본 픽셀에서 직접 시각 표현을 학습한다.
  • 인코더 제거 시 멀티모달 목표의 최적 계산 할당이 더 큰 모델 쪽으로 이동하는 반면, 텍스트 목표는 변화가 거의 없다.
  • 두 구조는 텍스트 손실에서는 겹치는 손실-계산 경계를 보이지만, 멀티모달 목표에서는 분산된다.
  • 인코더 없는 모델은 작은 규모에서는 성능이 떨어지지만, 약 10^22 FLOPs 규모에서 따라잡을 것으로 예측되며 이는 실제 사전학습 예산 범위 내다.
  • 비전 인코더 없이 언어모델은 시각 토큰 간의 양방향 상호작용 증가, 시각 처리의 초기 층 이동, 시각 토큰을 위한 전문가 라우팅 집중화를 통해 인코더의 역할을 대체한다.
  • 스케일이 커질수록 사전학습된 인코더가 제공하는 시각 선행 정보의 이점이 감소하므로, 인코더 제거 구조는 멀티모달 사전학습의 유망한 방향이다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗