비전 인코더 제거해도 될까, 스케일링 법칙으로 본 멀티모달 학습
원제 How Far Are We from Removing the Visual Encoder? Scaling Laws for Encoder-Free Multimodal Pretraining
추천 54댓글 1
Key Point
현재 멀티모달 모델의 구조적 선택지가 스케일에 따라 어떻게 바뀌는지 정량적으로 보여주는 논문으로, 미래 모델 아키텍처 설계의 방향성을 결정하는 근거가 된다.
핵심 요약
- 기존 멀티모달 대규모 언어모델(MLLM)은 사전학습된 비전 인코더를 기반으로 하지만, 인코더가 없는 모델은 원본 픽셀에서 직접 시각 표현을 학습한다.
- 인코더 제거 시 멀티모달 목표의 최적 계산 할당이 더 큰 모델 쪽으로 이동하는 반면, 텍스트 목표는 변화가 거의 없다.
- 두 구조는 텍스트 손실에서는 겹치는 손실-계산 경계를 보이지만, 멀티모달 목표에서는 분산된다.
- 인코더 없는 모델은 작은 규모에서는 성능이 떨어지지만, 약 10^22 FLOPs 규모에서 따라잡을 것으로 예측되며 이는 실제 사전학습 예산 범위 내다.
- 비전 인코더 없이 언어모델은 시각 토큰 간의 양방향 상호작용 증가, 시각 처리의 초기 층 이동, 시각 토큰을 위한 전문가 라우팅 집중화를 통해 인코더의 역할을 대체한다.
- 스케일이 커질수록 사전학습된 인코더가 제공하는 시각 선행 정보의 이점이 감소하므로, 인코더 제거 구조는 멀티모달 사전학습의 유망한 방향이다.