멀티모달 LLM의 비전 토큰 처리를 MLP로 경량화
원제 Just MLPs: Efficient Visual State Reconstruction for Multimodal Language Models
추천 15댓글 1
Key Point
멀티모달 LLM의 추론 속도 병목인 시각 처리를 경량화하면서 정보 손실 없이 정확도를 유지하는 새로운 접근법이 기존 토큰 제거 방식의 한계를 극복한다.
핵심 요약
- 멀티모달 대형 언어 모델(MLLM)에서 긴 시각 토큰 시퀀스의 계산 비용을 줄이는 것이 핵심 과제이다.
- 기존 방법은 불필요한 시각 토큰을 제거하는 토큰 가지치기(pruning)를 사용하지만, 이후 층에서 유용할 수 있는 시각 정보를 영구적으로 버린다.
- 연구진은 저랭크 개입 분석을 통해 시각-텍스트 정보 흐름을 차단한 후 몇 가지 방향만 복구해도 대부분의 정확도가 회복됨을 발견했다.
- 이는 관련 시각 정보가 저차원 부분공간에 집중되어 있음을 시사한다.
- 각 층별 시각 상태가 높은 예측 가능성을 보이며, 경량 MLP가 높은 코사인 유사도와 낮은 복구 오차로 근사할 수 있음을 관찰했다.
- 이 발견을 바탕으로 δ-Vision을 제안한다. 이는 시각 토큰의 반복적인 Transformer 진화를 저랭크 어댑터로 대체하여 모든 시각 토큰을 보존하면서 층별 시각 메모리를 구축한다.
- 이미지와 비디오 벤치마크에서 δ-Vision은 토큰 가지치기 기준선 대비 비슷하거나 낮은 계산량으로 더 높은 정확도를 달성했다.
- 시각 토큰을 버리지 않으면서도 경쟁력 있는 추론 효율성을 제공한다.