멀티모달 AI의 숨은 추론 과정, 시각 증거로 감시한다
원제 Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence
추천 202댓글 1
Key Point
멀티모달 AI가 추론하는 과정을 들여다보고 통제하는 방법이 나왔으며, 초대형 모델까지 확장 가능함을 증명했기 때문이다.
핵심 요약
- 멀티모달 대형언어모델(MLLM)이 추론 과정을 숨겨진 토큰(latent token)으로 수행하는 방식(LVR)이 확산되고 있지만, 이 과정을 직접 관찰할 수 없어 학습을 감독하기 어렵다.
- 연구팀이 토큰 동작을 분석한 결과, 이미지 변형으로 정답이 바뀌어도 토큰이 약한 반응만 보이는 '증거-신용 격차(evidence-credit gap)' 문제를 발견했다.
- GRPO 훈련 중 명시적 감독이 부족해서 생기는 문제로, 최종 답변에 대한 보상만으로는 어떤 시각 정보를 보존할지, 신용을 어떻게 배치할지 제대로 지도할 수 없음을 보여주었다.
- ReaLVR이라는 새 방법을 제안했으며, 모델이 자유롭게 생성한 추론 경로에 시각 증거 감독을 직접 가하는 방식이다.
- 정답과 모델이 생성한 오답을 대비시켜 어디에 강한 감독이 필요한지 파악하고, 관련 있는 시각 정보와 맞지 않는 정보를 대비시켜 무엇을 보존할지 결정한다.
- 세 가지 모델 계열에서 기존 LVR 방법을 능가했으며, Qwen2.5-VL-7B에서 다섯 과제 평균 63.7%로 최고 성능을 기록했다.
- 규모가 큰 모델(235B)까지 확대해도 안정적으로 성능 향상을 이뤄냈다.
- 분석 결과 더 많은 토큰 위치가 질문에 민감하게 반응하고, 관련 시각 영역과 더 잘 정렬되며, 주목도 높은 토큰에 더 크게 의존하는 패턴을 보였다.