Hugging Face 논문AI · 머신러닝오늘의 주요

멀티모달 AI의 숨은 추론 과정, 시각 증거로 감시한다

원제 Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence

추천 202댓글 1Xi Xiao, Tianchen Zhao, Youngeun Kim 외
Key Point

멀티모달 AI가 추론하는 과정을 들여다보고 통제하는 방법이 나왔으며, 초대형 모델까지 확장 가능함을 증명했기 때문이다.

핵심 요약

  • 멀티모달 대형언어모델(MLLM)이 추론 과정을 숨겨진 토큰(latent token)으로 수행하는 방식(LVR)이 확산되고 있지만, 이 과정을 직접 관찰할 수 없어 학습을 감독하기 어렵다.
  • 연구팀이 토큰 동작을 분석한 결과, 이미지 변형으로 정답이 바뀌어도 토큰이 약한 반응만 보이는 '증거-신용 격차(evidence-credit gap)' 문제를 발견했다.
  • GRPO 훈련 중 명시적 감독이 부족해서 생기는 문제로, 최종 답변에 대한 보상만으로는 어떤 시각 정보를 보존할지, 신용을 어떻게 배치할지 제대로 지도할 수 없음을 보여주었다.
  • ReaLVR이라는 새 방법을 제안했으며, 모델이 자유롭게 생성한 추론 경로에 시각 증거 감독을 직접 가하는 방식이다.
  • 정답과 모델이 생성한 오답을 대비시켜 어디에 강한 감독이 필요한지 파악하고, 관련 있는 시각 정보와 맞지 않는 정보를 대비시켜 무엇을 보존할지 결정한다.
  • 세 가지 모델 계열에서 기존 LVR 방법을 능가했으며, Qwen2.5-VL-7B에서 다섯 과제 평균 63.7%로 최고 성능을 기록했다.
  • 규모가 큰 모델(235B)까지 확대해도 안정적으로 성능 향상을 이뤄냈다.
  • 분석 결과 더 많은 토큰 위치가 질문에 민감하게 반응하고, 관련 시각 영역과 더 잘 정렬되며, 주목도 높은 토큰에 더 크게 의존하는 패턴을 보였다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗