Hugging Face 논문AI · 머신러닝오늘의 주요

VLM의 공간 추론 능력, 상호작용 학습으로 강화

원제 Spatial-Interactor: Learning Spatial Reasoning through Interaction with the Observable Physical World

추천 34댓글 2Kaixiang Yao, Xu Wang, Miao Pan 외
Key Point

VLM이 현실 세계의 물체 움직임과 공간 변화를 정확히 이해해야 로봇, AR, 자율 시스템 등에 실제 적용되는데, 이 논문이 그 핵심 약점을 구체적인 학습 방식으로 해결하는 방법을 제시합니다.

핵심 요약

  • 시각-언어 모델(VLM)이 동적 환경에서 물체 움직임과 시점 변화에 따른 상태 변화를 인식하고 추적하는 공간 추론 능력이 부족한 상태다.
  • 연구팀은 상호작용 궤적(선행 관찰-행동-후속 관찰)을 감독 신호로 삼아 VLM을 훈련하는 Spatial-Interactor 프레임워크를 제안했다.
  • L1(수동적 상태 전이) → L2(능동적 자기 상태 전이) → L3(장기 상호작용 궤적)의 3단계 커리큘럼으로 구성했다.
  • LSI-108K 데이터셋을 시뮬레이션과 실제 상호작용에서 구성했으며, SFT와 자기-증류(OPD) 두 단계로 훈련한다.
  • 여러 VLM과 공간 벤치마크에서 테스트한 결과 국소 전이 모델링과 장기 통합 능력 모두 일관되게 향상했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗