001▲ 47 · 댓글 4현실 상호작용으로 배우는 공간 추론, VLM의 약점을 잡다시각-언어 모델(VLM)이 물리 세계에서 행동하려면 동적 환경에서 물체의 움직임과 시점 변화로 인한 국지적 상태 전이를 감지하고 이를 장기 궤적에 걸쳐 통합해 공간 상태를 유지해야 한다.
AI · 머신러닝 · Spatial-Interactor: Learning Spatial Reasoning through Interaction with the Observable Physical World
현실 상호작용으로 배우는 공간 추론, VLM의 약점을 잡다
Key Point
VLM이 로봇·자율주행·구체화 AI 등 현실 세계 상호작용이 필요한 분야에서 공간 추론 능력을 크게 제약받고 있으며, 상호작용 궤적이라는 자연스러운 감독 신호를 활용해 이를 체계적으로 해결하는 방법을 제시한다.
핵심 요약
시각-언어 모델(VLM)이 물리 세계에서 행동하려면 동적 환경에서 물체의 움직임과 시점 변화로 인한 국지적 상태 전이를 감지하고 이를 장기 궤적에 걸쳐 통합해 공간 상태를 유지해야 한다.
기존 VLM 훈련은 객체 속성과 공간 관계의 정적 질문에 집중해 상태 전이에 대한 직접적 감독이 부족하지만, 상호작용 궤적은 선행 관찰·행동·후속 관찰을 자연스럽게 연결해 국지적 상태 전이에 대한 직접 감독을 제공한다.
연구진은 VLM이 상호작용을 통해 물리 세계의 상태 전이를 모델링하도록 훈련하는 Spatial-Interactor 프레임워크를 제안했으며, L1 수동적 세계 상태 전이, L2 능동적 자기 상태 전이, L3 장기 상호작용 궤적으로 구성된 3단계 커리큘럼으로 학습 과정을 조직화했다.