현실 상호작용으로 배우는 공간 추론, VLM의 약점을 잡다
Key Point
VLM이 로봇·자율주행·구체화 AI 등 현실 세계 상호작용이 필요한 분야에서 공간 추론 능력을 크게 제약받고 있으며, 상호작용 궤적이라는 자연스러운 감독 신호를 활용해 이를 체계적으로 해결하는 방법을 제시한다.
핵심 요약
- 시각-언어 모델(VLM)이 물리 세계에서 행동하려면 동적 환경에서 물체의 움직임과 시점 변화로 인한 국지적 상태 전이를 감지하고 이를 장기 궤적에 걸쳐 통합해 공간 상태를 유지해야 한다.
- 기존 VLM 훈련은 객체 속성과 공간 관계의 정적 질문에 집중해 상태 전이에 대한 직접적 감독이 부족하지만, 상호작용 궤적은 선행 관찰·행동·후속 관찰을 자연스럽게 연결해 국지적 상태 전이에 대한 직접 감독을 제공한다.
- 연구진은 VLM이 상호작용을 통해 물리 세계의 상태 전이를 모델링하도록 훈련하는 Spatial-Interactor 프레임워크를 제안했으며, L1 수동적 세계 상태 전이, L2 능동적 자기 상태 전이, L3 장기 상호작용 궤적으로 구성된 3단계 커리큘럼으로 학습 과정을 조직화했다.