멀티뷰 학습으로 공간 추론 강화한 SpatialSpeak 공개
Key Point
비전-언어 모델의 공간 추론 능력을 크게 향상하는 새로운 학습 방식이 제시되었으며, 멀티뷰 재구성과 사고의 흐름 학습을 결합한 접근법이 기하학적 이해와 답 도출 과정 모두를 강화한다.
핵심 요약
- 비전-언어 모델(VLM)이 다중 관점 공간 추론을 위해 기하학적 사전 정보를 활용하지만, 기존 답 위주의 학습은 중간의 기하학적 추정과 정량적 공간 답 도출 과정을 직접 감독하지 않는다.
- 연구팀은 VLM이 멀티뷰 재구성을 통해 국소 기하학과 전역 장면 맥락을 함께 학습할 때 공간 사고의 흐름(CoT) 감독이 더 효과적이라고 가정했다.
- SpatialSpeak은 두 단계 프레임워크로, 1단계(QA-Native Reconstruction Pretraining, QA-RP)에서 표시된 점 기반 3D 쿼리로 세밀한 국소 기하학을 학습하고 객체 중심 쿼리로 전역 장면 맥락을 학습한다.