멀티뷰 학습으로 공간 추론 강화한 SpatialSpeak 공개
원제 SpatialSpeak: QA-Native Reconstruction with Local and Global Context for Spatial Chain-of-Thought Reasoning
추천 18댓글 2
Key Point
비전-언어 모델의 공간 추론 능력을 크게 향상하는 새로운 학습 방식이 제시되었으며, 멀티뷰 재구성과 사고의 흐름 학습을 결합한 접근법이 기하학적 이해와 답 도출 과정 모두를 강화한다.
핵심 요약
- 비전-언어 모델(VLM)이 다중 관점 공간 추론을 위해 기하학적 사전 정보를 활용하지만, 기존 답 위주의 학습은 중간의 기하학적 추정과 정량적 공간 답 도출 과정을 직접 감독하지 않는다.
- 연구팀은 VLM이 멀티뷰 재구성을 통해 국소 기하학과 전역 장면 맥락을 함께 학습할 때 공간 사고의 흐름(CoT) 감독이 더 효과적이라고 가정했다.
- SpatialSpeak은 두 단계 프레임워크로, 1단계(QA-Native Reconstruction Pretraining, QA-RP)에서 표시된 점 기반 3D 쿼리로 세밀한 국소 기하학을 학습하고 객체 중심 쿼리로 전역 장면 맥락을 학습한다.
- 양쪽 작업 모두 텍스트 기반 질의응답으로 구성되어 기하학적 추정과 추론이 같은 자동회귀 출력 인터페이스를 공유한다.
- 2단계(CoT-VC)에서는 시각적 보상을 포함한 공간 CoT로 모델이 질문 관련 기하학적 추정을 표현하고 이를 이용해 답을 도출하도록 훈련한다.
- ReVSI 벤치에서 QA-RP 사전훈련이 CoT-VC의 성능 향상을 2.6점에서 6.9점으로 증가시켰다.
- 국소 및 전역 재구성 감독 모두 효과적임을 확인했고, ReVSI에서 62.8점으로 가장 강한 기존 방법보다 8.7점 높은 최신 성능을 달성했다.
- VSI-Bench와 SPAR-Bench 벤치마크에서도 최신 최고 성능을 기록했다.