로봇 기초모델, 3D 공간 이해로 조작 정확도 높이다
Key Point
로봇 조작 작업에서 객체 위치와 기하학 정보를 명시적으로 모델링함으로써 일반화 능력을 크게 개선한 새로운 아키텍처 패러다임으로, 실제 로봇 배포의 신뢰성을 높이는 핵심 진전입니다.
핵심 요약
- 기존 로봇 기초모델은 언어-비전-행동 모델(VLA)이나 세계-행동 모델(WAM)을 기반하지만 3D 공간 정보를 직접 학습하지 않아 로봇 시연 데이터에만 의존했다.
- Grounded Action Models(GAM)은 3D 공간 정보를 명시적으로 포함한 새로운 로봇 기초모델로, 언어·포인트·박스 프롬프트 등으로 입력받은 후 공유 객체 표현으로 변환해 행동을 예측한다.
- 이 표현은 목표 대상의 시각 특징과 기하학적 정보를 담으며 로봇 상태 이력과 함께 멀티스트림 트랜스포머로 처리된다.
- RoboTwin 2.0에서 55.3% 성공률을 기록했고(기존 방식 52.0%), 깨끗한 장면 데이터만으로 학습했지만 장면 변화에서 47.6% 성공률을 달성했다(기존 30.4%).
- LIBERO-PRO 벤치마크에서 61% 성공률로 기존 방식(53%)을 능가했으며, 실제 로봇에서도 시각 변화에 강건해 YAM에서 17/20 성공(기존 4/20)을 기록했다.
- 높은 수준의 계획자와 결합시 롱호라이즌 작업에서 64.7% ID 완성률과 49.8% OOD 완성률을 달성했다.