로봇 기초모델, 3D 공간 이해로 조작 정확도 높이다
원제 Grounded Action Model: 3D Grounding as a Foundation for Robotics
추천 84댓글 3
Key Point
로봇 조작 작업에서 객체 위치와 기하학 정보를 명시적으로 모델링함으로써 일반화 능력을 크게 개선한 새로운 아키텍처 패러다임으로, 실제 로봇 배포의 신뢰성을 높이는 핵심 진전입니다.
핵심 요약
- 기존 로봇 기초모델은 언어-비전-행동 모델(VLA)이나 세계-행동 모델(WAM)을 기반하지만 3D 공간 정보를 직접 학습하지 않아 로봇 시연 데이터에만 의존했다.
- Grounded Action Models(GAM)은 3D 공간 정보를 명시적으로 포함한 새로운 로봇 기초모델로, 언어·포인트·박스 프롬프트 등으로 입력받은 후 공유 객체 표현으로 변환해 행동을 예측한다.
- 이 표현은 목표 대상의 시각 특징과 기하학적 정보를 담으며 로봇 상태 이력과 함께 멀티스트림 트랜스포머로 처리된다.
- RoboTwin 2.0에서 55.3% 성공률을 기록했고(기존 방식 52.0%), 깨끗한 장면 데이터만으로 학습했지만 장면 변화에서 47.6% 성공률을 달성했다(기존 30.4%).
- LIBERO-PRO 벤치마크에서 61% 성공률로 기존 방식(53%)을 능가했으며, 실제 로봇에서도 시각 변화에 강건해 YAM에서 17/20 성공(기존 4/20)을 기록했다.
- 높은 수준의 계획자와 결합시 롱호라이즌 작업에서 64.7% ID 완성률과 49.8% OOD 완성률을 달성했다.