Hugging Face 논문AI · 머신러닝

로봇 기초모델, 3D 공간 이해로 조작 정확도 높이다

원제 Grounded Action Model: 3D Grounding as a Foundation for Robotics

추천 84댓글 3Gehao Zhang, Weikai Huang, Shailesh Shailesh 외
Key Point

로봇 조작 작업에서 객체 위치와 기하학 정보를 명시적으로 모델링함으로써 일반화 능력을 크게 개선한 새로운 아키텍처 패러다임으로, 실제 로봇 배포의 신뢰성을 높이는 핵심 진전입니다.

핵심 요약

  • 기존 로봇 기초모델은 언어-비전-행동 모델(VLA)이나 세계-행동 모델(WAM)을 기반하지만 3D 공간 정보를 직접 학습하지 않아 로봇 시연 데이터에만 의존했다.
  • Grounded Action Models(GAM)은 3D 공간 정보를 명시적으로 포함한 새로운 로봇 기초모델로, 언어·포인트·박스 프롬프트 등으로 입력받은 후 공유 객체 표현으로 변환해 행동을 예측한다.
  • 이 표현은 목표 대상의 시각 특징과 기하학적 정보를 담으며 로봇 상태 이력과 함께 멀티스트림 트랜스포머로 처리된다.
  • RoboTwin 2.0에서 55.3% 성공률을 기록했고(기존 방식 52.0%), 깨끗한 장면 데이터만으로 학습했지만 장면 변화에서 47.6% 성공률을 달성했다(기존 30.4%).
  • LIBERO-PRO 벤치마크에서 61% 성공률로 기존 방식(53%)을 능가했으며, 실제 로봇에서도 시각 변화에 강건해 YAM에서 17/20 성공(기존 4/20)을 기록했다.
  • 높은 수준의 계획자와 결합시 롱호라이즌 작업에서 64.7% ID 완성률과 49.8% OOD 완성률을 달성했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗