일반 비전-언어 모델로 로봇 조작 가능하게 하는 MotorMind
원제 MotorMind: Scaffolding General Vision Language Models for Zero-Shot Robot Manipulation
추천 65댓글 1
Key Point
일반 AI 모델만으로 로봇을 제어하는 새로운 방식이 기존 전문화된 방법들을 크게 능가한 성능을 보여주므로, AI와 로봇 응용 경계에서의 구조적 전환을 의미한다.
핵심 요약
- VLA(비전-언어-액션) 모델은 로봇 조작을 발전시켰으나 새로운 작업과 환경에서 제로샷 일반화가 제한적이고, 전문 훈련에 의존하면서 범용 VLM의 빠른 발전 혜택을 받지 못했다.
- 기존 에이전트 로봇 시스템은 고수준 추론을 위해 VLM을, 제어를 위해 코딩 에이전트를 활용하지만 외부 모델과 도구에 의존해 복잡도와 비용이 증가한다.
- MotorMind는 범용 VLM이 사람 원격조작자처럼 관찰에서 직접 추론하고 액션을 지시하며 실행 피드백에 적응할 수 있게 하는 로봇 조작 프레임워크다.
- MotorMind는 VLM이 제안한 중간 수준의 액션을 결정론적 로봇 제어와 피드백에 연결하고, 비동기 모니터링과 배경 메모리 업데이트를 수행한다.
- 작업 특화 정책 훈련, 코딩 에이전트, SAM3 같은 접지(grounding) 도구 없이도 LIBERO-PRO 베이스에서 66.7%, 교란 조건에서 53.8%의 성공률을 달성했으며, 기존 제로샷 방법은 각각 최대 13.3%, 19.2%였다.
- 실제 xArm6 로봇에서 직접 조작과 인간 교란 환경 모두에서 평균 95% 성공률을 기록했다.
- 더 강한 VLM으로 백본을 교체하면 성능이 더 향상되며, 남은 실패는 주로 시각 접지, 구현화된 추론, 액션 지식 부족 때문이다.
- 결과는 적절한 중간 수준의 액션 표현과 비동기 실행 프레임워크를 갖춘 범용 VLM이 효과적인 제로샷 로봇 조작을 수행할 수 있음을 보여준다.