Hugging Face 논문AI · 머신러닝오늘의 주요

일반 비전-언어 모델로 로봇 조작 가능하게 하는 MotorMind

원제 MotorMind: Scaffolding General Vision Language Models for Zero-Shot Robot Manipulation

추천 65댓글 1Bingxuan Li, Siqi Song, Yizhuo Wu 외
Key Point

일반 AI 모델만으로 로봇을 제어하는 새로운 방식이 기존 전문화된 방법들을 크게 능가한 성능을 보여주므로, AI와 로봇 응용 경계에서의 구조적 전환을 의미한다.

핵심 요약

  • VLA(비전-언어-액션) 모델은 로봇 조작을 발전시켰으나 새로운 작업과 환경에서 제로샷 일반화가 제한적이고, 전문 훈련에 의존하면서 범용 VLM의 빠른 발전 혜택을 받지 못했다.
  • 기존 에이전트 로봇 시스템은 고수준 추론을 위해 VLM을, 제어를 위해 코딩 에이전트를 활용하지만 외부 모델과 도구에 의존해 복잡도와 비용이 증가한다.
  • MotorMind는 범용 VLM이 사람 원격조작자처럼 관찰에서 직접 추론하고 액션을 지시하며 실행 피드백에 적응할 수 있게 하는 로봇 조작 프레임워크다.
  • MotorMind는 VLM이 제안한 중간 수준의 액션을 결정론적 로봇 제어와 피드백에 연결하고, 비동기 모니터링과 배경 메모리 업데이트를 수행한다.
  • 작업 특화 정책 훈련, 코딩 에이전트, SAM3 같은 접지(grounding) 도구 없이도 LIBERO-PRO 베이스에서 66.7%, 교란 조건에서 53.8%의 성공률을 달성했으며, 기존 제로샷 방법은 각각 최대 13.3%, 19.2%였다.
  • 실제 xArm6 로봇에서 직접 조작과 인간 교란 환경 모두에서 평균 95% 성공률을 기록했다.
  • 더 강한 VLM으로 백본을 교체하면 성능이 더 향상되며, 남은 실패는 주로 시각 접지, 구현화된 추론, 액션 지식 부족 때문이다.
  • 결과는 적절한 중간 수준의 액션 표현과 비동기 실행 프레임워크를 갖춘 범용 VLM이 효과적인 제로샷 로봇 조작을 수행할 수 있음을 보여준다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗