비전-언어모델의 지능을 로봇 제어로 옮기다
원제 Transferring the Intelligence of VLMs to Robotic Control
추천 93댓글 1
Key Point
로봇 제어에 사전학습된 대규모 언어-시각 모델을 직접 활용하는 방식이 과제별 학습 없이도 작동하며, 현실 로봇까지 확대되는 경로를 제시해 로봇공학의 실용화 가능성을 높인다.
핵심 요약
- VLM을 로봇 제어에 활용하는 RoboDawn 인터페이스를 제시했다. 로봇이 자신의 시각 상태를 관찰하고 다음 행동을 추론하며 이를 실행하고 결과에 따라 의사결정을 적응시키는 폐루프 방식으로 동작한다.
- 소수의 데모로 VLM을 인터페이스 사용법과 작업 전략에 적응시키는 인-컨텍스트 러닝 기법을 도입했다.
- 작업별 로봇 학습 없이도 강한 성능을 달성하며, 제로샷 설정에서 기존 정책보다 우수하다.
- RoboTwin 2.0 C2R 벤치마크에서 제로샷 53.2%에서 원샷 73.6%로 성공률이 상승하고, RoboDojo에서도 35.67%에서 47.17%로 향상된다.
- 동일한 프레임워크가 실제 로봇으로도 옮겨져 Franka 로봇에서 블록 정렬 및 쌓기 작업을 수행한다.