과거 정보 기억하는 로봇 제어 모델 'MemBodied' 제안
원제 MemBodied: Recurrent Associative Memory for Vision-Language-Action Models
추천 11댓글 2
Key Point
과거 관찰 정보가 필요한 로봇 제어 작업에서 컨텍스트 확장의 비효율성을 해결하면서 매개변수 효율성까지 확보한 새로운 메모리 메커니즘이다.
핵심 요약
- 비전-언어-행동 모델은 현재 관찰만으로 로봇 제어를 하는데, 과거 정보가 필요한 조작 작업에서 한계를 보인다.
- 과거 관찰을 컨텍스트에 포함하면 해결되지만 컨텍스트 크기 증가와 추론 지연이라는 문제가 발생한다.
- MemBodied는 고정 크기의 기억 구조로, 상호작용을 기록하는 연관 상태(associative state)와 초기 장면을 보존하는 에피소드 앵커(episode anchor) 두 개 요소로 구성된다.
- 정책 호출 시 현재 입력과 메모리 성분을 함께 조건으로 하여 행동을 생성한다.
- RMBench 메모리 요구 작업 5개에서 상태 없는 정책 대비 7.81배, 기본 순환 메모리 대비 2.98배 성공률 개선을 달성했다.
- 가장 강한 메모리 증강 기준 모델보다 1.3배 높은 성공률을 보이면서도 매개변수는 10배 적다.
- 완전 관찰 가능한 LIBERO-Long 테스트에서 90.6% 성공률로 상태 없는 기준 모델 대비 5.4% 향상되었다.
- MemBodied는 메모리가 필요한 조작 작업에서 정책 컨텍스트를 단순히 확장하는 대신 실용적 대안이 될 수 있음을 보여준다.