로봇 손가락 제어 보상 함수를 테스트 중에 진화시켜 새 작업 수행
원제 InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation
추천 37댓글 1
Key Point
재학습 없이 이미 학습된 로봇의 역량을 새로운 작업에 활용하는 방법을 구체적으로 제시해, 실제 로봇 개발에서 배포 후 신속한 작업 확장이 가능해진다.
핵심 요약
- 휴머노이드 로봇이 학습 과정 없이 테스트 시점에 새로운 작업을 수행하도록 하는 InterEvolve 기법을 제시했다.
- 핵심은 광범위하게 학습된 컨트롤러가 새 작업에 필요한 역량을 이미 대부분 갖고 있으며, 계획과 제어 사이의 적절한 인터페이스로 그 역량을 접근 가능하게 만드는 것이다.
- 객체 인식 순전파-역전파 행동 기초 모델(object-aware FB behavioral foundation model)을 개발해 동결된 신체 모델 위에서 객체 잔차를 통해 새로운 보상을 조작 행동으로 변환한다.
- 작업을 보상 프로그램(reward program)으로 정의하는데, 이는 단계별 보상과 완료 조건, 조정 가능한 상수를 포함한다.
- LLM 에이전트가 실행 피드백과 검증된 프로그램 스킬 라이브러리를 토대로 프로그램 구조를 반복적으로 수정하고, 수치 최적화 알고리즘이 상수를 조정한다.
- 각 후보 프로그램은 병렬 시뮬레이션 환경에서 검증되며 반복마다 컨트롤러의 기존 운동 역량을 새로운 방식으로 유도, 재활용, 조합하면서 성능을 개선한다.
- 실험 결과 수동으로 설계한 보상 함수는 기초 모델의 조작 역량 중 많은 부분을 미활용했으나, InterEvolve가 진화시킨 프로그램은 때로 새로운 전략을 통해 그 역량을 해제한다.
- 다양한 작업, 복잡한 장면, 길이가 긴 작업 조합을 시뮬레이션에서 생성하며, 진화된 기술은 Unitree G1 실제 로봇에서 자율적으로 구현되고 자기중심 탑재 카메라에서 인지하는 정보로 작동한다.