Hugging Face 논문AI · 머신러닝오늘의 주요

로봇 손가락 제어 보상 함수를 테스트 중에 진화시켜 새 작업 수행

원제 InterEvolve: Test-Time Evolution of Reward Programs for Humanoid Loco-Manipulation

추천 37댓글 1Zhuo Lin, Sirui Xu, Liuyu Bian 외
Key Point

재학습 없이 이미 학습된 로봇의 역량을 새로운 작업에 활용하는 방법을 구체적으로 제시해, 실제 로봇 개발에서 배포 후 신속한 작업 확장이 가능해진다.

핵심 요약

  • 휴머노이드 로봇이 학습 과정 없이 테스트 시점에 새로운 작업을 수행하도록 하는 InterEvolve 기법을 제시했다.
  • 핵심은 광범위하게 학습된 컨트롤러가 새 작업에 필요한 역량을 이미 대부분 갖고 있으며, 계획과 제어 사이의 적절한 인터페이스로 그 역량을 접근 가능하게 만드는 것이다.
  • 객체 인식 순전파-역전파 행동 기초 모델(object-aware FB behavioral foundation model)을 개발해 동결된 신체 모델 위에서 객체 잔차를 통해 새로운 보상을 조작 행동으로 변환한다.
  • 작업을 보상 프로그램(reward program)으로 정의하는데, 이는 단계별 보상과 완료 조건, 조정 가능한 상수를 포함한다.
  • LLM 에이전트가 실행 피드백과 검증된 프로그램 스킬 라이브러리를 토대로 프로그램 구조를 반복적으로 수정하고, 수치 최적화 알고리즘이 상수를 조정한다.
  • 각 후보 프로그램은 병렬 시뮬레이션 환경에서 검증되며 반복마다 컨트롤러의 기존 운동 역량을 새로운 방식으로 유도, 재활용, 조합하면서 성능을 개선한다.
  • 실험 결과 수동으로 설계한 보상 함수는 기초 모델의 조작 역량 중 많은 부분을 미활용했으나, InterEvolve가 진화시킨 프로그램은 때로 새로운 전략을 통해 그 역량을 해제한다.
  • 다양한 작업, 복잡한 장면, 길이가 긴 작업 조합을 시뮬레이션에서 생성하며, 진화된 기술은 Unitree G1 실제 로봇에서 자율적으로 구현되고 자기중심 탑재 카메라에서 인지하는 정보로 작동한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗