로봇 제어에서 토큰 65% 줄이고 성공률 14% 높인 GPT-6 에이전트
원제 Fewer Tokens, Better Action: GPT-6 Astra Robot Agents with 14% Higher Success Rate but 65% Fewer Tokens
추천 27댓글 2
Key Point
로봇 제어 작업에서 LLM 토큰 소비를 대폭 줄이면서 오히려 성공률을 높이는 기법이 나왔으므로, 실시간 로봇 시스템이나 토큰 비용에 민감한 에이전트 설계에 참고할 가치가 있다.
핵심 요약
- 로봇 제어 작업에서 VLM 에이전트가 매번 모델을 호출할 때마다 토큰이 과다하게 소비되는 문제를 해결하기 위해 PyRUA-Lean이라는 상호작용형 코드 실행 프레임워크를 제안했다.
- 이 프레임워크는 피드백 기반 로봇 원시 동작(primitive)과 학습된 시각-언어-행동(VLA) 정책을 Python 셀로 조합해 조건부 검사와 로컬 재시도를 수행하며, 명시적으로 요청한 이미지와 상태 피드백만 반환한다.
- LIBERO-PRO, RoboTwin 2.0, RoboCasa365의 700개 시뮬레이션 작업에서 동일한 GPT-6 Astra 플래너와 로봇 원시 동작을 사용하는 기존 도구 호출 방식과 비교했다.
- 동일한 LLM 호출 예산 조건에서 PyRUA-Lean은 전체 성공률을 63.1%에서 71.7%로 증가시켰다.
- 두 에이전트 모두 해결한 작업에서는 LLM 호출을 49% 줄이고 입력 토큰을 65% 감소시켰다.