LLM 에이전트 자동 최적화, 과적합 방지 기법 제시
원제 RRSI: Regularized Recursive Self-Improvement of Agent Harnesses
추천 144댓글 1
Key Point
LLM 에이전트 자동 최적화가 실무 문제인 과적합을 해결하면서 일반화 성능을 확보한 방법론으로, 에이전트 개발의 효율성과 신뢰성을 동시에 높인다.
핵심 요약
- LLM 에이전트의 성능을 좌우하는 프롬프트·제어 흐름·도구·메모리 등 구성 요소를 자동으로 개선하는 재귀적 자체 개선(RSI) 방식이 학습 데이터에 과적합되는 문제를 확인했다.
- 구글 연구팀이 제안한 RRSI는 제약 조건을 도입해 과적합을 줄인다: 제안 모듈에서 편집 횟수를 시간에 따라 제한하고 미탐색 경로를 선호하며, 선택 모듈에서 벤치마크 특화 제안과 불필요한 변경을 거른다.
- 코딩·에이전트 작업·설계 과제 8개 벤치마크에서 학습 데이터에는 최대 14.1점, 미학습 데이터에는 최대 4.7점 성능 향상을 달성했다.
- 정규화 없는 기존 방식 대비 정책 토큰 30% 감소하면서도 더 나은 일반화 성능을 보였다.