Hugging Face 논문AI · 머신러닝오늘의 주요

LLM 에이전트 자동 최적화, 과적합 방지 기법 제시

원제 RRSI: Regularized Recursive Self-Improvement of Agent Harnesses

추천 144댓글 1Peng Xia, Rujun Han, Zifeng Wang 외
Key Point

LLM 에이전트 자동 최적화가 실무 문제인 과적합을 해결하면서 일반화 성능을 확보한 방법론으로, 에이전트 개발의 효율성과 신뢰성을 동시에 높인다.

핵심 요약

  • LLM 에이전트의 성능을 좌우하는 프롬프트·제어 흐름·도구·메모리 등 구성 요소를 자동으로 개선하는 재귀적 자체 개선(RSI) 방식이 학습 데이터에 과적합되는 문제를 확인했다.
  • 구글 연구팀이 제안한 RRSI는 제약 조건을 도입해 과적합을 줄인다: 제안 모듈에서 편집 횟수를 시간에 따라 제한하고 미탐색 경로를 선호하며, 선택 모듈에서 벤치마크 특화 제안과 불필요한 변경을 거른다.
  • 코딩·에이전트 작업·설계 과제 8개 벤치마크에서 학습 데이터에는 최대 14.1점, 미학습 데이터에는 최대 4.7점 성능 향상을 달성했다.
  • 정규화 없는 기존 방식 대비 정책 토큰 30% 감소하면서도 더 나은 일반화 성능을 보였다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗