Hugging Face 논문AI · 머신러닝

LLM 에이전트 학습 순서를 동적으로 최적화하는 ActiveSaddler

원제 ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization

추천 27댓글 1Sungho Park, Wonjoong Kim, Jue Zhang 외
Key Point

하네스 최적화에 커리큘럼 학습을 도입한 새로운 접근법으로, 에이전트 성능 향상 방식을 바꿀 수 있다.

핵심 요약

  • LLM 에이전트의 프롬프트·도구·제어 로직을 반복적으로 개선하는 하네스(harness) 최적화에서, 기존 방법들은 하네스 업데이트 방식만 최적화했지 학습에 쓰는 시나리오는 고정했다.
  • ActiveSaddler는 하네스가 진화할수록 필요한 학습 시나리오가 달라진다는 점에 주목해, 커리큘럼 자체도 적응하도록 설계했다.
  • 반복되는 실패 패턴을 재사용 가능한 '암(arm)'으로 추상화하고, 각 패턴을 더 집중하면 얼마나 진전할 수 있을지 추정한다.
  • 알려진 약점 재점검과 미발견 시나리오 탐색 사이의 균형을 동적으로 조절하며, 최적화 결과는 발견된 실패 패턴과 우선순위를 지속 업데이트한다.
  • GAIA2 데이터셋에서 Pass@1을 4.4 포인트, Terminal-Bench 2.0에서 7.5 포인트 향상시켰으며, 같은 하네스 최적화기를 고정된 시나리오 순서로 실행했을 때보다 개선됐다.
  • 동적 최적화 타겟 구성, 변화하는 유틸리티 추정, 신규 실패 발견과 계속 최적화의 균형 조절이 이런 성과를 만드는 핵심 요소다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗