LLM 에이전트 학습 순서를 동적으로 최적화하는 ActiveSaddler
원제 ActiveSaddler: Automated Curriculum Learning for Agent Harness Optimization
추천 27댓글 1
Key Point
하네스 최적화에 커리큘럼 학습을 도입한 새로운 접근법으로, 에이전트 성능 향상 방식을 바꿀 수 있다.
핵심 요약
- LLM 에이전트의 프롬프트·도구·제어 로직을 반복적으로 개선하는 하네스(harness) 최적화에서, 기존 방법들은 하네스 업데이트 방식만 최적화했지 학습에 쓰는 시나리오는 고정했다.
- ActiveSaddler는 하네스가 진화할수록 필요한 학습 시나리오가 달라진다는 점에 주목해, 커리큘럼 자체도 적응하도록 설계했다.
- 반복되는 실패 패턴을 재사용 가능한 '암(arm)'으로 추상화하고, 각 패턴을 더 집중하면 얼마나 진전할 수 있을지 추정한다.
- 알려진 약점 재점검과 미발견 시나리오 탐색 사이의 균형을 동적으로 조절하며, 최적화 결과는 발견된 실패 패턴과 우선순위를 지속 업데이트한다.
- GAIA2 데이터셋에서 Pass@1을 4.4 포인트, Terminal-Bench 2.0에서 7.5 포인트 향상시켰으며, 같은 하네스 최적화기를 고정된 시나리오 순서로 실행했을 때보다 개선됐다.
- 동적 최적화 타겟 구성, 변화하는 유틸리티 추정, 신규 실패 발견과 계속 최적화의 균형 조절이 이런 성과를 만드는 핵심 요소다.