LLM 에이전트의 자기 개선 능력 강화하는 AREX-2 발표
원제 AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks
추천 121댓글 3
Key Point
기존 LLM 에이전트는 일회성 답변을 생성하는 데 그쳤다면, 반사적 사고를 통해 반복적으로 해결책을 개선할 수 있는 에이전트 설계 방식이 제시되어 자율 문제 해결 능력의 한계를 넘는 가능성을 보여준다.
핵심 요약
- LLM 에이전트가 테스트 단계에서 해를 반복적으로 개선하는 자기 개선 능력을 갖추도록 하는 AREX-2를 제시한다.
- 이 능력은 현재 해보다 나은 해를 만드는 반사적 사고(reflection)와 여러 라운드에서 효과를 유지하는 장기 실행(long-horizon execution) 두 가지를 결합한다.
- 두 능력이 모두 도메인 무관하다고 가정하여, 검증 가능한 피드백을 주는 기계학습과 알고리즘 프로그래밍 작업에서 데이터를 합성해 학습시킨다.
- Qwen 3.8-27B 모델 기반 에이전트가 MLE-bench Lite에서 81.8, Frontier-CS에서 70.7의 성능을 얻었다.
- BrowseComp(84.0), HLE(52.6), GAIA(92.2), DeepSearchQA(93.8)를 포함한 다양한 심화 연구 벤치마크로 전이 학습되었다.
- 라운드 예산이 증가하면서 계속 성능이 향상되어, 장기 반사적 데이터가 자기 개선 에이전트 개발에 효과적임을 보여준다.