Hugging Face 논문AI · 머신러닝

LLM 에이전트의 자기 개선 능력 강화하는 AREX-2 발표

원제 AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks

추천 121댓글 3Hongjin Qian, Chaofan Li, Kun Luo 외
Key Point

기존 LLM 에이전트는 일회성 답변을 생성하는 데 그쳤다면, 반사적 사고를 통해 반복적으로 해결책을 개선할 수 있는 에이전트 설계 방식이 제시되어 자율 문제 해결 능력의 한계를 넘는 가능성을 보여준다.

핵심 요약

  • LLM 에이전트가 테스트 단계에서 해를 반복적으로 개선하는 자기 개선 능력을 갖추도록 하는 AREX-2를 제시한다.
  • 이 능력은 현재 해보다 나은 해를 만드는 반사적 사고(reflection)와 여러 라운드에서 효과를 유지하는 장기 실행(long-horizon execution) 두 가지를 결합한다.
  • 두 능력이 모두 도메인 무관하다고 가정하여, 검증 가능한 피드백을 주는 기계학습과 알고리즘 프로그래밍 작업에서 데이터를 합성해 학습시킨다.
  • Qwen 3.8-27B 모델 기반 에이전트가 MLE-bench Lite에서 81.8, Frontier-CS에서 70.7의 성능을 얻었다.
  • BrowseComp(84.0), HLE(52.6), GAIA(92.2), DeepSearchQA(93.8)를 포함한 다양한 심화 연구 벤치마크로 전이 학습되었다.
  • 라운드 예산이 증가하면서 계속 성능이 향상되어, 장기 반사적 데이터가 자기 개선 에이전트 개발에 효과적임을 보여준다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗