LLM 에이전트의 자기 개선 능력 강화하는 AREX-2 발표
Key Point
기존 LLM 에이전트는 일회성 답변을 생성하는 데 그쳤다면, 반사적 사고를 통해 반복적으로 해결책을 개선할 수 있는 에이전트 설계 방식이 제시되어 자율 문제 해결 능력의 한계를 넘는 가능성을 보여준다.
핵심 요약
- LLM 에이전트가 테스트 단계에서 해를 반복적으로 개선하는 자기 개선 능력을 갖추도록 하는 AREX-2를 제시한다.
- 이 능력은 현재 해보다 나은 해를 만드는 반사적 사고(reflection)와 여러 라운드에서 효과를 유지하는 장기 실행(long-horizon execution) 두 가지를 결합한다.
- 두 능력이 모두 도메인 무관하다고 가정하여, 검증 가능한 피드백을 주는 기계학습과 알고리즘 프로그래밍 작업에서 데이터를 합성해 학습시킨다.