AI 연구 에이전트가 자신의 코드를 개선하는 자동 루프 구현
원제 Recursive self-improvement of AI research agents
추천 15댓글 1
Key Point
R&D 투자의 수익이 감소하는 추세를 극복할 수 있는 자동화 방식이 실제로 작동하는지 보여주는 첫 사례이며, 인간이 고안한 시스템과 경쟁하는 수준의 성과를 거두기 때문이다.
핵심 요약
- AIDE²라는 시스템이 AI 연구 에이전트가 자신의 코드를 개선하는 재귀적 자기개선 루프를 구현했다.
- 8일간의 자동 실행 중 새로운 검색 정책과 메모리 관리 메커니즘 등 7개의 연속 개선을 발견했다.
- 발견된 개선 사항은 머신러닝 엔지니어링, 휴리스틱 알고리즘, 날씨 예측 등 학습하지 않은 4개의 벤치마크에서도 효과를 나타냈다.
- 개선된 에이전트는 인간이 설계한 프로덕션 연구 에이전트 수준이상의 성능을 달성했으며, 보상 해킹 발생률도 55%에서 32%로 감소했다.
- 결과적으로 AI 연구 에이전트가 자기개선을 통해 연구 효율을 높일 수 있으며, 그 성과가 미지의 분야로 일반화됨을 보여준다.