AI 에이전트 제어 로직 자동 최적화, MILO 프레임워크
원제 MILO: Automated Harness Discovery via Orchestrated Multi-Agent Evolution
추천 15댓글 1
Key Point
AI 에이전트의 프롬프트나 도구를 수작업으로 최적화하는 시대가 끝나고, 전체 제어 로직을 자동으로 발견·진화시키는 방법이 등장했으며, 기존 방법들보다 현저히 높은 성능 향상을 입증했다.
핵심 요약
- AI 에이전트의 성능은 모델뿐만 아니라 실행을 제어하는 하니스 설계에 크게 좌우되는데, 이를 수작업으로 탐색하는 것이 비효율적이다.
- MILO는 에이전트 하니스와 그 발견 방법을 동시에 진화시키는 자동화 프레임워크로, 계층적 계보 메모리, 각 탐색 영역별 뮤테이터 에이전트, 그리고 검색 전략을 적응시키는 오케스트레이터로 구성된다.
- 버려진 변이를 부정 증거로 활용하는 계보 메모리, 전역 탐색 이력과 부모 피드백을 바탕으로 완전한 하니스를 재작성하는 뮤테이터 에이전트, 계보 이식과 종분화를 통해 검색을 적응시키는 오케스트레이터의 세 가지 메커니즘이 핵심이다.
- Terminal-Bench 2.1, PaperBench, DeepSWE 벤치마크에서 MILO는 기존 최고 성능 하니스 8개, 탐색 방법 6개를 초과한 하니스를 생성했다.
- Opus 4.8 모델 기준으로 Terminal-Bench 2.1에서 초기 하니스 대비 +12.0%, PaperBench에서 +28.3%, DeepSWE에서 +10.3% 성능 향상을 달성했으며, 기존 최고 탐색 기법의 +4.5%, +18.3%, 0%보다 우수하다.
- Terminal-Bench 2.1에서 86.1±2.0%의 정확도를 기록해 공식 리더보드 최고 기록(83.8±2.3%)을 능가하면서도 초기 하니스 대비 토큰 사용량을 26% 감소시켰다.
- EinsteinArena 미해결 문제에서 에르되시 최소 겹침 상한을 0.3808586에서 0.3808568로, 자기상관 부등식을 1.50274365에서 1.50274360, 1.45081에서 1.44889로 개선했다.