AI 에이전트가 스스로 탐색 전략을 개선하는 'Dream-RSI' 프레임워크 제안

Key Point
AI 에이전트가 복잡한 문제를 풀 때 탐색 정책을 동적으로 학습·개선하는 새로운 방식을 제시해, 기존의 고정 전략 또는 비싼 온라인 재학습의 한계를 극복한다.
핵심 요약
- 자율 AI 에이전트의 재귀적 자기개선을 위해 탐색 전략을 명시적으로 프로그래밍할 수 있는 경량 오케스트레이션 레이어를 도입했다.
- 과거 발견 이력을 시뮬레이터로 재구성해 리플레이 환경에서 저비용 오프폴리시 피드백을 얻음으로써, 비싼 온라인 평가를 반복할 필요를 줄였다.
- 개선된 탐색 정책을 온라인으로 재배포해 새로운 발견을 추진하고 시뮬레이터 풀을 확장하는 자기개선 루프를 구성했다.
- 알고리즘 엔지니어링, 수학 최적화, GPU 커널 엔지니어링 등 여러 분야에서 발견 품질을 유지하면서 탐색 비용을 대폭 감축했다.