수학 모델에서 자동으로 에이전트 학습 환경 생성
원제 Verifiable Hidden Dynamics Play: Generating Agentic RL Environments from Solved Mechanisms
추천 12댓글 1
Key Point
기존 환경 생성 방식의 비일관성 문제를 해결하면서도 낮은 비용으로 대규모 다양한 학습 데이터를 자동 생성할 수 있는 새로운 파이프라인이 실제 벤치마크에서 검증되었기 때문이다.
핵심 요약
- Language model 에이전트의 장기 작업 학습을 위해 다양한 환경이 필요하지만, 기존 방식은 환경 구성 후 평가 규칙을 나중에 맞추는 문제가 있다.
- VHD-Play는 이 순서를 역전하여, 먼저 수학 모델을 샘플링하고 풀이한 뒤 그 결과를 바탕으로 stateful 도구로 변환한다.
- 실행 가능한 환경 동작과 궤적 평가 기준이 같은 풀이된 모델에서 나오므로 일관성이 보장된다.
- 파이프라인으로 3,300개의 다양한 에이전트 환경을 개당 몇 센트 비용으로 생성했다.
- Qwen3.6-35B-A3B를 세 가지 메커니즘 계열로 학습시키면 5개 계열 진단 테스트에서 평균 점수가 0.204에서 0.815로 올랐다.
- 학습한 세 계열의 미공개 사례와 여덟 개 미학습 메커니즘 계열 모두에서 성능이 올랐으며, 일반 함수 호출, 여행 계획, 365일 전자상거래 등 외부 벤치마크까지 전이되었다.
- E-Commerce 벤치마크에서 학습된 모델은 모든 실행을 파산 없이 완료하고 Qwen3.7-Max를 능가했다.
- 문제를 명시적으로 제시한 방식과 상태를 감춘 버전을 비교한 결과, 학습의 대부분의 개선는 기본 문제 해결이 아니라 stateful 상호작용에서 나왔다.
- 동결된 35B 생성기는 더 큰 환경을 만들 수 있으며, 규모가 일치하는 학습은 메커니즘 크기와 호라이즌이 증가해도 성능 향상을 유지하여 진화하는 학습 기반으로의 가능성을 보여준다.