장시간 작업하는 AI 에이전트, GPU 효율 높이는 학습 프레임워크 공개
원제 QwenGyre: An Elastic Reinforcement Learning Framework for Training xLong-Horizon Agents
추천 21댓글 1
Key Point
수일 이상 걸리는 복잡한 작업을 수행하는 AI 에이전트의 학습을 현실적으로 가능하게 하는 기술이며, GPU 자원 활용률을 대폭 개선해 실무 배포 가능성을 높인다.
핵심 요약
- Qwen 팀이 극장시간(xlong-horizon) 작업을 수행하는 LLM 에이전트를 강화학습하기 위한 QwenGyre 프레임워크를 발표했다.
- 단일 실행이 수 시간에 걸치고 수백 번의 모델-환경 상호작용과 롤아웃당 거의 100만 토큰을 처리하는 극장시간 작업에서 온라인 강화학습을 적용할 때 두 가지 핵심 문제가 발생한다.
- 첫째, 심각한 실행 편차와 연장된 롤아웃 지연으로 인한 대규모 GPU 유휴; 둘째, 복잡한 비선형 분기로 인한 궤적 중복이 학습 효율을 낮춘다.
- QwenGyre는 라이브 실행을 중단하지 않으면서 GPU를 롤아웃과 학습 사이에 탄력적으로 재할당한다.
- 궤적 프로세서는 분기 이력을 재구성하고, 부분 진행을 점수화하며, 중복 경로를 제거하여 학습 비용을 제한한다.
- 롤아웃당 700K 토큰을 사용하는 Qwen 3.8 2.4T 모델로 확장했을 때, 48단계에 걸쳐 NL2RepoBench에서 52.5%에서 58.5%로 6.0% 절대 향상을 달성했다.
- 다양한 훈련 데이터셋 도메인 평가에서 Colocate 및 Async 대비 각각 최대 1.85배, 1.78배 속도 향상을 보였다.