Hugging Face 논문AI · 머신러닝

코드 에이전트 강화학습에서 품질 기반 보상 재분배하는 GAGAR 제안

원제 Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL

추천 112댓글 2Jinhao Dong, Liang Zhao, Zihao Yue 외
Key Point

테스트 통과 여부만 판단하던 기존 강화학습에서 구현 품질 차이를 감지하는 에이전트를 추가하면 코드 생성 모델의 학습 신호가 더 정교해진다.

핵심 요약

  • 기존 코드 에이전트 강화학습은 실행 가능한 테스트로 이진 보상을 제공하는데, Group Relative Policy Optimization(GRPO)은 테스트를 통과한 모든 궤적에 동일한 이득을 할당하여 구현 품질의 차이를 무시하는 문제가 있다.
  • 이를 보완하기 위해 GAGAR 프레임워크를 제안하는데, 통과 및 실패 궤적을 모두 포함하는 그룹만 선별하여 동적 샘플링한다.
  • 각 그룹의 모든 궤적을 공유 작업공간에 놓고, SFT 학습된 에이전트 평가자가 이들을 함께 검사하여 테스트 통과 후보들을 순위 매긴다.
  • 낮은 순위 궤적의 가중치를 낮추고, 모든 통과 궤적의 이득을 비례적으로 재조정하여 원래 합계를 유지하면서 고품질 구현으로 신용을 이동시킨다.
  • MiMo-V2.6-Flash(310B 파라미터)와 MiMo-V2.6-Pro(1.02T 파라미터)의 사전 RL SFT 체크포인트로 산업 규모에서 평가했다.
  • 코드 전용 Flash 실험에서 에이전트 성능 개선, 궤적 길이 증가 감소, 훈련 안정성 향상을 확인했고, Flash와 Pro 양쪽 모두에서 대규모 혼합 작업 RL을 적용했다.
  • 테스트 기반 검증과 그룹 단위 에이전트 평가를 결합하면 코드 에이전트 RL의 품질과 안정성을 개선할 수 있다는 결과를 도출했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗