001▲ 112 · 댓글 2코드 에이전트 강화학습에서 품질 기반 보상 재분배하는 GAGAR 제안기존 코드 에이전트 강화학습은 실행 가능한 테스트로 이진 보상을 제공하는데, Group Relative Policy Optimization(GRPO)은 테스트를 통과한 모든 궤적에 동일한 이득을 할당하여 구현 품질의 차이를 무시하는 문제가 있다.
AI · 머신러닝 · Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL
코드 에이전트 강화학습에서 품질 기반 보상 재분배하는 GAGAR 제안
Key Point
테스트 통과 여부만 판단하던 기존 강화학습에서 구현 품질 차이를 감지하는 에이전트를 추가하면 코드 생성 모델의 학습 신호가 더 정교해진다.
핵심 요약
기존 코드 에이전트 강화학습은 실행 가능한 테스트로 이진 보상을 제공하는데, Group Relative Policy Optimization(GRPO)은 테스트를 통과한 모든 궤적에 동일한 이득을 할당하여 구현 품질의 차이를 무시하는 문제가 있다.
이를 보완하기 위해 GAGAR 프레임워크를 제안하는데, 통과 및 실패 궤적을 모두 포함하는 그룹만 선별하여 동적 샘플링한다.
각 그룹의 모든 궤적을 공유 작업공간에 놓고, SFT 학습된 에이전트 평가자가 이들을 함께 검사하여 테스트 통과 후보들을 순위 매긴다.