수학 추론 모델, 동료 모델과 궤적 교환으로 성능 향상
원제 Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR
추천 24댓글 1
Key Point
이질적 모델들 사이의 상호 보완성을 활용해 동일 예산으로 수학 추론 성능을 크게 향상시키는 새로운 강화학습 방식을 제시하고 있으며, 실제 벤치마크에서 GRPO 대비 일관된 성능 개선을 입증했다.
핵심 요약
- RLVR(검증 가능한 보상 강화학습) 방식인 GRPO는 자가생성 궤적에 의존하지만 제한된 롤아웃 예산으로 인해 모두 실패한 그룹이 발생해 정책 기울기 신호를 얻지 못하는 문제가 있다.
- 연구진은 서로 다른 모델들이 상호 보완적인 문제들에서 성공하는 패턴을 발견했으며, 이를 통해 강한 교사 모델 없이도 상호 학습이 가능함을 확인했다.
- 이를 바탕으로 GRAFT(Gated Replacement of Answer-Failed groups with peer Trajectories)를 제안했으며, 이는 모두 실패한 그룹을 정보량 많은 동료 그룹으로 교체하는 오프정책 인식 프레임워크다.
- GRAFT는 성공·실패한 동료 응답을 모두 전달하면서 시퀀스 수준 호환성 가중치와 토큰 수준 중요도 비율 클리핑을 통해 모델 간 불일치를 제어한다.
- 3개 이질적 모델 쌍과 5개 수학 추론 벤치마크에서 GRAFT는 동일한 롤아웃 예산 조건에서 GRPO를 일관되게 능가했으며, 평균 2.1점 개선, 최대 4.5점 모델별 평균 성능 향상을 달성했다.
- 저장된 동료 궤적만 사용해도 동시 공동학습 없이 GRPO보다 평균 1.8점 개선되어 궤적 재사용의 실용성을 보여준다.