Hugging Face 논문AI · 머신러닝

수학 추론 모델, 동료 모델과 궤적 교환으로 성능 향상

원제 Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR

추천 24댓글 1Doohyuk Jang, Yoonsik Park, Gyouk Chu 외
Key Point

이질적 모델들 사이의 상호 보완성을 활용해 동일 예산으로 수학 추론 성능을 크게 향상시키는 새로운 강화학습 방식을 제시하고 있으며, 실제 벤치마크에서 GRPO 대비 일관된 성능 개선을 입증했다.

핵심 요약

  • RLVR(검증 가능한 보상 강화학습) 방식인 GRPO는 자가생성 궤적에 의존하지만 제한된 롤아웃 예산으로 인해 모두 실패한 그룹이 발생해 정책 기울기 신호를 얻지 못하는 문제가 있다.
  • 연구진은 서로 다른 모델들이 상호 보완적인 문제들에서 성공하는 패턴을 발견했으며, 이를 통해 강한 교사 모델 없이도 상호 학습이 가능함을 확인했다.
  • 이를 바탕으로 GRAFT(Gated Replacement of Answer-Failed groups with peer Trajectories)를 제안했으며, 이는 모두 실패한 그룹을 정보량 많은 동료 그룹으로 교체하는 오프정책 인식 프레임워크다.
  • GRAFT는 성공·실패한 동료 응답을 모두 전달하면서 시퀀스 수준 호환성 가중치와 토큰 수준 중요도 비율 클리핑을 통해 모델 간 불일치를 제어한다.
  • 3개 이질적 모델 쌍과 5개 수학 추론 벤치마크에서 GRAFT는 동일한 롤아웃 예산 조건에서 GRPO를 일관되게 능가했으며, 평균 2.1점 개선, 최대 4.5점 모델별 평균 성능 향상을 달성했다.
  • 저장된 동료 궤적만 사용해도 동시 공동학습 없이 GRPO보다 평균 1.8점 개선되어 궤적 재사용의 실용성을 보여준다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗