다중 보상 학습 최적화하는 CorrGRPO 알고리즘
Key Point
여러 목표를 동시에 최적화해야 하는 언어 모델 학습에서 각 보상의 영향력을 균형 있게 조절하는 새로운 방법을 제시하므로, 추론 모델과 에이전트 개발자에게 실질적인 개선 기회를 제공한다.
핵심 요약
- Group Relative Policy Optimization(GRPO)은 추론 언어 모델 학습에 널리 쓰이며, 동일 프롬프트 롤아웃에서 보상을 중심화·정규화해 이점을 계산한다.
- 다중 보상 처리 시 기존 GRPO는 보상 성분을 합산한 뒤 그룹 내 표준편차로 정규화하는데, 분산이 모든 보상 공분산의 합이 된다.
- 중심화된 보상이 고정될 때 공분산이 클수록 이점이 작아지므로, 보상 간 상관성에 따라 업데이트 크기가 적응하지만 대규모 보상이 정규화를 지배해 소규모 보상 신호를 억제한다.