다중 보상 RL에서 희소 신호까지 균등하게 학습시키는 방법
원제 Make Sparse Rewards Count: Density-Aware Reward Aggregation for Multi-Reward RL
추천 43댓글 2
Key Point
다중 보상 학습에서 일부 목표만 우선 학습되는 문제를 밀도 기반의 수학적 분석으로 해결하고, 훈련 효율을 크게 개선한 방법론이다.
핵심 요약
- 다중 보상 강화학습은 LLM이 여러 행동 목표를 동시에 만족하도록 훈련하는데, GDPO의 보상별 정규화 방식도 목표마다 학습 진도가 불균형하다는 문제가 있다.
- 연구팀은 '장점 에너지(advantage energy)'—배치 내 보상의 제곱된 장점의 합—를 분석하여, 이 에너지가 '활동 밀도'(보상이 0이 아닌 상대적 장점을 제공하는 롤아웃 그룹의 비율)에 비례함을 증명했다.
- 이는 배치 단위의 신호 불균형을 드러내고, 보상 기여도 보정의 근거를 제공한다.
- 이 관계를 바탕으로 Density-Aware Reward Aggregation(DARA)을 제안했으며, 역제곱근 밀도 보정으로 덜 자주 활동하는 보상의 신호에 더 큰 가중치를 부여한다.
- DARA는 각 롤아웃 배치에서 가중치를 계산하여 훈련 과정 중 보상 활동의 변화에 적응하며, 기저 정책 최적화 목표를 수정하지 않는다.
- 도구 호출과 수학 추론 실험에서 DARA는 GDPO보다 목표 행동을 빠르게 학습했고, 도구 호출에서는 형식 준수를 26% 적은 훈련 단계로 달성했으며, 수학 추론에서는 길이 준수를 65% 적은 단계로 거의 포화에 도달했다.
- 최종 성능은 경쟁력 있는 수준이며, 코드는 GitHub에 공개되어 있다.