LLM 강화학습의 훈련-추론 불일치 문제, 보정된 중요도 샘플링으로 해결
원제 Rethinking Training-Inference Mismatch in LLM Reinforcement Learning: Where It Arises and How to Correct It
추천 11댓글 1
Key Point
LLM 강화학습 훈련에서 핵심적인 엔진 간 확률 불일치 문제의 근본 원인을 수학적으로 규명하고 실질적인 해결책을 제시해, 향후 LLM-RLHF 개선에 직접 적용 가능한 방법론을 제공한다.
핵심 요약
- LLM 강화학습에서 추론 엔진과 훈련 엔진이 같은 토큰에 다른 확률을 할당하는 '훈련-추론 불일치' 문제를 분석했다.
- 이 불일치를 로짓 공간의 덧셈 변위(epsilon_t)로 특성화하며, 이 분포가 토큰 신뢰도에 관계없이 대체로 불변임을 발견했다.
- 이를 바탕으로 '보정된 중요도 샘플링(Calibrated Importance Sampling, CIS)'을 제안했다.
- CIS는 토큰 신뢰도가 높을수록 더 엄격해지는 중요도 비율 상한선을 설정하고, 큰 양의 변위를 단일 상수값에서 자른다.
- 이론적으로 기존 중요도 샘플링의 무한정한 2차 모멘트를 상수로 제한하며, 자른 부분으로 인한 편향은 통제된다.
- 3개의 혼합 전문가 모델과 5개의 수학 추론 벤치마크에서 CIS가 모든 모델에서 가장 높은 5-벤치마크 평균 성능을 달성했다.
- 진단 분석 결과 CIS는 자른 중요도 샘플링보다 저신뢰도 토큰에서 더 적은 자름 편향을 보이며, 작은 중요도 가중치의 상향 자르기는 검증 정확도를 감소시킨다.