FP8 양자화 RL 훈련 불안정성 해결
원제 Towards Full Pipeline FP8 Reinforcement Learning for LLMs
추천 12댓글 2
Key Point
LLM 강화학습을 저정밀도(FP8)로 가속하려는 산업계 노력에서 간과된 불안정성의 근본 원인을 규명하고, 실제 해결 방안을 제시하는 점이 중요하다.
핵심 요약
- LLM 강화학습(RL)에서 FP8 양자화를 적용할 때 훈련 중 엔트로피 급증과 손상된 출력이 발생하는 불안정성이 나타난다.
- 원인은 누적된 FP8 양자화 노이즈가 중요도 비율을 왜곡하여 음수 보상 토큰이 신뢰 영역 밖으로 밀려나고 기울기가 잘못 0으로 설정되기 때문이다.
- 이로 인해 잘못된 출력이 제대로 처벌받지 않고 훈련 과정에서 누적된다.
- Calibrated Clipping이라는 동적 방법으로 FP8 클리핑 경계를 BF16 분포에 정렬하여 하한 클리핑 분위수를 맞추고 상한을 재조정한다.
- GRPO, DAPO 알고리즘과 8B~32B 모델 규모에서 엔트로피 급증을 제거하고 BF16 수준의 성능을 복원했다.