추론 단계 다양성이 RL 학습을 앞당긴다
Key Point
RL 기반 추론 모델 개발에서 어떤 학습 데이터를 쓸지가 최종 성능을 크게 좌우하는데, 경로 다양성이라는 단순하지만 효과적인 선별 기준이 기존 방식을 일관되게 이기고 있습니다.
핵심 요약
- 검증된 풀이가 모두 같은 가치는 아니라는 점에서 출발하여, 감독 학습(SFT) 데이터에서 추론 경로의 다양성이 중요함을 발견했다.
- 추론 경로 다양성(route diversity)은 풀이 과정의 단계 수열이 얼마나 다양한지를 측정하는 지표로, 경량의 규칙 기반 지문(fingerprint)을 통해 선별할 수 있다.
- 같은 예산과 훈련 설정에서 유사한 경로보다 다양한 경로를 선택했을 때, SFT 이후 강화학습(RL)의 문제 해결률이 퍼즐과 수학 문제에서 모두 향상되었다.