추론 단계 다양성이 RL 학습을 앞당긴다
원제 Selecting Diverse SFT Traces Improves Post-RL Generalization
추천 25댓글 1
Key Point
RL 기반 추론 모델 개발에서 어떤 학습 데이터를 쓸지가 최종 성능을 크게 좌우하는데, 경로 다양성이라는 단순하지만 효과적인 선별 기준이 기존 방식을 일관되게 이기고 있습니다.
핵심 요약
- 검증된 풀이가 모두 같은 가치는 아니라는 점에서 출발하여, 감독 학습(SFT) 데이터에서 추론 경로의 다양성이 중요함을 발견했다.
- 추론 경로 다양성(route diversity)은 풀이 과정의 단계 수열이 얼마나 다양한지를 측정하는 지표로, 경량의 규칙 기반 지문(fingerprint)을 통해 선별할 수 있다.
- 같은 예산과 훈련 설정에서 유사한 경로보다 다양한 경로를 선택했을 때, SFT 이후 강화학습(RL)의 문제 해결률이 퍼즐과 수학 문제에서 모두 향상되었다.
- 특히 합성 실험에서 OLMo3-7B 모델이 다양한 경로 SFT를 받으면 환경에서 미학습 문제들의 pass@8이 16.9포인트 증가했고, 단일 모델 조건에서도 10개 수학 벤치마크에서 평균 6.2포인트 향상했다.
- 다양한 경로 SFT는 정확도가 약간 낮아도 더 많은 프롬프트에서 성공과 실패 사례를 모두 만들어내어, 그룹 상대적 RL이 더 풍부한 학습 신호를 얻을 수 있게 한다.
- 모델 호출 없이 CPU만으로 동작하는 이 선별기는 3개의 오픈소스 코퍼스에서 더 비싼 대안들을 모두 앞서며, 추론 경로 다양성이 RL 사전 학습을 위한 실용적인 SFT 데이터 선별 기준임을 보여준다.