Hugging Face 논문AI · 머신러닝

추론 단계 다양성이 RL 학습을 앞당긴다

원제 Selecting Diverse SFT Traces Improves Post-RL Generalization

추천 25댓글 1Dylan Zhang, Mingyuan Wu, Jinning Li
Key Point

RL 기반 추론 모델 개발에서 어떤 학습 데이터를 쓸지가 최종 성능을 크게 좌우하는데, 경로 다양성이라는 단순하지만 효과적인 선별 기준이 기존 방식을 일관되게 이기고 있습니다.

핵심 요약

  • 검증된 풀이가 모두 같은 가치는 아니라는 점에서 출발하여, 감독 학습(SFT) 데이터에서 추론 경로의 다양성이 중요함을 발견했다.
  • 추론 경로 다양성(route diversity)은 풀이 과정의 단계 수열이 얼마나 다양한지를 측정하는 지표로, 경량의 규칙 기반 지문(fingerprint)을 통해 선별할 수 있다.
  • 같은 예산과 훈련 설정에서 유사한 경로보다 다양한 경로를 선택했을 때, SFT 이후 강화학습(RL)의 문제 해결률이 퍼즐과 수학 문제에서 모두 향상되었다.
  • 특히 합성 실험에서 OLMo3-7B 모델이 다양한 경로 SFT를 받으면 환경에서 미학습 문제들의 pass@8이 16.9포인트 증가했고, 단일 모델 조건에서도 10개 수학 벤치마크에서 평균 6.2포인트 향상했다.
  • 다양한 경로 SFT는 정확도가 약간 낮아도 더 많은 프롬프트에서 성공과 실패 사례를 모두 만들어내어, 그룹 상대적 RL이 더 풍부한 학습 신호를 얻을 수 있게 한다.
  • 모델 호출 없이 CPU만으로 동작하는 이 선별기는 3개의 오픈소스 코퍼스에서 더 비싼 대안들을 모두 앞서며, 추론 경로 다양성이 RL 사전 학습을 위한 실용적인 SFT 데이터 선별 기준임을 보여준다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗