Hugging Face 논문AI · 머신러닝

LLM 학습 과정의 버려진 데이터를 재활용하는 기법 제안

원제 ROSS: Relearning from Self-Generated Rollouts through Selective Supervision

추천 33댓글 2Zhiwei Zhang, Huayu Deng, Fei Zhao 외
Key Point

LLM 학습의 데이터 재활용 효율을 높이는 방법론으로, 기존에 버려지던 학습 경험에서 추가 성능을 뽑아낼 수 있다는 점이 실무적 가치가 크다.

핵심 요약

  • 대규모 언어모델 사후학습에서 강화학습과 온폴리시 증류로 생성된 과거 경험은 정책이 발전하면서 버려지는 문제가 있다.
  • 과거 경험은 현재 정책과 호환되면서도 더 이상 안정적으로 표현되지 않는 행동들을 보존할 수 있지만, 실수와 포기된 시도들도 함께 담고 있다.
  • ROSS는 전체 과거 궤적을 맥락으로 유지하면서 모델이 선택적으로 생성한 부분만 손실을 적용하는 방식으로, 더 정밀한 감독 신호를 제공한다.
  • 수학·코드 생성·명령 따르기·소프트웨어 엔지니어링 등 다양한 도메인에서 ROSS는 기준 모델을 지속적으로 개선했다.
  • Qwen3.6-35B-A3B에서 여섯 벤치마크 평균을 58.40%에서 62.20%로, SWE-bench Verified를 64.20%에서 68.40%로 향상시켰다.
  • 추가 정책 롤아웃 없이 오프라인 지도학습만으로도 자기 생성 궤적에서 더 이상의 성능 향상을 얻을 수 있음을 보였다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗