LLM 학습 과정의 버려진 데이터를 재활용하는 기법 제안
원제 ROSS: Relearning from Self-Generated Rollouts through Selective Supervision
추천 33댓글 2
Key Point
LLM 학습의 데이터 재활용 효율을 높이는 방법론으로, 기존에 버려지던 학습 경험에서 추가 성능을 뽑아낼 수 있다는 점이 실무적 가치가 크다.
핵심 요약
- 대규모 언어모델 사후학습에서 강화학습과 온폴리시 증류로 생성된 과거 경험은 정책이 발전하면서 버려지는 문제가 있다.
- 과거 경험은 현재 정책과 호환되면서도 더 이상 안정적으로 표현되지 않는 행동들을 보존할 수 있지만, 실수와 포기된 시도들도 함께 담고 있다.
- ROSS는 전체 과거 궤적을 맥락으로 유지하면서 모델이 선택적으로 생성한 부분만 손실을 적용하는 방식으로, 더 정밀한 감독 신호를 제공한다.
- 수학·코드 생성·명령 따르기·소프트웨어 엔지니어링 등 다양한 도메인에서 ROSS는 기준 모델을 지속적으로 개선했다.
- Qwen3.6-35B-A3B에서 여섯 벤치마크 평균을 58.40%에서 62.20%로, SWE-bench Verified를 64.20%에서 68.40%로 향상시켰다.
- 추가 정책 롤아웃 없이 오프라인 지도학습만으로도 자기 생성 궤적에서 더 이상의 성능 향상을 얻을 수 있음을 보였다.