Hugging Face 논문AI · 머신러닝오늘의 주요

온정책 vs 비정책 학습, 체계적 실험으로 재평가

원제 On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics

추천 130댓글 1Julianna Piskorz, Antonin Berthon, Mihaela van der Schaar
Key Point

강화학습 기반 모델 최적화에서 온정책 학습의 필요성이 통념으로 여겨졌지만, 체계적인 실험을 통해 그 가정을 재검토한 논문으로 실무 선택에 직결되는 통찰을 제시한다.

핵심 요약

  • 온정책(on-policy) 학습이 재앙적 망각을 줄이고 성능을 개선한다는 주장이 있지만, 기존 연구는 여러 요소를 동시에 변경해 효과를 명확히 구분하기 어려웠다.
  • 연구팀은 강한 모델을 약한 모델로 증류하는 통제된 실험에서 온정책 정책, KL 방향, 학습률을 독립적으로 변경하며 Llama3과 Qwen2.5에서 과학·의료·산술 추론 과제를 실시했다.
  • 분석 결과 온정책 정책이 중심 역할을 하지 않는 것으로 드러났다.
  • 대신 토큰 수준의 KL 방향이 작업 성능과 출력 범위를 더 명확히 결정했으며, 학습률이 망각과 업데이트 희소성을 좌우했다.
  • 정방향 KL은 온정책 정책 변화에 매우 견고해 성능이 안정적으로 유지되지만, 역방향 KL은 민감해 학생이 생성한 데이터를 선호한다.
  • 온정책 데이터는 Countdown 산술 과제의 어려운 변형에 대한 일반화를 개선했으나, 그 이점이 이후 RLVR 학습 후 지속적으로 유지되지는 않았다.
  • 그래디언트 클리핑 제거, 샘플링 KL 추정기 사용, 긴 추론 체인이 필요한 과제 학습에서도 결론의 견고성이 확인되었다.
  • 결론적으로 온정책 롤아웃이 본질적으로 우수하다는 기존 관점에 의문을 제기하며, 그 가치는 목적함수, 평가 환경, 최적화 하이퍼파라미터에 따라 결정된다고 밝혔다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗