쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 10월 3일 (토)까지1629건
1건 · "KL divergence"조건 지우기 ×
001▲ 130 · 댓글 1온정책 vs 비정책 학습, 체계적 실험으로 재평가온정책(on-policy) 학습이 재앙적 망각을 줄이고 성능을 개선한다는 주장이 있지만, 기존 연구는 여러 요소를 동시에 변경해 효과를 명확히 구분하기 어려웠다.AI · 머신러닝 · On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics
온정책 vs 비정책 학습, 체계적 실험으로 재평가

Key Point강화학습 기반 모델 최적화에서 온정책 학습의 필요성이 통념으로 여겨졌지만, 체계적인 실험을 통해 그 가정을 재검토한 논문으로 실무 선택에 직결되는 통찰을 제시한다.
핵심 요약
- 온정책(on-policy) 학습이 재앙적 망각을 줄이고 성능을 개선한다는 주장이 있지만, 기존 연구는 여러 요소를 동시에 변경해 효과를 명확히 구분하기 어려웠다.
- 연구팀은 강한 모델을 약한 모델로 증류하는 통제된 실험에서 온정책 정책, KL 방향, 학습률을 독립적으로 변경하며 Llama3과 Qwen2.5에서 과학·의료·산술 추론 과제를 실시했다.
- 분석 결과 온정책 정책이 중심 역할을 하지 않는 것으로 드러났다.
전체 요약 8문장 읽기 →