강화학습 모델을 학생 모델에 가르치는 새로운 방식, 표현층에서 직접 학습
Key Point
모델 증류에서 강화학습의 효과를 더 효율적으로 전달하는 새로운 방법이 제시되어, 더 작은 모델로도 큰 모델 수준의 성능을 얻을 수 있는 경로를 열어준다.
핵심 요약
- 기존 온-폴리시 디스틸레이션(OPD)은 학생 모델이 자신의 궤적 위에서 교사의 다음 토큰 분포를 모방하도록 훈련하며, 출력 공간에서 암묵적 보상을 외삽하여 교사를 능가하게 할 수 있다.
- 그러나 언어모델 헤드는 이 변화를 비등방적으로 감쇠시키며, 교사 은닉층에 인코딩된 대부분의 변화가 로짓에는 작은 가중치로만 도달하고, 출력 공간 외삽이 의존하는 샘플 토큰 로그확률 비율은 훈련 불안정성을 초래하는 노이즈를 증폭시킨다.
- 연구진은 강화학습이 모델의 내부 표현을 기본 체크포인트에서 변화시키고, 이 변화의 방향을 모든 층에서 측정할 수 있음을 관찰했다.