교사 모델의 편차를 걸러내는 증류 기법 제안
원제 Calibrating Teacher--Student Discrepancy for On-Policy Distillation
추천 12댓글 2
Key Point
학생 모델의 추론 능력을 효율적으로 높이는 데 불필요한 학습 신호를 제거하는 방식이 기존 기법보다 더 효과적임을 보여주기 때문입니다.
핵심 요약
- On-policy distillation은 강한 교사 모델과 학생 모델의 토큰 수준 차이를 학습해 추론 성능을 높이지만, 이 차이에는 교사 모델 자체의 편차가 섞여 있다.
- 교사 모델의 자체 편차까지 학습하면 학생 모델의 성능이 저하되는데, 특히 특권 정보를 활용하는 경우 이 문제가 더 심해진다.
- 연구팀은 Cal-OPD 기법을 제안해 긍정·부정 개입을 통해 교사의 편차 영역을 추정하고, 이를 제외한 진정한 역량 차이만 학습하도록 한다.
- 수학 추론 벤치마크에서 원래 신호의 52~65%만 사용해도 표준 OPD보다 일관되게 높은 성능을 보였다.