Hugging Face 논문AI · 머신러닝

교사 모델의 편차를 걸러내는 증류 기법 제안

원제 Calibrating Teacher--Student Discrepancy for On-Policy Distillation

추천 12댓글 2Qiangqiang He, Jin Li, MingCai Chen
Key Point

학생 모델의 추론 능력을 효율적으로 높이는 데 불필요한 학습 신호를 제거하는 방식이 기존 기법보다 더 효과적임을 보여주기 때문입니다.

핵심 요약

  • On-policy distillation은 강한 교사 모델과 학생 모델의 토큰 수준 차이를 학습해 추론 성능을 높이지만, 이 차이에는 교사 모델 자체의 편차가 섞여 있다.
  • 교사 모델의 자체 편차까지 학습하면 학생 모델의 성능이 저하되는데, 특히 특권 정보를 활용하는 경우 이 문제가 더 심해진다.
  • 연구팀은 Cal-OPD 기법을 제안해 긍정·부정 개입을 통해 교사의 편차 영역을 추정하고, 이를 제외한 진정한 역량 차이만 학습하도록 한다.
  • 수학 추론 벤치마크에서 원래 신호의 52~65%만 사용해도 표준 OPD보다 일관되게 높은 성능을 보였다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗