Hugging Face 논문AI · 머신러닝

1% 토큰으로 충분할 수도, 그래디언트 추정의 효율성

원제 1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation

추천 15댓글 2Huanxin Sheng, Zhiling Ye, Haonan Wang 외
Key Point

효율적인 모델 학습을 위해 어떤 토큰에 교사 감독을 할당할지 결정하는 문제에서, 단순한 유용성 평가뿐 아니라 그래디언트 추정 안정성도 고려해야 한다는 실질적 통찰을 제시한다.

핵심 요약

  • 학생 모델 학습 시 교사 모델의 감독을 소수 토큰에만 할당하는 희소 온폴리시 증류(OPD) 기법의 그래디언트 추정 문제를 분석했다.
  • 다음 토큰 샘플링으로부터 계산한 그래디언트가 노이즈를 많이 포함할 수 있으며, 신호 대 잡음 분해를 기반으로 정보 효율성 비율(IER)을 제안했다.
  • IER은 토큰 선택 과정에서 유용성 점수와 결합되어 기존 방식보다 그래디언트 추정 신뢰성을 높인다.
  • 수학·의료 추론 작업에서 0.1%~1%의 토큰 예산으로 전체 OPD와 동등하거나 초과하는 성능을 달성했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗