1% 토큰으로 충분할 수도, 그래디언트 추정의 효율성
Key Point
효율적인 모델 학습을 위해 어떤 토큰에 교사 감독을 할당할지 결정하는 문제에서, 단순한 유용성 평가뿐 아니라 그래디언트 추정 안정성도 고려해야 한다는 실질적 통찰을 제시한다.
핵심 요약
- 학생 모델 학습 시 교사 모델의 감독을 소수 토큰에만 할당하는 희소 온폴리시 증류(OPD) 기법의 그래디언트 추정 문제를 분석했다.
- 다음 토큰 샘플링으로부터 계산한 그래디언트가 노이즈를 많이 포함할 수 있으며, 신호 대 잡음 분해를 기반으로 정보 효율성 비율(IER)을 제안했다.
- IER은 토큰 선택 과정에서 유용성 점수와 결합되어 기존 방식보다 그래디언트 추정 신뢰성을 높인다.
- 수학·의료 추론 작업에서 0.1%~1%의 토큰 예산으로 전체 OPD와 동등하거나 초과하는 성능을 달성했다.