교사 모델과 학생의 불일치를 줄이는 지도 라우팅 기법 SAKI
원제 SAKI: Maximal-Coupling-Routed Teacher Supervision for On-Policy Distillation
추천 37댓글 1
Key Point
학생 모델을 효율적으로 증류하면서 정확도를 높이는 새로운 방법으로, 수학 문제 해결 같은 복잡한 추론 작업의 비용 절감에 직결된다.
핵심 요약
- 온-폴리시 증류(OPD)는 학생 모델이 생성한 궤적으로 훈련하여 학습-테스트 상태 불일치를 줄이지만, 약한 학생은 교사 모델과 정렬되지 않은 접두사에서 대표성 낮은 감독을 받을 수 있다.
- SAKI(Supervision Allocation with KL-constrained Interpolation)는 KL 제약 교사 유도 롤아웃과 최대 결합을 결합하여, 실현된 수용/교정 이벤트를 재사용해 토큰 수준의 감독을 라우팅한다.
- 수용된 위치는 샘플링된 토큰의 역-KL 감독을 유지하고, 교정 위치는 교사의 최고 확률 토큰에 대한 직접 감독을 받는다.
- 최대 결합 하에서 교정 확률은 정확히 TV(p_t, q_t)이므로, 동일한 신뢰 반경이 롤아웃 편차를 제어하고 개입 및 특화된 감독 빈도의 상한을 정한다.
- 엔진 상주 추측 검증기를 구현하면 정확한-q 궤적 분포와 결합 의미를 보존하면서 매칭된 워크로드 롤아웃 처리량을 4.22배 향상시킨다.
- 7개 수학 추론 벤치마크에서 SAKI는 1.7B와 0.6B 학생 모두의 Mean@8과 Pass@8에서 매칭된 교사 유도 기준선을 개선한다.
- 배치 제어와 고정 접두사 분석은 교정 유발 라우팅이 충돌-적응형 감독 신호임을 추가로 지지한다.