온폴리시 증류 붕괴 문제, 마지막 레이어 신호로 해결
원제 LastOPD: Taming Collapse in Latent On-Policy Distillation
추천 15댓글 1
Key Point
온폴리시 증류의 근본적인 붕괴 문제를 진단하고 해결한 방법론으로, 작은 모델의 효율적 학습에 직접 적용할 수 있는 실용적 개선안을 제시한다.
핵심 요약
- 온폴리시 증류(OPD)는 학생 모델이 생성한 응답을 교사 모델의 다음 토큰 분포로만 보정하기 때문에, 교사가 어떻게 생각하는지(잠재 상태)는 학습하지 못한다.
- 최신 방법인 OPRD는 학생의 잠재 상태를 교사의 잠재 상태에 정렬하는 신호를 추가하지만, 실제 실험에서 심각한 문제가 발생한다.
- Qwen3 모델 증류 시 초기 성능은 높았지만(MATH-500에서 25에서 46으로 올라감) 이후 10단계 후 성능이 11까지 급락하며 회복되지 않는 '조기 이득, 후기 붕괴' 현상이 나타났다.
- 정렬 지표가 계속 개선되는데도 가장 정렬이 잘된 모델이 최악의 성능을 보이는 모순이 발생했으며, 이는 모델 간에 동일 깊이의 레이어가 다른 역할을 수행하기 때문이다.
- 연구팀은 LastOPD를 제안하여 잠재 신호를 모든 레이어가 아닌 마지막 레이어(LM 헤드의 공통 인터페이스)에만 적용하고, 10단계 동안만 토큰 수준 OPD로 교차 페이드한다.
- LastOPD는 토큰 수준 OPD 대비 MATH-500에서 4B 교사로 5.55점, 8B 교사로 4.02점 성능 향상을 달성하며, 대부분의 평가 데이터셋에서 우수하고, 토큰 수준 OPD의 최종 성능에 절반의 단계로 도달한다.
- 코드는 GitHub에 공개되어 있다.