Hugging Face 논문AI · 머신러닝

여러 전문 모델의 내부 표현까지 활용하는 학생 모델 증류법

원제 Latent-MOPD: Latent Multi-Teacher On-Policy Distillation

추천 15댓글 1Zhengyu Fang, Seoyeon Hong, Jie Yang 외
Key Point

여러 작은 전문 모델의 능력을 한 학생 모델에 집약할 때 숨겨진 상태라는 새로운 정보 채널을 활용하면 더 효과적인 학습이 가능하며, 이는 효율적인 언어 모델 설계에 새로운 방향을 제시한다.

핵심 요약

  • 온폴리시 증류(OPD)는 학생 모델이 생성한 응답으로 스스로를 학습시키는 기법인데, 기존 다중 교사 방식은 교사 모델의 출력 분포만 전달한다.
  • Latent-MOPD는 표현 수준의 첫 다중 교사 증류법으로, 교사의 예측뿐 아니라 예측을 계산하는 데 사용된 숨겨진 상태도 함께 활용한다.
  • 추가 교사 학습 없이 기존 전문 모델을 통합하며, 여러 교사로부터의 표현 감독을 조정하기 위해 후층 타겟을 선택하고, 숨겨진 너비 차이를 공유 투영으로 해소하고, 도메인별로 업데이트를 그룹화한다.
  • 각 교사의 감독은 숨겨진 상태에서 토큰 예측으로 점진적으로 전환되며, 두 채널 모두 동일한 라우팅 전문가를 사용한다.
  • 같은 계열의 교사들을 사용하는 표준 설정에서 Latent-MOPD는 수학, 코드, 논리 분야의 9개 벤치마크 모두에서 토큰만 사용하는 방식, 표현만 사용하는 방식, 균등 평균화 방식을 능가한다.
  • 학생 모델이 각 교사와 동일한 파라미터 수를 가지면서도 대다수 벤치마크에서 개별 최고 성능 교사를 초과한다.
  • 더 크고 별도 개발된 교차 계열 교사를 사용했을 때도 모든 벤치마크에서 두 채널 기준 모델을 능가한다.
  • 같은 계열의 전계층 표현만 사용하는 제어 실험에서는 도메인이 섞이지 않은 순수 업데이트에서는 안정적이지만, 교사 도메인이 한 번의 업데이트 내에서 섞일 때는 붕괴된다.
  • 이 결과는 단일 학생 모델이 출력 분포와 내부 표현 모두를 통해 여러 전문 모델의 기능을 통합할 수 있음을 보여준다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗