Hugging Face 논문AI · 머신러닝오늘의 주요

다중 전문가 모델 통합, 피드백 균형이 결정한다

원제 Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation

추천 95댓글 1Xin Li, Hao Jiang, Xin Gao 외
Key Point

여러 전문 분야의 언어모델을 하나로 통합할 때 단순 라우팅만으로는 부족하며, 도메인별 피드백의 강도를 정규화해야 모든 능력을 균형 있게 갖춘 학생 모델을 만들 수 있다는 실증적 발견을 제시한다.

핵심 요약

  • 강화학습으로 한 언어모델을 수학, 코딩, 지시 따르기 등 단일 분야에 특화된 여러 전문가 모델로 나눌 수 있지만, 사용자는 모든 능력을 갖춘 하나의 모델이 필요하다.
  • 기존 다중교사 정책 내 증류(MOPD) 방식은 학생 모델이 각 프롬프트에 답하면 해당 분야의 전문가가 모든 토큰에 대해 피드백을 주도록 라우팅하는 방식으로 통합한다.
  • Qwen 3.5 세 가지 크기에서 실험한 결과, MOPD 학생 모델은 최고의 단일 전문가 모델을 이기지 못했으며 수학 전문가의 장점을 거의 얻지 못했다.
  • 문제는 피드백의 불균형이었다: 지시 따르기 피드백이 수학 피드백보다 몇 배 더 넓게 퍼져 있어서 학생 모델의 학습을 지배했다.
  • 논문은 도메인 정규화 MOPD(DN-MOPD)를 제안하며, 라우팅은 유지하되 각 도메인의 피드백을 측정된 분산에 따라 재조정한다.
  • 여섯 개 공개 벤치마크에서 DN-MOPD는 세 가지 모델 크기 모두에서, 세 개 무작위 시드 반복과 두 가지 답변 길이 제약 조건 하에서 MOPD보다 평균 점수를 개선했으며 손실된 수학 이득 대부분을 회복했다.
  • 고정 도메인 가중치를 사용한 제어 실험에서 개선이 주로 지시 따르기 피드백을 낮춤으로써 나왔으며, DN-MOPD가 측정한 것과 비슷한 고정 가중치도 비슷한 성능을 보였다.
  • 결론적으로 전문가 모델을 통합할 때는 어느 전문가가 가르치는지뿐 아니라 그 피드백이 얼마나 강하게 작용하는지도 결정해야 한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗