학생 모델의 정답 여부에 따라 선별한 교사 피드백으로 성능 향상
원제 DuoOPD: Learning from Joint Teacher-Student Outcomes for Multi-Task On-Policy Distillation
추천 11댓글 1
Key Point
학생과 교사의 성공 여부 조합에 따라 피드백을 다르게 적용하는 간단한 규칙으로 다중 과제에서 일관되게 성능을 높이는 새로운 증류 방식이기 때문에, 모델 경량화 실무에 직접 도입할 수 있는 기법으로 주목할 만하다.
핵심 요약
- 기존 온정책 증류(OPD)는 강력한 교사 모델의 토큰 수준 피드백으로 학생을 훈련하지만, 학생이 이미 정확히 푼 질문에 교사가 실패하거나 과제별로 성공률이 다른 점을 무시한다.
- 이 논문은 DuoOPD를 제안하며, 학생의 정답 여부가 피드백 방향을 결정하고 교사-학생 결과 조합이 교사의 지원 방식을 정한다.
- 교사만 성공한 경우 교사의 검증된 답변이 학생의 실패 응답 평가 맥락이 되고, 학생만 성공한 경우 과제별 가중치가 전체 응답을 강화한다.
- 4가지 결과 조합 모두를 과제별 설정 없이 하나의 규칙으로 처리한다.
- Qwen3와 Llama에서 DuoOPD는 5개 기준선 모두를 평균 매크로 정확도에서 앞섰으며, OPD 대비 2.58~5.98 포인트 개선했다.
- 과학 계산, 지시 따르기, 코드 생성을 포함한 2개 추가 과제 조합에서도 최고 성능을 보였다.
- 제거 실험 결과 정답 기반 방향 설정만으로는 가중 기준선 수준에 머물며, 결과 조합 설계가 대부분의 이득을 제공한다.