작은 모델이 더 나은 거부 샘플을 만든다
Key Point
LLM 증류 비용의 핵심 병목인 거부 샘플 생성을 더 작은 모델로 대체 가능함을 보여 모델 훈련 효율성을 크게 개선할 수 있기 때문이다.
핵심 요약
- 선호도 증류(preference distillation)는 교사 응답을 선택지로, 학생의 자체 생성 응답을 거부지로 삼는데, 이는 자동생성 실패가 가장 유용한 부정 샘플이며 거부 샘플이 학생 규모 이상의 모델에서 와야 한다는 가정에 기초한다.
- 연구 결과 이 두 가정 모두 성립하지 않으며, 7B부터 72B 규모의 학생 모델에서 더 작은 고정 모델이 자체 생성 거부 샘플보다 추론 비용은 덜 들이면서 더 강한 학생을 훈련시킨다.
- 선형화된 특성 모델에서 Direct Preference Optimization(DPO)의 유한 지평선 유틸리티 상한을 유도해 효과적인 거부 샘플 분포의 특성을 분석했다.