학습 흔적이 무관한 과제에 영향을 미친다
Key Point
포스트 트레이닝의 변화가 무관한 텍스트만으로도 다른 모델로 전이될 수 있다는 것을 보여주며, 언어 모델 학습 메커니즘과 능력 전이의 근본적 원리에 대한 새로운 시각을 제시한다.
핵심 요약
- 언어 모델의 포스트 트레이닝 업데이트가 과제와 무관한 텍스트를 통해 다른 모델로 전이될 수 있음을 발견했다.
- Active Taskless Distillation(ATD) 기법은 교사 모델당 단 하나의 단어만 사용해 능력을 전이하며, 목표 과제 예제나 교사 로짓, 교사 매개변수 없이도 학습이 이루어진다.
- ATD는 교사 모델과 학생 모델의 공통 선조 모델이 두 평범한 단어 사이에서 거의 무차별한 프롬프트를 선택해 포스트 트레이닝의 동작적 흔적을 탐사한다.