학습 흔적이 무관한 과제에 영향을 미친다
원제 Post-Training Leaves Behavioral Shadows on Unrelated Decisions
추천 122댓글 1
Key Point
포스트 트레이닝의 변화가 무관한 텍스트만으로도 다른 모델로 전이될 수 있다는 것을 보여주며, 언어 모델 학습 메커니즘과 능력 전이의 근본적 원리에 대한 새로운 시각을 제시한다.
핵심 요약
- 언어 모델의 포스트 트레이닝 업데이트가 과제와 무관한 텍스트를 통해 다른 모델로 전이될 수 있음을 발견했다.
- Active Taskless Distillation(ATD) 기법은 교사 모델당 단 하나의 단어만 사용해 능력을 전이하며, 목표 과제 예제나 교사 로짓, 교사 매개변수 없이도 학습이 이루어진다.
- ATD는 교사 모델과 학생 모델의 공통 선조 모델이 두 평범한 단어 사이에서 거의 무차별한 프롬프트를 선택해 포스트 트레이닝의 동작적 흔적을 탐사한다.
- Qwen2.5-1.5B를 이용한 주요 코딩 실험에서 5,664개의 프롬프트-단어 쌍으로 HumanEval+에서 정확히 일치하는 대조군 대비 5.34 포인트 향상을 달성했다.
- 추가 실험들은 과학적 지식, 상식 추론, 독해력 이해 등 다양한 과제와 모델 크기, 모델 패밀리 전반에 걸쳐 능력 전이가 일어남을 보여준다.
- 기능 분석 결과 학습된 능력은 합성 가능하며, 그 강도는 교사 모델의 업데이트 강도와 연동된다.