온정책 학습의 매개변수 업데이트 방향이 LLM 일반화 능력 좌우한다
원제 On-Policy Parameter Update Direction Underlies Generalization in LLM Post-Training
추천 50댓글 1
Key Point
LLM 포스트트레이닝에서 온정책 방식의 우수한 일반화 능력을 효율적인 SFT 방식으로도 구현 가능하다는 것을 보여줌으로써, 실제 모델 학습 전략의 개선 방향을 제시한다.
핵심 요약
- 온정책(on-policy) 포스트트레이닝은 강한 일반화 성능을 보이는데, 기존 연구들은 이 과정의 매개변수 업데이트 행동을 단순 부산물로만 취급했다.
- 연구팀은 SFT(지도 미세조정)가 일관된 방향으로 매개변수를 업데이트하는 반면, 온정책 패러다임은 학습 중 지속적으로 방향을 조정한다는 점을 발견했다.
- 각 매개변수의 누적 업데이트 방향이 핵심 행동이라는 가설을 바탕으로, OPSFT(온정책 방향 제약 지도 미세조정) 기법을 제안했다.
- OPSFT는 SFT 업데이트를 온정책 패러다임이 식별한 방향으로 제한함으로써 온정책의 일반화 이점을 SFT에 전이시킨다.
- 실험 결과 OPSFT의 성능이 우수해, 온정책 패러다임의 일반화 장점이 매개변수 업데이트 방향을 통해 다른 학습 방식에 적용 가능함을 입증했다.
- 소수의 온정책 학습 단계로 일반화를 지원하는 업데이트 방향을 식별한 후 OPSFT를 적용하면 높은 학습 효율을 달성할 수 있다.
- OPSFT는 고품질 궤적을 활용하여 온정책 학습에서 획득한 능력을 손상하지 않으면서 모델을 계속 개선할 수 있다.