합성 데이터 사전학습, 규모가 커져도 효과 유지되지만 문법 학습 아니다
원제 Synthetic Pre-pretraining Survives Scale, but Not as a Grammatical Prior
추천 10댓글 1
Key Point
합성 데이터 사전학습이 실제로 어떤 원리로 효과를 내는지 바뀌면서, 향후 언어 모델 사전학습 전략의 설계 방향이 재검토되어야 한다.
핵심 요약
- 합성 비자연어 데이터로 사전학습한 뒤 자연어로 학습하는 PPT(사전사전학습) 방식이 토큰 효율성을 개선하지만, 기존 연구가 주장한 '문법 규칙 학습'이 아니라는 실험 결과가 나왔다.
- 연구팀이 5가지 PPT 과제, 4가지 학습 데이터 혼합, 500M~7B 모델 규모, 최대 100B 토큰 학습 예산에서 종합 실험을 진행했다.
- 결과적으로 PPT의 다운스트림 성능과 토큰 효율 개선이 규모에 관계없이 지속되어, 3B 규모에서 최소 21B 토큰을 절약했다.
- 그러나 문법 수용성이 모델 크기에 걸쳐 다운스트림 성능과 일관되게 정렬되지 않아, 기존 이론과 달리 문법 규칙 학습이 아님을 보여주었다.
- 대신 PPT의 이득은 장거리 검색 능력을 개선하는 과제에서 비롯된다는 것을 발견했다.
- PPT 성능 향상은 학습 데이터 구성 방식에 견고하며, 웹 텍스트가 제거될 때만 감소했다.
- PPT는 사전학습에 저비용으로 추가할 수 있으며, 향후 PPT 과제 설계는 자연어 문법이 아닌 장거리 검색을 목표로 해야 한다는 결론을 제시했다.