언어 모델의 가중치 변화를 읽고 동작을 개선하는 기술
Key Point
신경망의 가중치 변화를 직접 해석 가능한 자연어로 읽어낼 수 있다는 것이 새로운 발견이며, 이를 통해 모델의 동작을 의도적으로 개선할 수 있는 경로를 제시한다.
핵심 요약
- 언어 모델이 자신의 학습 과정을 인식하고 개선할 수 있도록 하기 위해 '임프린트 리더(Imprint Reader)'라는 방법을 제안했다.
- 리더는 Semantic Mount-and-Read Tuning(SaRT)으로 훈련되어 동결된 가중치 업데이트를 자연어로 설명하며, 앵커 없는 메타 쿼리로 학습 내용을 추출한다.
- 실제 업데이트에 대해 지식 설명은 2%, 동작 설명은 16%의 Pass@100 점수를 달성했으며, 미검증 주장을 억제하기 위해 무변화 및 랜덤 교란 제어 기법을 사용했다.