언어 모델의 가중치 변화를 읽고 동작을 개선하는 기술
원제 Imprint Reader: From Weight-Update Readout to Behavioral Intervention
추천 11댓글 1
Key Point
신경망의 가중치 변화를 직접 해석 가능한 자연어로 읽어낼 수 있다는 것이 새로운 발견이며, 이를 통해 모델의 동작을 의도적으로 개선할 수 있는 경로를 제시한다.
핵심 요약
- 언어 모델이 자신의 학습 과정을 인식하고 개선할 수 있도록 하기 위해 '임프린트 리더(Imprint Reader)'라는 방법을 제안했다.
- 리더는 Semantic Mount-and-Read Tuning(SaRT)으로 훈련되어 동결된 가중치 업데이트를 자연어로 설명하며, 앵커 없는 메타 쿼리로 학습 내용을 추출한다.
- 실제 업데이트에 대해 지식 설명은 2%, 동작 설명은 16%의 Pass@100 점수를 달성했으며, 미검증 주장을 억제하기 위해 무변화 및 랜덤 교란 제어 기법을 사용했다.
- 리더가 생성한 자연어 설명은 미분 가능한 프록시로 작동하여, MetaEdit 기법으로 가중치 업데이트를 목표 동작에 맞출 수 있다.
- 안전성 유지 목표에서 0.5% 프루닝 비율로 해로운 프롬프트 거부율을 57.9%에서 64.1%로 올렸다.
- 수학적 추론 작업에서는 목표 작업 학습 데이터 없이 동작 설명만으로 백트래킹과 부분 목표 표현 빈도를 높여 BFCL Overall 점수를 41.69%에서 44.60%로 향상시켰다.