트랜스포머 회로 분석을 위한 수학적 프레임워크
Key Point
대형 언어 모델의 예상 밖의 동작을 체계적으로 설명하고 안전 문제를 사전에 발견할 수 있는 기초 프레임워크를 제시하는 연구로, 모델 해석가능성 분야의 초기 이정표이다.
핵심 요약
- GPT-3, LaMDA 같은 대형 언어 모델은 학습 후에도 예상치 못한 해로운 행동이 드러나곤 하며, 이를 해결하려면 모델의 내부 계산을 역공학하는 기계적 해석가능성(mechanistic interpretability)이 필요하다.
- 이 논문은 트랜스포머를 역공학하기 위한 초기 단계로서, 가장 단순한 2층 이하의 어텐션 전용 모델부터 시작해 기본 알고리즘 패턴을 발견하는 것을 목표로 한다.
- 트랜스포머의 동작을 수학적으로 동등하면서도 새로운 관점으로 재구성함으로써, 특정 어텐션 헤드인 '귀납 헤드(induction heads)'가 인컨텍스트 학습을 설명할 수 있음을 발견했다.
- 귀납 헤드는 2개 이상의 어텐션 레이어를 가진 모델에서만 발달하며, 향후 연구에서는 이 프레임워크가 더 큰 모델에도 적용 가능함을 보일 예정이다.
- 현재 연구는 MLP 레이어 없이 어텐션만 포함한 장난감 모델을 대상으로 하는 것으로, MLP 레이어의 해석은 향후 과제로 남아 있다.