SAE가 품사 정보를 분산된 특성 그룹으로 인코딩한다
Key Point
언어모델의 '검은 상자'를 열기 위한 SAE 분석 방법이 실제로 문법 구조를 얼마나 잘 포착하는지 실증적으로 보여주는 연구로, 향후 모델 해석 연구의 방향을 제시한다.
핵심 요약
- Sparse AutoEncoder(SAE)는 언어모델의 내부 표현을 분석하는 도구인데, 어떤 언어 구조를 노출하는지는 아직 불명확하다.
- 연구팀은 품사(PoS) 범주를 통제된 테스트 케이스로 삼아, 형태통사 정보가 개별 잠재 변수로 인코딩되는지 아니면 특성의 구조화된 그룹으로 인코딩되는지 조사했다.
- SAE 활성화로부터 품사 구분을 높은 정확도로 복원할 수 있지만, 개별 잠재 변수와 범주 간에 일대일 대응이 없다는 것을 발견했다.