SAE가 품사 정보를 분산된 특성 그룹으로 인코딩한다
원제 Parts-of-Speech as Emergent Categories in SAE Latent Space
추천 10댓글 1
Key Point
언어모델의 '검은 상자'를 열기 위한 SAE 분석 방법이 실제로 문법 구조를 얼마나 잘 포착하는지 실증적으로 보여주는 연구로, 향후 모델 해석 연구의 방향을 제시한다.
핵심 요약
- Sparse AutoEncoder(SAE)는 언어모델의 내부 표현을 분석하는 도구인데, 어떤 언어 구조를 노출하는지는 아직 불명확하다.
- 연구팀은 품사(PoS) 범주를 통제된 테스트 케이스로 삼아, 형태통사 정보가 개별 잠재 변수로 인코딩되는지 아니면 특성의 구조화된 그룹으로 인코딩되는지 조사했다.
- SAE 활성화로부터 품사 구분을 높은 정확도로 복원할 수 있지만, 개별 잠재 변수와 범주 간에 일대일 대응이 없다는 것을 발견했다.
- 이러한 복원 가능성은 어휘 암기에 기인하지 않으며, 개방 품사 클래스와 폐쇄 품사 클래스는 상당히 다르다.
- 각 품사 범주는 compact한 스파스 잠재 변수 그룹으로 지원되며, 태그별로 상당한 변동성이 있다.
- 이 그룹들은 미학습 데이터에서도 안정적이면서 관련 범주 간에 겹침을 보인다.
- 결과적으로 SAE는 원자적 문법 특성을 통하지 않고 분산되고 범주 의존적인 형태로 형태통사 정보를 국소화한다.