단어 변형을 함수처럼 분해해 어휘집 크기를 줄인 토크나이저
원제 The Functionalizer: Lossless Functional Decomposition for Subword Tokenization
추천 11댓글 3
Key Point
단어의 표면적 변형을 의미론적 정보 손실 없이 효율적으로 처리하는 방식으로, 어휘 크기 제약이 있는 언어모델의 용량 문제를 해결할 수 있는 접근법을 보여준다.
핵심 요약
- 기존 토크나이저는 hello, Hello, HELLO 같은 대소문자나 악센트 변형을 별개의 어휘로 취급해 임베딩 공간이 파편화되거나, 정규화해서 정보를 손실한다.
- Functionalizer는 대문자화, 악센트, 반복 문자 같은 변형을 매개변수화된 연산자(opcode)와 기본 토큰(operand)으로 분해하는 사전 토크나이저다.
- 유니코드 프라이빗 영역을 이용해 변형 정보를 인코딩하며, 모든 변환이 역함수 가능하다.
- 자연어와 코드 모두에서 어휘 슬롯을 최대 19.7% 줄이면서도 전체 코퍼스를 커버한다.
- GPT-2 98M 모델 평가에서 Python 코드 문법 유효성이 7.70%에서 9.12%로 개선되고, 자연어에서 반복되는 n-그램이 감소했다.