토큰화 효율 높이는 기능 분해 방식 제안
Key Point
같은 단어의 다양한 표기를 효율적으로 처리해 모델의 어휘 크기를 줄이고 코드 생성 정확도를 높이는 실질적 개선 방법이기 때문입니다.
핵심 요약
- 기존 서브워드 토크나이저는 같은 단어의 대소문자·악센트 변형(hello, Hello, Héllo)을 서로 다른 어휘로 처리해 임베딩 공간이 파편화되거나, 정규화로 정보를 손실시킨다.
- 논문은 직교 및 구조 변형을 함수형 분해로 처리하는 Functionalizer를 제안한다.
- 대문자화(CAPITALIZE), 발음 기호(13개 전용 옵코드), 문자 반복(REPEAT, MULTIREPEAT) 등의 가역 연산자를 사용해 유니코드 개인용 영역에 인코딩한 프리픽스 스트림으로 정규 기본 토큰 앞에 붙인다.