Hugging Face 논문AI · 머신러닝오늘의 주요

단어 변형을 함수처럼 분해해 어휘집 크기를 줄인 토크나이저

원제 The Functionalizer: Lossless Functional Decomposition for Subword Tokenization

추천 11댓글 3Connor Makowski, Willem Guter
Key Point

단어의 표면적 변형을 의미론적 정보 손실 없이 효율적으로 처리하는 방식으로, 어휘 크기 제약이 있는 언어모델의 용량 문제를 해결할 수 있는 접근법을 보여준다.

핵심 요약

  • 기존 토크나이저는 hello, Hello, HELLO 같은 대소문자나 악센트 변형을 별개의 어휘로 취급해 임베딩 공간이 파편화되거나, 정규화해서 정보를 손실한다.
  • Functionalizer는 대문자화, 악센트, 반복 문자 같은 변형을 매개변수화된 연산자(opcode)와 기본 토큰(operand)으로 분해하는 사전 토크나이저다.
  • 유니코드 프라이빗 영역을 이용해 변형 정보를 인코딩하며, 모든 변환이 역함수 가능하다.
  • 자연어와 코드 모두에서 어휘 슬롯을 최대 19.7% 줄이면서도 전체 코퍼스를 커버한다.
  • GPT-2 98M 모델 평가에서 Python 코드 문법 유효성이 7.70%에서 9.12%로 개선되고, 자연어에서 반복되는 n-그램이 감소했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗