영어 부정관사 "a" vs "an" 규칙을 자동으로 판별하는 법
Key Point
텍스트 생성 시스템에서 문법 규칙 자동화할 때 발음 기반 처리의 중요성을 보여주며, 영어 문법의 예외를 데이터로 분석한 실용적인 접근법을 제시한다.
핵심 요약
- 프로시저럴 텍스트 생성 시 단어 앞에 올 부정관사를 자동으로 선택하는 함수 개발 과정을 설명한다.
- 일반적으로 모음 문자로 시작하면 'an'을 쓰지만, 실제 규칙은 발음에 기반한다.
- 'unicorn'은 'u'로 시작하지만 자음음으로 발음되어 'a unicorn'이 맞고, 'hour'는 'h'로 시작하지만 모음음으로 발음되어 'an hour'가 맞다.
- 32,455개 단어 데이터를 분석한 결과, 129개 단어(약 0.4%)만 예외 규칙이 필요했다.
- 첫 두 글자만으로도 대부분의 경우 부정관사를 올바르게 결정할 수 있음을 시각화로 제시했다.