다국어 텍스트 인식에 최적화된 MoE 아키텍처
원제 All-in-One Multilingual Scene Text Recognition with Script-aware Mixture-of-Experts
추천 42댓글 3
Key Point
언어별 별도 모델 배포 비용과 복잡성 없이 실무 OCR 성능을 크게 개선하는 실용적 기술로, 다국어 텍스트 인식이 필요한 개발자들이 주목할 만하다.
핵심 요약
- 다국어 OCR의 문제점을 해결하기 위해 script-aware Mixture-of-Experts(ScriptMoE) 아키텍처를 제안했다.
- TextMuSS-10M이라는 10개 문자 체계와 229개 언어를 포함한 대규모 합성 텍스트 데이터셋을 구축했다.
- ScriptMoE는 단일 비전 인코더와 이미지별 라우터가 상위 2개의 문자 체계 전문 모듈로 분배하는 희소 MoE 블록으로 구성된다.
- TextMuSS-Bench에서 82.06% 정확도를 달성해 기존 STR 방법을 1.31% 상회했다.
- PP-OCRv5의 인식기만 교체해도 F1 스코어가 65.71%에서 80.89%로 올라 최고 성능 VLM과 동등하면서도 파라미터는 훨씬 적다.