텍스트를 선택적으로 압축하는 FocusVTC, 긴 문맥 처리 속도 2.79배 향상
원제 FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution
추천 13댓글 1
Key Point
긴 문맥을 처리하는 LLM 서비스에서 입력 토큰 수를 2.9배 줄이면서도 성능을 높이고 추론 속도를 2.79배 가속하는 방법이 제시되었으므로, 비용과 속도가 중요한 실제 배포 환경에서 직접 적용할 가치가 있다.
핵심 요약
- 대규모 언어모델의 장문맥 처리는 계산과 메모리 비용이 큰데, 시각 텍스트 압축(VTC)은 텍스트를 이미지로 렌더링해 입력 길이를 줄인다.
- 기존 방식은 해상도를 고정하므로 저DPI는 토큰을 절약하지만 가독성을 잃고, 고DPI는 불필요한 내용에 토큰을 낭비하는 문제가 있다.
- FocusVTC는 적응형 해상도로 이 트레이드오프를 깨뜨렸고, 압축된 저DPI 전역 뷰와 선택적 영역 강화를 결합한다.
- 연구팀은 추론 과정을 페이지 인덱스와 바운딩박스로 연결한 29.4K 고품질 REL 체인오브쏘트 예제를 구축했다.
- 다중 해상도 REL 지도학습과 그룹 상대 정책 최적화를 통해 모델이 관련 영역을 찾고 강화된 해상도를 언제, 어떻게 사용할지 학습하도록 한다.
- RULER v1에서 72 DPI로 2.9배 입력 압축 달성 시 점수 87.4를 기록했으며, 동일 압축률 Glyph(57.5점)를 훨씬 넘어선다.
- LongBench에서 텍스트 기준(55.86점)을 초과한 56.40점, MRCR 매크로 평균 13.91포인트 향상, VTCBench에서 51.19 매크로 평균을 달성했다.
- 온라인 엔드투엔드 지연 평가에서 텍스트 대비 2.79배 처리 속도 향상을 보였다.
- 다중모달 기능은 보존되었으며, MMMU는 65.12에서 66.73, MME는 2424.02에서 2457.62로 개선되었다.