텍스트를 선택적으로 압축하는 FocusVTC, 긴 문맥 처리 속도 2.79배 향상
Key Point
긴 문맥을 처리하는 LLM 서비스에서 입력 토큰 수를 2.9배 줄이면서도 성능을 높이고 추론 속도를 2.79배 가속하는 방법이 제시되었으므로, 비용과 속도가 중요한 실제 배포 환경에서 직접 적용할 가치가 있다.
핵심 요약
- 대규모 언어모델의 장문맥 처리는 계산과 메모리 비용이 큰데, 시각 텍스트 압축(VTC)은 텍스트를 이미지로 렌더링해 입력 길이를 줄인다.
- 기존 방식은 해상도를 고정하므로 저DPI는 토큰을 절약하지만 가독성을 잃고, 고DPI는 불필요한 내용에 토큰을 낭비하는 문제가 있다.
- FocusVTC는 적응형 해상도로 이 트레이드오프를 깨뜨렸고, 압축된 저DPI 전역 뷰와 선택적 영역 강화를 결합한다.