LLM 긴 문맥 추론 가속, KV 캐시 저비트 양자화 기법 WUSH-KV
원제 WUSH-KV: KV Cache Quantization with Data-Adaptive Transforms
추천 14댓글 2
Key Point
긴 문맥을 다루는 LLM의 추론 속도와 메모리 효율을 크게 개선할 수 있는 양자화 기법으로, 실제 프로덕션 환경에서 바로 적용 가능한 방법을 제시한다.
핵심 요약
- 컨텍스트 길이와 배치 크기가 늘어나면서 KV 캐시의 메모리와 대역폭 비용이 증가하여 긴 문맥 추론 효율이 떨어지는 문제를 해결하기 위해 WUSH-KV 기법을 제안했다.
- WUSH-KV는 행렬 곱셈의 두 인수에서 2차 통계량을 이용해 데이터 인식 변환을 구성하는 WUSH 방식을 KV 캐시에 적용한 것으로, 양자화 오류를 줄일 수 있다.
- 캘리브레이션 데이터로 key와 value에 대해 별도의 변환을 구성하며, value 변환은 모델 가중치에 포함시키고 key 변환은 RoPE 이후에 적용한다.
- 이 변환들은 클리핑된 양자화기와 함께 사용할 수 있으며, QuEST INT 양자화기의 경우 온화한 조건하에서 WUSH 변환이 거의 최적임을 보였다.
- WUSH-KV는 계층별 재구성 오류를 줄이고 테스트한 다른 변환들 중 가장 낮은 end-to-end perplexity를 달성했다.
- SGLang에 WUSH-KV를 통합하고 OSCAR 스타일의 백분위수 클리핑 아핀 양자화를 사용한 end-to-end 평가에서, 2비트 양자화 시 평가한 모든 모델과 다운스트림 작업에서 OSCAR 변환보다 같거나 우수한 성능을 보였다.