LLM 긴 문맥 추론 가속, KV 캐시 저비트 양자화 기법 WUSH-KV
Key Point
긴 문맥을 다루는 LLM의 추론 속도와 메모리 효율을 크게 개선할 수 있는 양자화 기법으로, 실제 프로덕션 환경에서 바로 적용 가능한 방법을 제시한다.
핵심 요약
- 컨텍스트 길이와 배치 크기가 늘어나면서 KV 캐시의 메모리와 대역폭 비용이 증가하여 긴 문맥 추론 효율이 떨어지는 문제를 해결하기 위해 WUSH-KV 기법을 제안했다.
- WUSH-KV는 행렬 곱셈의 두 인수에서 2차 통계량을 이용해 데이터 인식 변환을 구성하는 WUSH 방식을 KV 캐시에 적용한 것으로, 양자화 오류를 줄일 수 있다.
- 캘리브레이션 데이터로 key와 value에 대해 별도의 변환을 구성하며, value 변환은 모델 가중치에 포함시키고 key 변환은 RoPE 이후에 적용한다.