3진 LLM 압축의 1.585비트 벽을 깬다

Key Point
3진 LLM의 저장 용량을 근본적으로 줄이는 압축 기법으로, 엣지 기기부터 서버까지 추론 성능을 즉시 개선할 수 있다.
핵심 요약
- 3진 LLM의 가중치는 {-1, 0, +1} 세 개 심볼로만 저장되며, 기존 5진-트릿 패킹 방식은 가중치당 1.625비트가 소요된다.
- 29개 3진 LLM 모델을 분석하면 영(0)이 최대 51.5%를 차지해 심볼이 균등하지 않게 분포한다.
- BITCOS 레이아웃은 영(0) 밀도에 따라 적응적으로 압축하며, 가중치당 (2 - z)비트를 사용한다.
- 26개 모델에서 기존 방식보다 압축률이 높으며, 가장 희소한 모델에서는 1.485비트까지 낮춘다.
- AVX-512, AVX2, Intel Xe2 GPU에서 효율적으로 압축을 풀 수 있으며, 행렬 곱셈 커널 성능은 최대 1.28배, 전체 추론 처리량은 CPU에서 최대 1.18배, GPU에서 최대 1.27배 향상된다.