Hacker NewsAI · 머신러닝

3진 LLM 압축의 1.585비트 벽을 깬다

원제 Breaking the 1.58-bit Barrier for Ternary LLMs

117 포인트댓글 11
Key Point

3진 LLM의 저장 용량을 근본적으로 줄이는 압축 기법으로, 엣지 기기부터 서버까지 추론 성능을 즉시 개선할 수 있다.

핵심 요약

  • 3진 LLM의 가중치는 {-1, 0, +1} 세 개 심볼로만 저장되며, 기존 5진-트릿 패킹 방식은 가중치당 1.625비트가 소요된다.
  • 29개 3진 LLM 모델을 분석하면 영(0)이 최대 51.5%를 차지해 심볼이 균등하지 않게 분포한다.
  • BITCOS 레이아웃은 영(0) 밀도에 따라 적응적으로 압축하며, 가중치당 (2 - z)비트를 사용한다.
  • 26개 모델에서 기존 방식보다 압축률이 높으며, 가장 희소한 모델에서는 1.485비트까지 낮춘다.
  • AVX-512, AVX2, Intel Xe2 GPU에서 효율적으로 압축을 풀 수 있으며, 행렬 곱셈 커널 성능은 최대 1.28배, 전체 추론 처리량은 CPU에서 최대 1.18배, GPU에서 최대 1.27배 향상된다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗