무게 9분의 1, 성능 98% 유지하는 경량 언어모델 Bonsai 2 공개
Key Point
극도로 경량화한 27B급 언어모델이 고성능을 유지하면서 개발자 기계에서 직접 실행 가능해지면서, 모델 압축 기술의 실용적 한계를 넓혔다.
핵심 요약
- PrismML이 극도로 압축한 언어모델 Bonsai 2 27B를 공개했으며, 5.9GB 크기로 노트북이나 단일 GPU에서 구동된다.
- FP16 대비 98.2% 수준의 성능을 유지하면서 원본의 약 9분의 1 크기를 달성했고, 수학은 반올림 수준의 정확도, 코딩은 기준 모델과 동일 수준이다.
- 3중 값(ternary) 가중치 기반이며 262K 토큰 콘텍스트, 비전 기능, OpenAI 방식의 도구 호출, 추론 기능을 지원한다.
- 가중치당 1.75비트 크기의 PTQ1_0 포장과 프롬프트 처리 속도가 빠른 PQ2_0 포장을 제공하며, 기본값은 후자다.
- Mac(Metal), Linux/Windows(CUDA/Vulkan/ROCm), CPU에서 로컬 실행 가능하고 두 개 명령으로 설정 완료된다.
- 이전 버전인 Bonsai(1비트)와 Ternary-Bonsai도 27B, 8B, 4B, 1.7B 크기로 계속 제공된다.
저장소 보기 ↗github.com