Hacker NewsAI · 머신러닝

27B 모델을 5.9GB로 압축, 98% 성능 유지

원제 Bonsai 2 27B: Near-Lossless Compression in a 9x Smaller Footprint

150 포인트댓글 49
Key Point

로컬 기기에서 대형 모델을 실용적으로 실행할 수 있는 경계가 넓어지며, 에너지 효율과 배포 가능성의 균형이 어디까지 갈 수 있는지를 보여주기 때문입니다.

핵심 요약

  • Qwen 3.8 27B 기반의 Ternary Bonsai 2 27B를 출시했으며, 삼진법 가중치와 FP16 그룹 스케일링으로 5.9GB 용량에 압축했다.
  • 전체 정밀도 모델 대비 9배 이상 작으면서 98.2% 성능을 유지하며, 262K 토큰 컨텍스트 윈도우와 멀티모달 기능을 지원한다.
  • 추론, 코딩, 비전, 에이전트 도구 사용 등에서 성능 저하를 최소화해 장시간 작업이나 다단계 처리에 유리하다.
  • NVIDIA RTX 5090에서 초당 143 토큰, M5 Max에서 초당 46.8 토큰 처리 가능하며, RTX 4090에서 8B 풀정밀도 모델보다 40% 에너지 효율이 좋다.
  • 로컬 디바이스에서 코딩 에이전트, 컴퓨터 사용 워크플로우, 문서 분석 등 실무 작업 수행이 가능해진다.
  • Apache 2.0 라이선스로 공개되며 NVIDIA GPU와 Apple 기기(MLX) 지원한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗