Hacker NewsAI · 머신러닝

Qwen 3.8 27B 최적화 모델, 13.1GB VRAM에서 99.63% 성능

원제 Shapelearn Qwen 3.8 27B (13.1 GB VRAM)

100 포인트댓글 38
Key Point

로컬에서 대규모 언어 모델을 최소 메모리로 효율적으로 운영하려는 개발자들에게 실질적인 선택지를 제시하는 벤치마크 기준을 제공한다.

핵심 요약

  • ByteShape가 Qwen 3.8 27B의 GGUF 양자화 모델 'ShapeLearn'을 공개했다.
  • GPU-5(IQ4_XS, 3.84bpw)는 13.1GB VRAM에서 BF16 기준 99.63% 정확도를 유지하며 90.4 토큰/초의 속도를 낸다.
  • 메모리가 제한적이면 GPU-4(IQ3_S, 11.0GB)를 추천하며, 이는 98.72% 성능을 내면서 더 빠르다.
  • MTP 임베디드 드래프트나 DFlash2 외부 드래프트로 추론 속도를 더 높일 수 있다.
  • DFlash2는 텍스트 전용에서 가장 빠르지만 더 많은 메모리가 필요하고, MTP는 이미지 입력을 지원한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗