Qwen 3.8 27B 최적화 모델, 13.1GB VRAM에서 99.63% 성능
원제 Shapelearn Qwen 3.8 27B (13.1 GB VRAM)
100 포인트댓글 38
Key Point
로컬에서 대규모 언어 모델을 최소 메모리로 효율적으로 운영하려는 개발자들에게 실질적인 선택지를 제시하는 벤치마크 기준을 제공한다.
핵심 요약
- ByteShape가 Qwen 3.8 27B의 GGUF 양자화 모델 'ShapeLearn'을 공개했다.
- GPU-5(IQ4_XS, 3.84bpw)는 13.1GB VRAM에서 BF16 기준 99.63% 정확도를 유지하며 90.4 토큰/초의 속도를 낸다.
- 메모리가 제한적이면 GPU-4(IQ3_S, 11.0GB)를 추천하며, 이는 98.72% 성능을 내면서 더 빠르다.
- MTP 임베디드 드래프트나 DFlash2 외부 드래프트로 추론 속도를 더 높일 수 있다.
- DFlash2는 텍스트 전용에서 가장 빠르지만 더 많은 메모리가 필요하고, MTP는 이미지 입력을 지원한다.