Neroued/ninfer
RTX 5090 전용 고성능 추론 엔진 NInfer 공개
원제 Neroued/ninfer
스타 1,949당일 +113C++
Key Point
단일 고사양 GPU에서 대규모 언어모델의 최고 속도 추론이 필요한 개발자나 기업에게 선택지를 제공하며, 양자화된 모델로도 높은 처리량을 유지하는 최적화 기법이 무엇인지 보여줍니다.
핵심 요약
- Qwen 3.5/3.6/3.8 모델의 단일 GPU 추론에 최적화된 C++/CUDA 엔진이 공개되었습니다.
- 텍스트, 이미지, 동영상 입력을 지원하며 로컬 CLI 또는 OpenAI/Anthropic 호환 HTTP API로 제공됩니다.
- RTX 5090에서 최대 8개 동시 요청을 처리할 수 있으며 1-8개 활성 요청의 고정 용량으로 특화되어 있습니다.
- Qwen3.6-27B/3.8-27B/3.6-35B-A3B용 공식 아티팩트 5개가 제공되며, groupwise-int와 NVFP4 양자화 포맷을 지원합니다.
- Qwen3.6-27B NVFP4는 8개 동시 요청 시 1,146.9 tok/s의 처리량을 달성하며, 단일 요청 대비 5.67배 성능 향상을 보입니다.
- Linux 64비트, CUDA 13.1, CMake 3.28 이상, C++20 컴파일러, FFmpeg 라이브러리가 필요하며 소스 트리에서만 실행됩니다.
저장소 보기 ↗github.com