RTX 5090 전용 고성능 추론 엔진 NInfer 공개
Key Point
단일 고사양 GPU에서 대규모 언어모델의 최고 속도 추론이 필요한 개발자나 기업에게 선택지를 제공하며, 양자화된 모델로도 높은 처리량을 유지하는 최적화 기법이 무엇인지 보여줍니다.
핵심 요약
- Qwen 3.5/3.6/3.8 모델의 단일 GPU 추론에 최적화된 C++/CUDA 엔진이 공개되었습니다.
- 텍스트, 이미지, 동영상 입력을 지원하며 로컬 CLI 또는 OpenAI/Anthropic 호환 HTTP API로 제공됩니다.
- RTX 5090에서 최대 8개 동시 요청을 처리할 수 있으며 1-8개 활성 요청의 고정 용량으로 특화되어 있습니다.
- Qwen3.6-27B/3.8-27B/3.6-35B-A3B용 공식 아티팩트 5개가 제공되며, groupwise-int와 NVFP4 양자화 포맷을 지원합니다.
- Qwen3.6-27B NVFP4는 8개 동시 요청 시 1,146.9 tok/s의 처리량을 달성하며, 단일 요청 대비 5.67배 성능 향상을 보입니다.
- Linux 64비트, CUDA 13.1, CMake 3.28 이상, C++20 컴파일러, FFmpeg 라이브러리가 필요하며 소스 트리에서만 실행됩니다.
저장소 보기 ↗github.com