쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 17일 (목)까지580건
2건 · "LLM 추론"조건 지우기 ×
001당일 +113RTX 5090 전용 고성능 추론 엔진 NInfer 공개Qwen 3.5/3.6/3.8 모델의 단일 GPU 추론에 최적화된 C++/CUDA 엔진이 공개되었습니다.인프라 · 데브옵스 · Neroued/ninfer · C++
RTX 5090 전용 고성능 추론 엔진 NInfer 공개

Key Point단일 고사양 GPU에서 대규모 언어모델의 최고 속도 추론이 필요한 개발자나 기업에게 선택지를 제공하며, 양자화된 모델로도 높은 처리량을 유지하는 최적화 기법이 무엇인지 보여줍니다.
핵심 요약
- Qwen 3.5/3.6/3.8 모델의 단일 GPU 추론에 최적화된 C++/CUDA 엔진이 공개되었습니다.
- 텍스트, 이미지, 동영상 입력을 지원하며 로컬 CLI 또는 OpenAI/Anthropic 호환 HTTP API로 제공됩니다.
- RTX 5090에서 최대 8개 동시 요청을 처리할 수 있으며 1-8개 활성 요청의 고정 용량으로 특화되어 있습니다.
- Qwen3.6-27B/3.8-27B/3.6-35B-A3B용 공식 아티팩트 5개가 제공되며, groupwise-int와 NVFP4 양자화 포맷을 지원합니다.
- Qwen3.6-27B NVFP4는 8개 동시 요청 시 1,146.9 tok/s의 처리량을 달성하며, 단일 요청 대비 5.67배 성능 향상을 보입니다.
- Linux 64비트, CUDA 13.1, CMake 3.28 이상, C++20 컴파일러, FFmpeg 라이브러리가 필요하며 소스 트리에서만 실행됩니다.
002▲ 143 · 댓글 53vLLM이 AMD GPU에서 추측 디코딩 지원vLLM이 추측 디코딩(speculative decoding) 기능을 AMD Instinct MI300X·MI355X GPU와 ROCm에서 구현했다.AI · 머신러닝 · Speculative Decoding in vLLM on AMD GPUs
vLLM이 AMD GPU에서 추측 디코딩 지원

Key PointLLM 추론 성능 최적화를 위한 주요 기법이 AMD GPU에서 실제 구현되어, 장기 생성 작업의 처리량 개선 가능성을 보여준다.
핵심 요약
- vLLM이 추측 디코딩(speculative decoding) 기능을 AMD Instinct MI300X·MI355X GPU와 ROCm에서 구현했다.
- 추측 디코딩은 경량 드래프트 모듈이 여러 토큰을 먼저 제안하고 타겟 모델이 한 번에 검증하는 방식으로, 기존 자동회귀 디코딩보다 모델 통과 횟수를 줄인다.
- 표준 방식은 토큰 하나당 모델 실행 1회가 필요하지만, 추측 디코딩은 여러 드래프트 토큰이 검증을 통과하면 단일 모델 실행으로 여러 토큰을 커밋할 수 있다.
- Native MTP, Gemma 4 MTP, EAGLE-3, DFlash, DSpark 등 5가지 드래프팅 방식을 검토했으며, 방식·제안 길이·모델 종류·수용 동작 등에 따라 처리량 개선 효과가 달라진다.
- 드래프트 토큰이 거부되면 거부 지점 이후의 토큰들은 폐기되고 타겟 모델의 결과로 생성을 계속한다.