GitHub TrendingAI · 머신러닝오늘의 주요

NVIDIA/Model-Optimizer

NVIDIA Model Optimizer, 양자화·가지치기·증류 등 최적화 기법 통합 라이브러리 오픈소스화

원제 NVIDIA/Model-Optimizer

스타 4,304당일 +360Python
Key Point

DL 인퍼런스 배포 시 성능과 메모리 효율을 동시에 높이려는 개발자들에게 양자화, 가지치기, 증류 등을 통합 관리할 수 있는 공식 도구가 생겼고, 오픈소스로 누구나 기여 가능해졌다.

핵심 요약

  • NVIDIA Model Optimizer는 양자화, 가지치기(pruning), 신경망 구조 탐색(NAS), 증류, 추측 디코딩, 희소성 등 최신 모델 최적화 기법을 통합한 라이브러리다.
  • Hugging Face, PyTorch, ONNX 모델을 입력받아 Python API로 최적화 기법들을 조합해 적용하고, 최적화된 양자화 체크포인트를 생성한다.
  • 생성된 체크포인트는 TensorRT-LLM, vLLM, SGLang 등 인퍼런스 프레임워크에 바로 배포 가능하며, Megatron-Bridge 및 Hugging Face Accelerate와 통합돼 있다.
  • Qwen3.6-35B에 W4A4 NVFP4 양자화와 양자화 인식 증류를 적용하면 BF16 대비 vLLM 처리량이 1.30배 향상되고 체크포인트 크기는 3.1배 감소한다.
  • Nemotron 3 Ultra(550B) 모델을 NVFP4로 양자화하면 GLM-5.1 754B의 FP4 모델 대비 5.9배 높은 디코드 중심 인퍼런스 처리량을 달성하면서 BF16 정확도를 유지한다.
  • Nemotron-3-Nano-30B에 가지치기, 2단계 증류, FP8 양자화를 적용하면 vLLM 처리량이 2.6배, 메모리가 2.6배 감소한다.
  • Puzzletron 알고리즘으로 LLM과 VLM의 이질적 가지치기와 NAS를 수행할 수 있으며, 고객 사례로 Domyn이 Colosseum-355B를 260B로 압축했고 Bielik.AI가 33% 더 작고 50% 더 빠른 Bielik Minitron 7B를 만들었다.
  • Nemotron-3-Super의 FP8 및 NVFP4 양자화 체크포인트, DeepSeek-R1-FP4, Llama 3.3 70B, Llama 3.1 405B 등의 NVFP4 모델이 Hugging Face에서 다운로드 가능하다.
  • PyPI에서 `pip install nvidia-modelopt`로 설치 가능하며, NVIDIA 공식 컨테이너 이미지(pytorch, nemo, tensorrt-llm)에도 사전 설치돼 있다.
  • LLM/VLM 양자화, Diffusers 양자화, ONNX 양자화, Windows 양자화, 양자화 인식 훈련, 가지치기, 증류, 추측 디코딩 등 각 기법별 지원 행렬을 제공한다.
  • 2025년 1월 28일 오픈소스화됐으며, NVIDIA TensorRT Model Optimizer에서 NVIDIA Model Optimizer로 공식 브랜드 변경됐다.
  • 기여자를 환영하며 Contributing 가이드라인을 제공하고, Claude Code와 Codex 에이전트 기술도 지원한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗