002새 버전Transformers 5.18.0 출시, Nemotron·NemotronH Omni 등 신모델 추가Nemotron 3 Diarization 오픈웨이트 모델이 추가되어 실시간 음성 화자 분리를 지원하며, 최대 8명의 화자를 처리할 수 있고 80ms부터 30.4s까지 구성 가능한 지연 시간 프로필을 제공한다.
AI · 머신러닝 · huggingface/transformers@v5.18.0
Transformers 5.18.0 출시, Nemotron·NemotronH Omni 등 신모델 추가
Key Point
Transformers는 파이토치의 표준 NLP 라이브러리이며, 이 버전은 실시간 음성 처리, 멀티모달 추론, 분산 학습 최적화 등 프로덕션 환경의 여러 문제를 해결한다.
핵심 요약
Nemotron 3 Diarization 오픈웨이트 모델이 추가되어 실시간 음성 화자 분리를 지원하며, 최대 8명의 화자를 처리할 수 있고 80ms부터 30.4s까지 구성 가능한 지연 시간 프로필을 제공한다.
NemotronH Omni 멀티모달 추론 모델은 Mamba-Transformer 언어 모델에 RADIO 비전 인코더와 Parakeet 사운드 인코더를 결합하여 텍스트, 이미지, 비디오, 음성을 동시에 처리한다.
HyperCLOVAX Vision V2는 NAVER가 개발한 멀티모달 모델로 Qwen2.5-VL 비전 인코더를 탑재하고 체인오브싱크 추론을 위한 thinking 토큰을 지원한다.
003▲ 65 · 댓글 3LLM 추론을 위한 '불일치 양자화', 프롬프트와 생성 단계별 최적화프롬프트 처리(Prefill)와 응답 생성(Decode)은 서로 다른 양자화 방식을 요구한다: Prefill은 저정밀 계산으로 빠른 처리가 필요하고, Decode는 컴팩트한 가중치로 메모리 대역폭을 줄이는 것이 중요하다.
AI · 머신러닝 · Disaggregated Quantization: Specializing LLM Prefill and Decode
LLM 추론을 위한 '불일치 양자화', 프롬프트와 생성 단계별 최적화
Key Point
LLM 추론의 Prefill과 Decode 두 단계에 서로 다른 양자화 전략을 적용해 정확도 손실 없이 처리 속도(첫 토큰까지 1.78배 단축)와 메모리 효율을 동시에 개선하는 방법론이 공개됐다.
핵심 요약
프롬프트 처리(Prefill)와 응답 생성(Decode)은 서로 다른 양자화 방식을 요구한다: Prefill은 저정밀 계산으로 빠른 처리가 필요하고, Decode는 컴팩트한 가중치로 메모리 대역폭을 줄이는 것이 중요하다.
연구진은 '불일치 양자화'(Disaggregated Quantization, DQ)를 제안했으며, 이는 두 단계별로 계산 형식·가중치·저장소 배치를 특화시킨다.
Qwen 3과 Gemma 3에서 Decode 단계의 활성화 양자화를 제거하면 생성 작업의 정확성이 향상되고 추론 비용은 증가하지 않는다.
004당일 +166C++로 만든 이미지 생성 엔진, Flux·Qwen 등 최신 모델까지 지원stable-diffusion.cpp는 GGML 기반의 순수 C/C++ 구현으로 Stable Diffusion, Flux, Wan, Qwen Image 등 다양한 이미지·영상 생성 모델을 추론할 수 있는 경량 프레임워크다.
AI · 머신러닝 · leejet/stable-diffusion.cpp · C++
C++로 만든 이미지 생성 엔진, Flux·Qwen 등 최신 모델까지 지원
Key Point
로컬 머신에서 최신 이미지·영상 생성 모델을 실행할 수 있는 경량 C++ 구현이 빠르게 성장하고 있으며, 모델 추가 속도가 빠르므로 개인 또는 온프레미스 AI 구축을 고려하는 개발자에게 선택지가 되고 있다.
핵심 요약
stable-diffusion.cpp는 GGML 기반의 순수 C/C++ 구현으로 Stable Diffusion, Flux, Wan, Qwen Image 등 다양한 이미지·영상 생성 모델을 추론할 수 있는 경량 프레임워크다.
외부 의존성이 없으며, 모델 무게 형식으로 PyTorch 체크포인트(.ckpt, .pth, .pt), Safetensors, GGUF를 지원하고 가중치를 .gguf나 .safetensors로 변환할 수 있다.