하드웨어별 자동 최적화하는 오픈소스 추론 엔진 Magnitude 출시
Key Point
로컬 추론 성능을 llama.cpp 대비 최대 2배 개선하면서 기존 에이전트와의 호환성을 유지한다는 점에서 에이전트 개발자와 프라이빗 AI 추론 사용자에게 실질적인 성능 이득이 생긴다.
핵심 요약
- YC S25 배치 스타트업 Magnitude가 에이전트용 오픈소스 추론 엔진을 공개했다.
- 기기별로 커널을 컴파일·튜닝해 오픈 모델을 llama.cpp보다 최대 2배 빠르게 실행한다(Metal에서 92% 더 빠름, CUDA에서 19% 더 빠름).
- macOS, Windows, Linux에서 Apple Silicon, NVIDIA, AMD GPU 또는 CPU만으로 작동한다.