Hacker NewsAI · 머신러닝

하드웨어별 자동 최적화하는 오픈소스 추론 엔진 Magnitude 출시

원제 Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agents

120 포인트댓글 54
Key Point

로컬 추론 성능을 llama.cpp 대비 최대 2배 개선하면서 기존 에이전트와의 호환성을 유지한다는 점에서 에이전트 개발자와 프라이빗 AI 추론 사용자에게 실질적인 성능 이득이 생긴다.

핵심 요약

  • YC S25 배치 스타트업 Magnitude가 에이전트용 오픈소스 추론 엔진을 공개했다.
  • 기기별로 커널을 컴파일·튜닝해 오픈 모델을 llama.cpp보다 최대 2배 빠르게 실행한다(Metal에서 92% 더 빠름, CUDA에서 19% 더 빠름).
  • macOS, Windows, Linux에서 Apple Silicon, NVIDIA, AMD GPU 또는 CPU만으로 작동한다.
  • 데스크톱 앱 형태로 배포되며 Pi, OpenCode, Hermes, Codex, Claude Code 등 기존 에이전트와 원클릭 연결이 가능하다.
  • 에이전트당 메모리 사용량을 27% 줄이고, 세션 종료 시 메모리를 해제하며, 여러 세션이 프리픽스 캐시를 공유해 성능 저하를 방지한다.
  • OpenAI 호환 API로도 다른 에이전트와 연결할 수 있다.
  • 모든 프롬프트, 파일, 모델이 로컬에 유지되며 별도 인터넷 연결이 불필요하다.
  • Apache 2.0 라이선스 오픈소스이며 추론 토큰 비용이 없다.
  • llama.cpp, Ollama, LM Studio와 달리 특정 칩에 맞춰 커널을 튜닝하기 때문에 성능 이득이 생긴다.
  • 인기 오픈웨이트 모델 계열을 지원하며 손으로 최적화한 커널을 제공한다.
  • 모델 다운로드 후 추가 설정이나 CLI 별도 설치가 필요 없다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗