GitHub TrendingAI · 머신러닝

antirez/ds4

DeepSeek와 GLM을 개인 하드웨어에서 돌리는 경량 추론 엔진 공개

원제 antirez/ds4

스타 23,364당일 +211C
Key Point

개인 맥이나 워크스테이션에서 DeepSeek·GLM 같은 최신 고성능 모델을 실제로 돌릴 수 있는 구체적인 방법과 제약조건(메모리, SSD 스트리밍 필요 여부)이 명확해진다.

핵심 요약

  • Salvatore Sanfilippo가 만든 DwarfStar는 DeepSeek V4/V4.1 Flash, GLM 5.2/5.3, Qwen3.8 Flash 등 주요 오픈웨이트 모델을 개인 하드웨어에서 실행하는 네이티브 추론 엔진으로, Metal·CUDA·ROCm을 지원한다.
  • 일반적인 GGUF 러너가 아니라 특정 모델 몇 개에 최적화된 자체 포함 C 코드이며, 프로젝트가 생산한 GGUF 파일만 사용한다.
  • Metal은 애플 실리콘 맥(96GB 이상, 또는 SSD 스트리밍으로 더 작은 기계에서도 가능)을 주요 대상으로, CUDA는 DGX Spark와 Ada/L40S 카드를 포함한 다중 GPU 시스템을 지원하며, ROCm은 Strix Halo 같은 시스템을 대상으로 한다.
  • 128GB 맥 두 대를 RDMA로 연결하면 tensor parallelism으로 4비트 모델을 실행할 수 있고, pipeline parallelism으로 여러 시스템을 연결해 메모리를 합칠 수 있다.
  • 대화형 CLI 도구(ds4), HTTP 서버, 네이티브 코딩 에이전트(ds4-agent)를 제공하며, 다중 턴 대화와 도구 호출, 비전 모델, speculative decoding, KV 캐시 저장·복원을 지원한다.
  • DeepSeek V4 Flash Q2는 SSD 스트리밍으로 128GB 맥 한 대에서 실행 가능하고, Q4 버전은 SSD 스트리밍이 필요하거나 512GB 맥이 필요하다.
  • Qwen3.8 Flash의 Q2는 가중치 41.73GB, 95.37GB의 BF16 n-gram을 디스크에서 직접 읽는 형태로 64GB 맥을 지원한다.
  • 생각 모드(thinking)를 기본 활성화하며, DeepSeek V4.1은 1~100의 추론 수준 조절이 가능하고, directional steering으로 생성 방향을 조종할 수 있다.
  • M5 Max 128GB 맥에서 DeepSeek V4 Flash Q2 기준으로 성능 측정을 제공하며, ds4-eval로 회귀 테스트를 실행할 수 있다.
  • 프로젝트는 llama.cpp와 GGML 위의 기반을 이용했고, 개발 과정에서 AI 코딩 에이전트의 강력한 지원을 받았으며 이를 명시적으로 공개하고 있다.
  • 사용자는 코딩 에이전트를 통해 소프트웨어를 특정 하드웨어에 맞게 수정하거나 문서화되지 않은 기능을 구현할 수 있도록 설계되었다.
  • 프로젝트는 현재 빠르게 변화 중인 베타 단계이며, 각 릴리스 전에 QA를 실행하지만 불안정성과 회귀는 가능하다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗