Hacker NewsAI · 머신러닝오늘의 주요

Go 바이너리 하나로 로컬 LLM 구동하는 Janus 공개

원제 Show HN: Janus – Go binary that runs GGUF models via Vulkan on AMD/Intel/Nvidia

101 포인트댓글 19
Key Point

로컬 LLM 추론 환경에서 복잡한 의존성 없이 한 번에 실행 가능한 도구로, Ollama나 llama.cpp 대비 간단한 설정과 Go의 빌드 편의성을 제공한다.

핵심 요약

  • Janus는 GGUF 모델을 GPU 또는 CPU에서 실행하는 단일 Go 바이너리로, Python·Docker·Ollama 없이도 작동한다.
  • Vulkan을 통해 AMD·Intel·NVIDIA GPU에서 추론을 수행하거나 CPU 폴백을 지원하며, OpenAI 호환 API(/v1/chat/completions, /v1/models)를 제공한다.
  • 재시작 없이 GGUF 모델을 바꿀 수 있고, Cursor·Cline 같은 OpenAI 클라이언트와 연동되며, GGUF 메타데이터에서 자동으로 채팅 템플릿을 감지한다.
  • Windows 10/11, Linux, macOS에서 실행 가능하며 Go 1.22 이상만 필요하고, 디스크 용량은 모델 크기(2~8GB) 플러스 약 50MB다.
  • 설치는 저장소를 클론한 후 build.ps1로 빌드하고, Hugging Face에서 GGUF 파일을 models/ 폴더에 다운로드한 뒤 .env를 설정하여 실행한다.
  • .env에서 INFERENCE_BACKEND(vulkan/cpu/openrouter), JANUS_MODEL_PATH, JANUS_GPU_LAYERS, JANUS_MAX_TOKENS 등을 설정할 수 있다.
  • curl로 /health, /v1/chat/completions 엔드포인트를 호출하거나 스트리밍 모드로 사용할 수 있으며, Base URL http://127.0.0.1:8990/v1에 API 키는 공란으로 두고 연동한다.
  • 문제 해결 가이드는 윈도우에서 실행 중인 exe 파일을 덮어쓸 수 없는 문제, 포트 충돌, 모델 경로 오류, GPU 드라이버 문제 등을 다루고, 모델 로딩 시 10~60초 소요되는 것이 정상임을 명시한다.
  • MIT 라이선스이며 cmd/janus(메인 서버), cmd/modelget(모델 다운로더), internal/engine(llama.cpp 백엔드), internal/bridge(DLL 로더) 등으로 구성된다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗