쌓인 기록에서 찾기
무엇을 찾으세요? 날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위 2026년 8월 13일 (목) 부터 2026년 10월 4일 (일)까지 1665건
9건 · "llama.cpp"조건 지우기 ×
001 03:11 ▲ 101 · 댓글 19 Go 바이너리 하나로 로컬 LLM 구동하는 Janus 공개 Janus는 GGUF 모델을 GPU 또는 CPU에서 실행하는 단일 Go 바이너리로, Python·Docker·Ollama 없이도 작동한다. AI · 머신러닝 · Show HN: Janus – Go binary that runs GGUF models via Vulkan on AMD/Intel/Nvidia
Go 바이너리 하나로 로컬 LLM 구동하는 Janus 공개 Key Point 로컬 LLM 추론 환경에서 복잡한 의존성 없이 한 번에 실행 가능한 도구로, Ollama나 llama.cpp 대비 간단한 설정과 Go의 빌드 편의성을 제공한다.
핵심 요약
Janus는 GGUF 모델을 GPU 또는 CPU에서 실행하는 단일 Go 바이너리로, Python·Docker·Ollama 없이도 작동한다. Vulkan을 통해 AMD·Intel·NVIDIA GPU에서 추론을 수행하거나 CPU 폴백을 지원하며, OpenAI 호환 API(/v1/chat/completions, /v1/models)를 제공한다. 재시작 없이 GGUF 모델을 바꿀 수 있고, Cursor·Cline 같은 OpenAI 클라이언트와 연동되며, GGUF 메타데이터에서 자동으로 채팅 템플릿을 감지한다. 전체 요약 9문장 읽기 → 002 03:11 새 버전 Ollama v0.35.1 릴리스, 웹 검색 기능 강화 Ollama v0.35.1이 출시되었습니다. AI · 머신러닝 · ollama/ollama@v0.35.1
Ollama v0.35.1 릴리스, 웹 검색 기능 강화 Key Point 로컬 LLM 도구인 Ollama의 웹 검색 능력이 10배 확대되어 더 최신 정보를 기반으로 답변할 수 있게 됩니다.
핵심 요약
Ollama v0.35.1이 출시되었습니다. 한 응답당 최대 10개의 웹 검색을 수행할 수 있는 기능이 추가되었습니다. MLX와 llama.cpp 라이브러리가 최신 버전으로 업데이트되었습니다. 전체 요약 5문장 읽기 → 003 09:11 ▲ 120 · 댓글 54 하드웨어별 자동 최적화하는 오픈소스 추론 엔진 Magnitude 출시 YC S25 배치 스타트업 Magnitude가 에이전트용 오픈소스 추론 엔진을 공개했다. AI · 머신러닝 · Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agents
하드웨어별 자동 최적화하는 오픈소스 추론 엔진 Magnitude 출시 Key Point 로컬 추론 성능을 llama.cpp 대비 최대 2배 개선하면서 기존 에이전트와의 호환성을 유지한다는 점에서 에이전트 개발자와 프라이빗 AI 추론 사용자에게 실질적인 성능 이득이 생긴다.
핵심 요약
YC S25 배치 스타트업 Magnitude가 에이전트용 오픈소스 추론 엔진을 공개했다. 기기별로 커널을 컴파일·튜닝해 오픈 모델을 llama.cpp보다 최대 2배 빠르게 실행한다(Metal에서 92% 더 빠름, CUDA에서 19% 더 빠름). macOS, Windows, Linux에서 Apple Silicon, NVIDIA, AMD GPU 또는 CPU만으로 작동한다. 전체 요약 11문장 읽기 → 004 06:11 ▲ 65 · 댓글 3 LLM 추론을 위한 '불일치 양자화', 프롬프트와 생성 단계별 최적화 프롬프트 처리(Prefill)와 응답 생성(Decode)은 서로 다른 양자화 방식을 요구한다: Prefill은 저정밀 계산으로 빠른 처리가 필요하고, Decode는 컴팩트한 가중치로 메모리 대역폭을 줄이는 것이 중요하다. AI · 머신러닝 · Disaggregated Quantization: Specializing LLM Prefill and Decode
LLM 추론을 위한 '불일치 양자화', 프롬프트와 생성 단계별 최적화 Key Point LLM 추론의 Prefill과 Decode 두 단계에 서로 다른 양자화 전략을 적용해 정확도 손실 없이 처리 속도(첫 토큰까지 1.78배 단축)와 메모리 효율을 동시에 개선하는 방법론이 공개됐다.
핵심 요약
프롬프트 처리(Prefill)와 응답 생성(Decode)은 서로 다른 양자화 방식을 요구한다: Prefill은 저정밀 계산으로 빠른 처리가 필요하고, Decode는 컴팩트한 가중치로 메모리 대역폭을 줄이는 것이 중요하다. 연구진은 '불일치 양자화'(Disaggregated Quantization, DQ)를 제안했으며, 이는 두 단계별로 계산 형식·가중치·저장소 배치를 특화시킨다. Qwen 3과 Gemma 3에서 Decode 단계의 활성화 양자화를 제거하면 생성 작업의 정확성이 향상되고 추론 비용은 증가하지 않는다. 전체 요약 8문장 읽기 → 005 00:11 ▲ 109 · 댓글 30 LLM의 토큰 확률 읽어 단일 함수로 선택지 점수 매기기 LLM API의 로그프로브(logprobs) 기능을 활용해 한 개 토큰만 생성하도록 강제한 후 각 선택지별 확률을 추출하는 기법을 소개했다. AI · 머신러닝 · A single function Jev-like wrapper for LLMs, including vision models
LLM의 토큰 확률 읽어 단일 함수로 선택지 점수 매기기 Key Point LLM의 로그프로브를 활용해 단 한 줄의 함수로 복잡한 다중 선택 평가를 빠르게 구현할 수 있으며, 비전 모델도 지원해 실시간 이미지 분석 애플리케이션의 선택지 점수 매김에 즉시 적용 가능하다.
핵심 요약
LLM API의 로그프로브(logprobs) 기능을 활용해 한 개 토큰만 생성하도록 강제한 후 각 선택지별 확률을 추출하는 기법을 소개했다. 상태와 질문을 프롬프트로 보내고 max_completion_tokens를 1로 설정한 후 top_logprobs로 대안 토큰들의 확률을 받으면, 여러 질문이 같은 상태 접두사를 공유할 때 KV 캐시를 활용할 수 있다. 이 방식은 텍스트뿐 아니라 비전 모델과도 작동하며, 이미지를 base64로 인코딩해 전송할 수 있도록 Jev 요청 형식에 attachments 필드를 추가했다. 전체 요약 7문장 읽기 → 006 22:29 새 버전 Ollama v0.34.4 출시, 성능 개선 및 버그 수정 Structured outputs이 싱글 패스로 적용돼 사고 모델에서 더 빠르고 안정적으로 동작한다. AI · 머신러닝 · ollama/ollama@v0.34.4
Ollama v0.34.4 출시, 성능 개선 및 버그 수정 Key Point 로컬 LLM 실행 환경의 가장 대중적인 도구인 Ollama의 안정성과 성능이 개선되어, 특히 Apple Silicon 사용자의 추론 속도와 안정성이 크게 향상된다.
핵심 요약
Structured outputs이 싱글 패스로 적용돼 사고 모델에서 더 빠르고 안정적으로 동작한다. 대규모 로컬 라이브러리에서 발생하던 간헐적인 '모델 미발견' 오류를 수정했다. macOS 앱이 ChatGPT나 Codex 실행 여부 확인 시 응답 없음 상태가 되는 문제를 해결했다. 전체 요약 6문장 읽기 → 007 21:10 ▲ 100 · 댓글 38 Qwen 3.8 27B 최적화 모델, 13.1GB VRAM에서 99.63% 성능 ByteShape가 Qwen 3.8 27B의 GGUF 양자화 모델 'ShapeLearn'을 공개했다. AI · 머신러닝 · Shapelearn Qwen 3.8 27B (13.1 GB VRAM)
Qwen 3.8 27B 최적화 모델, 13.1GB VRAM에서 99.63% 성능 Key Point 로컬에서 대규모 언어 모델을 최소 메모리로 효율적으로 운영하려는 개발자들에게 실질적인 선택지를 제시하는 벤치마크 기준을 제공한다.
핵심 요약
ByteShape가 Qwen 3.8 27B의 GGUF 양자화 모델 'ShapeLearn'을 공개했다. GPU-5(IQ4_XS, 3.84bpw)는 13.1GB VRAM에서 BF16 기준 99.63% 정확도를 유지하며 90.4 토큰/초의 속도를 낸다. 메모리가 제한적이면 GPU-4(IQ3_S, 11.0GB)를 추천하며, 이는 98.72% 성능을 내면서 더 빠르다. 전체 요약 5문장 읽기 → 008 11:10 당일 +111 Ollama, 오픈소스 LLM 로컬 실행 플랫폼 Ollama는 Kimi-K2.6, GLM-5.2, DeepSeek, Qwen, Gemma 등 다양한 오픈소스 모델을 로컬에서 실행할 수 있는 플랫폼이다. AI · 머신러닝 · ollama/ollama · Go
Ollama, 오픈소스 LLM 로컬 실행 플랫폼 Key Point 개발 팀이 LLM을 클라우드 종속 없이 로컬에서 운영하고 싶을 때 실용적인 선택지가 필요하기 때문이다.
핵심 요약
Ollama는 Kimi-K2.6, GLM-5.2, DeepSeek, Qwen, Gemma 등 다양한 오픈소스 모델을 로컬에서 실행할 수 있는 플랫폼이다. macOS, Windows, Linux 데스크톱은 물론 Docker로도 제공되며, Python과 JavaScript 라이브러리를 통해 기존 애플리케이션에 통합할 수 있다. Claude Code, Codex, Copilot CLI 등 다양한 코딩 IDE와 통합 지원하고, OpenClaw를 통해 WhatsApp, Telegram, Slack, Discord 등 메신저 앱과 연동 가능하다. 전체 요약 5문장 읽기 → 009 11:10 당일 +107 로컬에서 빠르게 LLM 실행하는 llama.cpp, 고성능 추론 엔진 llama.cpp는 C/C++로 구현된 경량 LLM·VLM 추론 엔진으로, 별도 의존성 없이 다양한 하드웨어에서 최적화된 성능을 제공한다. AI · 머신러닝 · ggml-org/llama.cpp · C++
로컬에서 빠르게 LLM 실행하는 llama.cpp, 고성능 추론 엔진 Key Point 하드웨어 요구사항이 낮으면서도 다양한 플랫폼을 지원해 개인 PC에서도 대형 언어모델을 효율적으로 운영할 수 있다는 점이 실무에서 중요해지고 있다.
핵심 요약
llama.cpp는 C/C++로 구현된 경량 LLM·VLM 추론 엔진으로, 별도 의존성 없이 다양한 하드웨어에서 최적화된 성능을 제공한다. Apple Silicon의 Metal, ARM NEON, x86의 AVX/AVX512, RISC-V의 RVV 등 각 플랫폼별 명령어세트를 지원해 효율성을 극대화했다. 1.5~8비트 정수 양자화를 통해 추론 속도를 높이고 메모리 사용량을 줄일 수 있으며, NVIDIA GPU(CUDA), AMD GPU(HIP), Intel NPU 등 14개 이상의 백엔드를 지원한다. 전체 요약 4문장 읽기 →