쌓인 기록에서 찾기
무엇을 찾으세요? 날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위 2026년 8월 13일 (목) 부터 2026년 10월 4일 (일)까지 1665건
12건 · "로컬 LLM"조건 지우기 ×
001 03:11 ▲ 101 · 댓글 19 Go 바이너리 하나로 로컬 LLM 구동하는 Janus 공개 Janus는 GGUF 모델을 GPU 또는 CPU에서 실행하는 단일 Go 바이너리로, Python·Docker·Ollama 없이도 작동한다. AI · 머신러닝 · Show HN: Janus – Go binary that runs GGUF models via Vulkan on AMD/Intel/Nvidia
Go 바이너리 하나로 로컬 LLM 구동하는 Janus 공개 Key Point 로컬 LLM 추론 환경에서 복잡한 의존성 없이 한 번에 실행 가능한 도구로, Ollama나 llama.cpp 대비 간단한 설정과 Go의 빌드 편의성을 제공한다.
핵심 요약
Janus는 GGUF 모델을 GPU 또는 CPU에서 실행하는 단일 Go 바이너리로, Python·Docker·Ollama 없이도 작동한다. Vulkan을 통해 AMD·Intel·NVIDIA GPU에서 추론을 수행하거나 CPU 폴백을 지원하며, OpenAI 호환 API(/v1/chat/completions, /v1/models)를 제공한다. 재시작 없이 GGUF 모델을 바꿀 수 있고, Cursor·Cline 같은 OpenAI 클라이언트와 연동되며, GGUF 메타데이터에서 자동으로 채팅 템플릿을 감지한다. 전체 요약 9문장 읽기 → 002 00:11 ▲ 118 · 댓글 61 Tmux처럼 동작하는 OS 설계: 작업 중심 윈도 관리 저자는 Scott Jenson의 데스크톱 UX 혁신에 관한 강연에서 영감을 받아, 현재의 윈도 관리 시스템이 하드웨어 제약이 사라진 지 오래되었는데도 그대로 유지되고 있다고 지적한다. 기타 · Make Tmux the OS
Tmux처럼 동작하는 OS 설계: 작업 중심 윈도 관리 Key Point 작업별 윈도 관리 개념은 20~40년 전 연구에서 나왔는데도 주요 OS에서 기본 기능으로 구현되지 않은 이유, 그리고 LLM이 이를 해결할 수 있는지를 구체적으로 탐색하는 글이다.
핵심 요약
저자는 Scott Jenson의 데스크톱 UX 혁신에 관한 강연에서 영감을 받아, 현재의 윈도 관리 시스템이 하드웨어 제약이 사라진 지 오래되었는데도 그대로 유지되고 있다고 지적한다. 현대 OS의 윈도 관리 문제는 크게 네 가지로 나뉜다: 모니터 개수와 배치의 빈번한 변화, 사람마다 다른 윈도 사용 방식, 브라우저가 실질적인 미니 OS 역할을 하는 현실, 파일시스템이 약해진 개념이 되었다는 점이다. 1986년 Rooms, 2004년 WindowScape 등 기존 연구들은 이미 작업별 윈도 그룹화의 필요성을 보였고, 최근 Windows Timeline, Windows Sets, macOS Stage Manager, KDE Activities 등이 시도했지만 기본 설정이 아니거나 수동 설정이 필요해 대중화되지 못했다. 전체 요약 9문장 읽기 → 003 21:11 당일 +192 프로덕션 RAG 시스템을 7주에 실전 구축하기 arXiv 논문을 자동으로 수집하고 분석하는 AI 연구 어시스턴트를 직접 만드는 실습 강좌다. AI · 머신러닝 · jamwithai/production-agentic-rag-course · Python
프로덕션 RAG 시스템을 7주에 실전 구축하기 Key Point 기업 수준의 RAG 시스템 구축 방식을 처음부터 끝까지 직접 구현하며 배울 수 있으며, 에이전트 기반의 지능형 검색과 모니터링을 모두 다루기 때문이다.
핵심 요약
arXiv 논문을 자동으로 수집하고 분석하는 AI 연구 어시스턴트를 직접 만드는 실습 강좌다. Week 1-7에 걸쳐 Docker, FastAPI, PostgreSQL, OpenSearch, Airflow 등 현대적 스택으로 인프라를 구축한다. Week 2는 arXiv API와 Docling을 이용한 PDF 파싱으로 데이터 파이프라인을 자동화한다. 전체 요약 12문장 읽기 → 004 09:11 ▲ 125 · 댓글 35 Redis 만든 개발자, 로컬에서 돌리는 LLM 엔진 공개 Redis 창시자 안티레즈가 개발한 DwarfStar 4(DS4)는 고용량 맥, NVIDIA, AMD 머신에서 대규모 AI 모델을 로컬로 실행하는 C 기반 추론 엔진이다. AI · 머신러닝 · From the creator of Redis; run LLM locally with ds4
Redis 만든 개발자, 로컬에서 돌리는 LLM 엔진 공개 Key Point Redis 개발자의 로컬 LLM 엔진으로, 대규모 모델을 개인 머신에서 완전히 제어하며 실행할 수 있는 기술 경로를 제시해 오픈소스 AI 스택의 선택지를 확대한다.
핵심 요약
Redis 창시자 안티레즈가 개발한 DwarfStar 4(DS4)는 고용량 맥, NVIDIA, AMD 머신에서 대규모 AI 모델을 로컬로 실행하는 C 기반 추론 엔진이다. DeepSeek V4, V4.1 Flash, GLM 5.x, Qwen 3.8 Flash 등을 지원하며 텍스트·비전 모델, 로컬 API, CLI, 네이티브 에이전트를 제공한다. 핵심 기술은 라우팅된 전문가 모델의 비필수 부분을 2비트 양자화로 압축하면서 중요한 경로는 정밀도를 유지하는 비대칭 양자화다. 전체 요약 7문장 읽기 → 005 03:11 새 버전 Ollama v0.35.1 릴리스, 웹 검색 기능 강화 Ollama v0.35.1이 출시되었습니다. AI · 머신러닝 · ollama/ollama@v0.35.1
Ollama v0.35.1 릴리스, 웹 검색 기능 강화 Key Point 로컬 LLM 도구인 Ollama의 웹 검색 능력이 10배 확대되어 더 최신 정보를 기반으로 답변할 수 있게 됩니다.
핵심 요약
Ollama v0.35.1이 출시되었습니다. 한 응답당 최대 10개의 웹 검색을 수행할 수 있는 기능이 추가되었습니다. MLX와 llama.cpp 라이브러리가 최신 버전으로 업데이트되었습니다. 전체 요약 5문장 읽기 → 007 22:29 새 버전 Ollama v0.34.4 출시, 성능 개선 및 버그 수정 Structured outputs이 싱글 패스로 적용돼 사고 모델에서 더 빠르고 안정적으로 동작한다. AI · 머신러닝 · ollama/ollama@v0.34.4
Ollama v0.34.4 출시, 성능 개선 및 버그 수정 Key Point 로컬 LLM 실행 환경의 가장 대중적인 도구인 Ollama의 안정성과 성능이 개선되어, 특히 Apple Silicon 사용자의 추론 속도와 안정성이 크게 향상된다.
핵심 요약
Structured outputs이 싱글 패스로 적용돼 사고 모델에서 더 빠르고 안정적으로 동작한다. 대규모 로컬 라이브러리에서 발생하던 간헐적인 '모델 미발견' 오류를 수정했다. macOS 앱이 ChatGPT나 Codex 실행 여부 확인 시 응답 없음 상태가 되는 문제를 해결했다. 전체 요약 6문장 읽기 → 008 21:11 ▲ 253 · 댓글 83 25줄의 파이썬으로 구현한 Jev Jev는 주어진 선택지에 대해 확률을 출력하는 분류 모델로, 로컬에서 실행되며 데이터를 외부로 보내지 않는다. AI · 머신러닝 · Jev in 25 Lines of Python
25줄의 파이썬으로 구현한 Jev Key Point 로컬 LLM만으로 프롬프트 기반 분류를 확률값으로 변환하는 간단한 방법을 제시하므로, 프라이빗한 분류 작업이 필요한 개발자에게 실용적이다.
핵심 요약
Jev는 주어진 선택지에 대해 확률을 출력하는 분류 모델로, 로컬에서 실행되며 데이터를 외부로 보내지 않는다. 저자는 Qwen3-0.6B 모델을 로드하고 선택지의 로짓값을 계산한 후 소프트맥스를 적용해 확률을 도출하는 방식으로 Jev를 구현했다. 합성 데이터 생성, API 호출, 강화학습 기반 캘리브레이션 등 복잡한 방법 없이도 기본 확률 계산만으로 Jev를 구현할 수 있음을 보여준다. 009 21:10 ▲ 100 · 댓글 38 Qwen 3.8 27B 최적화 모델, 13.1GB VRAM에서 99.63% 성능 ByteShape가 Qwen 3.8 27B의 GGUF 양자화 모델 'ShapeLearn'을 공개했다. AI · 머신러닝 · Shapelearn Qwen 3.8 27B (13.1 GB VRAM)
Qwen 3.8 27B 최적화 모델, 13.1GB VRAM에서 99.63% 성능 Key Point 로컬에서 대규모 언어 모델을 최소 메모리로 효율적으로 운영하려는 개발자들에게 실질적인 선택지를 제시하는 벤치마크 기준을 제공한다.
핵심 요약
ByteShape가 Qwen 3.8 27B의 GGUF 양자화 모델 'ShapeLearn'을 공개했다. GPU-5(IQ4_XS, 3.84bpw)는 13.1GB VRAM에서 BF16 기준 99.63% 정확도를 유지하며 90.4 토큰/초의 속도를 낸다. 메모리가 제한적이면 GPU-4(IQ3_S, 11.0GB)를 추천하며, 이는 98.72% 성능을 내면서 더 빠르다. 전체 요약 5문장 읽기 → 010 21:11 ▲ 179 · 댓글 98 브라우저에서 LLM 의사결정 방식 직접 비교 OpenJev는 로컬 LLM이 선택지별 확률을 계산하는 두 가지 방식을 브라우저에서 직접 비교하는 인터랙티브 도구다. 기타 · OpenJev
브라우저에서 LLM 의사결정 방식 직접 비교 Key Point 두 의사결정 방식의 성능 차이를 실측할 수 있어, LLM을 실제 애플리케이션에 활용할 때 최적의 방법을 선택하는 데 도움이 된다. ai
핵심 요약
OpenJev는 로컬 LLM이 선택지별 확률을 계산하는 두 가지 방식을 브라우저에서 직접 비교하는 인터랙티브 도구다. 한 방식은 모델의 로짓(logits)을 직접 읽어 정규화하고, 다른 방식은 모델이 확률을 JSON 텍스트로 생성하도록 요청한다. Qwen3 0.6B(639MB), MiniCPM5 2B(1.56GB), Qwen3.5 4B(3.01GB) 세 가지 크기의 모델을 선택해 실행할 수 있다. 전체 요약 5문장 읽기 → 011 03:10 당일 +205 로컬에서 구축하는 ChatGPT, AnythingLLM AnythingLLM은 로컬 중심의 올인원 AI 애플리케이션으로, 개인이 소유할 수 있는 프라이빗 ChatGPT를 구축할 수 있다. AI · 머신러닝 · Mintplex-Labs/anything-llm · JavaScript
로컬에서 구축하는 ChatGPT, AnythingLLM Key Point 로컬 LLM의 활용을 원하는 개발자와 기업이 기술적 진입장벽 없이 프라이빗 AI 시스템을 구축하고 운영할 수 있게 되어, 클라우드 기반 AI 서비스의 종속성을 줄일 수 있다.
핵심 요약
AnythingLLM은 로컬 중심의 올인원 AI 애플리케이션으로, 개인이 소유할 수 있는 프라이빗 ChatGPT를 구축할 수 있다. 문서 업로드, AI 에이전트, 동적 모델 라우팅, 사용자 메모리, 스케줄된 작업 등 추가 설정 없이 기본으로 제공된다. OpenAI, Claude, Ollama, LocalAI 등 30개 이상의 로컬·클라우드 LLM 제공자와 벡터 데이터베이스를 지원한다. 전체 요약 5문장 읽기 → 012 08:12 당일 +109 Claude 기반 AI 에이전트 운영 플랫폼 Ruflo 공개 Claude Code/Codex를 위한 에이전트 메타-하니스로, 100개 이상의 전문화된 에이전트를 제공하고 다중 에이전트 스웜을 조직하며 자율 워크플로우를 조정합니다. AI · 머신러닝 · ruvnet/ruflo · TypeScript
Claude 기반 AI 에이전트 운영 플랫폼 Ruflo 공개 Key Point 에이전트 기반 자동화를 원하는 개발자에게 기존의 개별 도구 학습 부담 없이 통합된 플랫폼으로 멀티 에이전트 시스템을 구축하는 새로운 방식을 제시합니다.
핵심 요약
Claude Code/Codex를 위한 에이전트 메타-하니스로, 100개 이상의 전문화된 에이전트를 제공하고 다중 에이전트 스웜을 조직하며 자율 워크플로우를 조정합니다. 메모리 기능으로 세션 간 학습을 저장하고, RAG 통합으로 지능형 검색을 지원하며, 페더레이션 커뮤니케이션으로 여러 머신의 에이전트가 안전하게 협력합니다. npx ruflo init 명령어로 초기화하면 자동으로 에이전트가 스웜을 조직하고, 성공한 패턴을 학습하고, 백그라운드에서 작업을 조정하며 사용자는 일반 코딩만 계속합니다. 전체 요약 5문장 읽기 →