쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 11일 (금)까지270건
9건 · "Qwen"조건 지우기 ×
001당일 +130일반 PC에서 744B 규모 대규모 언어모델 실행하는 C 엔진 공개Colibrì는 순수 C와 의존성 없이 744B~2.8T 규모 MoE 모델을 일반 하드웨어에서 실행하는 추론 엔진이다.오픈소스 · 도구 · JustVugg/colibri · C
일반 PC에서 744B 규모 대규모 언어모델 실행하는 C 엔진 공개

Key Point소유한 PC로 최대 2.8T 규모 모델을 실행할 수 있는 가능성을 보여주며, 하이퍼스케일러 하드웨어 의존성을 제거해 대규모 모델 접근성을 크게 낮춘다.
핵심 요약
- Colibrì는 순수 C와 의존성 없이 744B~2.8T 규모 MoE 모델을 일반 하드웨어에서 실행하는 추론 엔진이다.
- VRAM, RAM, 디스크를 하나의 계층 구조로 취급해 제한된 고속 메모리에서도 모델 정확도를 유지하며 속도만 조절된다.
- GLM, Kimi, DeepSeek, Qwen 등 8개 모델 계열을 지원하며 각각 하나의 C 파일로 구현되어 동일한 인터페이스(coli chat/serve/web)를 사용한다.
- 라우팅 히트 기반 LRU, I/O 최적화, 이질적 실행(CPU/GPU/메탈), 압축 상태 등 다층 최적화 기법으로 추론 속도와 비용을 개선한다.
- 모든 최적화는 실제 하드웨어에서 정량 측정한 결과를 바탕으로만 채택하며, 모델 의미론을 몰래 바꾸지 않는 것을 보장한다.
002▲ 159 · 댓글 65Qwen 3.8이 GPT-5.5 Pro의 추론 과정을 흡수했다GPT-5.5 Pro의 추론 시작 부분 1%를 다른 모델에 주입한 후 두 모델의 응답이 얼마나 유사한지 측정하는 실험을 진행했다.AI · 머신러닝 · Qwen 3.8 follows GPT-5.5 Pro reasoning prefills
Qwen 3.8이 GPT-5.5 Pro의 추론 과정을 흡수했다

Key Point오픈 소스 모델이 대형 상용 모델의 추론 방식을 얼마나 모사할 수 있는지, 특히 학습 데이터의 출처가 무엇인지 보여주는 분석이다.
핵심 요약
- GPT-5.5 Pro의 추론 시작 부분 1%를 다른 모델에 주입한 후 두 모델의 응답이 얼마나 유사한지 측정하는 실험을 진행했다.
- Qwen 3.8은 프리필 없을 때 16.79% 일치도에서 프리필 적용 시 34.97%로 +18.18 포인트 향상되어 가장 큰 변화를 보였다.
- Kimi K3는 GPT-5.5 Pro와의 기본 일치도가 31.11%로 가장 높지만 프리필의 추가 효과는 4.54 포인트에 불과했다.
- STEM 문제에서는 +26.99 포인트, 비STEM에서는 +12.80 포인트, 합성 퍼즐에서는 +14.75 포인트로 범주별로 다르게 나타났다.
- 분석 결과 Qwen이 이전 실험의 Opus와는 달리 GPT-5.5 Pro나 관련 GPT 모델에서 학습했을 가능성을 시사한다.
003당일 +139음성 클론부터 AI 에이전트 연동까지, 로컬 기반 AI 음성 스튜디오오픈소스 AI 음성 스튜디오 Voicebox는 ElevenLabs와 Whisper Flow의 기능을 하나로 통합한 로컬 우선 솔루션으로, 모든 데이터가 기기에서만 처리된다.AI · 머신러닝 · jamiepine/voicebox · TypeScript
음성 클론부터 AI 에이전트 연동까지, 로컬 기반 AI 음성 스튜디오

Key Point클라우드 의존을 벗어나 개인 기기에서 음성 클론, 생성, 인식, AI 연동을 모두 제어할 수 있는 완전한 로컬 솔루션이 등장했기 때문이다.
핵심 요약
- 오픈소스 AI 음성 스튜디오 Voicebox는 ElevenLabs와 Whisper Flow의 기능을 하나로 통합한 로컬 우선 솔루션으로, 모든 데이터가 기기에서만 처리된다.
- 음성 클론, 음성 생성(23개 언어 지원), 딕테이션, AI 에이전트 음성 출력까지 완전한 음성 입출력 스택을 7개 TTS 엔진으로 제공한다.
- Qwen3-TTS, Qwen CustomVoice, LuxTTS, Chatterbox 시리즈, HumeAI TADA, Kokoro 등 각 엔진이 서로 다른 강점을 가지며, Chatterbox Turbo만 [laugh], [sigh] 같은 감정 태그를 해석한다.
- 피치 시프트, 리버브, 컴프레션 등 8가지 오디오 이펙트와 자동 청킹, 멀티트랙 에디터, 음성 기반 페르소나 시스템을 갖춘다.
- macOS(Apple Silicon/Intel), Windows, Linux, Docker 등 다양한 플랫폼을 지원하며, Tauri 기반으로 Electron이 아닌 네이티브 성능을 제공한다.
- REST API와 MCP 서버를 내장해 커스텀 앱과 에이전트(Claude Code, Cursor, Cline)에 음성 입출력을 통합할 수 있다.
004당일 +111Ollama, 오픈소스 LLM 로컬 실행 플랫폼Ollama는 Kimi-K2.6, GLM-5.2, DeepSeek, Qwen, Gemma 등 다양한 오픈소스 모델을 로컬에서 실행할 수 있는 플랫폼이다.AI · 머신러닝 · ollama/ollama · Go
Ollama, 오픈소스 LLM 로컬 실행 플랫폼

Key Point개발 팀이 LLM을 클라우드 종속 없이 로컬에서 운영하고 싶을 때 실용적인 선택지가 필요하기 때문이다.
핵심 요약
- Ollama는 Kimi-K2.6, GLM-5.2, DeepSeek, Qwen, Gemma 등 다양한 오픈소스 모델을 로컬에서 실행할 수 있는 플랫폼이다.
- macOS, Windows, Linux 데스크톱은 물론 Docker로도 제공되며, Python과 JavaScript 라이브러리를 통해 기존 애플리케이션에 통합할 수 있다.
- Claude Code, Codex, Copilot CLI 등 다양한 코딩 IDE와 통합 지원하고, OpenClaw를 통해 WhatsApp, Telegram, Slack, Discord 등 메신저 앱과 연동 가능하다.
- REST API를 제공해 모델 실행과 관리를 프로그래밍 방식으로 제어할 수 있으며, llama.cpp를 기반으로 동작한다.
- Open WebUI, LibreChat, Lobe Chat, Perplexica 등 30개 이상의 오픈소스 커뮤니티 프로젝트가 Ollama와 통합되어 웹 인터페이스, 데스크톱 클라이언트, RAG 챗봇 등을 제공한다.
005▲ 218 · 댓글 107Qwen 3.8 27B, 4비트 양자화까지는 성능 유지원본 모델 55GB에 비해 4비트 Q4_K_M(17GB)은 Terminal-Bench 2.1 등 주요 벤치마크에서 동일한 성능을 유지한다.AI · 머신러닝 · Benchmarking Qwen3.8 27B quantizations: 4-bit holds up, 1-bit collapses
Qwen 3.8 27B, 4비트 양자화까지는 성능 유지

Key Point로컬에서 대형 언어 모델을 실행할 때 양자화 정도별로 실제 성능이 어떻게 달라지는지 벤치마크로 확인한 첫 실측 데이터라, 제한된 GPU 메모리 환경에서 모델 선택을 할 때 직접적인 참고 기준이 된다.
핵심 요약
- 원본 모델 55GB에 비해 4비트 Q4_K_M(17GB)은 Terminal-Bench 2.1 등 주요 벤치마크에서 동일한 성능을 유지한다.
- RTX 4090(24GB) 같은 소비자 GPU에서도 약 64k 토큰 컨텍스트를 남기며 실행 가능하다.
- 2비트 양자화는 조금 낮은 성능을 보이지만 10.7GB로 감소하고 실용적 수준을 유지한다.
- 1비트 양자화에서는 GPQA Diamond 벤치마크에서 무작위 추측 수준으로 성능이 붕괴되며, 긴 추론일수록 악화된다.
- 저자는 $3,000 규모의 GPU 비용을 들여 GPQA Diamond, IFBench, Terminal-Bench 2.1 세 벤치마크에서 실측했다.
- 추론 난이도(effort level)에 따라 점수가 크게 달라지며, xhigh 설정에서 1비트는 빈 답변을 반환하는 경우까지 생긴다.
006▲ 117 · 댓글 68AI 모델 10가지, Three.js 코딩 작업으로 벤치마크 비교GLM 5.3 Flash Max가 가장 빠르고 저렴했으며, 9분 내 3D 씬 생성을 완료했다.AI · 머신러닝 · I tested 10 model/harness combinations on the same Three.js task
AI 모델 10가지, Three.js 코딩 작업으로 벤치마크 비교
Key PointThree.js 같은 복잡한 프론트엔드 작업에서 모델별 성능과 비용 효율이 크게 달라지므로, 개발자가 선택할 때 참고할 수 있는 실제 측정 데이터가 제공된다.
핵심 요약
- GLM 5.3 Flash Max가 가장 빠르고 저렴했으며, 9분 내 3D 씬 생성을 완료했다.
- 같은 프롬프트로 다양한 모델(Qwen, Luna, Sol, Astra)과 프레임워크(Codex, OpenCodeOpen 등)를 조합해 성능을 측정했다.
- 처리 시간은 8분부터 41분까지 편차가 컸고, 생성된 토큰 수는 모델마다 크게 달랐다.
- 총 비용(OpenRouter 환율 기준)은 GLM 5.3이 약 $0.015로 가장 저렴했고, Astra 6.0은 약 $4.04로 가장 비쌌다.
- 캐시 활용도는 대부분 78~95% 범위였고, 일부 모델은 도구 호출 오류가 발생했거나 브라우저에서 결과물을 열지 못했다.
007▲ 15 · 댓글 3알리바바 Qwen 3.8 27B 공개, 로컬 모델 최고 성능Qwen3.8-27B-FP8은 오픈 가중치 모델로 HuggingFace Transformers, vLLM 등과 호환된다.AI · 머신러닝 · Qwen 3.8 27B is out: open weights, best local dense model yet
알리바바 Qwen 3.8 27B 공개, 로컬 모델 최고 성능

Key Point로컬에서 구동 가능한 고성능 오픈소스 모델로, Hacker News 커뮤니티에서 배포 용이성과 벤치마크 성과에 주목받고 있다.
핵심 요약
- Qwen3.8-27B-FP8은 오픈 가중치 모델로 HuggingFace Transformers, vLLM 등과 호환된다.
- 27B 매개변수 모델로 코딩, 에이전트 작업, 멀티모달 이해 능력을 갖추고 262K 네이티브 컨텍스트를 지원한다.
- 터미널 코딩 벤치마크 73.0점, SWE-bench Pro 61.7점 등 기존 모델을 능가하는 성능을 보인다.
008▲ 17 · 댓글 1알리바바, Qwen3.8-27B 공개제목 기반알리바바가 Qwen3.8-27B 모델을 공개했다.AI · 머신러닝 · Qwen3.8-27B
알리바바, Qwen3.8-27B 공개
Key PointHacker News에서 17포인트를 얻으며 오픈소스 LLM 커뮤니티에서 주목받고 있다.
핵심 요약
- 알리바바가 Qwen3.8-27B 모델을 공개했다.
- 이는 278억 파라미터 규모의 언어 모델이다.
- 구체적인 성능 및 특징은 공식 발표를 통해 확인할 수 있다.
본문을 가져오지 못해 제목과 인기 지표로 요약했습니다. 실제 내용과 다를 수 있으니 원문을 확인해 주세요.
009▲ 643 · 댓글 151알리바바 Qwen3.8 공개, 2.4T 규모 오픈소스 LLM알리바바가 Qwen 시리즈 중 가장 강력한 모델인 Qwen3.8을 공개했으며, 2.4T 매개변수 중 95B가 활성화되는 혼합 전문가(MoE) 구조로 설계됐다.AI · 머신러닝 · Qwen3.8-2.4T
알리바바 Qwen3.8 공개, 2.4T 규모 오픈소스 LLM

Key PointQwen-Max급 오픈 모델의 첫 공개로, 개발 커뮤니티에서 높은 관심을 받으며 코딩과 에이전트 작업 성능을 주목하고 있다.
핵심 요약
- 알리바바가 Qwen 시리즈 중 가장 강력한 모델인 Qwen3.8을 공개했으며, 2.4T 매개변수 중 95B가 활성화되는 혼합 전문가(MoE) 구조로 설계됐다.
- 코딩, 전문 작업, 연구, 장기 에이전트 작업 전반에서 상당한 성능 향상을 제공하며, 복잡한 다단계 작업 완료 신뢰성이 강화됐다.
- 최대 1,010,000 토큰까지 확장 가능한 맥락 길이와 추론 깊이를 조절할 수 있는 유연한 사고 제어 기능을 지원한다.