쌓인 기록에서 찾기
무엇을 찾으세요? 날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위 2026년 8월 13일 (목) 부터 2026년 9월 11일 (금)까지 270건
16건 · "추론"조건 지우기 ×
001 21:11 당일 +130 일반 PC에서 744B 규모 대규모 언어모델 실행하는 C 엔진 공개 Colibrì는 순수 C와 의존성 없이 744B~2.8T 규모 MoE 모델을 일반 하드웨어에서 실행하는 추론 엔진이다. 오픈소스 · 도구 · JustVugg/colibri · C
일반 PC에서 744B 규모 대규모 언어모델 실행하는 C 엔진 공개 Key Point 소유한 PC로 최대 2.8T 규모 모델을 실행할 수 있는 가능성을 보여주며, 하이퍼스케일러 하드웨어 의존성을 제거해 대규모 모델 접근성을 크게 낮춘다.
핵심 요약
Colibrì는 순수 C와 의존성 없이 744B~2.8T 규모 MoE 모델을 일반 하드웨어에서 실행하는 추론 엔진이다. VRAM, RAM, 디스크를 하나의 계층 구조로 취급해 제한된 고속 메모리에서도 모델 정확도를 유지하며 속도만 조절된다. GLM, Kimi, DeepSeek, Qwen 등 8개 모델 계열을 지원하며 각각 하나의 C 파일로 구현되어 동일한 인터페이스(coli chat/serve/web)를 사용한다. 라우팅 히트 기반 LRU, I/O 최적화, 이질적 실행(CPU/GPU/메탈), 압축 상태 등 다층 최적화 기법으로 추론 속도와 비용을 개선한다. 모든 최적화는 실제 하드웨어에서 정량 측정한 결과를 바탕으로만 채택하며, 모델 의미론을 몰래 바꾸지 않는 것을 보장한다. 002 09:10 ▲ 159 · 댓글 65 Qwen 3.8이 GPT-5.5 Pro의 추론 과정을 흡수했다 GPT-5.5 Pro의 추론 시작 부분 1%를 다른 모델에 주입한 후 두 모델의 응답이 얼마나 유사한지 측정하는 실험을 진행했다. AI · 머신러닝 · Qwen 3.8 follows GPT-5.5 Pro reasoning prefills
Qwen 3.8이 GPT-5.5 Pro의 추론 과정을 흡수했다 Key Point 오픈 소스 모델이 대형 상용 모델의 추론 방식을 얼마나 모사할 수 있는지, 특히 학습 데이터의 출처가 무엇인지 보여주는 분석이다.
핵심 요약
GPT-5.5 Pro의 추론 시작 부분 1%를 다른 모델에 주입한 후 두 모델의 응답이 얼마나 유사한지 측정하는 실험을 진행했다. Qwen 3.8은 프리필 없을 때 16.79% 일치도에서 프리필 적용 시 34.97%로 +18.18 포인트 향상되어 가장 큰 변화를 보였다. Kimi K3는 GPT-5.5 Pro와의 기본 일치도가 31.11%로 가장 높지만 프리필의 추가 효과는 4.54 포인트에 불과했다. STEM 문제에서는 +26.99 포인트, 비STEM에서는 +12.80 포인트, 합성 퍼즐에서는 +14.75 포인트로 범주별로 다르게 나타났다. 분석 결과 Qwen이 이전 실험의 Opus와는 달리 GPT-5.5 Pro나 관련 GPT 모델에서 학습했을 가능성을 시사한다. 003 03:10 ▲ 172 · 댓글 62 GPT-6 Astra, 루프 트랜스포머, 숨겨진 추론 메커니즘 OpenAI의 GPT-6 Astra는 코딩, 수학, 3D 렌더링 등 거의 모든 카테고리에서 GPT-5.6을 능가하며, 특히 ARC-AGI-3 벤치마크에서 99.9% 정확도를 기록했다. AI · 머신러닝 · GPT-6 Astra, looped transformers, and hidden reasoning
GPT-6 Astra, 루프 트랜스포머, 숨겨진 추론 메커니즘 Key Point GPT-6 Astra의 구체적인 성능 향상(특히 추론과 컴퓨터 조작 능력)을 이해해야 차세대 모델의 방향을 파악할 수 있습니다.
핵심 요약
OpenAI의 GPT-6 Astra는 코딩, 수학, 3D 렌더링 등 거의 모든 카테고리에서 GPT-5.6을 능가하며, 특히 ARC-AGI-3 벤치마크에서 99.9% 정확도를 기록했다. 컴퓨터 사용 능력이 뛰어나 로컬 PC의 그래픽 소프트웨어(페인트, 블렌더 등)를 마우스와 UI로 직접 조작할 수 있으며, 이는 데모 영상의 시각적 임팩트로 주목받고 있다. 루프 트랜스포머(반복적 깊이) 및 숨겨진 추론 메커니즘에 대한 건축학적 루머가 있으며, 이 글은 이러한 기술 혁신과 최근 연구를 분석한다. 004 03:10 ▲ 296 · 댓글 81 온디바이스 AI 모델 플랫폼 Desert Ant Labs 출범 유럽 AI 스타트업 Desert Ant Labs가 스마트폰·태블릿에서 직접 실행되는 경량 전문화 모델 18개를 공개했다. AI · 머신러닝 · Desert Ant Labs: local, fast models that run on device
온디바이스 AI 모델 플랫폼 Desert Ant Labs 출범 Key Point 온디바이스 AI의 경제성이 바뀌고 있다. 클라우드 추론 비용이 없으면 개발자들은 모든 사용자 입력마다 모델을 실행할 수 있게 되고, 기존 클라우드 API 중심의 제품 설계 방식이 근본적으로 흔들린다.
핵심 요약
유럽 AI 스타트업 Desert Ant Labs가 스마트폰·태블릿에서 직접 실행되는 경량 전문화 모델 18개를 공개했다. 음성인식(Voz), 오디오 품질 개선(Clear), 개인정보 마스킹(Redact) 등 각 작업별로 최적화된 모델들로, 모두 밀리초 단위 응답 시간을 제공한다. Voz는 Whisper보다 4.7배 빠르고, Clear는 5분 음성을 1초에 처리하며, Redact는 12MB 크기로 GLiNER-PII(2.3GB)와 유사한 정확도를 낸다. 월 10만 활성 기기까지 무료이며, 개발자는 Swift·Kotlin·JavaScript SDK로 몇 줄의 코드로 통합할 수 있다. 데이터가 기기를 벗어나지 않으므로 클라우드 API 비용을 없앨 수 있고, 기업들이 LLM에 쏟는 토큰 비용의 40~70%를 이런 소형 모델로 대체할 수 있다고 주장한다. 005 11:10 당일 +233 AI 에이전트 토큰 65% 줄이는 '동굴인 말하기' 스킬 Claude Code를 비롯한 30개 이상의 AI 에이전트에서 사용 가능한 규칙 파일 'Caveman'을 공개했다. AI · 머신러닝 · JuliusBrussee/caveman · Go
AI 에이전트 토큰 65% 줄이는 '동굴인 말하기' 스킬 Key Point AI API 사용료가 토큰 기반인 상황에서, 에이전트의 장황한 답변을 자동으로 간결하게 변환해 구체적인 비용 절감 효과를 제시한다.
핵심 요약
Claude Code를 비롯한 30개 이상의 AI 에이전트에서 사용 가능한 규칙 파일 'Caveman'을 공개했다. AI 에이전트가 과도하게 긴 설명을 피하고 간결하게 답변하도록 학습시켜, 출력 토큰을 평균 65% 감소시킨다. 코드·명령어·파일 경로·오류 메시지는 건드리지 않고 설명 부분만 간결하게 다듬는다. 스킬 형태(무료, MIT 라이선스)와 프록시 형태(사용자 머신에서 읽는 토큰도 감축, BSL-1.1)로 제공된다. 스킬만 사용하면 출력 토큰은 줄지만 입력·추론 토큰은 유지되며, 기존에 이미 간결한 답변에선 절감 효과가 미미하다. 전체 세션 기준으로는 토큰 감축보다 응답 속도와 가독성 향상이 주요 이점이다. 006 11:10 당일 +160 텐센트의 오픈소스 LLM 지식 플랫폼 'WeKnora' 공개 문서를 RAG 기반 Q&A, 자율 추론 에이전트, 자동 유지 위키로 변환하는 엔터프라이즈급 지식 프레임워크다. AI · 머신러닝 · Tencent/WeKnora · Go
텐센트의 오픈소스 LLM 지식 플랫폼 'WeKnora' 공개 Key Point 문서 기반 정보 검색과 활용 방식을 근본적으로 바꾸는 오픈소스 플랫폼으로, 한국 기업들의 지식 관리 자동화와 데이터 주권 보호에 직결된 기술이다.
핵심 요약
문서를 RAG 기반 Q&A, 자율 추론 에이전트, 자동 유지 위키로 변환하는 엔터프라이즈급 지식 프레임워크다. ReAct 에이전트가 검색·MCP 도구·웹 검색을 자동 조합하고, Wiki 모드에서 문서를 상호연결된 마크다운 지식베이스로 정제한다. PDF·Word·이미지·Excel·XMind 등 10+ 포맷 지원하고, Feishu·GitLab·Notion·Slack·Telegram 등 20+ 데이터 소스 및 LLM 제공자와 통합된다. 세션 간 장기 기억, 청크 편집 이력 관리, 다중 워크스페이스 RBAC, Langfuse 옵저버빌리티를 지원한다. 로컬 및 프라이빗 클라우드 자체 배포 가능하며, LLM·벡터 DB·스토리지 백엔드를 자유롭게 교체할 수 있다. 007 11:10 당일 +125 로컬에서 빠르게 LLM 실행하는 llama.cpp, 고성능 추론 엔진 llama.cpp는 C/C++로 구현된 경량 LLM·VLM 추론 엔진으로, 별도 의존성 없이 다양한 하드웨어에서 최적화된 성능을 제공한다. AI · 머신러닝 · ggml-org/llama.cpp · C++
로컬에서 빠르게 LLM 실행하는 llama.cpp, 고성능 추론 엔진 Key Point 하드웨어 요구사항이 낮으면서도 다양한 플랫폼을 지원해 개인 PC에서도 대형 언어모델을 효율적으로 운영할 수 있다는 점이 실무에서 중요해지고 있다.
핵심 요약
llama.cpp는 C/C++로 구현된 경량 LLM·VLM 추론 엔진으로, 별도 의존성 없이 다양한 하드웨어에서 최적화된 성능을 제공한다. Apple Silicon의 Metal, ARM NEON, x86의 AVX/AVX512, RISC-V의 RVV 등 각 플랫폼별 명령어세트를 지원해 효율성을 극대화했다. 1.5~8비트 정수 양자화를 통해 추론 속도를 높이고 메모리 사용량을 줄일 수 있으며, NVIDIA GPU(CUDA), AMD GPU(HIP), Intel NPU 등 14개 이상의 백엔드를 지원한다. 총 VRAM 용량을 초과하는 큰 모델도 CPU·GPU 하이브리드 방식으로 부분 가속할 수 있고, Docker·웹 UI·CLI 도구로 빠르게 시작할 수 있다. 008 11:10 당일 +280 600개 언어 지원하는 제로샷 음성 복제 TTS 'OmniVoice' 공개 K2-FSA가 600개 이상 언어를 지원하는 다중언어 제로샷 TTS 모델 OmniVoice를 공개했다. AI · 머신러닝 · k2-fsa/OmniVoice · Python
600개 언어 지원하는 제로샷 음성 복제 TTS 'OmniVoice' 공개 Key Point 지금까지 가장 광범위한 언어 커버리지를 갖춘 제로샷 TTS 모델이 공개되어 다국어 음성 합성 애플리케이션 개발에 새로운 가능성을 열고 있다.
핵심 요약
K2-FSA가 600개 이상 언어를 지원하는 다중언어 제로샷 TTS 모델 OmniVoice를 공개했다. 확산 언어 모델 기반 아키텍처로 설계되어 높은 음성 품질과 빠른 추론 속도(RTF 0.025, 실시간 40배)를 제공한다. 참조 음성 클립(3~10초)으로 음성을 복제하거나 성별, 나이, 음역, 방언 등 속성으로 음성을 설계할 수 있다. 웃음소리 등 비언어 기호와 병음·음소로 발음 교정을 지원하며, 음성 복제 모드는 안정적이지만 음성 설계는 중국어·영어 데이터로만 학습되었다. HuggingFace Space, Google Colab, 로컬 웹 UI로 코딩 없이 테스트 가능하며, 다양한 하드웨어(NVIDIA, Apple Silicon, Intel Arc GPU)를 지원한다. 009 11:10 ▲ 120 · 댓글 43 임베딩 벡터를 쌍 데이터 없이 변환하는 방법 개발 텍스트 임베딩을 한 벡터 공간에서 다른 공간으로 옮기는 비지도 학습 방법을 제시했다. AI · 머신러닝 · Harnessing the Universal Geometry of Embeddings
임베딩 벡터를 쌍 데이터 없이 변환하는 방법 개발 Key Point 서로 다른 AI 모델의 임베딩을 통역할 수 있다는 것은 모델 간 상호운용성을 높이지만, 동시에 벡터 데이터베이스의 민감 정보 노출 위험을 직시하게 한다.
핵심 요약
텍스트 임베딩을 한 벡터 공간에서 다른 공간으로 옮기는 비지도 학습 방법을 제시했다. 쌍 데이터, 인코더, 미리 정의된 매치 없이 범용 잠재 표현(Platonic Representation Hypothesis)으로 변환한다. 서로 다른 아키텍처·파라미터 크기·학습 데이터를 가진 모델 간에도 높은 코사인 유사도를 달성한다. 임베딩 벡터만으로도 원본 문서 정보를 추출해 분류나 속성 추론에 이용할 수 있어 벡터 데이터베이스의 보안 문제를 드러낸다. 010 11:10 ▲ 143 · 댓글 53 vLLM이 AMD GPU에서 추측 디코딩 지원 vLLM이 추측 디코딩(speculative decoding) 기능을 AMD Instinct MI300X·MI355X GPU와 ROCm에서 구현했다. AI · 머신러닝 · Speculative Decoding in vLLM on AMD GPUs
vLLM이 AMD GPU에서 추측 디코딩 지원 Key Point LLM 추론 성능 최적화를 위한 주요 기법이 AMD GPU에서 실제 구현되어, 장기 생성 작업의 처리량 개선 가능성을 보여준다.
핵심 요약
vLLM이 추측 디코딩(speculative decoding) 기능을 AMD Instinct MI300X·MI355X GPU와 ROCm에서 구현했다. 추측 디코딩은 경량 드래프트 모듈이 여러 토큰을 먼저 제안하고 타겟 모델이 한 번에 검증하는 방식으로, 기존 자동회귀 디코딩보다 모델 통과 횟수를 줄인다. 표준 방식은 토큰 하나당 모델 실행 1회가 필요하지만, 추측 디코딩은 여러 드래프트 토큰이 검증을 통과하면 단일 모델 실행으로 여러 토큰을 커밋할 수 있다. Native MTP, Gemma 4 MTP, EAGLE-3, DFlash, DSpark 등 5가지 드래프팅 방식을 검토했으며, 방식·제안 길이·모델 종류·수용 동작 등에 따라 처리량 개선 효과가 달라진다. 드래프트 토큰이 거부되면 거부 지점 이후의 토큰들은 폐기되고 타겟 모델의 결과로 생성을 계속한다. 011 08:12 ▲ 211 · 댓글 112 280억 파라미터 Kimi K3를 맥북에서 초당 1토큰 속도로 구동 삼성 M5 Max 맥북 프로(128GB)에서 280억 파라미터 Kimi K3 MoE 모델을 4개 SSD에서 스트리밍하며 초당 1.00토큰의 안정적 디코딩 속도를 달성했다. AI · 머신러닝 · Kimi K3 (2.8T) at 1 token/s on a MacBook Pro, streamed from four SSDs
280억 파라미터 Kimi K3를 맥북에서 초당 1토큰 속도로 구동 Key Point 280억 개 파라미터를 가진 대규모 언어모델을 품질 손상 없이 소비자용 하드웨어에서 구동하는 것이 가능함을 보여주며, 가정용 AI 인프라의 현실적 가능성을 시사한다.
핵심 요약
삼성 M5 Max 맥북 프로(128GB)에서 280억 파라미터 Kimi K3 MoE 모델을 4개 SSD에서 스트리밍하며 초당 1.00토큰의 안정적 디코딩 속도를 달성했다. 모델의 1.45TB 전문가 가중치는 SSD에서 동적으로 로드되며, 프리필 단계에서 각 레이어의 전문가를 8배 중복 읽기하면서 약 6.3분의 지연이 발생한다. 기존 공개 벤치마크(0.68토큰/s)보다 43% 빠른 성능을 기록했으며, 드라이브 개수에 따라 1개 52%, 2개 73%, 3개 90%의 속도 향상을 보인다. MIT 라이선스 Deltafin은 모델 품질을 절대 훼손하지 않고 전체 16개 전문가를 모두 사용하며, 스트리밍 모드(215GB 시작) 또는 풀 다운로드 모드(1.7TB)로 설치 가능하다. 프리필 재읽기 문제는 식별되었고 수정 계획이 있지만 아직 구현되지 않았으며, 개발진은 이를 순수한 연구 실험이자 자체 호스팅 AI의 한계를 탐색하는 프로젝트로 규정했다. 012 08:12 ▲ 218 · 댓글 107 Qwen 3.8 27B, 4비트 양자화까지는 성능 유지 원본 모델 55GB에 비해 4비트 Q4_K_M(17GB)은 Terminal-Bench 2.1 등 주요 벤치마크에서 동일한 성능을 유지한다. AI · 머신러닝 · Benchmarking Qwen3.8 27B quantizations: 4-bit holds up, 1-bit collapses
Qwen 3.8 27B, 4비트 양자화까지는 성능 유지 Key Point 로컬에서 대형 언어 모델을 실행할 때 양자화 정도별로 실제 성능이 어떻게 달라지는지 벤치마크로 확인한 첫 실측 데이터라, 제한된 GPU 메모리 환경에서 모델 선택을 할 때 직접적인 참고 기준이 된다.
핵심 요약
원본 모델 55GB에 비해 4비트 Q4_K_M(17GB)은 Terminal-Bench 2.1 등 주요 벤치마크에서 동일한 성능을 유지한다. RTX 4090(24GB) 같은 소비자 GPU에서도 약 64k 토큰 컨텍스트를 남기며 실행 가능하다. 2비트 양자화는 조금 낮은 성능을 보이지만 10.7GB로 감소하고 실용적 수준을 유지한다. 1비트 양자화에서는 GPQA Diamond 벤치마크에서 무작위 추측 수준으로 성능이 붕괴되며, 긴 추론일수록 악화된다. 저자는 $3,000 규모의 GPU 비용을 들여 GPQA Diamond, IFBench, Terminal-Bench 2.1 세 벤치마크에서 실측했다. 추론 난이도(effort level)에 따라 점수가 크게 달라지며, xhigh 설정에서 1비트는 빈 답변을 반환하는 경우까지 생긴다. 013 00:10 ▲ 160 · 댓글 80 DeepSeek-V4-Pro 공개, 피크/비피크 요금제 도입 DeepSeek-V4-Pro를 출시했으며 에이전트 성능을 대폭 강화했다. AI · 머신러닝 · DeepSeek peak/off-peak pricing update
DeepSeek-V4-Pro 공개, 피크/비피크 요금제 도입 Key Point AI API 비용 최적화 기능의 도입과 DeepSeek의 모델 업그레이드가 개발자 커뮤니티에서 주목받고 있다.
핵심 요약
DeepSeek-V4-Pro를 출시했으며 에이전트 성능을 대폭 강화했다. 추론 난이도를 낮음/높음/최대로 조절할 수 있고 OpenAI Responses API를 기본 지원한다. 비피크 요금이 피크 요금의 50% 저렴하며 2026년 8월 16일 16:00 UTC부터 적용된다. 014 00:10 ▲ 669 · 댓글 262 Cerebras와 OpenAI, GPT-5.6 Sol 울트라팩스트 모드 공개 Cerebras와 OpenAI가 새로운 서비스 계층 울트라팩스트 모드를 OpenAI API에 출시했으며, 초당 최대 750개 토큰을 생성한다. AI · 머신러닝 · Accelerating GPT-5.6 Sol Ultrafast
Cerebras와 OpenAI, GPT-5.6 Sol 울트라팩스트 모드 공개 Key Point 고성능 AI 추론 기술의 실질적 진전을 보여주는 사례로, GPU 기반 시스템의 근본적 한계를 새로운 아키텍처로 극복한 점이 개발자 커뮤니티의 관심을 받고 있다.
핵심 요약
Cerebras와 OpenAI가 새로운 서비스 계층 울트라팩스트 모드를 OpenAI API에 출시했으며, 초당 최대 750개 토큰을 생성한다. 울트라팩스트 모드는 Fable 5보다 11배, Opus 4.8 Fast 모드보다 5배 빠르며, 품질 저하 없이 동작한다. Cerebras의 Wafer-Scale Engine 아키텍처가 칩에 44GB SRAM을 탑재하여 메모리 대역폭 병목을 제거해 고속 추론을 실현한다. 015 20:31 ▲ 643 · 댓글 151 알리바바 Qwen3.8 공개, 2.4T 규모 오픈소스 LLM 알리바바가 Qwen 시리즈 중 가장 강력한 모델인 Qwen3.8을 공개했으며, 2.4T 매개변수 중 95B가 활성화되는 혼합 전문가(MoE) 구조로 설계됐다. AI · 머신러닝 · Qwen3.8-2.4T
알리바바 Qwen3.8 공개, 2.4T 규모 오픈소스 LLM Key Point Qwen-Max급 오픈 모델의 첫 공개로, 개발 커뮤니티에서 높은 관심을 받으며 코딩과 에이전트 작업 성능을 주목하고 있다.
핵심 요약
알리바바가 Qwen 시리즈 중 가장 강력한 모델인 Qwen3.8을 공개했으며, 2.4T 매개변수 중 95B가 활성화되는 혼합 전문가(MoE) 구조로 설계됐다. 코딩, 전문 작업, 연구, 장기 에이전트 작업 전반에서 상당한 성능 향상을 제공하며, 복잡한 다단계 작업 완료 신뢰성이 강화됐다. 최대 1,010,000 토큰까지 확장 가능한 맥락 길이와 추론 깊이를 조절할 수 있는 유연한 사고 제어 기능을 지원한다. 016 20:31 당일 +1,183 규제 산업 위한 투명한 AI 에이전트 기반 마련 엔터프라이즈 데이터를 수집해 의미 있는 정보를 추출하고 컨텍스트 그래프와 지식 그래프를 구축한다. AI · 머신러닝 · semantica-agi/semantica · Python
규제 산업 위한 투명한 AI 에이전트 기반 마련 Key Point GitHub Trending에서 하루에 845개 스타를 받으며 급부상한 프로젝트로, AI 에이전트의 투명성과 규정 준수를 다루는 실질적 솔루션에 대한 개발자들의 관심을 반영한다.
핵심 요약
엔터프라이즈 데이터를 수집해 의미 있는 정보를 추출하고 컨텍스트 그래프와 지식 그래프를 구축한다. LLM 없이도 그래프 구성, 추론, 의사결정 추적이 가능한 결정론적 인프라 계층으로 작동한다. 금융, 의료, 법률, 정부 등 규제 산업에서 AI 의사결정의 근거를 감시자에게 설명 가능하게 한다.