쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 11일 (금)까지270건
4건 · "MoE"조건 지우기 ×
001당일 +130일반 PC에서 744B 규모 대규모 언어모델 실행하는 C 엔진 공개Colibrì는 순수 C와 의존성 없이 744B~2.8T 규모 MoE 모델을 일반 하드웨어에서 실행하는 추론 엔진이다.오픈소스 · 도구 · JustVugg/colibri · C
일반 PC에서 744B 규모 대규모 언어모델 실행하는 C 엔진 공개

Key Point소유한 PC로 최대 2.8T 규모 모델을 실행할 수 있는 가능성을 보여주며, 하이퍼스케일러 하드웨어 의존성을 제거해 대규모 모델 접근성을 크게 낮춘다.
핵심 요약
- Colibrì는 순수 C와 의존성 없이 744B~2.8T 규모 MoE 모델을 일반 하드웨어에서 실행하는 추론 엔진이다.
- VRAM, RAM, 디스크를 하나의 계층 구조로 취급해 제한된 고속 메모리에서도 모델 정확도를 유지하며 속도만 조절된다.
- GLM, Kimi, DeepSeek, Qwen 등 8개 모델 계열을 지원하며 각각 하나의 C 파일로 구현되어 동일한 인터페이스(coli chat/serve/web)를 사용한다.
- 라우팅 히트 기반 LRU, I/O 최적화, 이질적 실행(CPU/GPU/메탈), 압축 상태 등 다층 최적화 기법으로 추론 속도와 비용을 개선한다.
- 모든 최적화는 실제 하드웨어에서 정량 측정한 결과를 바탕으로만 채택하며, 모델 의미론을 몰래 바꾸지 않는 것을 보장한다.
002▲ 211 · 댓글 112280억 파라미터 Kimi K3를 맥북에서 초당 1토큰 속도로 구동삼성 M5 Max 맥북 프로(128GB)에서 280억 파라미터 Kimi K3 MoE 모델을 4개 SSD에서 스트리밍하며 초당 1.00토큰의 안정적 디코딩 속도를 달성했다.AI · 머신러닝 · Kimi K3 (2.8T) at 1 token/s on a MacBook Pro, streamed from four SSDs
280억 파라미터 Kimi K3를 맥북에서 초당 1토큰 속도로 구동

Key Point280억 개 파라미터를 가진 대규모 언어모델을 품질 손상 없이 소비자용 하드웨어에서 구동하는 것이 가능함을 보여주며, 가정용 AI 인프라의 현실적 가능성을 시사한다.
핵심 요약
- 삼성 M5 Max 맥북 프로(128GB)에서 280억 파라미터 Kimi K3 MoE 모델을 4개 SSD에서 스트리밍하며 초당 1.00토큰의 안정적 디코딩 속도를 달성했다.
- 모델의 1.45TB 전문가 가중치는 SSD에서 동적으로 로드되며, 프리필 단계에서 각 레이어의 전문가를 8배 중복 읽기하면서 약 6.3분의 지연이 발생한다.
- 기존 공개 벤치마크(0.68토큰/s)보다 43% 빠른 성능을 기록했으며, 드라이브 개수에 따라 1개 52%, 2개 73%, 3개 90%의 속도 향상을 보인다.
- MIT 라이선스 Deltafin은 모델 품질을 절대 훼손하지 않고 전체 16개 전문가를 모두 사용하며, 스트리밍 모드(215GB 시작) 또는 풀 다운로드 모드(1.7TB)로 설치 가능하다.
- 프리필 재읽기 문제는 식별되었고 수정 계획이 있지만 아직 구현되지 않았으며, 개발진은 이를 순수한 연구 실험이자 자체 호스팅 AI의 한계를 탐색하는 프로젝트로 규정했다.
003▲ 951 · 댓글 399DeepSeek V4 Pro 정식 공개DeepSeek V4 Pro 0813은 DeepSeek이 출시한 대규모 혼합 전문가(MoE) 모델이다.AI · 머신러닝 · DeepSeek V4 Pro 0813
DeepSeek V4 Pro 정식 공개

Key PointDeepSeek의 최신 고성능 모델이 정식 공개되면서 개발자들의 관심이 집중되고 있다.
핵심 요약
- DeepSeek V4 Pro 0813은 DeepSeek이 출시한 대규모 혼합 전문가(MoE) 모델이다.
- OpenRouter를 통해 호스팅되며, 실시간 성능 지표와 가격 정보를 제공한다.
- OpenAI 호환 API로 대부분의 SDK에서 베이스 URL만 변경하여 사용할 수 있다.
004▲ 643 · 댓글 151알리바바 Qwen3.8 공개, 2.4T 규모 오픈소스 LLM알리바바가 Qwen 시리즈 중 가장 강력한 모델인 Qwen3.8을 공개했으며, 2.4T 매개변수 중 95B가 활성화되는 혼합 전문가(MoE) 구조로 설계됐다.AI · 머신러닝 · Qwen3.8-2.4T
알리바바 Qwen3.8 공개, 2.4T 규모 오픈소스 LLM

Key PointQwen-Max급 오픈 모델의 첫 공개로, 개발 커뮤니티에서 높은 관심을 받으며 코딩과 에이전트 작업 성능을 주목하고 있다.
핵심 요약
- 알리바바가 Qwen 시리즈 중 가장 강력한 모델인 Qwen3.8을 공개했으며, 2.4T 매개변수 중 95B가 활성화되는 혼합 전문가(MoE) 구조로 설계됐다.
- 코딩, 전문 작업, 연구, 장기 에이전트 작업 전반에서 상당한 성능 향상을 제공하며, 복잡한 다단계 작업 완료 신뢰성이 강화됐다.
- 최대 1,010,000 토큰까지 확장 가능한 맥락 길이와 추론 깊이를 조절할 수 있는 유연한 사고 제어 기능을 지원한다.