쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 22일 (화)까지843건
15건 · "언어모델"조건 지우기 ×
001▲ 109 · 댓글 37gzip으로 텍스트를 생성할 수 있다정보 이론에서 압축은 예측과 동치이므로, 신경망 없이 OS의 gzip 압축기만으로 언어 모델처럼 동작할 수 있다.AI · 머신러닝 · Can gzip be a language model?
gzip으로 텍스트를 생성할 수 있다
Key Point기존의 대규모 학습된 신경망 없이 순수 표준 라이브러리만으로 언어 모델이 동작하는 방식을 보여주며, 압축과 예측의 수학적 동치성을 실제로 구현한 흥미로운 증명이다.
핵심 요약
- 정보 이론에서 압축은 예측과 동치이므로, 신경망 없이 OS의 gzip 압축기만으로 언어 모델처럼 동작할 수 있다.
- gzip은 최근 텍스트의 32KiB 슬라이딩 윈도우에서 매칭을 찾아 압축하는데, 이를 확률 점수로 변환할 수 있다.
- 코퍼스를 gzip의 윈도우에 포함시켜 프라임한 후, 후보 텍스트를 덧붙여 압축했을 때의 길이를 측정해 점수를 매긴다.
- 단일 바이트 단위로는 양자화 노이즈로 신호가 묻히므로, 여러 바이트 스팬에 대해 빔 서치를 실행한다.
- 최근 꼬리 부분만 문맥에 유지하면 반복 루프를 방지하고, 코퍼스에 나타난 바이트들을 확장하며 최적 후보들을 선별해 순차 생성한다.
- 결과는 완벽하진 않지만 신경망 없이 코퍼스의 구조를 학습해 의미 있는 텍스트를 생성한다.
002▲ 20 · 댓글 2토큰 단위 수정으로 LLM 학습 데이터 만드는 onPandaonPanda는 대형언어모델의 정렬 데이터와 에이전트 궤적을 효율적으로 주석하는 대화형 도구다.AI · 머신러닝 · onPanda: Efficient Annotation of On-Policy Alignment Data for LLMs and Agents via Token-Level Correction
토큰 단위 수정으로 LLM 학습 데이터 만드는 onPanda

Key PointLLM 기반 시스템의 학습 데이터 효율이 개선되면서 모델 정렬에 소요되는 비용이 대폭 줄어들 가능성이 생겼습니다.
핵심 요약
- onPanda는 대형언어모델의 정렬 데이터와 에이전트 궤적을 효율적으로 주석하는 대화형 도구다.
- 모델 응답을 읽으면서 부적절한 첫 토큰을 찾아 후보 토큰에서 대체하거나 자유로운 편집으로 수정한 후, 수정된 지점부터 계속 생성하는 방식으로 작동한다.
- 수동 후편집 대비 주석 작업 시간을 중앙값 기준 52% 단축하고, 최종 응답의 대부분이 모델 자체에서 생성되어 온-정책 학습 데이터로 적합하다.
- 토큰 단위 수정 기록은 정확한 위치와 함께 명확한 감독을 제공하며 긍정·부정 샘플이 자연스럽게 쌍을 이룬다.
- 외부 도구와 연결되어 실제 환경에서 대화형 궤적 주석이 가능하며, 논문은 Panda-CVL 데이터셋과 벤치마크를 공개한다.
003▲ 43 · 댓글 1비전-언어모델의 지능을 로봇 제어로 옮기다VLM을 로봇 제어에 활용하는 RoboDawn 인터페이스를 제시했다. 로봇이 자신의 시각 상태를 관찰하고 다음 행동을 추론하며 이를 실행하고 결과에 따라 의사결정을 적응시키는 폐루프 방식으로 동작한다.하드웨어 · 시스템 · Transferring the Intelligence of VLMs to Robotic Control
비전-언어모델의 지능을 로봇 제어로 옮기다

Key Point로봇 제어에 사전학습된 대규모 언어-시각 모델을 직접 활용하는 방식이 과제별 학습 없이도 작동하며, 현실 로봇까지 확대되는 경로를 제시해 로봇공학의 실용화 가능성을 높인다.
핵심 요약
- VLM을 로봇 제어에 활용하는 RoboDawn 인터페이스를 제시했다. 로봇이 자신의 시각 상태를 관찰하고 다음 행동을 추론하며 이를 실행하고 결과에 따라 의사결정을 적응시키는 폐루프 방식으로 동작한다.
- 소수의 데모로 VLM을 인터페이스 사용법과 작업 전략에 적응시키는 인-컨텍스트 러닝 기법을 도입했다.
- 작업별 로봇 학습 없이도 강한 성능을 달성하며, 제로샷 설정에서 기존 정책보다 우수하다.
- RoboTwin 2.0 C2R 벤치마크에서 제로샷 53.2%에서 원샷 73.6%로 성공률이 상승하고, RoboDojo에서도 35.67%에서 47.17%로 향상된다.
- 동일한 프레임워크가 실제 로봇으로도 옮겨져 Franka 로봇에서 블록 정렬 및 쌓기 작업을 수행한다.
004▲ 24 · 댓글 2AI 디자이너가 사용자 경험에서 배우는 '절차 메모리' 시스템Claude 같은 고정된 언어모델이 230개 이상의 그래픽 디자인 도구를 다루면서, 자연어로 된 설계 절차를 자동으로 축적·개선하는 '절차 메모리' 프레임워크를 제시했다.AI · 머신러닝 · Designer-RSI: Evolving Procedural Memory from User Traffic for Agentic Graphic Design
AI 디자이너가 사용자 경험에서 배우는 '절차 메모리' 시스템

Key PointLLM 기반 에이전트가 노이즈 많은 실제 사용자 데이터로 자동 학습하면서 성능이 극적으로 개선되는 메커니즘이 새로운 접근이며, 그래픽 디자인 같은 모호한 작업에서 AI 능력의 한계를 확장하는 방식을 보여준다.
핵심 요약
- Claude 같은 고정된 언어모델이 230개 이상의 그래픽 디자인 도구를 다루면서, 자연어로 된 설계 절차를 자동으로 축적·개선하는 '절차 메모리' 프레임워크를 제시했다.
- 1,406건의 실제 사용자 요청과 1,869개의 자동 평가 궤적으로 5라운드 학습한 결과, 기초 스킬 76개에서 139개로 늘어났고 생성 품질이 72.7%에서 99.3%로 향상됐다.
- 메모리 확장(새 절차 습득)과 개선(기존 절차 수정)의 두 메커니즘을 함께 쓸 때 별도 적용보다 효과가 커서, 비숙련 에이전트 대비 58.5% 승률을 기록했다.
- 가중치 업데이트나 인간 라벨 없이 검증 불가능한 피드백으로도 에이전트가 계속 적응할 수 있는 실질적 경로를 제시한다.
005당일 +465수조 개 파라미터 모델 훈련용 오픈소스 GPU 오케스트레이션 프레임워크Higgsfield는 수십억~수조 개 파라미터의 거대 언어모델 훈련을 위한 장애 허용 GPU 오케스트레이션 및 머신러닝 프레임워크다.AI · 머신러닝 · higgsfield-ai/higgsfield · Jupyter Notebook
수조 개 파라미터 모델 훈련용 오픈소스 GPU 오케스트레이션 프레임워크

Key PointGPU 자원이 부족한 국내 개발자도 클라우드 서버들을 연결해 차세대 LLM 훈련을 시작할 수 있게 되었으며, 환경과 설정 복잡도를 크게 줄였기 때문이다.
핵심 요약
- Higgsfield는 수십억~수조 개 파라미터의 거대 언어모델 훈련을 위한 장애 허용 GPU 오케스트레이션 및 머신러닝 프레임워크다.
- DeepSpeed ZeRO-3와 PyTorch의 완전 샤딩 데이터 병렬(FSDP)을 지원하여 극대규모 모델 분산 훈련을 가능하게 한다.
- Docker와 GitHub Actions를 통해 코드 배포 및 실험 실행·모니터링을 자동화하며, 표준 PyTorch 워크플로를 따른다.
- 환경·의존성 버전 관리를 Docker로 일원화하고, 복잡한 YAML 설정 없이 간단한 인터페이스로 실험을 정의할 수 있다.
- Ubuntu, SSH 접근, sudo 권한이 있는 노드만 있으면 Azure, LambdaLabs, FluidStack 등 클라우드에서 운영 가능하다.
006당일 +158무게 9분의 1, 성능 98% 유지하는 경량 언어모델 Bonsai 2 공개PrismML이 극도로 압축한 언어모델 Bonsai 2 27B를 공개했으며, 5.9GB 크기로 노트북이나 단일 GPU에서 구동된다.AI · 머신러닝 · PrismML-Eng/Bonsai-demo · Shell
무게 9분의 1, 성능 98% 유지하는 경량 언어모델 Bonsai 2 공개

Key Point극도로 경량화한 27B급 언어모델이 고성능을 유지하면서 개발자 기계에서 직접 실행 가능해지면서, 모델 압축 기술의 실용적 한계를 넓혔다.
핵심 요약
- PrismML이 극도로 압축한 언어모델 Bonsai 2 27B를 공개했으며, 5.9GB 크기로 노트북이나 단일 GPU에서 구동된다.
- FP16 대비 98.2% 수준의 성능을 유지하면서 원본의 약 9분의 1 크기를 달성했고, 수학은 반올림 수준의 정확도, 코딩은 기준 모델과 동일 수준이다.
- 3중 값(ternary) 가중치 기반이며 262K 토큰 콘텍스트, 비전 기능, OpenAI 방식의 도구 호출, 추론 기능을 지원한다.
- 가중치당 1.75비트 크기의 PTQ1_0 포장과 프롬프트 처리 속도가 빠른 PQ2_0 포장을 제공하며, 기본값은 후자다.
- Mac(Metal), Linux/Windows(CUDA/Vulkan/ROCm), CPU에서 로컬 실행 가능하고 두 개 명령으로 설정 완료된다.
- 이전 버전인 Bonsai(1비트)와 Ternary-Bonsai도 27B, 8B, 4B, 1.7B 크기로 계속 제공된다.
007▲ 114 · 댓글 8디ープ시크, KV 캐시 압축으로 추론 속도 420 토큰/초 달성DeepSeek-V4.1 Flash는 KV 캐시 압축을 극대화해 장문맥 에이전트 워크플로우를 효율화한 모델이다.AI · 머신러닝 · DeepSeek-v4.1 Flash: Pushing the Limits of KV Cache Compression
디ープ시크, KV 캐시 압축으로 추론 속도 420 토큰/초 달성
Key Point장문맥 처리가 필요한 에이전트 작업에서 메모리와 통신 병목을 근본적으로 해결하는 아키텍처 혁신이므로, 대규모 언어모델의 실제 배포 환경에서의 효율성 기준을 바꾼다.
핵심 요약
- DeepSeek-V4.1 Flash는 KV 캐시 압축을 극대화해 장문맥 에이전트 워크플로우를 효율화한 모델이다.
- Prefill 단계에서 8B 파라미터만 활성화하고 Decoding 단계에서 16B를 활성화해, 기존 V4-Flash 대비 약 420 토큰/초의 추론 속도를 달성했다.
- 런타임 KV 캐시 저장량은 V4-Flash의 1/4 수준으로, 지속 저장(persistent storage)은 1/8 수준으로 줄였다.
- 채널 차원에서 512차원 잠재 벡터로 어텐션 헤드를 공유하고, 시퀀스 차원에서 인코더가 인접한 2개 위치를 1개 캐시 항목으로 통합하는 방식으로 압축했다.
- Causal Encoder-Decoder 아키텍처를 채용해 인코더의 최종 은닉 상태를 디코더의 글로벌 KV 캐시로 투영함으로써 입력 집약적 에이전트 시나리오에 최적화했다.
- FP4 KV 캐시 등 수치 정밀도 최적화와 스파스 어텐션 인덱서 계산 최적화를 통해 성능 하락 없이 전체 KV 캐시를 4배 압축했다.
008당일 +104YAML 한 줄로 LLM 학습하는 Soup, 4GB GPU에서 8B 모델 실행Soup는 YAML 설정 파일 하나로 LLM 파인튜닝과 포스트트레이닝을 실행하는 CLI 도구다.AI · 머신러닝 · MakazhanAlpamys/Soup · Python
YAML 한 줄로 LLM 학습하는 Soup, 4GB GPU에서 8B 모델 실행

Key Point로컬 저사양 GPU에서도 대규모 언어모델을 효율적으로 학습할 수 있는 실용적인 도구로, 인프라 복잡성을 제거하고 싶은 개발자와 연구진이 참고해야 한다.
핵심 요약
- Soup는 YAML 설정 파일 하나로 LLM 파인튜닝과 포스트트레이닝을 실행하는 CLI 도구다.
- 레이어 스트리밍 기술로 8B 모델을 4GB 노트북 GPU에서 학습할 수 있으며, RTX 3050에서 119.6 tok/s, 3.32GB 피크 메모리로 동작한다.
- SSH 설정 없이 로컬 GPU에서 QLoRA로 훈련 가능하며, 배치 크기와 양자화 등을 자동으로 처리한다.
- v0.75.0 업데이트에서 검증되지 않은 설정값 거부, MLX 백엔드의 설정 호환성 개선, 검증 손실 메트릭 추가 등을 적용했다.
- 새로운 설정 키는 자동으로 거부되고, 오타 감지 기능을 통해 의도하지 않은 설정 누락을 방지한다.
- Python 3.10-3.12만 지원하며, PyPI의 soup-cli로 설치할 수 있다.
009당일 +113RTX 5090 전용 고성능 추론 엔진 NInfer 공개Qwen 3.5/3.6/3.8 모델의 단일 GPU 추론에 최적화된 C++/CUDA 엔진이 공개되었습니다.인프라 · 데브옵스 · Neroued/ninfer · C++
RTX 5090 전용 고성능 추론 엔진 NInfer 공개

Key Point단일 고사양 GPU에서 대규모 언어모델의 최고 속도 추론이 필요한 개발자나 기업에게 선택지를 제공하며, 양자화된 모델로도 높은 처리량을 유지하는 최적화 기법이 무엇인지 보여줍니다.
핵심 요약
- Qwen 3.5/3.6/3.8 모델의 단일 GPU 추론에 최적화된 C++/CUDA 엔진이 공개되었습니다.
- 텍스트, 이미지, 동영상 입력을 지원하며 로컬 CLI 또는 OpenAI/Anthropic 호환 HTTP API로 제공됩니다.
- RTX 5090에서 최대 8개 동시 요청을 처리할 수 있으며 1-8개 활성 요청의 고정 용량으로 특화되어 있습니다.
- Qwen3.6-27B/3.8-27B/3.6-35B-A3B용 공식 아티팩트 5개가 제공되며, groupwise-int와 NVFP4 양자화 포맷을 지원합니다.
- Qwen3.6-27B NVFP4는 8개 동시 요청 시 1,146.9 tok/s의 처리량을 달성하며, 단일 요청 대비 5.67배 성능 향상을 보입니다.
- Linux 64비트, CUDA 13.1, CMake 3.28 이상, C++20 컴파일러, FFmpeg 라이브러리가 필요하며 소스 트리에서만 실행됩니다.
010당일 +167다중 에이전트로 미래 예측하는 'MiroFish' 공개다중 에이전트 기술 기반의 AI 예측 엔진 'MiroFish'가 공개되었다.AI · 머신러닝 · 666ghj/MiroFish · Python
다중 에이전트로 미래 예측하는 'MiroFish' 공개

Key Point대규모 언어모델과 멀티 에이전트 기술이 결합된 예측 도구의 실제 활용 가능성을 보여주며, 의사결정자와 콘텐츠 제작자 모두를 위한 새로운 시뮬레이션 방식을 제시한다.
핵심 요약
- 다중 에이전트 기술 기반의 AI 예측 엔진 'MiroFish'가 공개되었다.
- 뉴스·정책안·금융 신호 같은 실제 데이터를 입력하면 고충실도 디지털 세계를 자동 구성하고, 독립적 성격과 장기 기억을 가진 수천 개 에이전트가 상호작용하며 사회진화를 시뮬레이션한다.
- 동적으로 변수를 주입해 미래 궤적을 정확히 추론할 수 있으며, '신의 시점'에서 정책과 홍보를 위험 없이 테스트하는 의사결정 실험실로 활용 가능하다.
- 데이터 분석 보고서나 콘텐츠를 업로드하고 자연언어로 예측 요구사항을 설명하면 상세한 예측 보고서와 인터랙티브 디지털 세계를 제공한다.
- Python 기반이며 그래프 구축·환경 설정·시뮬레이션·보고서 생성·심화 상호작용의 5단계 워크플로우로 동작한다.
- Node.js 18+, Python 3.11~3.12, 도커를 통해 배포 가능하며 온라인 데모와 비디오 튜토리얼을 제공한다.
011당일 +873일반 PC에서 744B 규모 대규모 언어모델 실행하는 C 엔진 공개Colibrì는 순수 C와 의존성 없이 744B~2.8T 규모 MoE 모델을 일반 하드웨어에서 실행하는 추론 엔진이다.오픈소스 · 도구 · JustVugg/colibri · C
일반 PC에서 744B 규모 대규모 언어모델 실행하는 C 엔진 공개

Key Point소유한 PC로 최대 2.8T 규모 모델을 실행할 수 있는 가능성을 보여주며, 하이퍼스케일러 하드웨어 의존성을 제거해 대규모 모델 접근성을 크게 낮춘다.
핵심 요약
- Colibrì는 순수 C와 의존성 없이 744B~2.8T 규모 MoE 모델을 일반 하드웨어에서 실행하는 추론 엔진이다.
- VRAM, RAM, 디스크를 하나의 계층 구조로 취급해 제한된 고속 메모리에서도 모델 정확도를 유지하며 속도만 조절된다.
- GLM, Kimi, DeepSeek, Qwen 등 8개 모델 계열을 지원하며 각각 하나의 C 파일로 구현되어 동일한 인터페이스(coli chat/serve/web)를 사용한다.
- 라우팅 히트 기반 LRU, I/O 최적화, 이질적 실행(CPU/GPU/메탈), 압축 상태 등 다층 최적화 기법으로 추론 속도와 비용을 개선한다.
- 모든 최적화는 실제 하드웨어에서 정량 측정한 결과를 바탕으로만 채택하며, 모델 의미론을 몰래 바꾸지 않는 것을 보장한다.
012당일 +145로컬에서 빠르게 LLM 실행하는 llama.cpp, 고성능 추론 엔진llama.cpp는 C/C++로 구현된 경량 LLM·VLM 추론 엔진으로, 별도 의존성 없이 다양한 하드웨어에서 최적화된 성능을 제공한다.AI · 머신러닝 · ggml-org/llama.cpp · C++
로컬에서 빠르게 LLM 실행하는 llama.cpp, 고성능 추론 엔진

Key Point하드웨어 요구사항이 낮으면서도 다양한 플랫폼을 지원해 개인 PC에서도 대형 언어모델을 효율적으로 운영할 수 있다는 점이 실무에서 중요해지고 있다.
핵심 요약
- llama.cpp는 C/C++로 구현된 경량 LLM·VLM 추론 엔진으로, 별도 의존성 없이 다양한 하드웨어에서 최적화된 성능을 제공한다.
- Apple Silicon의 Metal, ARM NEON, x86의 AVX/AVX512, RISC-V의 RVV 등 각 플랫폼별 명령어세트를 지원해 효율성을 극대화했다.
- 1.5~8비트 정수 양자화를 통해 추론 속도를 높이고 메모리 사용량을 줄일 수 있으며, NVIDIA GPU(CUDA), AMD GPU(HIP), Intel NPU 등 14개 이상의 백엔드를 지원한다.
- 총 VRAM 용량을 초과하는 큰 모델도 CPU·GPU 하이브리드 방식으로 부분 가속할 수 있고, Docker·웹 UI·CLI 도구로 빠르게 시작할 수 있다.
013당일 +2,047마이크로소프트의 MarkItDown, 각종 문서를 마크다운으로 변환마이크로소프트가 공개한 Python 유틸리티로, PDF·파워포인트·워드·엑셀·이미지·오디오·HTML 등 다양한 파일을 마크다운 형식으로 변환한다.AI · 머신러닝 · microsoft/markitdown · Python
마이크로소프트의 MarkItDown, 각종 문서를 마크다운으로 변환

Key PointLLM 기반 애플리케이션에서 다양한 형식의 문서를 처리해야 할 때, 마크다운으로의 표준화된 변환 방식을 제시하는 도구가 등장했으므로.
핵심 요약
- 마이크로소프트가 공개한 Python 유틸리티로, PDF·파워포인트·워드·엑셀·이미지·오디오·HTML 등 다양한 파일을 마크다운 형식으로 변환한다.
- 제목, 리스트, 표, 링크 등 문서 구조를 마크다운으로 보존하도록 설계되었으며, LLM과 텍스트 분석 파이프라인에서 사용하기 위한 목적이다.
- 마크다운은 LLM이 기본적으로 이해하고 토큰 효율도 높기 때문에, GPT-4o 같은 주류 언어모델과의 호환성이 우수하다.
- Python 3.10 이상이 필요하고, pip로 설치 가능하며, PDF·DOCX·PPTX·XLSX·오디오·YouTube 자막 등 기능별 선택적 의존성을 제공한다.
- 타사 플러그인을 지원하며, markitdown-ocr 플러그인으로 LLM 비전을 통한 OCR 기능을 추가할 수 있다.
- Azure Content Understanding 통합으로 스캔된 PDF, 복잡한 표, 비디오 등의 고품질 변환도 가능하다.
014▲ 211 · 댓글 112280억 파라미터 Kimi K3를 맥북에서 초당 1토큰 속도로 구동삼성 M5 Max 맥북 프로(128GB)에서 280억 파라미터 Kimi K3 MoE 모델을 4개 SSD에서 스트리밍하며 초당 1.00토큰의 안정적 디코딩 속도를 달성했다.AI · 머신러닝 · Kimi K3 (2.8T) at 1 token/s on a MacBook Pro, streamed from four SSDs
280억 파라미터 Kimi K3를 맥북에서 초당 1토큰 속도로 구동

Key Point280억 개 파라미터를 가진 대규모 언어모델을 품질 손상 없이 소비자용 하드웨어에서 구동하는 것이 가능함을 보여주며, 가정용 AI 인프라의 현실적 가능성을 시사한다.
핵심 요약
- 삼성 M5 Max 맥북 프로(128GB)에서 280억 파라미터 Kimi K3 MoE 모델을 4개 SSD에서 스트리밍하며 초당 1.00토큰의 안정적 디코딩 속도를 달성했다.
- 모델의 1.45TB 전문가 가중치는 SSD에서 동적으로 로드되며, 프리필 단계에서 각 레이어의 전문가를 8배 중복 읽기하면서 약 6.3분의 지연이 발생한다.
- 기존 공개 벤치마크(0.68토큰/s)보다 43% 빠른 성능을 기록했으며, 드라이브 개수에 따라 1개 52%, 2개 73%, 3개 90%의 속도 향상을 보인다.
- MIT 라이선스 Deltafin은 모델 품질을 절대 훼손하지 않고 전체 16개 전문가를 모두 사용하며, 스트리밍 모드(215GB 시작) 또는 풀 다운로드 모드(1.7TB)로 설치 가능하다.
- 프리필 재읽기 문제는 식별되었고 수정 계획이 있지만 아직 구현되지 않았으며, 개발진은 이를 순수한 연구 실험이자 자체 호스팅 AI의 한계를 탐색하는 프로젝트로 규정했다.
015▲ 125 · 댓글 16Mercury 2.5, 저지연 생성형 LLM의 차세대 모델 공개Inception Labs가 확산형(diffusion) 언어모델인 Mercury 2.5를 출시했으며, Mercury 2보다 40% 지능이 향상됐다.AI · 머신러닝 · Mercury 2.5
Mercury 2.5, 저지연 생성형 LLM의 차세대 모델 공개

Key Point저지연이 필수적인 음성·검색·코딩 시스템에서 실제로 검증된 경량 모델이 나왔으며, 기존 고사양 모델 대비 훨씬 저렴하면서도 실제 프로덕션 환경에서 성능을 입증했다.
핵심 요약
- Inception Labs가 확산형(diffusion) 언어모델인 Mercury 2.5를 출시했으며, Mercury 2보다 40% 지능이 향상됐다.
- 초당 1,107개 토큰 생성 속도로 GPT-4o나 Claude Haiku 등 주요 경량 모델과 유사한 성능을 낸다.
- 입력 토큰당 $0.20/백만, 출력 토큰당 $0.75/백만이며 런칭 기념으로 80% 할인된 가격을 제공한다.
- 음성 에이전트(OpenCall 사례), 검색 인프라, 코딩 에이전트 등 저지연이 중요한 프로덕션 워크로드에서 검증됐다.
- Augment Code의 컨텍스트 압축 작업을 Mercury로 전환했을 때 지연 시간 82% 감소, 비용 90% 절감을 달성했다.
- 음성 전용 모델인 Mercury Voice(170ms 이하 TTFT)와 모델 라우팅 도구인 Mercury Router도 공개 예정이다.