쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 11일 (금)까지270건
2건 · "경량 모델"조건 지우기 ×
001▲ 296 · 댓글 81온디바이스 AI 모델 플랫폼 Desert Ant Labs 출범유럽 AI 스타트업 Desert Ant Labs가 스마트폰·태블릿에서 직접 실행되는 경량 전문화 모델 18개를 공개했다.AI · 머신러닝 · Desert Ant Labs: local, fast models that run on device
온디바이스 AI 모델 플랫폼 Desert Ant Labs 출범

Key Point온디바이스 AI의 경제성이 바뀌고 있다. 클라우드 추론 비용이 없으면 개발자들은 모든 사용자 입력마다 모델을 실행할 수 있게 되고, 기존 클라우드 API 중심의 제품 설계 방식이 근본적으로 흔들린다.
핵심 요약
- 유럽 AI 스타트업 Desert Ant Labs가 스마트폰·태블릿에서 직접 실행되는 경량 전문화 모델 18개를 공개했다.
- 음성인식(Voz), 오디오 품질 개선(Clear), 개인정보 마스킹(Redact) 등 각 작업별로 최적화된 모델들로, 모두 밀리초 단위 응답 시간을 제공한다.
- Voz는 Whisper보다 4.7배 빠르고, Clear는 5분 음성을 1초에 처리하며, Redact는 12MB 크기로 GLiNER-PII(2.3GB)와 유사한 정확도를 낸다.
- 월 10만 활성 기기까지 무료이며, 개발자는 Swift·Kotlin·JavaScript SDK로 몇 줄의 코드로 통합할 수 있다.
- 데이터가 기기를 벗어나지 않으므로 클라우드 API 비용을 없앨 수 있고, 기업들이 LLM에 쏟는 토큰 비용의 40~70%를 이런 소형 모델로 대체할 수 있다고 주장한다.
002▲ 125 · 댓글 16Mercury 2.5, 저지연 생성형 LLM의 차세대 모델 공개Inception Labs가 확산형(diffusion) 언어모델인 Mercury 2.5를 출시했으며, Mercury 2보다 40% 지능이 향상됐다.AI · 머신러닝 · Mercury 2.5
Mercury 2.5, 저지연 생성형 LLM의 차세대 모델 공개

Key Point저지연이 필수적인 음성·검색·코딩 시스템에서 실제로 검증된 경량 모델이 나왔으며, 기존 고사양 모델 대비 훨씬 저렴하면서도 실제 프로덕션 환경에서 성능을 입증했다.
핵심 요약
- Inception Labs가 확산형(diffusion) 언어모델인 Mercury 2.5를 출시했으며, Mercury 2보다 40% 지능이 향상됐다.
- 초당 1,107개 토큰 생성 속도로 GPT-4o나 Claude Haiku 등 주요 경량 모델과 유사한 성능을 낸다.
- 입력 토큰당 $0.20/백만, 출력 토큰당 $0.75/백만이며 런칭 기념으로 80% 할인된 가격을 제공한다.
- 음성 에이전트(OpenCall 사례), 검색 인프라, 코딩 에이전트 등 저지연이 중요한 프로덕션 워크로드에서 검증됐다.
- Augment Code의 컨텍스트 압축 작업을 Mercury로 전환했을 때 지연 시간 82% 감소, 비용 90% 절감을 달성했다.
- 음성 전용 모델인 Mercury Voice(170ms 이하 TTFT)와 모델 라우팅 도구인 Mercury Router도 공개 예정이다.