쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 11일 (금)까지270건
3건 · "비용 최적화"조건 지우기 ×
001당일 +686자신의 모델을 소유하면서 비용을 절감하는 오픈소스 LLM 게이트웨이Experiential은 OpenAI 호환 API 하나로 자체 호스팅, BYOK, 1000개 이상의 마켓플레이스 모델을 통합 관리하는 오픈소스 게이트웨이다.AI · 머신러닝 · experientiallabs/experiential · Python
자신의 모델을 소유하면서 비용을 절감하는 오픈소스 LLM 게이트웨이

Key Point프로덕션 트래픽 데이터로 자신이 소유한 모델을 최적화하면서도 OpenAI 호환 인터페이스로 기존 도구와 호환되어, LLM 비용 관리와 성능 개선을 동시에 달성할 수 있다.
핵심 요약
- Experiential은 OpenAI 호환 API 하나로 자체 호스팅, BYOK, 1000개 이상의 마켓플레이스 모델을 통합 관리하는 오픈소스 게이트웨이다.
- 사용자와 에이전트별로 어떤 모델을 사용할 수 있는지, 각 용도별 지출 한도를 제어할 수 있다.
- 프로덕션 트래픽으로부터 OpenTelemetry 추적을 수집하고 이를 통해 커스텀 라우터를 학습시켜 품질, 속도, 비용을 최적화한다.
- 로컬 게이트웨이와 호스팅 플랫폼(platform.experientiallabs.ai)을 선택할 수 있으며, 두 환경 모두 동일한 API를 제공한다.
- OpenAI, Anthropic, Gemini, Azure, Bedrock, Fireworks, OpenRouter 등 주요 LLM 제공자의 API 키를 연결할 수 있다.
002▲ 125 · 댓글 16Mercury 2.5, 저지연 생성형 LLM의 차세대 모델 공개Inception Labs가 확산형(diffusion) 언어모델인 Mercury 2.5를 출시했으며, Mercury 2보다 40% 지능이 향상됐다.AI · 머신러닝 · Mercury 2.5
Mercury 2.5, 저지연 생성형 LLM의 차세대 모델 공개

Key Point저지연이 필수적인 음성·검색·코딩 시스템에서 실제로 검증된 경량 모델이 나왔으며, 기존 고사양 모델 대비 훨씬 저렴하면서도 실제 프로덕션 환경에서 성능을 입증했다.
핵심 요약
- Inception Labs가 확산형(diffusion) 언어모델인 Mercury 2.5를 출시했으며, Mercury 2보다 40% 지능이 향상됐다.
- 초당 1,107개 토큰 생성 속도로 GPT-4o나 Claude Haiku 등 주요 경량 모델과 유사한 성능을 낸다.
- 입력 토큰당 $0.20/백만, 출력 토큰당 $0.75/백만이며 런칭 기념으로 80% 할인된 가격을 제공한다.
- 음성 에이전트(OpenCall 사례), 검색 인프라, 코딩 에이전트 등 저지연이 중요한 프로덕션 워크로드에서 검증됐다.
- Augment Code의 컨텍스트 압축 작업을 Mercury로 전환했을 때 지연 시간 82% 감소, 비용 90% 절감을 달성했다.
- 음성 전용 모델인 Mercury Voice(170ms 이하 TTFT)와 모델 라우팅 도구인 Mercury Router도 공개 예정이다.
003▲ 160 · 댓글 80DeepSeek-V4-Pro 공개, 피크/비피크 요금제 도입DeepSeek-V4-Pro를 출시했으며 에이전트 성능을 대폭 강화했다.AI · 머신러닝 · DeepSeek peak/off-peak pricing update
DeepSeek-V4-Pro 공개, 피크/비피크 요금제 도입

Key PointAI API 비용 최적화 기능의 도입과 DeepSeek의 모델 업그레이드가 개발자 커뮤니티에서 주목받고 있다.
핵심 요약
- DeepSeek-V4-Pro를 출시했으며 에이전트 성능을 대폭 강화했다.
- 추론 난이도를 낮음/높음/최대로 조절할 수 있고 OpenAI Responses API를 기본 지원한다.
- 비피크 요금이 피크 요금의 50% 저렴하며 2026년 8월 16일 16:00 UTC부터 적용된다.