토큰 40% 줄인 Kimi K3 기반 Ember-1 공개
원제 Ember-1
213 포인트댓글 124

Key Point
추론 토큰이 비용의 대부분을 차지하는 AI 워크로드(특히 에이전트 작업)에서 비용을 획기적으로 줄일 수 있는 방법이 실제로 작동한다는 검증된 사례이기 때문이다.
핵심 요약
- Fireworks Research가 Kimi K3를 기반으로 한 Ember-1 모델을 공개했으며, 같은 품질을 유지하면서 토큰을 40% 감소시켰다.
- K3의 장황한 추론(최대 90% 이상이 내부 추론에 사용)으로 인한 비용 문제를 해결하기 위해, 불필요한 추론은 제거하고 의미 있는 사고만 보존하도록 훈련했다.
- 이를 위해 50회 이상의 훈련 실험과 200회 이상의 평가를 수행했으며, 추론 토큰을 줄이면서 정확도를 잃지 않기 위한 새로운 훈련 알고리즘을 개발했다.
- 특히 다중 턴 에이전트 작업에서 문제가 심각한데, 이전 추론이 모든 후속 호출에서 다시 읽혀 문맥이 턴 수에 따라 이차적으로 증가하고 비용이 반복 청구되는 구조였다.
- 수학, 코딩, 명령 따르기, 대화, 검색, 도구 사용, 소프트웨어 엔지니어링 등 광범위한 작업에서 훈련했으며, 피드백을 통해 적응 학습을 강조했다.
- 공개 벤치마크 7개와 실제 고객 운영 환경에서 K3의 추론을 35~50% 단축해도 정확도 손실이 없음을 확인했다.
- Doximity의 Bedside Bench 의료 벤치마크에서 Ember-1은 GPT-5.6 Sol, GPT-6 Astra, Claude Opus 5를 포함한 다른 모델들과 비교해 비용 대비 최적 경계선(Pareto frontier)을 달성했다.
- 두 고객의 실제 코딩 작업으로 A/B 테스트했을 때, 비교 가능한 품질에서 약 35% 더 적은 토큰을 사용했고, 작업 완료율과 성공률은 유지 또는 개선되었다.
- Fireworks의 내부 코딩 작업에 먼저 적용했을 때 개발자들이 전환을 인지하지 못했으며, 이는 같은 답변에 더 적은 토큰을 사용한다는 가치 제안의 가장 강력한 신호로 평가했다.
- Ember-1은 Research Preview로 Serverless에서 K3 모델과 함께 제공되며, 2주간의 무료 접근으로 커뮤니티 수요에 따라 영구적으로 제공될 계획이다.
- 에이전트 코딩 등 추론 토큰이 대부분의 비용을 차지하는 작업에서 약 절반의 토큰 비용으로 같은 품질을 제공한다.
- Fireworks는 Ember-1용 훈련 지원을 출시해 기업이 자체 데이터와 특정 워크로드에 맞춘 맞춤형 토큰 효율 모델을 구축할 수 있도록 했다.