Hacker NewsAI · 머신러닝

모델 라우터로 Astra 수준의 성능 달성, 비용은 절반

원제 Show HN: Open-source model routing for coding agents at Astra-level performance

101 포인트댓글 36
Key Point

비용을 절반으로 줄이면서 최강 수준의 성능을 유지하는 라우팅 기술은 개발자 도구의 경제성을 크게 바꿀 수 있다.

핵심 요약

  • Weave Router 2.0은 여러 LLM을 지능형으로 전환하는 오픈소스 모델 라우터로, Astra 같은 강력한 모델이 필요한 작업과 Deepseek v4 Flash 같은 가벼운 모델이 적합한 작업을 구분한다.
  • Terminal Bench 4.0과 SWE Atlas 벤치마크에서 GPT-6 Astra와 동등한 정확도를 달성하면서 비용은 52~54% 수준으로 줄이고 완료 속도는 2.2~2.5배 빨아졌다.
  • 라우팅 결정 공간이 100 LLM 호출 × 10개 모델 기준 10^100개에 달하므로, Hidden Markov Model로 세션 상태를 추적한 후 분류기가 모델 버킷을 선택하는 구조로 탐색 공간을 대폭 축소했다.
  • HMM은 현재 상태뿐 아니라 세션이 어떻게 진행되었는지 맥락을 포착하므로, 단순한 분류기보다 비슷해 보이는 세션들을 훨씬 정확히 구분한다.
  • 대규모 LLM으로 라벨링한 더 많고 다양한 코딩 에이전트 세션 데이터셋을 확보해 HMM과 분류기의 초기 상태를 개선하고 강화학습의 보상 신호를 강화했다.
  • 모델 캐시를 효과적으로 관리하기 위해 다른 모델로 전환할 때의 캐시 채우기 비용 대비 이득을 정밀하게 계산하는 서브시스템을 구축했으며, 이것이 비용 절감의 주요 원인이다.
  • 라우팅 모델의 구조 개선이 가장 큰 성능 향상을 제공했고, 단일 모델보다 모델 앙상블이 우수하다는 초기 가설이 검증되었다.
  • Weave Router는 GitHub에서 오픈소스로 공개되었으며, weaveos.com/router에서 호스팅 버전을 이용할 수도 있다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗