LLM 라우팅의 경제성을 높이는 희소 감독 학습 기법
원제 Routing Should Pay for Itself: Sparse Supervision for Economical LLM Routing
추천 13댓글 1
Key Point
LLM 라우팅 시스템의 총소유비용을 처음으로 정량화하며, 학습 비용과 서빙 절감을 동시에 고려하는 새로운 평가 방식이 산업 배포에 미치는 영향이 크기 때문이다.
핵심 요약
- LLM 라우팅은 쿼리를 적절한 모델에 할당해 서빙 비용을 줄이지만, 라우터 학습을 위해선 여러 후보 모델을 반복 실행해 피드백을 모아야 하므로 배포 전 상당한 감독 비용이 발생한다.
- 기존 연구는 서빙 단계 효율성에만 집중해, 그 절감액이 사전 학습 비용을 회수할 수 있는지 여부를 무시했다.
- 라우팅 품질은 모든 피드백을 수집하기 훨씬 전에 포화되는 경향을 보여, 밀집한 감독이 경제적으로 과도함을 시사한다.
- SaveRouter는 정보량 높은 모델 피드백만 선택적으로 수집하고 관련 쿼리들 간 능력 정보를 공유하면서도 미세한 라우팅을 위한 쿼리 수준 개선을 유지한다.
- 4개 벤치마크에서 SaveRouter는 전체 학습 피드백의 33~41%만 사용하면서도 라우팅 품질을 유지하거나 개선했다.
- 손익분기점 도달 필요 배포량을 기존 가장 빠른 라우터 대비 1.9~9.5배 단축했다.
- 추가 감독 수집이 항상 경제적으로 유리하지는 않으며, 서빙 비용을 최소화하는 감독 수준이 빠른 손익분기를 달성하는 수준과 다를 수 있음을 보였다.
- 코드는 공개 저장소에서 이용 가능하다.