LRU 캐시 정책, 기존 논문보다 더 견고했다
Key Point
생성형 LLM 에이전트 서빙에서 캐시 정책을 최적화하려는 엔지니어들이 설계 선택을 할 때, 최근 학술 논문의 주장이 실제 프로덕션 워크로드에 얼마나 적용되는지 확인할 수 있다.
핵심 요약
- 실제 Claude Code 세션 393개(요청 68,266건)와 Mooncake 요청 23,608건을 재현해 LRU를 이길 방법을 3가지로 시도했으나 모두 실패했다.
- 용량 부족 상황에서 캐시 재계산의 주요 원인은 세션 만료(TTL)가 아니라 2초 간격의 도구 호출 루프였고, 5분 TTL은 실제로 발동되지 않았다.
- 재계산 토큰의 33.1%는 10초 이내 요청에서 발생했고, 5분 이상 대기 후 요청은 17.5%에 불과해 기존 논문의 핵심 가정이 실제 워크로드와 다르다.
- SGLang과 vLLM의 라딕스 트리 구조 내 LRU 구현이 단순 블록 LRU와 거의 동일한 성능(0.02pp 차이)을 보여 기존 최적화가 실무에서는 거의 효과가 없다.
- 생성형 LLM 에이전트 서빙에서 크로스 요청 KV 캐시 프리픽스 공유가 가장 큰 성능 이득이지만, LRU를 대체할 더 나은 정책이 실제로 존재하지 않을 수 있다.