쌓인 기록에서 찾기
무엇을 찾으세요?
날짜를 몰라도 됩니다. 제목·Key Point·요약·태그를 한꺼번에 뒤집니다.
검색 범위부터 2026년 9월 22일 (화)까지845건
2건 · "KV 캐시"조건 지우기 ×
001▲ 114 · 댓글 8디ープ시크, KV 캐시 압축으로 추론 속도 420 토큰/초 달성DeepSeek-V4.1 Flash는 KV 캐시 압축을 극대화해 장문맥 에이전트 워크플로우를 효율화한 모델이다.AI · 머신러닝 · DeepSeek-v4.1 Flash: Pushing the Limits of KV Cache Compression
디ープ시크, KV 캐시 압축으로 추론 속도 420 토큰/초 달성
Key Point장문맥 처리가 필요한 에이전트 작업에서 메모리와 통신 병목을 근본적으로 해결하는 아키텍처 혁신이므로, 대규모 언어모델의 실제 배포 환경에서의 효율성 기준을 바꾼다.
핵심 요약
- DeepSeek-V4.1 Flash는 KV 캐시 압축을 극대화해 장문맥 에이전트 워크플로우를 효율화한 모델이다.
- Prefill 단계에서 8B 파라미터만 활성화하고 Decoding 단계에서 16B를 활성화해, 기존 V4-Flash 대비 약 420 토큰/초의 추론 속도를 달성했다.
- 런타임 KV 캐시 저장량은 V4-Flash의 1/4 수준으로, 지속 저장(persistent storage)은 1/8 수준으로 줄였다.
- 채널 차원에서 512차원 잠재 벡터로 어텐션 헤드를 공유하고, 시퀀스 차원에서 인코더가 인접한 2개 위치를 1개 캐시 항목으로 통합하는 방식으로 압축했다.
- Causal Encoder-Decoder 아키텍처를 채용해 인코더의 최종 은닉 상태를 디코더의 글로벌 KV 캐시로 투영함으로써 입력 집약적 에이전트 시나리오에 최적화했다.
- FP4 KV 캐시 등 수치 정밀도 최적화와 스파스 어텐션 인덱서 계산 최적화를 통해 성능 하락 없이 전체 KV 캐시를 4배 압축했다.
002▲ 103 · 댓글 51LRU 캐시 정책, 기존 논문보다 더 견고했다실제 Claude Code 세션 393개(요청 68,266건)와 Mooncake 요청 23,608건을 재현해 LRU를 이길 방법을 3가지로 시도했으나 모두 실패했다.인프라 · 데브옵스 · LRU is harder to beat than the KV-cache papers suggest
LRU 캐시 정책, 기존 논문보다 더 견고했다

Key Point생성형 LLM 에이전트 서빙에서 캐시 정책을 최적화하려는 엔지니어들이 설계 선택을 할 때, 최근 학술 논문의 주장이 실제 프로덕션 워크로드에 얼마나 적용되는지 확인할 수 있다.
핵심 요약
- 실제 Claude Code 세션 393개(요청 68,266건)와 Mooncake 요청 23,608건을 재현해 LRU를 이길 방법을 3가지로 시도했으나 모두 실패했다.
- 용량 부족 상황에서 캐시 재계산의 주요 원인은 세션 만료(TTL)가 아니라 2초 간격의 도구 호출 루프였고, 5분 TTL은 실제로 발동되지 않았다.
- 재계산 토큰의 33.1%는 10초 이내 요청에서 발생했고, 5분 이상 대기 후 요청은 17.5%에 불과해 기존 논문의 핵심 가정이 실제 워크로드와 다르다.
- SGLang과 vLLM의 라딕스 트리 구조 내 LRU 구현이 단순 블록 LRU와 거의 동일한 성능(0.02pp 차이)을 보여 기존 최적화가 실무에서는 거의 효과가 없다.
- 생성형 LLM 에이전트 서빙에서 크로스 요청 KV 캐시 프리픽스 공유가 가장 큰 성능 이득이지만, LRU를 대체할 더 나은 정책이 실제로 존재하지 않을 수 있다.