Hacker NewsAI · 머신러닝

디ープ시크, KV 캐시 압축으로 추론 속도 420 토큰/초 달성

원제 DeepSeek-v4.1 Flash: Pushing the Limits of KV Cache Compression

114 포인트댓글 8
Key Point

장문맥 처리가 필요한 에이전트 작업에서 메모리와 통신 병목을 근본적으로 해결하는 아키텍처 혁신이므로, 대규모 언어모델의 실제 배포 환경에서의 효율성 기준을 바꾼다.

핵심 요약

  • DeepSeek-V4.1 Flash는 KV 캐시 압축을 극대화해 장문맥 에이전트 워크플로우를 효율화한 모델이다.
  • Prefill 단계에서 8B 파라미터만 활성화하고 Decoding 단계에서 16B를 활성화해, 기존 V4-Flash 대비 약 420 토큰/초의 추론 속도를 달성했다.
  • 런타임 KV 캐시 저장량은 V4-Flash의 1/4 수준으로, 지속 저장(persistent storage)은 1/8 수준으로 줄였다.
  • 채널 차원에서 512차원 잠재 벡터로 어텐션 헤드를 공유하고, 시퀀스 차원에서 인코더가 인접한 2개 위치를 1개 캐시 항목으로 통합하는 방식으로 압축했다.
  • Causal Encoder-Decoder 아키텍처를 채용해 인코더의 최종 은닉 상태를 디코더의 글로벌 KV 캐시로 투영함으로써 입력 집약적 에이전트 시나리오에 최적화했다.
  • FP4 KV 캐시 등 수치 정밀도 최적화와 스파스 어텐션 인덱서 계산 최적화를 통해 성능 하락 없이 전체 KV 캐시를 4배 압축했다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗