Hugging Face 논문AI · 머신러닝오늘의 주요

여러 LLM을 조합한 멀티에이전트, KV 캐시 공유로 10배 빠르게

원제 Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Multi-Agent LLMs

추천 13댓글 2Vincent-Daniel Yun, Woosang Lim, Haneul Yoo 외
Key Point

서로 다른 LLM을 조합하는 멀티에이전트 시스템에서 구조적 차이를 극복하고 캐시 재사용으로 최대 10배의 속도 향상을 달성한 방식이 처음 제시되었습니다.

핵심 요약

  • Llama, Mistral 등 서로 다른 모델을 조합하는 멀티에이전트 LLM 시스템에서, 송신자의 처리된 문맥을 수신자가 다시 처리(prefill)하는 중복 비용이 발생한다.
  • 논문은 HeteroFold라는 방식을 제안했다. 토큰화·모델 깊이·KV 표현의 차이를 처리하면서 양쪽 모델을 그대로 두고 KV 캐시를 다른 모델 족으로 이전한다.
  • HeteroFold는 구조를 정렬하고, 송신자의 캐시를 수신자 공간으로 매핑한 뒤, 수신자의 동작을 유지하도록 보정한다.
  • 6가지 이전 방향에서 모두 4개의 장문맥 벤치마크와 대부분의 단문맥 설정에서 최고 성능을 달성했다.
  • 32K 컨텍스트 길이에서 Llama-3.1-8B → Mistral-3-14B 이전은 기본 Prefill보다 10.7배 빠르고, 최신 기준인 Dense Latent와 KV Ridge보다 1.18~1.47배 빠르다.
  • 멀티에이전트 벤치마크에서는 텍스트 기반 통신과 동등한 수준의 성능을 유지한다.
AI 요약 안내

AI가 한국어로 정리한 내용입니다. 정확한 정보는 원문을 확인해 주세요.

요약 원칙 ↗