여러 LLM을 조합한 멀티에이전트, KV 캐시 공유로 10배 빠르게
원제 Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Multi-Agent LLMs
추천 13댓글 2
Key Point
서로 다른 LLM을 조합하는 멀티에이전트 시스템에서 구조적 차이를 극복하고 캐시 재사용으로 최대 10배의 속도 향상을 달성한 방식이 처음 제시되었습니다.
핵심 요약
- Llama, Mistral 등 서로 다른 모델을 조합하는 멀티에이전트 LLM 시스템에서, 송신자의 처리된 문맥을 수신자가 다시 처리(prefill)하는 중복 비용이 발생한다.
- 논문은 HeteroFold라는 방식을 제안했다. 토큰화·모델 깊이·KV 표현의 차이를 처리하면서 양쪽 모델을 그대로 두고 KV 캐시를 다른 모델 족으로 이전한다.
- HeteroFold는 구조를 정렬하고, 송신자의 캐시를 수신자 공간으로 매핑한 뒤, 수신자의 동작을 유지하도록 보정한다.
- 6가지 이전 방향에서 모두 4개의 장문맥 벤치마크와 대부분의 단문맥 설정에서 최고 성능을 달성했다.
- 32K 컨텍스트 길이에서 Llama-3.1-8B → Mistral-3-14B 이전은 기본 Prefill보다 10.7배 빠르고, 최신 기준인 Dense Latent와 KV Ridge보다 1.18~1.47배 빠르다.
- 멀티에이전트 벤치마크에서는 텍스트 기반 통신과 동등한 수준의 성능을 유지한다.