LLM끼리 텍스트 없이 직접 대화한다, KV-캐시로 의미 전송

Key Point
LLM 조합 시스템에서 텍스트 대신 내부 표현을 직접 주고받는 새로운 방식으로, 정확도와 속도 모두에서 현저한 개선을 보여 멀티모델 아키텍처의 효율성을 크게 높일 수 있다.
핵심 요약
- 여러 LLM을 조합하는 멀티모델 시스템에서 기존의 텍스트 통신은 의미 정보를 손실하고 토큰 생성 지연을 야기한다.
- 연구진은 KV-캐시를 모델 간 의미 전송 매체로 활용하는 Cache-to-Cache(C2C) 패러다임을 제안했다.
- 신경망이 소스 모델의 KV-캐시를 투영·융합해 대상 모델의 캐시와 직접 연결하며, 학습 가능한 게이팅 메커니즘이 최적의 레이어를 선택한다.
- C2C는 텍스트 통신 대비 정확도 3.1~5.4% 향상, 지연 시간 2.5배 단축을 달성했으며, 개별 모델 대비 6.4~14.2% 높은 정확도를 보인다.
- 논문은 ICLR'26에 발표되었으며 코드도 공개되었다.