LLM끼리 텍스트 없이 직접 대화한다, KV-캐시로 의미 전송
원제 Cache-to-Cache: Direct Semantic Communication Between LLMs (2025)
100 포인트댓글 18

Key Point
LLM 조합 시스템에서 텍스트 대신 내부 표현을 직접 주고받는 새로운 방식으로, 정확도와 속도 모두에서 현저한 개선을 보여 멀티모델 아키텍처의 효율성을 크게 높일 수 있다.
핵심 요약
- 여러 LLM을 조합하는 멀티모델 시스템에서 기존의 텍스트 통신은 의미 정보를 손실하고 토큰 생성 지연을 야기한다.
- 연구진은 KV-캐시를 모델 간 의미 전송 매체로 활용하는 Cache-to-Cache(C2C) 패러다임을 제안했다.
- 신경망이 소스 모델의 KV-캐시를 투영·융합해 대상 모델의 캐시와 직접 연결하며, 학습 가능한 게이팅 메커니즘이 최적의 레이어를 선택한다.
- C2C는 텍스트 통신 대비 정확도 3.1~5.4% 향상, 지연 시간 2.5배 단축을 달성했으며, 개별 모델 대비 6.4~14.2% 높은 정확도를 보인다.
- 논문은 ICLR'26에 발표되었으며 코드도 공개되었다.