C2C 기법은 LLM끼리 텍스트 대신 KV 캐시로 직접 의미를 주고받는다
여러 개의 거대언어모델(LLM)을 조합해 쓰는 시스템에서, 모델끼리 주고받는 매개체를 텍스트에서 내부 표현으로 바꾸자는 제안이 나왔다. arXiv에 공개된 논문 「Cache-to-Cache: Direct Semantic Communication Between Large Language Models」는 한 모델이 만든 KV 캐시를 다른 모델의 KV 캐시에 직접 투영·융합해 의미를 넘기는 C2C(Cache-to-Cache) 패러다임을 제시한다. 요약하면 모델 A의 답변 문장을 모델 B가 다시 읽는 대신, A의 내부 상태를 B의 내부 상태에 이식하자는 발상이다.
구현의 핵심은 두 가지다. 먼저 신경망 하나가 소스 모델의 KV 캐시를 타깃 모델이 이해할 수 있는 공간으로 투영하고, 이를 타깃 모델의 캐시와 융합한다. 다음으로 학습 가능한 게이팅 메커니즘이 타깃 모델의 여러 레이어 가운데 어디에서 캐시 통신을 받아들일지 고른다. 모든 레이어에 무조건 주입하는 대신, 이득이 나는 지점만 선택적으로 연다는 설계다.
성능 수치는 논문 초록 기준으로 이렇다. C2C는 개별 모델 단독 실행보다 평균 정확도가 6.4~14.2% 높았고, 기존 텍스트 통신 방식보다는 약 3.1~5.4% 앞섰다. 지연 시간은 평균 2.5배 개선됐다. 논문은 2025년 10월 3일 처음 제출됐고 2026년 3월 2일 개정판(v2)이 올라왔으며, arXiv 번호는 2510.03215다. 저자는 Tianyu Fu를 포함해 7명이다.
배경에는 멀티 LLM 시스템의 구조적 병목이 있다. 서로 다른 모델을 붙이면 하나로는 못 내는 성능과 효율을 얻을 수 있지만, 기존 설계에서는 모델 간 소통이 전부 텍스트로 이뤄진다. 이 과정에서 내부 표현이 출력 토큰 시퀀스로 납작해지며 풍부한 의미 정보가 사라지고, 토큰을 하나씩 생성하는 지연이 그대로 누적된다. 모델을 여러 개 엮을수록 이 비용이 곱해지는 셈이다.
논문은 이 가설을 먼저 실험으로 확인했다. 캐시 크기를 늘리지 않고도 KV 캐시의 의미를 풍부하게 만들면 응답 품질이 올라간다는 결과를 제시하며, KV 캐시가 모델 간 통신 매개체로 유효하다는 근거로 삼는다. C2C는 이 관찰 위에 세워진 실제 구현이다.
실무 관점에서 눈에 띄는 지점은 지연이다. 에이전트 파이프라인이나 모델 라우팅 구조에서는 모델 간 핸드오프마다 중간 텍스트를 생성하는 비용이 붙는데, C2C는 이 단계를 건너뛴다. 두 모델의 전문화된 깊은 의미를 동시에 활용한다는 점도 텍스트 중계 방식과 다른 부분이다. 이기종 모델을 조합해 정확도와 응답 속도를 함께 챙기려는 팀이라면 구조 설계의 선택지가 하나 늘어난다.
다만 도입 전에 따져볼 조건이 있다. C2C는 투영·융합 신경망과 게이팅을 학습시켜야 하므로, 어떤 모델 쌍에 얼마만큼의 추가 학습이 필요한지, 학습된 구성이 다른 모델 조합으로 얼마나 재사용되는지는 논문 본문과 공개 코드에서 직접 확인하는 편이 좋다. 모델마다 레이어 수와 캐시 구조가 다르다는 점도 실제 적용 시 걸리는 지점이다.
논문이 스스로 밝힌 출발점은 명확하다. 텍스트를 거치는 기존 방식이 의미 손실과 생성 지연을 낳는다는 문제의식, 그리고 KV 캐시를 매개로 쓰면 캐시 크기를 키우지 않고도 품질을 올릴 수 있다는 사전 실험 결과다. 즉 C2C의 성능은 학습된 프로젝션과 레이어 선택에 의존하는 구조이며, 초록에 제시된 수치는 특정 실험 조건에서 나온 값이다. 실제 서비스에 얹기 전에는 자신의 모델 조합과 워크로드에서 재현해 보는 절차가 필요하다.