CacheBack이 수신자 조건부 KV 선택으로 에이전트 통신을 94% 줄인다
Receiver-Conditioned Latent Communication gives 94% CacheBack
무엇인가
멀티에이전트 시스템은 큰 컨텍스트를 여러 에이전트에 나눠 담고 메시지로 주고받는다. 텍스트 메시지는 짧지만 토큰을 하나씩 디코딩해야 하고, 수신 에이전트가 필요로 하는 근거를 빠뜨릴 수 있다. 최근에는 KV 캐시를 그대로 넘기는 잠재(latent) 통신이 대안으로 떠올랐지만, 전체 KV 캐시는 개별 에이전트가 처리한 컨텍스트와 협업하는 에이전트 수에 비례해 선형으로 커진다. 논문은 이 현상을 컨텍스트 재팽창(context re-expansion)이라고 부른다. Qwen 3 8B를 bfloat16으로 쓸 때 위치 하나당 144KiB이고, 수신자는 자기 프롬프트에 더해 모든 서브에이전트의 위치를 전부 로드해야 한다. FanOutQA 실험 설정에서 전체 캐시 전송은 모든 태스크에서 수신자 생성용 컨텍스트를 남기지 못했다.
어떻게 동작하나
제안은 수신자 조건부 통신(receiver-conditioned communication)이다. 수신자가 자신의 정보 필요를 짧은 질의 q로 서술해 보내면, 송신자가 그 q로 자기 KV 캐시에서 보낼 위치를 고르고 압축한다. 구성은 세 부분이다. 수신자 질의, 질의에 기반한 선택, 선택된 정보의 전송 표현. q는 송신자의 원래 프리필이 끝난 뒤 덧붙여지고 오직 송신자 위치를 점수화하는 데만 쓰인다. 그래서 같은 송신 상태에 서로 다른 수신자 질의를 적용해 각기 다른 메시지를 만들 수 있다. 메시지 예산은 수신자 프롬프트 길이, 각 에이전트가 보낼 위치 상한, 출력 예약분의 합이 컨텍스트 한도를 넘지 않도록 잡는다.
무엇과 다른가
CacheBack은 훈련이 필요 없는 선택기다. SnapKV에서 착안해, 수신자 질의 토큰들이 앞선 위치에 지불하는 어텐션을 질의 토큰과 헤드에 걸쳐 평균하고, 해당 레이어에 걸쳐 합산한 뒤 근처 위치를 풀링해 위치별 점수 Q_t를 만든다. 문제는 평균이 신호를 희석한다는 점이다. 어떤 위치가 질의의 일부 토큰에서만 강한 어텐션을 받으면 전체 평균에서는 밀려난다. CacheBack은 S_t^CB = Q_t × C_t²로 보정한다. C_t는 질의 토큰을 평균하기 전과 후의 풀링된 어텐션을 비교하는 항으로, 위치가 질의의 일부에서 집중적인 지지를 받을수록 보정이 커진다. 선택된 위치는 연속 행(continuous-row) 형태로 전송되어 Qwen3-8B 기준 위치당 전체 KV보다 약 18배 작고, 원문 토큰에서 온 위치는 토큰 ID로 보내 페이로드를 추가로 75배 줄일 수 있다. 잠재 스텝은 토큰 ID가 없어 연속 벡터로 남는다. 수신자는 토큰 ID를 프리필하고 생성된 KV 위치를 덧붙인 뒤 작업을 이어간다.
어떻게 쓰나
선택기 진단은 13개 FanOutQA 태스크(각 약 50K 토큰)와 Qwen 3 1.7B/4B/8B/32B로 수행했다. 수신자 독립 선택기(StreamingLLM, H2O, ChunkKV, KVzip)와 비교했을 때, 8배 압축에서 가장 강한 수신자 독립 선택기가 근거의 68%를 유지한 반면 CacheBack은 93%를 유지했다. 128배 압축에서는 CacheBack이 25%를 유지한 것에 비해 다른 선택기들은 1~3%에 그쳤다. 모델이 커질수록 수신자 질의의 순위 품질도 좋아져, 1.7B에서 32B로 갈 때 gold 토큰의 중앙 백분위가 0.61에서 0.76으로 올랐고 8배 압축에서 CacheBack 근거 리콜도 68%에서 93%로 상승했다.
전제와 한계
FanOutQA 본 실험은 송신자 3개가 수신자 1개로 모이는 fan-in 구조로, 송신자당 최소 40K 토큰, 총 120,000 토큰, 50개 태스크를 쓴다. 동일 크기 텍스트 통신과 비교해 strict accuracy가 7.3~20.7%p 향상되고 중앙 TTEOA가 1.3~8.0배 줄었다. 16배 압축에서 CacheBack은 송신자 위치의 94%를 제거하면서 테스트한 모든 모델 패밀리와 토폴로지에서 텍스트 에이전트보다 낮은 지연과 높은 정확도를 보였다. 메시지 리콜은 91.5~95.8%로 동일 크기 텍스트의 84.8~91.1%보다 높았다. 수신자 질의를 무관한 고정 질의로 바꾸는 절제 실험에서는 16배 압축에서 메시지 리콜이 91%에서 65%로, strict accuracy가 46%에서 23%로 떨어졌다.
LongBench v2는 100K~246K 토큰 문서를 25K~61K 토큰씩 4등분해 4개 에이전트가 순차 체인으로 읽는 구조이며 Easy 부분집합 50문항을 평가했다. 상대 예산(Relative) CacheBack은 Qwen에서 정확도 14.7%p, Nemotron에서 9.3%p를 올리면서 중앙 TTEOA를 각각 3.7배, 2.5배 줄였다. 고정 예산(Fixed)은 7.3%p와 6.0%p 향상에 2.5배, 1.9배 감소였다. Qwen에서 압축률을 16배에서 128배로 올리면 중앙 TTEOA가 165초에서 143초로 줄지만 정확도는 44.7%에서 32.7%로 떨어져, 과도한 압축은 이득이 줄고 품질이 무너진다.
개발자 관점에서 핵심은 메시지 생성 비용이다. 논문은 Qwen 3 8B로 텍스트 메시지 3개를 생성하는 데 H100 80GB 한 장에서 중앙 73.2초가 걸렸다고 보고한다. CacheBack은 이미 계산된 상태에서 위치를 고르므로 추가 디코딩이 없다. 따라서 긴 메시지나 반복 메시지가 의존 작업을 지연시키거나 동시 부하에서 송신 GPU를 붙잡는 상황, 예컨대 여러 에이전트가 상세한 조사 결과를 반환해야 계획이 이어지는 저장소 탐색에서 이득이 크다. 반대로 네트워크 전송이나 수신자 프리필 비용이 회피한 디코딩 비용보다 클 때는 이득이 좁아진다. 도입 시에는 하이브리드 아키텍처에서 전역 어텐션 레이어만 점수화한다는 점, 메시지 예산을 어떻게 고정할지, 토큰 ID 인코딩을 쓸지 연속 행을 쓸지를 확인해야 한다.
저자들이 밝힌 한계는 분명하다. 질의를 태스크 질문으로 고정하고 송신자 계산이 끝난 뒤 한 번만 발행하며 메시지 예산도 실행 전에 정한다. 질의를 어떻게 써야 하는지, 수신자가 언제 다시 물어야 하는지, 얼마나 많은 상태를 요청해야 하는지는 규정하지 않는다. 선택기는 의도적으로 단순하고 무훈련이라 최선의 선택기가 아니며, 점수 규칙을 학습하거나 모델 상태를 더 활용하면 선택이 개선될 여지가 있다. 한 송신자가 여러 질의를 감당할 수 있는 한계도 평가하지 않았다. 또한 압축된 핸드오프가 수신자에게 필요했던 세부를 버려 하류 오류를 만들 위험, 잠재 메시지가 송신자의 사적 컨텍스트에서 파생되므로 기밀성을 보장하지 않는다는 위험을 함께 지적한다.