멀티에이전트 공유 컨텍스트의 KV 캐시를 저랭크 보정으로 재사용한다

KVCMAS: Efficient KV cache Correction for Shared Context in Multi-Agent Systems

HF Daily2609.34060

Hyesung Jeon, Hyeongju Ha, Seoyoung Lee2026-09-28조회 2

무엇인가

프롬프트로 역할을 나누는 멀티에이전트 시스템은 모델 가중치를 공유하면서도 에이전트마다 시스템 프롬프트와 글루 프롬프트가 다르다. 문제는 이 프리픽스 차이가 같은 공유 컨텍스트에 대해 서로 다른 KV 캐시를 만든다는 점이다. 논문은 에이전트 i의 궤적을 에이전트별 PF 세그먼트와 공유 PH 세그먼트가 교차하는 형태로 정의하고, 같은 PH 세그먼트라도 앞선 컨텍스트가 달라 C_i,seg ≠ C_j,seg가 된다고 정리한다. 그 결과 각 에이전트가 겹치는 컨텍스트를 반복 prefill하고 별도 캐시를 유지하며, 궤적이 멀티턴·다중 에이전트·멀티모달 입력으로 길어질수록 이 중복이 서빙 비용의 주된 부분이 된다. 다른 에이전트의 캐시를 그대로 재사용하면 계산은 아끼지만 정확도가 크게 떨어진다.

어떻게 동작하나

기존 접근은 두 갈래다. 선택적 재계산(DroidSpeak, CacheBlend, RelayCaching)은 재사용 캐시의 일부 레이어나 토큰을 대상 에이전트 컨텍스트로 다시 계산해 넣지만, 선택되지 않은 부분의 편차는 그대로 남고 정확도를 더 올리려면 재계산 범위를 늘려 prefill 계산이 다시 증가한다. 델타 보정(GraphFlow, Kamera)은 모델 실행 없이 캐시 차이를 추정해 더하지만, 대부분 이전에 관측된 컨텍스트 관계에 묶여 있어 새 사용자 요청이나 새 에이전트 출력에는 쓰기 어렵다. KVComm은 온라인 앵커 풀로 동적으로 변하는 컨텍스트를 지원하지만, 앵커마다 컨텍스트 프리 베이스 캐시와 에이전트별 보정을 전차원으로 저장해 메모리가 공유 컨텍스트 길이에 따라 증가한다. 또 이들 델타 보정은 에이전트 프리픽스가 없는 context-free 참조 캐시를 별도로 만들어 기준으로 삼기 때문에, 처음 보는 공유 컨텍스트에서는 워크플로 밖에서 참조용 prefill을 한 번 더 해야 하고, 첫 에이전트에 적용된 근사 보정의 오차가 그 에이전트의 출력을 거쳐 다음 에이전트의 공유 컨텍스트로 전파된다.

무엇과 다른가

KVCMAS는 이 두 문제를 각각 저랭크 앵커 풀과 체인 보정으로 푼다. 첫째, 저자들은 에이전트별 델타 보정이 실제로는 낮은 차원의 특징 공간에 몰려 있다는 관찰을 제시한다. 여러 워크로드에서 델타 보정의 유효 랭크가 32 미만으로 KV 캐시 특징 차원보다 훨씬 작고, 베이스 캐시도 비슷한 구조를 보이되 유효 랭크가 조금 더 높다. 그래서 KVCMAS는 앵커에 저장하는 베이스 캐시와 델타 보정을 절단 SVD로 Z ≈ U_{Z,r}Σ_{Z,r}R_{Z,r}^T = A_Z B_Z 형태로 분해해 보관한다. 어텐션에 실제로 쓰이는 활성 KV 캐시는 전차원 그대로 두고 앵커 풀만 압축하는 방식이며, 앵커 메모리는 O(VNLD)에서 O(VNr(L+D))로 줄어든다. 둘째, 보정의 기준을 context-free 참조가 아니라 현재 워크플로 엣지에서 이미 만들어진 소스 에이전트 캐시 C_i,seg로 잡는다. 정확한 보정은 Δ_{j←i,seg} = Δ_{j←ref,seg} − Δ_{i←ref,seg}로, 두 기준은 대수적으로 동등하지만 실제 모델 실행에서 얻은 근사 보정에서는 기준 선택이 근사 오차를 바꾼다. KVCMAS는 첫 에이전트를 dense prefill해 정확한 캐시를 확보하고, 이후에는 각 단계에서 물질화된 공유 컨텍스트 캐시를 다음 보정의 기준으로 이어 붙인다. 논문은 이 구조가 평가한 레이어와 에이전트 전반에서 누적 보정 오차를 줄인다고 보고한다.

어떻게 쓰나

구체적 절차는 다음과 같다. 에이전트별 PF는 따로 처리하고 공유 세그먼트에만 온라인 보정을 적용한다. 소스 에이전트 i에서 타깃 에이전트 j로 공유 세그먼트가 넘어가면 먼저 C_i,seg의 키 위치를 타깃 위치에 맞게 재정렬하고, 재구성된 앵커 베이스 표현과 비교해 유사도가 높은 앵커에 큰 가중치를 준다. 이때 C_i,seg가 이미 소스 에이전트에서 생성된 캐시이므로 앵커 매칭에 추가 forward pass가 필요 없다. 보정값은 저장된 저랭크 인자들의 가중합으로 추정한다. 보정 신뢰도는 앵커 매칭 점수의 정규화 엔트로피로 판단하며, 분포가 뾰족하면 수용하고 평평하면 dense prefill로 폴백한다. 임계값 τ가 높을수록 재사용 비율 ρ가 올라간다. 수용된 보정은 정렬된 소스 캐시에 더해져 전차원 타깃 캐시로 물질화되고, 이 캐시가 일반 어텐션에 쓰이면서 동시에 다음 워크플로 엣지의 참조가 된다. 앵커 풀은 공유 플레이스홀더 슬롯마다 유지되며, 논문 실험에서는 랭크 r=32, 슬롯당 앵커 V=10을 기본값으로 쓴다.

전제와 한계

실험은 MMLU·GSM8K에 Llama-3.1-8B-Instruct, HumanEval에 Qwen2.5-Coder-7B-Instruct, MathVista·Video-MME에 LLaVA-OneVision-7B를 쓴다. 각 정확도 워크로드는 작업별 에이전트 3개와 반성 에이전트 1개로 구성된다. 베이스라인은 캐시 공유 없이 반복 prefill하는 NonShared, 보정 없이 그대로 재사용하는 FullShared, 그리고 DroidSpeak·CacheBlend·RelayCaching·GraphFlow·KVComm이다. 선택적 재계산은 ρ=0.9와 0.8, 델타 보정은 LLM에서 ρ≈0.8, VLM에서 ρ≈0.6으로 맞춰 비교한다. KVCMAS는 5개 벤치마크 중 3개에서 KV 캐시 공유 기법 중 최고 정확도를 기록했고, GSM8K와 HumanEval에서는 KVComm에 0.7%포인트 이내로 뒤진 2위다. 모든 워크로드에서 델타 보정 기법 중 가장 낮은 종단 지연과 TTFT를 보였고, GSM8K를 제외하면 더 낮은 재사용률을 쓰고도 선택적 재계산 기법보다 낮은 지연을 냈다. 서빙 실험은 vLLM 위에서 4-에이전트 스케줄의 통제된 트레이스로 수행했으며, 32K 공유 토큰·8 QPS·ρ=0.8 조건에서 NonShared 대비 2.0배 TTFT 단축, 다음으로 빠른 GraphFlow 대비 27% 낮은 TTFT를 보고한다. 같은 조건에서 체인 보정은 비체인 변형보다 중앙값 TTFT를 34% 줄였는데, 참조 prefill이 동시 요청과 배칭·연산 자원을 다투지 않게 되었기 때문이다. KVComm은 전차원 앵커 상태 때문에 8K와 32K 공유 컨텍스트에서 메모리 부족이 발생했고, KVCMAS는 KVComm 대비 피크 GPU 메모리를 최대 3.7배 줄였다. 정확도는 3회 평균, 지연·TTFT·피크 메모리는 NVIDIA A100 80GB에서 1 QPS로 측정했고, 단일 스트림 메모리·처리량은 A6000 48GB에서 측정했다.

실무적으로 이 논문은 같은 모델 위에 역할별 시스템 프롬프트를 얹어 여러 에이전트를 돌리는 서빙 구성, 특히 긴 공유 컨텍스트를 여러 에이전트가 번갈아 읽는 워크플로에 직접 해당한다. vLLM 위에 구현되었다는 점과 첫 에이전트만 dense prefill하고 이후에는 캐시 보정으로 이어 간다는 점은 기존 prefix caching 인프라에 얹기 쉬운 구조다. 다만 도입 전에 확인할 것은 세 가지다. 보정 신뢰도 임계값 τ가 재사용률과 정확도를 동시에 좌우하므로 자기 워크로드에서 τ와 ρ를 튜닝해야 하고, 앵커 풀은 공유 플레이스홀더 슬롯마다 유지되므로 슬롯 수와 에이전트 수가 늘면 메모리 계산을 다시 해야 하며, 보정이 수용되지 않으면 dense prefill로 떨어져 이득이 사라진다. 또한 에이전트별 PF 세그먼트는 공유 대상이 아니므로 프리픽스 자체가 긴 구성에서는 절감 폭이 제한된다.

저자들이 밝힌 전제와 한계는 이렇다. 랭크와 앵커 풀 크기 절제 실험에서 r=32, V=10이 정확도 이득의 대부분을 가져가고 더 키우면 메모리만 늘고 개선은 미미하다. 보정 수용 여부는 정규화 엔트로피 임계값에 달려 있고 신뢰할 수 없는 보정은 dense prefill로 폴백하므로, 재사용률이 낮은 워크로드에서는 이득이 줄어든다. 논문도 짧은 컨텍스트와 낮은 요청률에서는 prefill이 서빙 시간에서 차지하는 비중이 작아 기법 간 차이가 작아진다고 인정한다. 평가는 Llama-3.1-8B-Instruct, Qwen2.5-Coder-7B-Instruct, LLaVA-OneVision-7B와 5개 벤치마크로 한정되며 정확도는 3회 평균이다. 또한 KVCMAS는 학습이나 캘리브레이션이 필요한 KV 전이 기법과 달리 추가 학습을 요구하지 않지만, 시스템 수준 캐시 최적화와는 상호 보완적이라고 논문은 밝힌다.