ValueDiff는 값벡터 기하로 약한 어텐션 싱크 LLM의 KV캐시를 축출한다.
ValueDiff: Value-Geometric KV Cache Eviction for Sink-Suppressed LLMs
무엇인가
긴 문맥 추론에서 KV 캐시는 시퀀스 길이에 비례해 커지므로, 엣지 기기의 고정 RAM이나 서빙 시스템의 GPU 메모리 상한 안에서 돌리려면 추론 내내 캐시를 예산 N개 토큰 이하로 유지해야 한다. 이 논문이 다루는 것은 그 예산을 넘길 때마다 점수가 낮은 토큰을 버리는 KV 캐시 축출(eviction)이다. 특히 프롬프트를 B=128 크기의 겹치지 않는 블록으로 나눠 각 블록 경계마다 캐시를 정리하는 블록 프롬프트 처리를 전제로 하는데, 이때 축출 결정은 되돌릴 수 없고 나중에 들어올 모든 질의에 대해 유효해야 한다. 기존 방법들은 대부분 키(key) 쪽 구조에 의존한다. 어텐션 점수 기반(H2O, TOVA, SnapKV, KVZip)이든 키 기하 기반(KeyDiff, ManifoldKV, KeyNorm)이든, 소수의 토큰이 어텐션 질량을 독식하는 어텐션 싱크 현상, 즉 싱크 키 벡터가 대부분의 질의와 지속적으로 정렬되는 성질을 활용한다. 문제는 QK 정규화, 게이티드 어텐션, 학습된 어텐션 싱크, logit softcapping을 도입한 최근 모델들이 이 싱크를 약화시킨다는 점이다.
어떻게 동작하나
저자들은 네 가지 최근 아키텍처 계열과 표준 대조군 모델에서 싱크율과 키·값 벡터의 분산을 측정한다. 싱크율은 선두 토큰의 어텐션 가중치가 τ=0.3을 넘는 헤드의 비율로 정의되는데, Llama 3에서 0.86~0.90인 반면 Qwen3.5와 GPT-OSS-20B에서는 거의 0에 가깝다. 이때 싱크가 약한 모델일수록 값 벡터의 분산 σ_V가 키 벡터의 분산 σ_K보다 커지는 경향이 일관되게 나타난다. 즉 σ_V/σ_K 비율이 키 우세(σ_V < σ_K)에서 값 우세(σ_V > σ_K)로 이동한다. 축출이 '어떤 토큰이 중복이고 어떤 토큰이 구별되는가'를 묻는 작업이라면, 이 비율의 상승은 값 기하가 더 강한 질의 불변 신호라는 뜻이 된다.
무엇과 다른가
제안 방법 ValueDiff는 각 토큰 j의 점수를 값 벡터 v_j와 캐시 평균 v̄의 L2 거리, 즉 s_j = ||v_j - v̄||로 매긴다. 점수가 낮은 토큰은 거의 중복으로 보고 먼저 버리며, 높은 토큰은 구별되는 내용을 담은 것으로 보고 남긴다. 코사인 법칙으로 전개하면 이 점수는 크기(||v_j||)와 방향(1 - cos θ_j) 두 축으로 분해되는데, 저자들은 어느 축이 정보를 나르는지 확인하려고 방향만 쓰는 ValueDiff-Dir과 크기만 쓰는 ValueDiff-Norm을 함께 평가한다. 이 점수는 미래 어텐션을 모른다는 가정에서도 유도된다. 미래 어텐션 벡터 α에 대한 기대 출력 교란을 최소화하는 토큰을 고르는 문제에서, 토큰을 구별할 정보가 없을 때 대칭적인 선택인 균등 어텐션 α* = (1/n, ..., 1/n)을 대입하면 교란은 (1/(n-1)^2) ||v_j - v̄||^2로 줄어들고, 그 최소화 지점이 정확히 ValueDiff 점수가 된다(Proposition 3.1).
어떻게 쓰나
실험은 블록 크기 B=128의 블록 프롬프트 처리와 디코딩 단계별 축출을 결합해, 프리필 중 매 블록 경계와 생성 중 매 디코딩 스텝에서 축출한다. 모델은 QK 정규화(Qwen3-4B, Gemma3-4B), 게이티드 어텐션(Qwen3.5-4B, 9B), 학습된 어텐션 싱크(GPT-OSS-20B), logit softcapping(Gemma2-2B, 9B)을 아우르고, 표준 아키텍처인 Llama 3.1-8B, 3.2-3B와 Qwen2.5-3B, 7B가 대조군이다. 베이스라인은 StreamingLLM(고정 싱크+최근 윈도), TOVA·SnapKV(어텐션 점수), KeyNorm·KeyDiff·ManifoldKV(키 기하), FastCAOTE(어텐션×값 기하)다.
전제와 한계
RULER에서는 8k 문맥, 2k와 4k의 빡빡한 예산에서 13개 과제의 dense 대비 유지율을 측정한다. 2k 예산에서 ValueDiff는 싱크가 억제된 7개 모델 전체에서 dense의 88~99%를 유지하며 7개 중 6개에서 최고 또는 공동 최고를 기록한다. LongBench에서는 4k 예산에서 싱크 억제 모델 평균 92% 유지로, 가장 강한 기존 베이스라인의 83%를 앞선다. 이 벤치마크에서 크기 기반 키 선택은 아키텍처 의존적 붕괴를 보이는데, Gemma3-4B(QK-norm)에서 KeyNorm이 49.5%로 무너지고 GPT-OSS-20B(학습된 싱크)에서는 KeyNorm 25.3%, ManifoldKV 31.0%까지 떨어진다. MATH-500에서는 각 모델 평균 시퀀스 길이의 약 25%와 50%를 예산으로 두고 사고 사슬 추론 중의 디코딩 캐시 증가를 압박하는데, 25% 예산에서 ValueDiff는 테스트한 모든 싱크 억제 모델에서 dense를 제외한 최강 방법이고, 게이티드 어텐션 모델에서는 기존 방법을 최대 약 20점 앞선다. Qwen3.5의 25% 예산에서는 어텐션·키 기반 대안이 약 19~24점 뒤진다. 싱크 억제 모델에서 ValueDiff는 빡빡한 예산에서도 dense 성능의 최소 84%를 유지한다.
논문은 결과를 두 축 기하 그림으로 정리한다. BOS 키 벡터와 내용 키 평균의 코사인 유사도(bos-cosim)를 σ_V/σ_K와 함께 그리면, bos-cosim < 0이고 σ_V/σ_K < 1인 사분면 III에서만 KeyDiff가 앞서고 나머지 사분면 I, II, IV에서는 ValueDiff가 KeyDiff를 앞선다. Gemma2-9B는 σ_V/σ_K ≈ 1.0 경계에 놓여 두 방법이 +0.6pt 차이로 거의 동률인데, 어느 신호도 지배적이지 않다는 해석과 맞아떨어진다. 메모리와 지연 측면에서 축출은 입력 길이와 무관하게 캐시를 O(budget)으로 묶는다. Qwen3.5-4B의 128k 문맥에서 최대 GPU 메모리가 15.0GB에서 8.6GB로 43% 줄고, GPT-OSS-20B의 65k 문맥에서는 29% 줄어든다. TTFT는 dense보다 줄어들며 가장 저렴한 축출 베이스라인 대비 3~4% 이내에 머문다.
실무적으로 이 논문은 '내 모델이 어텐션 싱크에 기대는가'를 먼저 확인하라는 신호다. QK 정규화, 게이티드 어텐션, 학습된 싱크, logit softcapping을 쓰는 모델이라면 KeyDiff나 ManifoldKV 같은 키 기하 축출, 혹은 SnapKV·TOVA 같은 어텐션 점수 축출이 조용히 성능을 잃을 수 있다. ValueDiff는 캐시 평균만 있으면 되는 질의 불변 점수라 구현이 단순하고, 블록 프롬프트 처리에서 온라인 비용이 TOVA·SnapKV·KeyDiff와 같은 점근 차수를 가진다. 다만 축출 시점마다 캐시 평균을 다시 계산해야 하고, 어텐션 가중치를 곱하는 FastCAOTE식 변형은 오히려 해롭다는 결과도 함께 봐야 한다. 또한 어떤 신호가 이기는지는 모델의 σ_V/σ_K와 bos-cosim에 달려 있으므로, 배포 전에 자기 모델에서 이 두 값을 재보고 축출 규칙을 고르는 편이 안전하다.
저자들이 밝힌 전제와 한계도 분명하다. Qwen2.5는 레이어별 기하 이질성이 커서 값·키 기하 방법 모두 크게 열화되며, LongBench와 MATH-500 비교에서는 아예 제외된다. Gemma2 계열은 학습된 문맥 길이가 8k라 LongBench 평가에서 빠진다. KVZip은 축출 스텝마다 프리필 길이를 두 배로 늘려 블록 프롬프트 처리에서 비용이 감당되지 않아 베이스라인에서 제외된다. Max-entropy 유도는 대칭 기준점 α*에 의존하며, 어텐션 분포가 평탄해질수록 이 기준점의 관련성이 커진다는 점을 부록에서 다룬다. 또한 혼합 기하 영역에서는 키와 값 어느 쪽도 확실한 우위가 없어, 레이어별로 두 신호를 적응적으로 결합하는 하이브리드 점수가 향후 연구 방향으로 남는다. 지연·메모리 측정은 고정된 블록 처리 구현에서의 스코어링 오버헤드를 재는 것이며, 최적화된 서빙 성능은 커널 수준 캐시 관리에 달려 있다는 단서도 붙는다.
관련 논문
- KV 캐시 축출을 배포 위험 계약으로 재정의한 위험 제어 프레임워크KV 캐시 축출을 평균 품질-메모리 절충이 아니라 배포 위험 제어 문제로 재정식화하고, 목표 위험과 신뢰도 계약을 만족하는 보존 정책을 보정 데이터로 인증한다. 인증 실패 시 전체 KV로 폴백하며, Llama·LongBench 등에서 같은 계약이 허용하는 축출 수준이 달라짐을 보인다.
- 하이브리드 LLM의 KV 너머의 기억을 4B에서 9B로 프리픽스 재생 없이 넘긴다Qwen3.5 4B 하이브리드 모델의 살아 있는 추론 메모리를 9B 모델로 접두사 재처리 없이 넘기는 LatentPort 연구를 정리한다. 번역된 KV에 Gated DeltaNet 영속 상태를 더해 NLL을 0.747 nats/token 낮췄다.