DeepSeek V4의 청크 KV 캐시 압축이 토큰 위치에 따라 정답률을 흔든다
바이트댄스 연구팀이 DeepSeek V4 계열 모델에서 입력의 사소한 차이가 정답과 오답을 가르는 현상을 분석한 논문을 공개했다. 논문 제목은 "Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression"으로, 문제의 원인을 모델 크기나 학습 데이터가 아니라 긴 문맥을 처리하기 위해 도입한 청크 단위 KV 캐시 압축에서 찾았다. 같은 질문을 두 번 던지면서 공백 문자 몇 개만 더 넣었을 뿐인데 한쪽은 정답을, 다른 쪽은 엉뚱한 답을 내놓는다는 관찰에서 출발한 연구다.
가장 구체적인 사례는 코드 생성 실험이다. FP8 양자화 함수의 마지막 토큰을 채우는 과제에서 정답은 8이었지만, 연구진이 코드 맨 앞에 장식용 등호를 넣자 모델은 32를 출력했다. 등호 개수를 4로 나눈 나머지가 0이나 1이면 오답률이 71.3%까지 올라갔고, 나머지가 2나 3이면 정답률이 91.5%로 되돌아왔다. 논문에 따르면 이는 특정 토큰이 압축 구간의 어느 자리에 놓이느냐에 따라 정보가 보존되거나 버려지기 때문에 생기는 현상이다.
메커니즘은 이렇다. 청크 KV 캐시 압축은 연속된 토큰을 고정 길이로 잘라 각 구간을 학습 가능한 게이팅 레이어를 통해 요약본으로 압축한다. 긴 문맥의 메모리 부담을 크게 줄이는 대신, 표준 트랜스포머 어텐션이 토큰 간 상대 거리만 보던 것과 달리 구간 내 위치, 즉 위상이 중요해진다. 게이팅 레이어가 자리마다 다른 가중치를 주기 때문에 유리한 슬롯에 놓인 토큰은 살아남고, 사각지대 슬롯에 놓인 토큰은 사실상 무시된다. 연구진은 어텐션 헤드가 구간 앞쪽과 뒤쪽을 나눠 맡는 식으로 분업한다는 점도 확인했다.
규모를 키운 실험도 있다. 128K 토큰 길이의 문맥에 약 1만 6천 개의 키-값 쌍을 넣고, 관계와 질문, 전체 길이는 그대로 둔 채 특정 키-값 쌍의 위치만 옮겼다. DeepSeek-V4-Flash-Base는 위치에 따라 정확도 차이가 최대 40.2%포인트 벌어졌고, DeepSeek-V4-Pro-Base는 34.8%포인트였다. 후속 학습을 거친 뒤에도 각각 19.1%포인트와 14.8%포인트의 격차가 남았다. DeepSeek이 압축 스텝을 4에서 2로 절반으로 줄인 DeepSeek-V4.1-Flash에서는 격차가 6.1%포인트까지 줄었지만 완전히 사라지지는 않았다.
이 현상이 특정 모델만의 문제인지도 검증했다. 연구진은 Qwen3-0.6B 아키텍처로 압축 방식만 바꾼 모델들을 처음부터 학습시켰다. 청크 압축을 쓴 모델은 모두 주기적인 정확도 변동을 보였고, 압축 없이 전체 어텐션을 쓰는 기준 모델은 그런 변동이 없었다. RoPE 위치 인코딩을 제거해도 변동은 남았고, 학습 가능한 게이팅 가중치를 단순 균등 평균으로 바꿔도 마찬가지였다. 압축 스텝을 4, 6, 8, 12로 두면 정확도 변동 주기도 4, 6, 8, 12로 따라갔다. 논문은 이를 고정 길이 분할 압축 방식 자체의 구조적 결함으로 규정한다.
대안으로 논문이 제시하는 방향은 분할 경계를 내용에 따라 움직이는 동적 청킹이다. 정보 밀도가 낮은 구간은 크게 묶고, 중요한 전환점이나 밀도 높은 구간은 잘게 쪼개면 토큰이 고정된 위상을 갖지 않게 되어 위치 민감성이 사라진다는 논리다. 다만 GPU가 8, 16, 32로 나누어떨어지는 규칙적인 행렬 연산에 최적화돼 있어, 크기가 제각각인 블록은 텐서 코어 활용률을 떨어뜨린다. 논문은 제로 패딩으로 물리 메모리는 촘촘하게 채우면서 논리적 경계는 유지하는 방법과, 트랜스포머 레이어 간 동적 분할 경계가 유사해 재사용할 수 있다는 관찰을 함께 언급한다.
관련 연구로는 홍콩과학기술대학교 광저우 캠퍼스 팀의 ChunkKV가 소개된다. 토큰 단위로 점수를 매겨 중요한 것만 남기는 H2O, SnapKV, PyramidKV와 달리 연속된 의미 블록을 통째로 남기거나 버리는 방식이다. 논문에 인용된 NIAH 테스트에서 KV 캐시를 128로 제한했을 때 LLaMA-3 기반 ChunkKV는 73.8%를 기록해 SnapKV의 58.9%를 앞섰다. Jina AI의 지연 청킹, 마이크로소프트 아시아 연구소의 MInference도 함께 언급된다. MInference는 어텐션 행렬의 고정된 희소 패턴을 활용해 백만 토큰급 문맥의 프리필 단계를 최대 10배 가속한다고 보고됐다.
실무 관점에서 이 논문이 던지는 신호는 분명하다. 청크 압축이나 희소화를 적용한 모델을 쓴다면 프롬프트의 서식, 공백, 앞부분 장식 텍스트 같은 사소한 요소가 결과를 바꿀 수 있다. 긴 문맥을 다루는 서비스라면 동일 내용을 위치만 바꿔 여러 번 평가하는 위치 민감도 테스트를 별도로 두는 편이 안전하다. 다만 이번 분석은 논문에 보고된 특정 버전과 실험 조건에 근거한 것이며, DeepSeek 측이 공식적으로 확인하거나 반박한 내용은 원문에 포함돼 있지 않다.