비디오 월드 모델 2비트 KV 캐시 양자화의 깜빡임을 잡는 QuantWM
QuantWM: Temporally Consistent 2-Bit KV Cache Quantization for Video World Models
무엇인가
비디오 월드 모델은 생성 과정에서 KV 캐시를 계속 쌓아 장기 시간 일관성을 얻지만, 그 캐시가 메모리를 압도한다. 논문이 든 예로 LingBot-World-v2는 약 93프레임(5초) 영상 하나를 만들 때 KV 캐시만 21GiB 이상을 요구한다. 그래서 2비트 KV 캐시 양자화가 유력한 해법으로 연구돼 왔고, 기존 방법(Quant-VideoGen, QVG)은 VBench 같은 영상 벤치마크에서 거의 손실 없는 점수를 보고했다. 그런데 저자들이 비디오 월드 모델에 그대로 적용해 보니, 벤치마크 점수는 그대로인데도 시간적 깜빡임(temporal flickering), 흐림, 아티팩트가 뚜렷하게 나타났다.
어떻게 동작하나
원인 규명이 이 논문의 핵심이다. Key와 Value를 따로 양자화해 보면 K2V16(Key만 2비트)이 K16V2(Value만 2비트)보다 시각 품질이 훨씬 나쁘고, PSNR·SSIM·LPIPS 모두 K16V2가 우세하며 K2V2는 K2V16과 비슷하다. 더 이상한 것은 Key의 재구성 오차가 Value보다 오히려 작은데도 출력 오차는 더 크다는 점이다. 저자들은 이를 어텐션 계산으로 설명한다. 어텐션 로짓 L = QKᵀ/√d이고 양자화로 인한 교란은 ΔL = Q(K−K̂)ᵀ/√d이므로, 작은 Key 오차도 로짓의 상대 순위를 바꿔 Query가 선택하는 시공간 토큰을 다른 프레임·영역으로 밀어낸다. 실제로 2비트 Key는 BF16 대비 토큰 선택이 자주 바뀌며, 측정된 top-1 시공간 토큰 선택 이동률은 최대 61.36%에 달했다.
무엇과 다른가
첫 번째 기법 QSAC(quantization-sensitivity-aware clustering)는 중심점 선택 단계를 바꾼다. 기존 QVG는 K-means로 가장 가까운 중심점을 고르고 잔차를 양자화할 뿐, 잔차 양자화가 로짓에 미치는 영향을 보지 않는다. QSAC는 이전 생성 스텝에서 관측한 Query들의 2차 통계 M_h^{t−1}을 어텐션 헤드별로 누적하고, 그 대각 근사로 채널별 민감도 가중치 w_{h,c}를 만든다. 이 가중치로 Query-aware 거리를 계산해 상위 M개 후보 중심점을 추린 뒤, 각 후보에 대한 잔차의 그룹별 동적 범위 R_g를 이용해 QSAC 점수 S(k_i, μ_j) = Σ_g (Σ_{c∈G_g} w_{h,c}) R_g(r_ij)²를 최소화하는 중심점을 고른다. 즉 로짓 교란이 작아지는 방향으로 중심점을 배정한다.
어떻게 쓰나
두 번째 기법 PSAC(principal-subspace attention compensation)는 QSAC 이후에도 남는 Key 오차 E = K − K̂₀를 직접 보정한다. 같은 Query 통계 M_h^{t−1}을 고유분해해 상위 r개 고유벡터 U_r을 주 Query 부분공간으로 잡고(구현에서 r=8, 상위 8개 방향이 전체 Query 에너지의 60% 이상), C = E U_r을 저장해 K̂ = K̂₀ + C U_rᵀ로 복원한다. U_r은 BF16, C는 INT8로 저장하므로 저랭크라서 오버헤드가 제한적이다. 전체 프레임워크는 학습이 필요 없는(training-free) 2비트 KV 캐시 양자화이며, 256개 중심점과 그룹 크기 64, BF16 중심점 + INT2 잔차를 쓴다.
전제와 한계
실험은 비디오 월드 모델 3종(Matrix-Game-2, HY-World 1.5, LingBot-World-v2)과 자기회귀 영상 생성 모델 2종(LongCat-Video, Causal-Forcing)에서 480p·720p, 93프레임 영상으로 수행했고, 베이스라인은 QVG와 KIVI다. LongCat-Video에서 PSNR이 20.683에서 25.508로, LPIPS가 0.0784에서 0.0332로 개선됐다. KIVI가 더 세밀한 그룹 크기와 BF16 최근 윈도우 캐시를 쓰는데도 QuantWM이 모든 모델에서 최고 성능을 냈다. VBench에서도 평균 순위가 가장 좋았지만, Temporal 점수는 방법 간 차이가 거의 없어 QVG의 명백한 깜빡임을 잡아내지 못했다고 저자들은 지적한다.
어텐션 보존 효과는 토큰 선택 이동률로 검증된다. QVG가 최대 61.36%까지 이동을 일으킨 반면 QuantWM은 평균 51.55%에서 15.31%로 낮췄다. HY-World 1.5 절제 실험에서 QSAC만으로 61.36%→38.17%, PSAC만으로 22.9%, 둘을 합치면 최고 성능이었다. 메모리는 최대 6.20배 압축으로, LongCat-Video에서 KV 캐시가 21.709GiB에서 3.625GiB로 줄었다. 지연 시간은 LingBot-World-v2에서 5.44%, HY-World 1.5에서 5.87% 늘었고 LongCat-Video에서는 오히려 17.78% 줄었다.
개발자 관점에서 이 논문이 주는 실무적 교훈은 두 가지다. 첫째, 영상 생성 모델의 KV 캐시를 2비트로 누를 때 VBench 같은 집계 지표만 보고 판단하면 안 된다. 점수가 유지돼도 프레임 간 깜빡임이 생길 수 있으므로 프레임 단위 PSNR·SSIM·LPIPS와 토큰 선택 이동률 같은 진단 지표를 함께 봐야 한다. 둘째, Key와 Value를 같은 민감도로 취급하면 안 된다. Key 쪽에 Query 통계 기반 가중치와 저랭크 보상을 추가로 얹는 것이 메모리 이득을 거의 그대로 유지하면서 화질을 지키는 경로다.
한계와 전제도 분명하다. 저자들은 2비트 표현력의 한계 때문에 QSAC를 적용해도 Key 양자화 오차가 완전히 사라지지 않는다고 인정하며, 그래서 PSAC라는 별도 보상 단계를 둔다. PSAC는 상위 r=8 고유벡터만 보존하는 근사이고, Query 에너지가 소수 주방향에 집중된다는 관찰에 의존한다. 평가는 93프레임, 480p·720p 영상에 한정되며, VBench의 Temporal 지표가 이 논문이 다루는 시각적 열화를 충분히 반영하지 못한다는 점도 저자들이 명시한 전제다. 논문에 별도의 한계 절이 따로 있는 것은 아니고, 이 전제들은 방법 설명과 실험 해석 과정에서 드러난다.