V-CoLA가 선형 어텐션 VLM의 비전 토큰을 학습 없이 압축한다

V-CoLA: Vision Token Compression with Linear Attention

HF Daily2610.11251

Hao Jiang, Yiru Mao, Tianpeng Bu2026-10-08조회 1

무엇인가

비전 언어 모델(VLM)은 이미지에서 뽑은 비전 토큰이 텍스트 토큰보다 훨씬 많아 입력 시퀀스를 지배하고, 그만큼 계산과 메모리 부담이 커진다. 그래서 비전 토큰 압축은 오래전부터 효율화의 핵심 방향이었지만, 기존 방법들은 대부분 소프트맥스 어텐션 점수를 직접 쓰거나 소프트맥스 어텐션 모델에서만 평가됐다. Qwen3.5처럼 선형 어텐션을 섞은 하이브리드 아키텍처가 등장하면서 이 방법들의 교차 아키텍처 전이가 어려워졌고, 저자들은 실제로 어텐션 기반·유사도 기반 압축이 하이브리드 구조에서 랜덤 토큰 제거 베이스라인조차 넘지 못한다는 실험 결과를 제시한다. 이 논문은 그 실패 원인을 분석하고, 선형 어텐션에 맞춘 학습 불필요(token compression, training-free) 압축 프레임워크 V-CoLA를 제안한다.

어떻게 동작하나

실패 원인 분석은 두 갈래다. 첫째, Qwen3-VL과 Qwen3.5의 층별 어텐션 분포를 비교하면 Qwen3-VL은 얕은 층에서 비전 토큰 어텐션이 급격히 떨어지지만 Qwen3.5는 중간 층까지 시각 내용에 주목하고 깊은 층에서야 낮아진다. 즉 얕은 층 어텐션만으로는 중요 토큰을 다 찾지 못한다. 둘째, DART식 중복 토큰 선택은 Qwen3.5에서 피벗 토큰을 고정해도 신뢰도가 크게 떨어진다. 저자들은 이를 정보 이론적으로 설명한다. Gated DeltaNet은 전체 히스토리를 고정 크기 상태 S_t ∈ R^{d×d}로 압축하므로, 데이터 처리 부등식에 의해 I(M; S_L) ≤ H(S_L) = c·d² = O(d²)인 반면 소스 정보는 H(M) = L·h(k,v) = O(Ld)다. 따라서 손실되는 정보 H(M | S_L) ≥ Ω(Ld − d²)이고, L > d이면 L에 선형으로 커진다. 고해상도 멀티모달 입력에서 L이 d보다 훨씬 큰 VLM에서는 이 상한이 특히 뼈아프다. 다만 같은 분석이 역으로, 상태를 선택적으로 갱신하는 게이트 자체가 토큰 중요도 신호를 담고 있다는 점을 알려준다.

무엇과 다른가

V-CoLA의 첫 구성 요소는 고유성 인식 중요도 기준(uniqueness-aware importance criterion)이다. 선형 어텐션의 상태 갱신은 매 키를 대응 값으로 매핑하는 온라인 경사하강 한 스텝으로 볼 수 있고, 저자들은 최종 상태 S_L에서의 재구성 오차를 장기 기여도로 삼는다. R_imp_t = 1 − ψ(S_L k_t, v_t)이며 ψ는 정규화 코사인 거리다. 하지만 이것만 쓰면 두드러진 영역에 쏠려 중복 토큰이 대량 선택되고, 게이트 감쇠 누적으로 장기 토큰이 누락될 수 있다. 그래서 토큰 t가 상태에 흡수되기 전후의 상태를, 토큰 t 근처의 실제 쿼리들(Q*_t = Q[t+w1 : t+w2))을 프로브로 삼아 읽은 값의 코사인 거리 R_uni_t = ψ(S_t Q*_t^T, S_{t−1} Q*_t^T)를 단기 고유성 지표로 더한다. 최종 점수는 R_t = (1−λ)·R_imp_t + λ·R_uni_t이고, 실험 기본값은 λ = 0.1, 윈도 (w1, w2) = (0, 4)다. 두 항 모두 값 공간 판독값 사이의 거리라 점수는 [0,1]로 정규화된다.

어떻게 쓰나

두 번째 요소는 적응적 청크 단위 토큰 병합이다. 하드 프루닝 대신 병합이 더 견고하다는 기존 분석에 따라, 중요도 분포 밀도에 맞춰 토큰열을 L' = L × γ개의 청크로 나누되 각 청크의 중요도 합이 기대값 R̄에 가깝도록 분할한다(식 9). 중요도가 밀집한 영역은 잘게, 정보가 적은 영역은 굵게 묶이는 셈이다. 각 청크 안에서는 o'_i = Σ w_t o_t, w_t = exp(R_t/τ) / Σ exp(R_k/τ)로 가중 평균해 하나의 토큰으로 합치며 τ는 1.0이다. 세 번째 요소는 비전 토큰 조기 종료다. 층별로 비전 토큰을 전부 제거하며 혼란도(PPL)를 재보면 layer-24 이후 급격히 떨어져 평탄해지고, MME·MMB·SQA 결과도 exit layer 1에서 967.3 / 22.6 / 83.7, layer 12에서 2169.5 / 80.4 / 90.6, layer 24에서 2401.6 / 85.2 / 92.3, layer 32(제거 안 함)에서 2398.2 / 85.6 / 92.2로 layer-24 이후 비전 토큰 없이도 성능이 유지된다. 저자들은 이 세 요소를 모두 청크 단위 병렬성과 호환되도록 구현 수준에서 최적화했다.

전제와 한계

실험은 Qwen3.5-9B를 주 모델로, Qwen3.5-27B와 InfiniteVL을 추가로 쓰고 NVIDIA A100에서 수행했다. 벤치마크는 MME, MMB, GQA, ScienceQA, TextVQA, POPE, VizWiz, MMStar이며 LMMs-Eval로 평가했다. 비교 대상은 FastV, SparseVLM, DART, VisionZip, 그리고 선형 어텐션용으로 설계된 DTP다. 압축은 기본적으로 layer-1 끝에서 적용하고 조기 종료는 layer-24로 두었다. 결과적으로 토큰을 50%만 남겨도 평균 성능의 99.5%를, 12.5%만 남겨도 88.0% 이상을 유지하며 여러 압축률에서 베이스라인을 앞선다. prefill 지연은 1.86배에서 6.15배까지 줄었고, 프루닝에 따른 추가 런타임은 순전파 비용의 1.6%에 불과하다. 적응적 토큰 병합 자체는 0.86ms로 전체 prefill의 약 0.1%를 차지하며, 확장 Gated DeltaRule 구현은 단일 쿼리 추론에서 원 연산자와 비슷한 지연을 유지하면서 4-쿼리 추론에서 3.85배 빠르다. 절제 실험에서는 λ = 0.1이 가장 좋고 λ ∈ [0.05, 0.10]이 비슷한 성능을 보였으며, (w1, w2)는 (0,4)와 (−4,4)가 유사하되 앞쪽 윈도가 뒤쪽보다 유리했고, 쿼리 수를 4개 이상 늘려도 이득이 없었다. 적응적 병합과 조기 종료 중 하나라도 빼면 성능이 떨어졌고, 온도 계수를 조절하면 하드 프루닝을 흉내 낼 수도 있다. 동일 설정이 Qwen3.5-9B, Qwen3.5-27B, InfiniteVL 세 곳 모두에서 최고 성능을 냈다.

실무 관점에서 이 논문이 유용한 지점은 두 가지다. 하나는 학습 없이 기존 VLM 위에 얹을 수 있는 추론 최적화라는 점이다. 비전 토큰이 긴 고해상도 입력이나 다중 이미지 입력에서 prefill 지연과 KV 캐시 부담을 직접 줄이는 데 쓸 수 있고, 추가 오버헤드가 순전파의 1~2% 수준이라 배포 부담이 작다. 다른 하나는 진단 도구로서의 가치다. 선형 어텐션 하이브리드 모델로 서빙 스택을 옮기면서 기존 소프트맥스 어텐션 기반 토큰 프루닝을 그대로 가져오면 랜덤 제거보다 나을 게 없다는 것이 실측과 정보 이론 양쪽으로 제시되므로, 모델 아키텍처를 먼저 확인하고 압축 기법을 골라야 한다. 다만 압축 적용 위치(layer-1 끝), 조기 종료 층(layer-24), λ와 윈도 같은 기본값이 특정 모델 계열에서 튜닝된 값이라는 점은 자신의 모델에 적용할 때 재확인이 필요한 부분이다.

저자들이 명시한 한계는 두 가지다. 첫째, 아키텍처 커버리지다. 평가는 선형 어텐션 층과 소프트맥스 어텐션 층을 교차 배치한 하이브리드 VLM(Qwen3.5, InfiniteVL)에 집중되어 있고, 순수 Mamba 기반이나 완전 선형 어텐션 VLM은 실험에 포함되지 않았다. 이런 구조에서는 주기적 소프트맥스 어텐션 층이 없다는 전제 때문에 고유성 인식 중요도 기준의 상호작용을 다시 검토해야 할 수 있다. 둘째, 선형 어텐션 정식화의 범위다. 분석과 설계는 Gated DeltaNet 정식화에 주로 근거하고 있으며, 재구성 기반 관점 자체는 일반적이어서 다른 게이트 선형 어텐션 변형으로 확장될 여지가 있지만 더 체계적인 비교 연구가 필요하다고 밝힌다.