Braco는 극한 시각 토큰 압축을 토큰 파라미터화 문제로 재정의한다

Beyond Selection: Token Parameterization for Extreme Visual Token Compression

HF Daily2609.35232

Rui Zhong, Yu Li, Zheyu Yan2026-09-28조회 2

무엇인가

비전-언어 모델(VLM)은 이미지를 시각 토큰 시퀀스로 인코딩해 멀티모달 추론을 수행하지만, 비용이 토큰 수에 선형으로 비례한다. 모바일 추론, 저지연 대화형 에이전트, 롱컨텍스트 멀티모달 추론 같은 배포 환경에서는 이미지 토큰을 수십 개 수준으로 줄여야 하는데, 이 극한 예산 구간에서 기존 토큰 프루닝은 드물지만 결정적인 영역을 버려 시각적 그라운딩을 깨뜨린다. 어텐션 기반 중요도 프록시 자체가 불안정하다는 문제도 있다. 학습된 리샘플러는 이런 취약성을 완화하지만 압축 모듈 안에 추가 어텐션 연산과 파라미터, 다단계 학습과 정렬 복잡도를 끌어들인다. 이 논문은 압축을 토큰 선택 문제가 아니라 토큰 파라미터화 문제로 다시 본다.

어떻게 동작하나

저자들은 압축을 두 축으로 분리한다. 하나는 기저 변환과 구조적 절단으로 결정되는 압축성(compressibility), 다른 하나는 유지된 부분공간 안에서의 좌표 구성으로 결정되는 학습 가능성(learnability)이다. 토큰 코더는 Z = A P_S U_B X로 정식화된다. 직교 기저 B가 토큰 격자를 재표현하고, 고정된 인덱스 집합 S가 K개 좌표를 남기며, 직교 행렬 A가 그 안의 좌표를 재구성한다. (B, S)는 어떤 부분공간을 남길지, A는 같은 부분공간 안의 좌표를 어떻게 배열할지를 담당한다. 압축성은 에너지 보존율 E와 과제 방향 보존율 R의 가중합 C = λE + (1-λ)R로, 학습 가능성은 통계적 조건화 페널티와 기하학적 호환성 페널티의 합 L_learn = (1/K²)L_st + βL_geo로 측정한다.

무엇과 다른가

이 분석을 바탕으로 한 실제 코더 Braco는 네 단계다. 첫째, N×N 시각 토큰 격자에 2D DCT를 적용하고 C×C 저주파 블록만 남긴다(백본 토큰 수 K_b = C²). 공간·DCT·Haar·랜덤 직교 기저를 비교한 결과 DCT가 에너지 집중, 과제 판독성, 구현 단순성에서 가장 좋았다. 둘째, DCT 계수는 명시적 공간 정체성을 잃으므로 유지된 변환 좌표 (u,v)에 입력 독립적인 기저 좌표 임베딩을 더해 안정적인 인덱싱 단서를 복원한다. 셋째, 같은 부분공간 안에서 예산에 따라 좌표 구성을 바꾼다. K_b = C² < 16이면 계수 좌표(vanilla), K_b ≥ 16이면 역 DCT로 만든 성긴 공간 격자(idct)를 쓴다. 넷째, 저역 통과 절단이 놓치는 국소 정보를 되살리기 위해 TokenLearner 스타일 스코어러가 sparsemax 가중 맵으로 원본 공간 격자에서 S개 잔차 토큰을 만든다. 전체 예산은 K = K_b + K_r로 나뉘고, K = 4/9/16/25에 대해 c1s3/c2s5/c3s7/c4s9 조합을 쓴다.

어떻게 쓰나

진단 실험에서 DCT와 Haar는 공간·랜덤 기저보다 훨씬 많은 에너지를 보존했다. K=32에서 약 0.51 대 약 0.04, K=64에서 약 0.57 대 약 0.08이었다. CelebA 선형 프로브에서 DCT는 K=1에서 91.6% 대 공간 기저 89.8%, K=4에서 92.5% 대 90.9%를 기록했다. 학습 가능성 진단에서는 K_b=4일 때 vanilla만 목표에 도달했고, K_b=16과 64에서는 idct가 각각 18%, 60% 더 빠르게 도달했다.

전제와 한계

본 실험은 LLaVA-1.5-7B에 Braco를 구현하고 GQA, MMBench(EN/CN), MME, POPE, ScienceQA, TextVQA, MMVet에서 PruMerge, DivPrune, MQT-LLaVA, QueCC, TokenPacker, Fourier-VLM과 동일 토큰 예산으로 비교했다. 576토큰 Vanilla 상한 대비 프리필 FLOPs를 8.67T에서 1.09~1.37T로 줄이면서 4~25토큰 구간에서 Vanilla 정규화 정확도 91.2~95.2%를 유지했다. 25·16·9토큰에서 평가 대상 중 최고 정확도를 냈고, 4토큰에서는 QueCC에 0.2 정확도 이내로 따라붙었다. 16·9토큰에서는 QueCC와 0.1 정확도 이내이면서 지연시간을 약 36% 줄였다. 16토큰 압축기만 분리 측정하면 QueCC와 같은 정확도로 모듈 지연시간 16.6배, 압축기 FLOPs 78.8배 낮다. 2880 입력 토큰 Vicuna-7B에서는 98.1 정확도를 유지하며 프리필 FLOPs를 40.57T에서 3.45T로, 지연시간을 261.08ms에서 44.36ms로 줄였다. Qwen2.5-3B에서는 729/1024 토큰에서 93.1/92.6 정확도, 3645 토큰(182배 압축)에서 90.8 정확도를 기록했는데, 비교 대상 이전 방법은 같은 조건에서 68.9%로 떨어졌다.

절제 실험도 설계 선택을 뒷받침한다. 9토큰에서 하이브리드 c2s5는 93.2 정확도로 순수 백본 c3s0(89.8)과 잔차 전용 c0s9(92.0)를 앞섰다. 16토큰 c3s7 설정에서 DCT 백본을 공간/Haar 토큰으로 바꾸면 2.3~3.0점, 좌표 구성을 idct/랜덤 회전으로 바꾸면 2.5~3.1점, Polar Fourier 임베딩을 학습형/2D 사인-코사인으로 바꾸면 0.8~0.9점이 깎였다.

개발자 관점에서 이 논문의 실무적 의미는 압축 인터페이스의 비용을 프롬프트와 독립적으로 측정할 수 있다는 점이다. Braco는 쿼리 조건부 집계를 쓰지 않으므로 압축기 지연시간과 FLOPs를 별도로 계량할 수 있고, 입력 토큰이 커질수록 절감 효과가 커진다. 다만 실제 도입 전에는 자신의 워크로드에서 백본/잔차 토큰 배분(cXsY)과 K_b=16이라는 좌표 전환 임계값이 그대로 유효한지 확인해야 한다. 이 값들은 특정 진단과 실험에서 나온 경험적 선택이기 때문이다.

한계와 전제도 분명하다. 4토큰에서는 QueCC를 앞서지 못하고 0.2 정확도 이내에 머문다. 576토큰 스윕은 전체 파이프라인 FLOPs와 지연시간에 토큰 수에 둔감한 비전·프롬프트 처리 비용이 섞여 있어 주로 극한 압축에서 정확도가 버티는지를 시험한다. Qwen2.5-3B에서 QueCC가 무너지는 현상에 대해 저자들은 쿼리 의존적 압축이 작은 LLM의 약한 프롬프트 이해에 민감할 수 있다고 해석하는데, 이는 추정이며 원문에 별도의 한계 절이 제시된 것은 아니다.