VPRune은 LLM 전 시각토큰을 학습 없이 편향·손실·왜곡 줄이며 가지치기한다.

VPRune: Efficient Training-free Pre-LLM Visual Token Pruning

arXiv2609.24485v1

Guangchuan Lv2026-09-21조회 4

무엇인가

이 논문은 대규모 비전-언어 모델(LVLM)에서 시각 토큰을 LLM에 넣기 전에 줄이는 pre-LLM visual token pruning을 다룬다. 시각 표현에는 중복이 많고 긴 시각 토큰 시퀀스는 추론 지연과 엣지 배포 비용을 키우지만, 공격적으로 토큰을 줄이면 성능이 크게 떨어진다. 저자들은 그 원인을 세 가지로 본다. 텍스트 조건이 토큰 선택을 과도하게 집중시켜 시각적 커버리지를 줄이는 text-guided selection bias, 버려진 토큰이 중복일 뿐 아니라 상보적 증거를 담을 수 있다는 정보 손실, 그리고 시퀀스 압축이 유지 토큰에 연속 위치 인덱스를 재할당해 공간 관계를 왜곡하는 positional distortion이다. 기존 방법들이 토큰이 많은 LVLM 설정을 전제로 하는 반면, 엣지 지향 모델은 이미 압축된 표현을 쓰기 때문에 같은 유지 비율에서도 절대 토큰 예산이 더 빡빡해 이런 손실에 민감하다고 주장한다.

어떻게 동작하나

제안 방법 VPRune은 학습 없이(training-free) LLM 이전 단계에서 동작하는 프레임워크다. 멀티모달 프로젝터를 통과한 시각 토큰 X={x_i}, i=1..N을 입력으로 받고, N=256 설정에서 유지 비율 b에 대해 K=round(bN)개의 토큰을 남긴다. 가지치기는 프로젝터 이후, LLM 이전에 수행되므로 LLM은 줄어든 시각 시퀀스를 처리한다. VPRune은 세 구성 요소로 이루어진다. Visual-only Diversity Selection(VDS)은 텍스트 관련성 편향을 제거하고 시각적으로 다양한 부분집합을 고른다. Similarity-guided Token Recycling(STR)은 버려진 토큰의 상보 정보를 유사한 유지 토큰으로 흡수한다. Position-Preserving Restoration(PPR)은 유지 토큰의 원래 래스터 순서와 위치 인덱스를 복원한다.

무엇과 다른가

VDS는 DPP(Determinantal Point Process) 목적함수를 사용한다. 코사인 유사도 기반 시각 다양성 커널을 L, 정규화된 텍스트 관련성 점수의 대각 행렬을 D_r=diag(r_1,...,r_N)이라 하면 텍스트 조건이 결합된 커널은 L~=D_r L D_r이 된다. 이때 부분집합 S의 목적식은 log det(L~_S)=log det(L_S)+2Σ_{i∈S} log r_i로 분해되는데, 이는 텍스트 관련성이 다양성 목적에 명시적 가산 편향을 더한다는 뜻이다. 공격적 압축에서는 텍스트 관련성이 낮은 시각적 보완 토큰이 강하게 억제될 수 있다. 그래서 VDS는 텍스트 조건을 제거하고 S*=argmax_{|S|=K} log det(L_S)를 그리디 MAP 추론으로 푼다.

어떻게 쓰나

STR은 버려진 토큰을 그냥 삭제하지 않는다. 각 버려진 토큰 i∈D를 유지 토큰 중 가장 유사한 j*(i)=argmax_{j∈S} cos(x_i,x_j)에 할당하고, DPP 커널에서 이미 계산한 유사도를 재사용한다. 유지 토큰 j에 할당된 버려진 토큰 집합을 G_j라 할 때 가중치는 w_ij=exp(L_ij/τ)/Σ_{i'∈G_j} exp(L_i'j/τ)로 계산한다. 유지 표현은 x~_j=(1-γ)x_j+γΣ_{i∈G_j} w_ij x_i로 갱신되며, G_j가 비어 있으면 x~_j=x_j를 유지한다. γ는 재활용 정보량을 조절하고 토큰 수는 늘리지 않는다. PPR은 유지 토큰의 원래 래스터 인덱스 S={q_i}, q_1<...<q_K에 대해 위치를 p_i^vis=N_prefix+q_i로 부여한다. 기존처럼 N_prefix+i로 압축하지 않고, 이미지 뒤 텍스트 토큰은 N_prefix+N에서 시작하게 해 원래 시각 토큰 범위를 보존한다. 유지 임베딩은 여전히 K개 토큰의 압축 시퀀스이고, 빈 토큰 슬롯을 만드는 대신 위치 인덱스에만 간격을 둔다.

전제와 한계

실험은 고정된 FastVLM-1.5B에서 수행한다. 이 모델은 FastViT-HD 비전 인코더와 Qwen2 LLM을 사용하고, 입력은 1024×1024로 패딩되어 256개 시각 토큰을 만든다. 비교 대상은 CDPruner, VScan, FastV, HiPrune, VisionZip, FlashVLM의 여섯 가지 대표적 시각 토큰 감소 방법이다. 벤치마크는 조합적 추론 GQA, 텍스트가 많은 이해 TextVQA, 객체 환각 POPE-adv, 도표 이해 AI2D의 500샘플 부분집합 AI2D-lite, 차트 추론 ChartQA다. 유지 비율 b는 0.3, 0.6, 0.8에서 정확도를 보고하고 효율 실험에는 b=0.1도 쓴다. 모든 실행은 파인튜닝 없이 그리디 디코딩, 배치 크기 1이며 VPRune은 γ=0.3, τ=0.1로 설정한다. 엣지 지연은 Qualcomm QCS8550 개발 플랫폼에서 CPU만 사용하고 GPU와 NPU 가속을 끈 상태로 측정한다. QCS8550은 최대 3.2GHz의 64비트 Kryo CPU를 갖춘 자원 제약 플랫폼이다.

주요 결과에서 VPRune은 보고된 모든 감소 비율에서 가장 높은 정규화 평균 성능을 낸다. 토큰 제거율 20%, 40%, 70%에서 각각 전체 토큰 성능의 99.47%, 98.14%, 94.87%를 유지한다. 2위 방법과의 격차는 20%와 40% 제거에서 0.77, 1.21 퍼센트포인트였지만 70% 제거에서는 FastV보다 9.90포인트 커진다. 이 70% 제거 설정에서 VPRune은 다섯 벤치마크 모두 1위다. 가장 큰 이득은 TextVQA와 ChartQA에서 나오며 각각 2위보다 8.49, 11.64 원점 높다. 저자들은 이 두 과제가 세밀한 텍스트나 구조적 시각 증거에 의존해 공격적 가지치기에 민감하다고 설명한다. POPE-adv에서는 격차가 더 작은데, 여러 방법의 점수가 전체 토큰 기준선 근처에 머물기 때문이다. 절제 실험은 b=0.3에서 수행했고, 텍스트 기반 관련성을 제거하면 TextVQA에서 큰 이득, GQA에서 완만한 개선이 있었다. PPR은 두 벤치마크를 추가로 개선하고 STR은 버려진 토큰의 상보 정보를 회복해 일관된 추가 이득을 준다. 재활용 강도 γ는 중간값에서 비교적 안정적이고 과도하면 성능이 떨어진다.

효율 분석에서 VPRune은 멀티모달 프로젝터 이후에 가지치기하므로 비전 인코더 지연은 기준선에 가깝게 유지한다. 반면 VScan, VisionZip, HiPrune은 비전 쪽 오버헤드가 더 크다. LLM 추론 전에 시각 시퀀스를 줄이는 것은 종단 간 이득으로 이어진다. QCS8550 CPU 전용 환경에서 TTFT는 전체 토큰 기준선 25.551초에서 b=0.1일 때 20.365초로 줄어 20.30% 감소한다. 감소율은 b=0.3, 0.6, 0.8에서 각각 14.97%, 8.82%, 4.02%다. 30% 토큰 유지(b=0.3)에서는 LLM 프리필 지연이 9.88초에서 6.13초로 38.0% 줄었다고 보고한다. VPRune의 TTFT는 가장 빠른 경쟁 방법과 비슷한 수준이면서 공격적 압축에서 더 높은 정확도를 유지해 엣지 배포에 유리한 정확도-지연 트레이드오프를 보인다고 주장한다.

개발자 관점에서 VPRune은 LVLM 추론 비용을 줄여야 하는 엣지·CPU 환경에서, 특히 TextVQA나 ChartQA처럼 세밀한 텍스트와 구조 정보가 중요한 작업에서 검토할 만하다. 학습이나 모델 수정 없이 프로젝터 뒤, LLM 앞에 붙일 수 있는 전처리 가지치기라는 점이 실무적으로 매력적이다. 다만 원문은 FastVLM-1.5B 한 모델, 1024×1024 입력, 256개 시각 토큰, QCS8550 CPU 전용 플랫폼에서만 평가했다. γ=0.3, τ=0.1 같은 하이퍼파라미터와 b 값에 따라 결과가 달라질 수 있고, 다른 LVLM 구조나 GPU·NPU 환경, 다른 토큰 수에서도 같은 이득이 나오는지는 원문에 제시되지 않았다. 저자들은 별도의 한계 절을 두지 않았지만, 실험 전제가 단일 모델과 단일 엣지 플랫폼에 집중되어 있다는 점은 실제 도입 전에 확인해야 할 부분이다.