5% 시각 토큰만 남긴 MLLM이 자기 생성 궤적 위에서 전체 토큰 교사에게 배우는 온폴리시 자기증류

Fewer Tokens, More Self-Teaching: On-Policy Self-Distillation for Extreme Visual Token Reduction

HF Daily2609.32353

Junxian Li, Ruixuan Yang, Tianao Zhang2026-09-26조회 3

무엇인가

멀티모달 대형 언어모델(MLLM)의 추론 비용을 줄이는 가장 흔한 방법은 시각 인코더가 뱉는 시각 토큰을 솎아내는 것이다. 문제는 예산을 극단까지 낮출 때다. 논문은 5% 수준의 시각 토큰 유지율에서 기존 무학습 토큰 선택 기법들이 더 이상 쓸 만한 성능을 내지 못한다고 지적한다. 저자들의 진단은 이렇다. 시각 토큰을 심하게 압축하면 사용할 수 있는 시각 증거의 양만 줄어드는 게 아니라, 모델이 추론 시점에 마주치는 생성 궤적 자체가 달라진다. 압축 모델의 다음 토큰 예측 분포는 전체 토큰 모델의 분포에서 크게 벗어나고, 한번 생성된 토큰이 다시 문맥으로 들어가면 그 어긋남이 누적된다. 고정된 응답 접두사로 파인튜닝하는 기존 학습 기반 적응은 이 상태를 다루지 못한다.

어떻게 동작하나

제안 방법 LT-OPD(Low-Token On-Policy Distillation)의 핵심은 압축된 학생이 실제로 만들어낸 궤적 위에서 감독한다는 점이다. 학습 시 학생은 유지율 r에 따라 round(r×N)개의 시각 토큰만 보고 응답을 샘플링한다. 이 샘플은 stop-gradient로 취급해 이산 샘플링 과정을 미분하지 않는다. 각 디코딩 스텝 t에서 교사와 학생은 같은 학생 생성 접두사 y<t를 조건으로 평가되지만, 교사는 전체 N개 시각 토큰을, 학생은 압축된 토큰만 본다. 두 다음 토큰 분포 사이의 불일치는 Jensen-Shannon divergence로 측정한다. 즉 교사는 별도 궤적을 생성하지 않고, 현재 학생 정책이 만들어낸 상태 위에서 분포 수준의 감독만 제공한다. 교사는 같은 MLLM의 가중치를 복사해 동결한 자기 교사이며, 학습이 끝나면 압축된 학생만 추론에 남는다. 구현 효율을 위해 top-K 어휘 지원을 사용한다.

무엇과 다른가

여기에 예산 수준 커리큘럼이 붙는다. 학습 초반부터 5% 예산을 강제하면 학생이 쓸모 있는 궤적을 거의 만들지 못한다. 그래서 유지율 r(s)을 세 단계로 조정한다. 처음 s1=14 스텝까지는 (2α+1)β(α=2)로 비교적 넉넉한 예산을 주고, s1부터 s2=100까지는 코사인 곡선으로 β까지 부드럽게 낮추며, 이후에는 목표 예산 β에서 직접 적응한다. 학습 데이터는 LLaVA-Instruct-665K, OneThinker, PixMo, Vision-OPD 등에서 모은 단일 이미지 질문 14,000개로 구성한 LT-14K다.

어떻게 쓰나

실험은 Qwen3.5-4B에 CDPruner를 토큰 축소 연산으로 붙이고 8×A100 80G에서 15.1시간 학습해 진행했다. 평가는 V*Bench, HR-Bench 4K, GQA, MMMU, MMB(en), MME, POPE, TextVQA, OCRBench 아홉 개 벤치마크다. 5% 예산에서 평균 성능 유지율은 학습 전 68.6%에서 82.3%로 올랐다. 같은 예산의 무학습 최강 베이스라인 DivPrune이 77.6%, 학습 기반 최강 베이스라인 EPIC이 73.7%였으니 각각 4.7%p, 8.6%p 앞선다. 9개 중 8개 벤치마크에서 5% 예산 최고 기록이며, V*Bench 74.9 대 70.7, MME 2,077.0 대 1,915.4, OCRBench 535 대 477처럼 세밀한 시각 정보가 필요한 과제에서 격차가 크다. 더 눈에 띄는 건 5%만 남긴 LT-OPD가 10%를 남긴 무학습 기법 전체(최대 80.2%)를 평균 유지율에서 앞서고, 15~20% 예산의 최고 결과에 거의 맞먹는다는 점이다.

전제와 한계

구성 요소별 기여도 분리되어 있다. 단순 SFT에 커리큘럼만 더하면 평균 유지율이 2.7%p 오르고, OPD만 적용하면 81.5%, 둘을 합친 전체 버전이 82.3%다. 고정 접두사에 JSD 지식 증류를 적용한 경우는 77.6%에 그쳐, 이득이 온폴리시 학습 자체에서 나온다는 걸 보여준다. 모델 규모를 키운 Qwen3.5-9B에서는 71.1%에서 81.4%로, 다른 계열인 GLM-4.6V-9B는 73.8%에서 86.3%로, LLaVA-OV-1.5-4B는 71.8%에서 84.1%로 개선됐다. 범용 강화학습 알고리즘 GRPO·GSPO·DAPO와 비교하면 이들은 75.8~78.2%에 머무는데, LT-OPD가 82.3%로 앞선다. 압축으로 잃은 성능을 얼마나 되찾았는지 재는 recovery 지표에서도 네 개 벤치마크 모두 가장 높았고, V*Bench에서는 RL 계열보다 45점 이상 높다. 다중 이미지 벤치마크인 MuirBench와 MVBench에서도 CDPruner와 EPIC을 평균 유지율 기준 12% 이상 앞선다.

효율은 성능 향상의 대가로 잃지 않았다. 5% 시각 토큰 유지 시 KV 캐시가 85.2%, 전체 및 prefill FLOPs가 85.4% 줄고, 추론 시 추가 오버헤드가 없다. FLOPs 비율은 HiPrune과 같은 0.146×이며 EPIC의 0.200×보다 낮다. 다만 종단 간 지연 시간은 1,331.5ms에서 1,293.7ms로 1.029배 개선에 그친다. 저자들은 시각 토큰 축소가 주로 prefill 연산을 줄이는 반면 자기회귀 디코딩 시간은 토큰당 연산과 메모리 접근이 지배하기 때문이라고 설명한다.

실무 관점에서 이 논문이 주는 신호는 두 가지다. 첫째, 시각 토큰 예산을 10% 아래로 내려야 하는 상황이라면 토큰 선택 기법을 바꾸는 것만으로는 한계가 있고, 압축된 모델을 자기 생성 궤적 위에서 다시 학습시키는 절차가 실질적인 성능 회복을 준다. 둘째, 이 학습은 교사 모델을 따로 구할 필요가 없다. 같은 MLLM의 전체 토큰 복사본을 동결해 교사로 쓰고, 학생 롤아웃은 그래디언트 없이 샘플링한 뒤 분포 손실만 역전파하면 되므로 기존 학습 파이프라인에 얹기 쉽다. 도입 전에는 자신의 모델·토큰 축소 연산·목표 예산 조합에서 커리큘럼 스케줄(α, s1, s2)과 top-K 지원 크기를 다시 튜닝해야 하며, 논문이 쓴 CDPruner 외의 축소 연산에서도 같은 이득이 나는지는 별도 확인이 필요하다.

한계는 저자들이 별도의 한계 절로 정리하지 않았고, 본문 곳곳의 전제에서 읽어야 한다. 종단 간 지연 개선이 1.029배로 작아 prefill이 지배적인 워크로드에서만 체감 효과가 크다. 학습에는 8개 A100 80G로 15.1시간이 들고, 학습 데이터 LT-14K는 단일 이미지 질문 14,000개로 한정되어 있어 다중 이미지·비디오는 평가만 있고 학습에는 쓰이지 않았다. 교사는 초기 정책을 동결한 자기 교사이며, 구현상 top-K 어휘 근사를 사용한다. 실험의 목표 예산은 5% 한 점에 집중되어 있고 토큰 축소 연산도 CDPruner로 고정되어 있어, 다른 예산이나 다른 축소 연산으로의 일반화는 논문이 직접 검증하지 않았다.