시각 토큰을 버리지 않고 경량 MLP로 레이어별 시각 메모리를 재구성하는 δ-Vision
Just MLPs: Efficient Visual State Reconstruction for Multimodal Language Models
무엇인가
멀티모달 대형 언어모델(MLLM)에서 고해상도 이미지와 비디오는 긴 시각 토큰 시퀀스로 표현되고, 이 토큰들이 내부 LLM의 모든 Transformer 레이어에서 어텐션과 FFN 계산에 참여하기 때문에 추론 비용이 크게 늘어난다. 기존 접근은 중복 시각 토큰을 프루닝해 시퀀스 길이를 줄이지만, 한 번 버린 토큰의 시각적 증거는 이후 레이어에서 다시 접근할 수 없다. 이 논문은 "토큰을 안전하게 버릴 수 있는가" 대신 "모든 시각 토큰을 보존하면서 처리 비용을 줄일 수 있는가"를 묻는다. 즉 시각 토큰이 매 레이어마다 전체 차원으로 진화할 필요가 있는지, 필요한 시각 정보를 더 효율적으로 텍스트 스트림에 통합할 수 있는지를 검토한다.
어떻게 동작하나
저자들은 먼저 visual-to-text 정보 흐름에 저랭크 개입을 가하는 분석을 수행한다. visual-to-text 어텐션을 차단한 뒤 소수 방향만 복원해도 잃어버린 정확도의 대부분이 회복되어, 과제에 유효한 시각 영향이 저차원 부분공간에 집중되어 있음을 보인다. 또한 레이어별 시각 상태가 초기 시각 임베딩으로부터 강하게 예측 가능하다는 관찰을 제시한다. 레이어마다 d→d→d 구조의 경량 MLP를 따로 학습시켜 Transformer가 진화시킨 시각 상태를 근사시킨 결과, 높은 코사인 유사도와 낮은 재구성 오차를 얻었다. 이 두 관찰이 제안 방법의 직접적인 근거가 된다.
무엇과 다른가
제안 방법 δ-Vision은 시각 토큰의 반복적인 Transformer 진화를 경량 저랭크 어댑터로 대체한다. 어댑터는 A_l(X) = X + Δ_l(X), Δ_l(X) = φ(X D_l) U_l 형태로 정의되며, D_l은 d×r 다운프로젝션, U_l은 r×d 업프로젝션, φ는 SiLU 활성화다. U_l을 0으로 초기화해 어댑터가 항등 매핑에서 시작하도록 한다. 잔차 업데이트 Δ_l(X)의 랭크는 최대 r로 제한되지만, 잔차 연결 덕분에 A_l(X) 자체는 전체 d차원 표현을 유지한다. 구성 방식은 두 가지다. embedding adapter는 각 레이어의 메모리를 초기 시각 임베딩 E에서 직접 예측하고(M_l = E + Δ_l(E)), recurrent adapter는 이전 레이어 메모리를 누적 갱신한다(M_0 = E, M_l = M_{l-1} + Δ_l(M_{l-1})).
어떻게 쓰나
예측된 시각 메모리는 동결된 LayerNorm과 원래의 키·값 프로젝션을 통과해 K^v_l, V^v_l이 되고, 텍스트 쿼리는 시각 메모리와 텍스트 컨텍스트에 공동으로 어텐션한다. 반면 시각 쿼리, 시각 어텐션 출력, 시각 FFN 업데이트는 계산하지 않는다. 중요한 점은 M_l이 텍스트 어텐션으로 갱신되지 않는다는 것이다. 레이어 l에서 키·값 컨텍스트로 소비된 뒤 버려지고, 다음 레이어의 메모리는 해당 어댑터가 새로 생성한다. 그 결과 시각 메모리는 백본을 타고 전파되는 은닉 상태가 아니라 외부의 레이어별 컨텍스트 시퀀스가 되며, 모든 시각 토큰에 대한 접근이 동시에 보존된다. 학습에서는 비전 인코더, 멀티모달 프로젝터, LLM 백본을 모두 동결하고 시각 메모리 어댑터만 최적화한다. 원본 MLLM을 teacher, δ-Vision을 student로 두고 정답 토큰 위치에서 forward KL 발산을 최소화하는 Supervised-KD를 사용한다. SFT 및 on-policy distillation과의 비교 실험에서 Supervised-KD가 평균 성능이 가장 좋으면서 on-policy 학습의 롤아웃 비용을 피했다고 보고한다.
전제와 한계
실험은 기본 설정으로 Qwen3-VL-4B-Instruct에 embedding adapter를 붙여 수행한다. 단일 이미지 벤치마크로 MMStar, RealWorldQA, GQA, MMBench, MMBench-CN, MME, POPE, ScienceQA, VQA-v2를 사용하고, 멀티이미지는 MuirBench, 비디오는 Video-MME와 MVBench를 평가한다. FastV, VisionZip, SparseVLM, DART, DivPrune, Zoo-Prune 같은 학습 불필요 프루닝 방법과 LLaVA-Mini, EPIC 같은 학습 기반 압축 방법을 베이스라인으로 삼는다. Qwen3-VL-4B에서 δ-Vision은 평균 74.4점으로 비압축 모델 성능의 92.9%를 유지했고, 5% 토큰 유지 조건의 최강 베이스라인 DivPrune보다 9.1점 높았다. 학습 기반 베이스라인 LLaVA-Mini와 EPIC도 각각 9.4점, 7.5점 앞선다. 시각 토큰 20%를 유지하는 프루닝 방법의 최고 결과도 소폭 상회한다. recurrent adapter를 쓰면 embedding adapter의 74.4점이 75.4점으로 더 올라간다.
효율과 일반화도 함께 보고된다. Video-MME에서 δ-Vision은 비압축 모델 FLOPs의 17.90%만 사용하는데, 이는 시각 토큰 5%만 남기는 프루닝 방법들의 16.58–23.90% 범위와 비슷한 수준이다. 실제로 end-to-end 1.30배, prefill 1.50배 속도 향상을 얻으면서 모든 시각 토큰을 유지한다. 백본 일반화 실험은 LLaVA-1.5-7B, Qwen3-VL-30B-A3B, Qwen3.5-4B에서 수행했고, Qwen3-VL-30B-A3B에서 평균 78.6점(5% 유지 DivPrune 71.3점), Qwen3.5-4B에서 71.6점(DivPrune 62.7점)을 기록했다. 세 백본 모두 vanilla 모델 성능의 약 94–96%를 유지한다. 멀티이미지·비디오에서는 단일 이미지 데이터만으로 학습한 embedding adapter가 평균 49.5점이었고, 멀티이미지·비디오 데이터를 추가하면 52.0점으로 올라간다. MuirBench가 40.7→45.5, MVBench가 57.4→59.5, Video-MME가 50.5→51.0으로 개선되며, 52.0점은 5% 유지 최강 프루닝 베이스라인의 50.2점을 넘는다.
논문은 시각 계산이 실제로 얼마나 필요한지도 세 층위로 분석한다. 원본 모델의 시각 어텐션 출력은 95% 스펙트럼 에너지를 유지하는 데 Qwen3-VL-4B에서 38.0–103.5개, LLaVA-1.5-7B에서 29.6–37.6개 방향만 필요해 스펙트럼이 강하게 집중되어 있다. 저랭크 개입을 레이어 전체에 순차 적용하면, 직접 시각 정보를 완전히 제거할 때 RWQA가 71.2→46.1, MMStar가 64.9→25.6으로 찬스 수준까지 떨어지지만, 128개 은닉 방향만 복원해도 70.7과 64.6으로 회복된다. 레이어별 의존도는 균일하지 않다. Qwen3-VL-4B는 중간 레이어 차단 시 손실이 가장 크고 앞뒤 레이어는 상대적으로 둔감하며, LLaVA-1.5-7B는 더 분산적이고 과제 의존적인 패턴을 보인다. 저자들은 이를 근거로 모든 레이어에 동일하게 전체 시각 계산을 적용하는 대신 레이어별 선택적 스킵이 가능하다고 주장한다.
개발자 관점에서 이 방법은 시각 토큰 프루닝과 경쟁하는 것이 아니라 직교하는 효율 축이다. 시퀀스 길이를 줄이는 대신 은닉 차원 방향의 계산을 압축하므로, 기존 프루닝 파이프라인과 결합할 수 있다(부록 I에서 DART, DivPrune과의 결합 결과를 제시한다). 도입을 검토한다면 몇 가지를 확인해야 한다. 첫째, 학습 불필요 기법이 아니다. 백본별로 어댑터를 KD 학습해야 하며, 비전 인코더·프로젝터·LLM은 동결한다. 둘째, 시각 정보 의존도가 깊이에 따라 비균일하고 모델마다 다르므로 레이어 민감도를 자체 측정해야 한다. 셋째, Qwen3.5-4B처럼 하이브리드 어텐션 아키텍처를 쓰는 백본은 별도 분석이 필요하다고 부록 K에서 다룬다. 넷째, 멀티이미지·비디오처럼 긴 시각 컨텍스트를 다루려면 해당 도메인 데이터를 학습 레시피에 포함해야 효과가 커진다.
한계와 전제는 저자들이 명시적으로 밝힌 범위에서 다음과 같다. δ-Vision은 주어진 Transformer에 맞게 시각 정보를 적응시키는 데 필요한 레이어별 변위가 저차원 은닉 채널 부분공간 안에서 표현될 수 있다고 가정한다. 이 가정이 깨지는 레이어나 과제에서는 근사 오차가 커질 수 있다. 또한 방법 자체가 어댑터 학습을 전제로 하므로 완전한 학습 불필요 기법이 아니며, teacher 모델의 출력 분포에 의존하는 KD 목적함수를 쓴다. 분석 결과가 보여주듯 시각 토큰 처리의 중요도는 깊이에 따라 크게 다르고 모델 특정적이어서, 레이어별 스킵이나 어댑터 배치를 백본마다 다시 설계해야 하는 부담이 남는다. 제공된 원문에는 별도의 한계 절이 없어, 그 밖의 실패 모드나 적용 범위 제한은 명시되어 있지 않다.