롱비디오 VLM 효율은 프레임·해상도·전단 지연의 공동 배분 문제다
Rethinking Long-Video Efficiency: A Joint Allocation Perspective on Frames, Pixels, and Front-End Latency
무엇인가
이 논문이 다루는 문제는 긴 영상 이해에서 비전-언어 모델(VLM)의 효율을 어디서 확보할 것인가다. 기존 연구는 대부분 네이티브 해상도를 고정한 채 어떤 프레임을 고를지, 혹은 어떤 시각 토큰을 남길지만을 문제로 삼았다. 저자들은 이 틀 자체가 두 개의 축을 쓰지 않고 있다고 주장한다. 첫째, 프레임별 해상도를 낮추면 그만큼 토큰 예산이 남아 더 촘촘한 시간 커버리지를 살 수 있는데도 해상도는 기본값으로 방치된다. 둘째, VLM에 들어가기 전 영상을 디코딩하고 프레임을 전처리하는 전단(front-end) 지연은 영상 길이에 따라 커지며, 시간 단위 영상에서는 모델 추론 자체를 넘어설 수 있는데도 거의 계산되지 않는다. 그래서 질문은 "어떤 토큰을 남길까"가 아니라 "프레임 수, 프레임별 해상도, 전단 지연에 걸쳐 예산을 어떻게 공동 배분할까"가 된다.
어떻게 동작하나
이 관점은 여러 VLM과 롱비디오 벤치마크에 걸친 실증 연구에서 세 가지 교훈으로 정리된다. 첫째, 동일 토큰 예산에서 프레임당 해상도를 희생해 시간 커버리지를 높이는 편이 희소한 네이티브 해상도 샘플링보다 일관되게 낫다. 약 5,760 토큰 예산에서 (16, 1.0) 대신 (256, 0.25)를 쓰면 Qwen3-VL-4B 기준 VideoMME +6.66%p, MLVU +10.47%p, LVBench +5.10%p가 나온다. 둘째, 해상도 민감도는 과제 의존적이다. OCR과 속성 인식 같은 과제는 공격적 다운스케일에서 크게 무너지고, 행동 인식이나 시간 추론은 강건하다. 같은 예산에서 (64, 0.5)와 (256, 0.25)는 민감/비민감 부분집합 사이에서 우열이 뒤집히므로, 어떤 단일 (N, r) 조합도 모든 과제에 최적일 수 없다. 셋째, 전단 지연이 지배적이다. 비디오 코덱은 프레임을 GOP로 묶고 I-프레임 뒤에 P/B-프레임을 순차 참조하는데, 특정 P-프레임 하나를 뽑으려면 I-프레임부터 그 지점까지 순차 디코딩해야 한다. FPS=1로 후보 풀을 만드는 디코드-후-선택 방식은 지연이 영상 길이에 선형으로 늘어 60분 영상에서 7.4배까지 벌어지고, 256프레임 균일 샘플링은 지연이 상수로 유지된다.
무엇과 다른가
제안 방법 LoHi는 이 세 교훈을 하나의 문제, 즉 전단 지연 제약 아래의 프레임-해상도 배분으로 통합한다. 핵심은 단일 설정 (N, r)을 두 개의 상보적 스트림으로 쪼개는 교차 해상도 분해다. 조밀한 저해상도 비디오 스트림(Lo-V)이 전체 타임라인의 시간 커버리지를 맡고, K≪N개의 고해상도 이미지 스트림(Hi-I)이 공간 디테일을 복구한다. 두 스트림은 토큰 예산 N·τ(r_l) + K·τ(r_h) ≤ B를 함께 만족하고, 디코딩 예산은 N_dec = N으로 영상 길이와 무관하게 고정된다. Hi-I 인덱스는 Lo-V 그리드의 부분집합에서 뽑기 때문에 각 프레임은 네이티브 해상도로 한 번만 디코딩되어 두 스케일에서 재사용된다. 구현은 Qwen-VL 계열처럼 비디오 경로(3D 시공간 mRoPE)와 이미지 경로(2D 위치 인코딩)를 함께 노출하는 통합 VLM에서 이뤄진다. Lo-V는 비디오 경로로, Hi-I는 이미지 경로로 보내 비디오 타임라인을 건드리지 않고, 두 스트림 사이에 자연어 마커를 넣어 고해상도 이미지가 어떤 저해상도 영상의 선택된 키프레임인지 모델에 알려준다. 파인튜닝이나 구조 변경은 필요 없다.
어떻게 쓰나
Hi-I를 고르는 선택기는 세 가지다. LoHi-Uniform은 Lo-V 그리드에서 일정 간격으로 K개를 뽑는 추가 비용 0의 기본형이다. LoHi-Anchor는 코덱이 이미 계산해 둔 I-프레임 인덱스를 무료 의미 신호로 활용해, 균등 간격 위치마다 가장 가까운 I-프레임에 대응하는 Lo-V 프레임을 고른다. 픽셀 디코딩이 추가로 필요 없다. LoHi-SemDiv는 Hi-I 선택을 질의 Q가 주어진 상태에서의 부분집합 선택 문제로 보고, CLIP 임베딩 위에 품질-유사도 분해를 적용한 DPP 커널 L = diag(q) E E^T diag(q)를 만든다. 대각 성분 q_j^2는 질의-프레임 코사인 유사도를 min-max 정규화 후 α=5로 샤프닝한 관련도이고, 비대각 성분은 관련도와 프레임 간 시각적 유사도를 곱해 유사한 프레임이 함께 뽑히면 행렬식이 작아지도록 벌점을 준다. 목적함수는 log det(L_S + I)를 최대화하는 것이며, 항등 정규화 덕분에 이 함수는 단조 증가 부분모듈러가 되어 탐욕 근사가 최적의 (1-1/e) 이상을 보장한다. 여기에 더해 Lo-V만으로 답을 생성해 답 분포의 엔트로피가 임계값 θ를 넘을 때만 Hi-I를 호출하는 적응형 변형이 있다.
전제와 한계
실험은 VideoMME(자막 제외), MLVU, LVBench 세 벤치마크에서 수행됐다. 주 백본은 Qwen3-VL-4B이고 Qwen3-VL-8B, Qwen3.5-4B, VideoLLaMA3-7B, VideoChat3-4B, Qwen2.5-VL-7B로 일반화를 확인한다. 비교 대상은 키프레임 선택 계열 AKS, BOLT, CLIP-Topk와 토큰 프루닝 계열 FlashVid, VisionZip이다. 모든 방법이 영상당 디코딩 프레임을 256 이하로 제한하고 약 5,760 토큰 예산을 공유한다. LoHi는 Lo-V로 N=128 @ r_l=0.25, Hi-I로 K=8 @ r_h=1.0을 써서 N_dec=128, 즉 베이스라인 256프레임의 절반만 디코딩한다. 결과적으로 LoHi-SemDiv가 VideoMME 66.81%, MLVU 74.38%, LVBench 45.90%로 세 벤치마크 모두 최고 성능이며, 네이티브 해상도 기본형(16F, 1.0) 대비 평균 +10.60%p, 가장 강한 기존 방법인 BOLT 대비 +5.23%p다. 선택 로직이 전혀 없는 저해상도 베이스([email protected])만으로도 기존 키프레임 선택·토큰 프루닝 베이스라인 평균을 앞선다. 선택기 순서는 모든 벤치마크에서 SemDiv > Anchor > Uniform이었고, MLVU에서 SemDiv가 Uniform보다 +6.76%p 높았다. 효율 쪽에서는 전단 지연이 5.4초에서 3.3초로 줄고, 네이티브 해상도로 인코딩한 뒤 토큰을 버리는 프루닝 방법들이 겪는 비전 타워 병목(464.3 TFLOPs, 2,486ms)을 피해 ViT 지연을 약 12배(2,486→195ms) 줄이며 GPU 메모리 9.6GB를 쓴다. TTFT는 5,963ms에서 3,906ms로, 같은 조건에서 VideoMME 정확도는 64.44%에서 66.81%로 올라간다.
절제 실험은 세 축을 확인한다. Hi-I 개수 K∈{2,4,8}와 네 가지 선택 전략의 12개 조합이 모두 VideoMME에서 65.22~66.81%를 기록해 128프레임 Lo-V 단독(63.00%)을 넘었고, 이득이 특정 선택기나 예산에 국한되지 않음을 보인다. 두 스트림의 상보성도 분리 실험으로 드러난다. 같은 5,760 토큰에서 조밀 저해상도 비디오만 쓰면 64.44%, 희소 고해상도 이미지만 쓰면 63.74%인데, 128프레임 Lo-V와 8장 Hi-I를 합치면 66.81%가 된다. 별도로 EgoLongQA에서 Qwen3.5-27B를 쓸 때 LoHi는 더 높은 해상도의 단일 스트림 베이스라인과 같은 정확도를 시각 토큰 29% 적게 쓰고 달성한다. 또한 25%/50% 예산에서 단순 리사이즈가 MMTok을 포함한 전용 프루닝 방법들과 동등하거나 더 낫다는 결과를 제시하며, 프레임 간 불규칙한 패치를 버리는 프루닝이 영상의 공간적 연속성과 시간적 일관성을 훼손한다고 지적한다.
개발자 관점에서 이 논문의 실용적 메시지는 두 가지다. 첫째, 긴 영상 파이프라인의 지연을 재볼 때 모델 추론 시간만 보면 안 된다. 후보 프레임을 FPS=1로 밀집 디코딩해 두고 그중 일부를 고르는 구조라면, 그 전단 디코딩이 영상 길이에 선형으로 늘어나 시간 단위 입력에서 전체 지연을 지배한다. 디코딩하는 프레임 수 자체를 상한으로 묶는 설계가 필요하다. 둘째, 해상도를 낮춰 프레임을 늘리는 것이 공짜에 가까운 개선인 경우가 많다. 다만 OCR이나 세밀한 속성 판별처럼 해상도에 민감한 과제가 섞여 있다면 저해상도 스트림만으로는 부족하므로, 소수의 고해상도 프레임을 별도 경로로 얹는 구성이 유효하다. LoHi는 재학습 없이 기존 통합 VLM의 비디오·이미지 경로를 그대로 쓰므로, 이미지와 비디오 입력을 모두 받는 모델이면 적용 장벽이 낮다. 확인해야 할 것은 백본이 두 경로를 실제로 분리해 제공하는지, 그리고 CLIP 기반 선택기를 쓸 경우 그 한 번의 추가 포워드 비용이 전체 예산 안에서 감당 가능한지다.
한계와 전제도 분명하다. Hi-I 스트림은 K개의 고해상도 프레임을 추가로 처리하므로 비용이 늘어나고, 저자들은 이를 엔트로피 임계값 θ로 제어하는 적응형 변형을 제안한다. 이 변형은 전체 LoHi 파이프라인에 거의 근접하는 성능을 내면서 고해상도 스트림을 질의의 약 3분의 1에서만 호출한다고 보고되지만, θ 값 자체가 조정 대상이다. 또한 방법의 이득은 "저해상도 조밀 스트림 + 소량의 고해상도 증거"라는 분해 가정 위에 서 있으며, 해상도 민감 과제에서 남는 격차를 고해상도 프레임이 메운다는 전제를 깐다. 결론부는 더 풍부한 선택기와 적응적 배분을 향후 과제로 남긴다. 제시된 실험은 최대 60분 길이 영상과 세 개 롱비디오 벤치마크, 그리고 EgoLongQA 일부에 한정되며, 원문 발췌 범위에는 별도의 한계 절이 포함되어 있지 않다.