VideoMSN이 이미지 ViT 재활용으로 영상 사전학습을 160배 줄인다

Image Classifiers are Efficient Self-Supervised Video Representation Learners

arXiv2609.40347v1

Owais Iqbal2026-09-30조회 3

무엇인가

비디오 행동 인식을 위한 자기지도 표현 학습은 오랫동안 무거운 3D CNN이나 비디오 전용 비전 트랜스포머, 또는 마스킹된 토큰을 픽셀 단위로 복원하는 인코더-디코더 구조에 의존해 왔다. 이런 방식은 파라미터와 GPU 메모리를 많이 쓰고, 특히 이미지 사전학습 가중치가 없는 디코더를 처음부터 학습해야 해서 비디오 사전학습 스케줄이 길어진다. 이 논문은 비디오를 3D 텐서가 아니라 2D '슈퍼 이미지(super image)'로 취급하면 표준 이미지 ViT와 이미지용 자기지도 기법을 그대로 재활용할 수 있다는 관점에서 출발한다. 즉 비디오 행동 인식을 2D 이미지 분류 문제로 재구성해, 이미지 분야에서 검증된 효율적 학습법을 그대로 가져오자는 것이다.

어떻게 동작하나

구체적으로 VideoMSN은 비디오에서 겹치지 않는 시간 구간마다 등간격으로 M개의 프레임을 뽑아 고정된 격자로 배열해 슈퍼 이미지 S를 만든다. 하나의 슈퍼 이미지에서 마스킹이 없는 타깃 뷰 하나와, 마스킹이 적용된 여러 앵커 뷰를 만든다. 앵커 뷰는 두 종류다. 첫째는 랜덤 뷰로, 각 프레임을 N×N 패치로 나눈 뒤 같은 공간 위치의 패치를 모든 프레임에서 동시에 마스킹하거나 유지한다. 이는 VideoMAE의 temporal tube masking과 같은 발상으로, 프레임 간 정보 누출로 지름길을 학습하는 것을 막는다. 둘째는 포컬 뷰로, 2단계 마스킹을 쓴다. 1단계는 시간 마스킹으로 특정 프레임 전체를 버려 시간적으로 다운샘플링한 뷰를 만든다. 프레임을 약 절반 남긴 fast 뷰와, 거기서 다시 절반을 버려 약 M/4 프레임만 남긴 slow 뷰를 만드는데, 이는 슈퍼 이미지가 정사각형 격자일 때 가장 잘 동작하기 때문이다. 2단계에서는 각 프레임 안에서 연속된 영역 하나를 무작위로 골라 남기고 주변 패치를 마스킹하며, 이때도 모든 프레임에서 같은 공간 영역을 마스킹한다. 기본 설정에서 포컬 뷰는 6개이고 절반은 fast, 절반은 slow다.

무엇과 다른가

학습 목표는 재구성이 아니라 특징 정렬이다. 타깃 뷰와 앵커 뷰를 공유 ViT 인코더에 통과시켜 [CLS] 토큰 표현을 얻고, 이를 1024개의 학습 가능한 프로토타입(차원 256)에 투영해 소프트맥스 분포로 바꾼다. 앵커 분포는 온도 τ=0.1, 타깃 분포는 더 날카로운 τ+=0.025로 계산하고, 두 분포 사이의 교차엔트로피를 최소화한다. 타깃 인코더는 앵커 인코더 가중치의 지수이동평균(EMA)으로 갱신한다. 표현 붕괴를 막기 위해 배치 전체 앵커 예측의 평균 엔트로피를 최대화하는 ME-MAX 정규화(λ=5.0)를 더한다. 디코더가 없다는 점이 핵심으로, 픽셀 복원을 하지 않으므로 이미지로만 사전학습된 DINO-v3, DeiT-v3 인코더를 그대로 초기값으로 쓸 수 있다.

어떻게 쓰나

실험은 Kinetics-400, UCF101, HMDB51, Something-Something V2에서 ViT-S와 ViT-B로 수행했다. Kinetics-400에서 VideoMSN-DeiT(ViT-S)는 두 번째로 좋은 모델을 0.5%p 앞섰고 VideoMSN-DINO는 1.3%p 앞섰으며, ViT-B에서는 VideoMSN-DINO가 기존 최고 성능을 0.2%p 개선했다. 이때 비디오 사전학습은 DeiT 기준 50 에포크, DINO 기준 10 에포크만 돌렸다. 비교 대상인 SMILE은 600 에포크(60배)를 요구하고도 성능이 뒤진다. VideoMAE, MGM, MME 같은 MAE 계열과 비교하면 사전학습 에포크가 최대 160배 적다. 저자들은 이미지넷-21K 가중치로 VideoMAE의 ViT-B 인코더를 초기화하고 50 에포크 사전학습 + 30 에포크 파인튜닝을 돌린 대조 실험에서 top-1이 57%에 그쳤다고 보고하며, 무작위 초기화된 디코더를 짧은 스케줄로 학습시키기 어렵다는 점을 디코더 없는 설계의 근거로 든다.

전제와 한계

소규모 데이터셋에서의 효율은 더 두드러진다. UCF101과 HMDB51에서 기존 방법들이 각각 3200, 4800 에포크의 사전학습을 요구하는 반면, VideoMSN-DINO는 10 에포크만으로 더 높은 top-1 정확도를 내 UCF101에서 320배, HMDB51에서 480배의 에포크 감소를 보인다. 다만 움직임 중심의 어려운 벤치마크인 SSV2에서는 VideoMAE에 ViT-S 기준 1.0%p, ViT-B 기준 1.4%p 뒤지는데, 저자들은 이를 240배 적은 사전학습 에포크와 맞바꾼 정당한 트레이드오프라고 설명한다. 실제 계산량도 VideoMAE가 1600 에포크 × 10분 = 266.7시간인 데 비해 VideoMSN-DINO는 10 에포크 × 130분 = 21.7시간으로 벽시계 시간 기준 12.3배, 총 FLOPs 기준 약 8.9배(40.89 EFLOPs 대 4.58 EFLOPs) 줄어든다. 라벨이 적은 상황도 강한데, Kinetics-400으로 사전학습한 ViT-B를 UCF101에서 1000개 샘플만으로 파인튜닝하는 low-shot 실험에서 비교 방법들을 크게 앞선다.

절제 실험은 설계 선택의 근거를 보여준다. ViT-S, 16프레임, Kinetics-400, 50 에포크 조건에서 시간 마스킹 증강을 넣으면 정확도가 1.4%p 올랐고, 랜덤 뷰만 쓰면 78.5%, 포컬 뷰만 쓰면 77.1%, 둘을 합치면 80.0%였다. 포컬 뷰 구성에서는 fast와 slow를 모두 쓰는 조합이 80%로, fast만(78.6%)이나 slow만(77.5%)보다 좋았다. 또한 λ=5.0을 유지하면서 Sinkhorn 정규화를 생략한 쪽이 최고 성능이었는데, 강한 정규화와 함께 쓰면 Sinkhorn이 특징 학습을 방해할 수 있다고 본다.

개발자 관점에서 이 논문의 실용적 가치는 '비디오용 3D 백본을 새로 학습할 필요 없이, 이미지 파운데이션 모델을 짧은 자기지도 적응 단계로 비디오에 전용할 수 있다'는 레시피에 있다. 이미 DINO-v3나 DeiT-v3 체크포인트를 보유하고 있고 GPU 예산이 제한적이라면, 10~50 에포크 규모의 적응 학습으로 기존 이미지 인코더를 비디오 태스크에 올리는 선택지가 된다. 다만 슈퍼 이미지 격자 크기(프레임 수와 배치)가 성능에 직접 영향을 주고, SSV2처럼 세밀한 움직임 구분이 중요한 태스크에서는 재구성 기반 방법보다 약할 수 있으므로 자신의 데이터 특성에서 검증이 필요하다.

한계도 저자들이 명시한다. SSV2에서 VideoMAE보다 낮은 정확도를 감수해야 하고, VideoMAEv2처럼 더 큰 백본과 대형 교사 모델 증류에 의존하는 방법은 계산 자원 범위를 벗어나 직접 비교하지 않았다. SMILE은 비라벨 비디오 외에 합성 움직임 신호를 추가로 사용한다는 차이가 있다. 또한 이 논문은 근본적으로 새로운 아키텍처 패러다임이라기보다 슈퍼 이미지 표현, 이미지 사전학습 ViT, 마스크드 샴 학습을 결합한 효율적 통합으로 스스로를 위치시킨다. 절제 실험 표의 값들은 계산 제약 때문에 단일 고정 시드로 측정됐다는 점도 감안해야 한다.