TT-VidT가 영상 자기지도학습에서 시간축을 분리해 모션 표현을 앞세운다

TT-VidT: Decoupling the Temporal Axis for Efficient Motion-Centric Video Pretraining

HF Daily2609.33419

Shih-Ying Yeh, Daniel Z. Kaplan, Xuehai Wang2026-09-27조회 2

무엇인가

영상 자기지도학습(Video SSL) 논문들은 대개 완성된 학습 레시피 전체를 비교한다. 아키텍처, 목적함수, 데이터 노출량, 스케줄, 파라미터 스케일, 디코더 용량이 한꺼번에 달라지기 때문에 어떤 선택이 실제로 모션 중심 표현을 만드는지 귀속시키기 어렵다. 게다가 행동 인식 벤치마크 상당수는 사물·장면·인물·의상 같은 정지 외형 단서만으로도 라벨을 예측할 수 있어, 모델이 외형에 의존하고도 좋은 점수를 얻는다. 저자들은 프레임 간 변화에 라벨이 의존하는 과제에서 가장 뚜렷하게 성능이 오르면서 외형 중심 과제에서도 경쟁력을 유지하는 경험적 패턴을 'motion-prioritized'라고 부르고, 이를 통제된 레시피 안에서 측정 가능하게 만드는 것을 목표로 삼는다.

어떻게 동작하나

제안 방법 TT-VidT는 두 부분으로 구성된다. 하나는 DINOv3로 초기화한 ViT-B/16 기반의 프레임별 2D 공간 경로이고, 다른 하나는 프레임마다 모션 임베딩을 만들어내는 소형 Temporal Transfer Layer다. 프레임당 K=8개의 학습 가능한 모션 토큰을 붙이고, 12층·은닉 차원 768의 Temporal Transfer Layer에서 각 프레임의 모션 토큰이 그 프레임의 공간 토큰과 함께 셀프 어텐션을 거친 뒤, T·K=64 길이의 블록 인과(block-causal) 마스크 아래 프레임 간 어텐션으로 정보를 교환한다. 이 변형이 TT1D다. TT3D는 여기서 한 걸음 더 나아가 공간 토큰을 축당 4배 다운샘플해 프레임당 256개에서 16개로 줄이고, 모션 토큰 8개와 합쳐 프레임당 24개 토큰, 전체 192개 토큰에 대해 하나의 블록 인과 3D 셀프 어텐션을 돌린다. 전체 공간 특징에 시간축 어텐션을 걸면 2048 토큰이 필요한 것과 비교하면 크게 줄어든 셈이다.

무엇과 다른가

사전학습 목적함수인 Diff Compression은 첫 프레임의 공간 특징 z1을 외형 앵커로, t번째 프레임의 모션 임베딩 mt를 프레임 고유 정보의 운반체로 삼아 x̂t = D(z1, mt) (t=2,…,T)를 복원한다. 손실은 기본적으로 확산·플로우 매칭 복원 손실이고 잠재 회귀는 절제 실험용이다. 앵커가 아닌 프레임에 대해 평균을 낸다. 인코더, Temporal Transfer Layer, 디코더, 모션 토큰 임베딩이 모두 공동 학습된다. 디코더는 다운샘플된 특징이 아니라 온전한 z1(256×768)에 크로스 어텐션하므로, 외형 경로는 넓게 유지되고 모션 경로만 좁아진다. VTok의 키프레임 분해에서 착안했지만, VTok이 특징 차분으로 모션 토큰을 명시적으로 계산하는 것과 달리 여기서는 mt가 복원 목적함수 아래에서 종단간 학습된다.

어떻게 쓰나

실험은 약 170M~190M 인코더 스케일에서 OpenVid 약 100만 클립과 Moments-in-Time v2 약 70만 클립을 8 에폭 학습하는 통제 레시피로 진행됐다. 6fps로 8프레임을 샘플링하고, 유효 전역 배치 32, AdamW 피크 학습률 5e-4, 웨이트 감쇠 0.01, 그라디언트 클리핑 0.1, 10k 선형 워밍업 후 코사인 감쇠, fp16 혼합 정밀도, μP(기저 차원 256)를 쓴다. 아키텍처 4종(ViT3D, DisMo형 2D+3D, TT1D, TT3D)과 목적함수 6종(MAE, Adaptive AR, naive AR, two-jump AR, MAE-Diff, Diff Compression)을 조합한 4×6=24 셀을 비교한다.

전제와 한계

스윕 결과 성공 영역은 희소하다. 증강 없이 모션 중심 Jester와 Something-Something V2에서 높은 구간에 도달한 셀은 ViT3D+MAE와 TT3D+Diff Compression 둘뿐이었다. ViT3D+MAE가 Jester 39.47, SSv2 14.95인 반면 TT3D+Diff Compression은 53.89와 18.28로 두 데이터셋 모두 최고였다. TT3D를 고정하고 Diff Compression을 MAE로 바꾸면 Jester가 53.89에서 11.07로, SSv2가 18.28에서 4.98로 떨어진다. 반대로 Diff Compression을 고정하고 TT3D를 ViT3D나 DisMo로 바꾸면 Jester 19.82/12.98, SSv2 6.57/5.53이 된다. 저자들은 이 짝지은 하락을 두 구성요소 각각의 일반적 효과가 아니라 TT3D와 Diff Compression 사이의 상호작용 효과로 해석한다. ARID는 기본 스윕에서 ViT3D+MAE가 24.37로 앞서고 TT3D+Diff Compression이 21.98이었지만, 디코더 절제로 'S 크기·비디오 사전학습' 디코더를 고른 뒤에는 TT-VidT가 37.47까지 오른다.

디코더 절제는 사전학습의 중요성을 보여준다. 크기 S에서 비디오 사전학습 디코더가 Jester 73.25, SSv2 25.92로 ImageNet 사전학습(53.89, 18.28)과 랜덤 초기화(확산 보조 28.46/11.71, 회귀 보조 20.21/7.53)를 크게 앞선다. 반면 더 큰 디코더는 역효과다. 비디오 사전학습 조건에서 디코더 L은 Jester 34.37, SSv2 12.15로 S보다 약 50~53% 낮다. 저자들은 큰 디코더가 압축된 모션 토큰에 걸리는 압력을 줄여 복원 부담을 디코더로 옮기고, 그 결과 모션 임베딩이 담는 정보 자체가 줄어든다고 해석한다. 효율 측면에서 TT3D는 인코더 기준 456.1 GF로, 같은 T=8·256² 설정의 DisMo-2D-3D의 약 절반, VideoMAE-3D의 절반 이하다.

최종 비교에서 TT-VidT는 Jester, Something-Something V2, ARID, Diving48 파인튜닝을 동시에 앞선 유일한 방법이다. ARID 37.47, Jester 73.25, SSv2 25.92, Diving48 파인튜닝 18.63을 기록했고, 가장 강한 비-TT 행보다 54~121% 개선이며 DisMo보다 인코더 FLOPs를 48%, VideoMAE나 V-JEPA 2보다 55% 적게 쓴다. 구체적 격차는 ARID에서 VideoMAE 24.37 대비 +13.1, Jester에서 이중 증강을 켠 DisMo 46.95 대비 +26.3, SSv2에서 VideoMAE 14.95 대비 +11.0이다. 종단간 파인튜닝에서도 Jester와 SSv2에서 각각 21.0점, 12.9점 앞서며, 베이스라인들은 30 에폭 감독 학습을 거치고도 Jester에서 51.5 근처에 머물러 TT-VidT의 프로즌 프로브 73.25에 못 미친다. 모션 반전 프로브에서는 TT-VidT가 뒤집힌 모션을 거의 모든 클립에서 따라가는 반면 베이스라인들은 9~43%에서 원래 답을 유지했고, 단일 프레임 DINOv3 대조군은 프레임 순서를 보지 못해 반전을 전혀 따라가지 못했다.

개발자 관점에서 이 논문의 실용적 신호는 세 가지다. 첫째, 외형과 시간 변화를 분리하는 병목 설계가 실제로 모션 민감 과제에서 이득을 낸다는 점을 동일 레시피의 24셀 비교로 보여준다. 둘째, 디코더가 단순 출력 헤드가 아니라 인코더에 가하는 압력을 바꾸는 학습 구성요소이며, 크기를 키우는 것이 항상 좋지 않다는 실측 근거를 제시한다. 셋째, 인코더 FLOPs가 비교군의 절반 수준이라 추론 비용이 중요한 환경에서 검토할 가치가 있다. 다만 이득이 모션 중심 과제에 집중되므로, 사물·장면 맥락이 중요한 과제라면 VideoMAE가 HMDB51 27.73, EPIC-Kitchens 동사 분류 35.62로 더 낫고, 신원 불변성이 중요한 IARD에서는 DisMo가 89.89로 앞선다는 점을 함께 봐야 한다. EPIC-Kitchens 동사 예측에서는 V-JEPA 2가 23.07로 가장 높다.

저자들이 명시한 한계는 분명하다. 이 연구는 의도적으로 작은 통제 레시피에 한정된다. 사전학습 혼합은 약 170만 클립(OpenVid + Moments-in-Time v2) 하나뿐이고, 스윕 셀은 단일 실행이며 정규 구성에만 다중 시드 검증을 붙였고, 인코더 스케일도 약 170M~190M 한 지점이다. 따라서 결과는 이 통제된 영역에 대한 증거로 읽어야 하며 모든 데이터 스케일이나 스케줄에 대한 주장이 아니다. TT3D와 DisMo식 이중 증강의 조합, 대안적 외형 프로브, 공간 인코더의 부분 동결 같은 조합은 테스트하지 않았다.