SemanTok이 영상 토큰 앞부분에 의미를 몰아 자가회귀 생성 비용을 줄인다

SemanTok: Predictable Semantic Tokens for Efficient Autoregressive Video Generation

HF Daily2610.00686

Mikhail Dereviannykh, Vikram Voleti, Simon Donne2026-09-30조회 2

무엇인가

영상 기반 월드모델은 클립을 학습된 토큰으로 압축해 자가회귀(AR) 모델이 언어모델처럼 예측하고, 확산 디코더가 픽셀로 렌더링하는 구조를 쓴다. 문제는 표준 영상 토크나이저가 모든 클립을 동일한 고정 크기 시공간 격자에 매핑한다는 점이다. 예측 비용이 시퀀스 길이에 비례하므로 정적인 한 장면과 자동차 추격전이 같은 표현 예산과 같은 연산을 받는다. VideoFlexTok 같은 flexible-length coarse-to-fine 토크나이저는 이를 1차원 시퀀스로 바꿔 추론 시 애플리케이션이 예산 k를 고르고 앞부분만 예측하게 한다. 그러나 기존 flexible 토크나이저는 표현 정렬(REPA) 손실을 디코더 초기 은닉 상태에만 걸었고, 디코더는 노이즈가 낀 latent를 함께 보기 때문에 토큰이 없어도 그 목표를 부분적으로 달성할 수 있었다.

어떻게 동작하나

SemanTok은 VideoFlexTok의 코드북, nested dropout, 디코더, 기본 손실을 그대로 두고 인코더 입력과 토큰 감독만 바꾼다. 동결된 DINOv2-L 교사가 각 latent 프레임마다 16×16 패치 격자 d와 클래스 토큰 c를 제공하고, 패치 임베딩은 e = W_in[z; d] + b_in으로 VAE latent와 DINO 특징을 융합한다. 클래스 토큰은 zero-initialized 투영을 거쳐 첫 번째 register 토큰에 더해진다(r̃ = r + W_cls·c). 패킹, 시간 인과 어텐션, FSQ(6차원, 격자 [8,8,8,5,5,5], 코드북 64,000)는 기존과 동일하다.

무엇과 다른가

핵심 추가는 유지된 토큰 프리픽스만 읽는 두 개의 cross-attention 헤드다. 컨텍스트는 C = {q_{s,i} : 1≤s≤t, 0≤i<k}로, 토크나이저의 인과 경로와 일치하도록 시간 제약이 걸린다. Dense DINO 헤드는 공간 readout 쿼리로 각 DINO 패치를, Class DINO 헤드는 단일 쿼리로 클래스 토큰을 복원하며, 둘 다 폭 768·12 어텐션 헤드·2개 cross-attention 층을 갖는다. 손실은 코사인 거리이고 전체 목적함수는 L = L_base + 0.5·L_dense + 0.5·L_cls다. 중요한 차이는 이 헤드들이 노이즈 낀 latent를 전혀 보지 않는다는 점으로, 오직 토큰만이 손실을 낮출 수 있다. 어떤 손실도 특정 DINO 특징을 특정 토큰에 배정하지 않으며, 순서는 공유 프리픽스 제약에서 창발한다. nested dropout이 k를 {1,2,4,…,256}에서 균일 샘플하므로 모든 프리픽스가 두 예측을 지지해야 한다.

어떻게 쓰나

실험은 클래스→영상 설정의 Kinetics-600과 텍스트→영상 설정의 uCO3D(학습에 없던 OOD 클래스 분할 포함)에서 수행했고, 해상도는 17프레임 128×128이다. AR 모델 크기는 49M부터 2.29B까지 7종을 훑고, 1.33B 모델은 1.3B에서 65.5B 토큰까지 학습했다. Kinetics-600에서 SemanTok은 gFVD를 11–24%, gFID를 5–17% 낮추고 클래스 정확도를 25–61% 올렸으며, 가장 작은 AR 모델에서 이득이 가장 컸다. uCO3D에서는 gFVD 2–13%, gFID 5–8%, 클래스 정확도 22–30% 개선이다. k=16 단일 예산에서 85M SemanTok AR 모델이 두 데이터셋 모두 gFID에서 2.29B까지 모든 크기의 VideoFlexTok을 앞서고, Kinetics-600 gFVD에서도 앞선다. 의미 정렬에서는 가장 작은 49M SemanTok이 2.29B VideoFlexTok보다 클래스 정확도·ClipV·ViCLIP 모두 우위이며, Kinetics-600 클래스 정확도는 0.631 대 0.560이다.

전제와 한계

스케일링에서 best-k gFVD는 49M→2.29B 구간에 Kinetics-600 224→202, uCO3D 218→197로 내려간다. k=64에서 gFID 이득은 49M→2.29B로 가면서 절반으로 줄어, AR 용량이 부족할수록 SemanTok의 이점이 크다. 학습 예산을 5배 늘려도 VideoFlexTok은 fidelity 일부를 얻을 뿐 의미 정렬은 얻지 못한다(65.5B 토큰 후에도 Kinetics-600 클래스 정확도 우위 30% 유지). 디코더 REPA 읽기값도 모든 노이즈 수준에서 SemanTok이 앞선다. uCO3D k=32에서 SemanTok의 pure-noise readout은 VideoFlexTok이 75% 깨끗한 latent로 도달하는 DINOv2 코사인 유사도에 도달하며(0.721 대 0.716), k=256에서는 latent가 SemanTok readout에 거의 기여하지 않지만 VideoFlexTok에는 11배 이상 기여한다.

토큰 예측 비용도 줄어든다. 201M 모델 k=16에서 토큰당 8.8비트로 VideoFlexTok의 12.9비트보다 32% 적고, marginal entropy 차이는 약 1비트뿐이라 절감의 대부분은 컨텍스트에서 나온다. SemanTok의 첫 4개 토큰은 프레임당 37비트인데 VideoFlexTok의 첫 32개 토큰(405비트)의 클래스 정확도에 거의 맞먹는다. 앞 16–64개 토큰을 강제로 주입하면 SemanTok의 gFVD 우위가 사라지고 이후에는 재구성이 더 좋은 VideoFlexTok 꼬리가 앞선다. 즉 이득은 앞 토큰에 집중돼 있고 픽셀 디테일은 뒤 토큰으로 미뤄진다. 재구성 자체는 VideoFlexTok이 PSNR·rFVD에서 조금 더 좋지만 생성에서 더 많이 잃어 realization gap이 더 크다.

저자가 명시한 한계는 프레임당 토큰 1개(k=1) 설정이다. uCO3D의 k≤4, 주로 k=1에서 gFID와 ClipV가 VideoFlexTok에 뒤지고, 대부분 깨끗한 latent 조건에서는 k=4(uCO3D)·k=8(Kinetics-600)까지 decoder REPA 읽기값이 낮다. 토큰 하나가 담는 정보가 최대 약 16비트라 flow matching, decoder REPA, 의미 감독을 동시에 만족시키기 어렵다는 설명이다. 다만 클래스 정확도만은 어떤 예산·AR 크기에서도 뒤지지 않는다. 또 SemanTok은 의미 정렬을 재구성보다 우선하므로 낮은 토큰 예산에서 색과 외형 세부를 재구성하는 능력이 약하다(uCO3D k=16에서 PSNR 약 2.7 dB 낮음).

개발자 관점에서 이 논문은 유연한 토큰 예산을 쓰는 영상 생성·월드모델 파이프라인에서 "앞 토큰에 의미, 뒤 토큰에 디테일"이라는 배분을 학습 목표로 직접 강제할 수 있음을 보여준다. 작은 AR 모델로 앞 프리픽스만 예측해 장면 내용을 확정하고 나머지를 생성 디코더에 맡기는 전략이 파라미터와 비트를 아낀다. 도입 전에 확인할 것은 세 가지다. 첫째, 서비스가 요구하는 최소 토큰 예산이 k=1~4인지(이 구간이 유일한 열세 지점), 둘째, 학습에 없던 클래스에 대한 일반화가 필요한지(OOD에서도 클래스 정확도 우위는 유지되지만 재구성 PSNR은 낮다), 셋째, 재구성 충실도(색·외형)가 생성 품질보다 중요한 용도인지다.