VDOT++가 비대칭 불균형 최적수송으로 4스텝 영상 생성을 통합한다

VDOT++: Unified Few-Step Video Generation via Unbalanced Optimal Transport Distillation

arXiv2610.03221v1

Yutong Wang2026-10-02조회 3

무엇인가

이 논문이 다루는 문제는 영상 확산 모델의 샘플링 비용이다. 영상 생성은 텍스트→영상(T2V), 이미지→영상(I2V), 그리고 VACE처럼 텍스트·컨텍스트 프레임·정렬된 마스크를 함께 받는 조건 기반 생성으로 나뉘는데, 이 모델들은 샘플링 과정에서 큰 백본을 반복 평가하기 때문에 비싸다. DMD(분포 매칭 증류)는 이 비용을 줄이지만 reverse KL 목적함수는 student와 teacher 분포의 겹침이 적을 때 불안정하거나 불완전한 지도를 준다. 저자들의 이전 연구인 VDOT(CVPR 2026)는 최적수송 증류(OTD)를 더해 명시적 coupling으로 기하학적 방향을 공급했지만, balanced OTD는 대응하는 student-teacher 프레임 쌍마다 공간 토큰 사이의 full-mass 매칭을 전제한다. 이 전제는 하나의 조건이 여러 유효 출력을 허용하고 실현마다 공간 내용이 정렬될 필요가 없는 T2V와 I2V에서 약해진다.

어떻게 동작하나

논문은 balanced OTD의 실패를 두 갈래로 진단한다. 첫째는 '누구와 매칭할지'의 문제로, 하드 marginal 제약이 신뢰할 만한 teacher 대응이 없는데도 모든 student 토큰에 정해진 질량을 강제한다. 둘째는 '어떻게 집계할지'의 문제로, 제곱 ℓ2 ground cost가 서로 양립하지 않는 teacher 토큰들에 대한 평균 기반 집계를 유도한다. 논문의 Proposition 2는 이를 정확히 보인다. 고정된 수송 계획에서 ∇a_i W = r_i(a_i − b̄_i)가 되어, student 토큰은 자신이 매칭된 teacher 토큰들의 수송 가중 평균 쪽으로 끌려간다. 시각적으로 구분되는 타깃들이 평균값으로 뭉개지면서 국소적 고주파 특징이 흐려질 수 있다는 것이다.

무엇과 다른가

해법의 핵심은 두 가지다. 먼저 비대칭 불균형 최적수송(AUOT)으로, 하드 marginal 등식 T1=u, Tᵀ1=μ를 KL 페널티로 바꾸고 student와 teacher에 서로 다른 가중치를 준다. student 쪽 페널티 τ_s는 작게 두어 신뢰할 수 없는 student 토큰이 더 적은 질량을 나르게 하고, teacher 쪽 페널티 τ_t는 크게 두어 어려운 teacher 콘텐츠의 커버리지를 유지한다. 다음으로 ℓ1 ground cost를 써서 평균 기반 집계를 좌표별 가중 중앙값으로 대체하고, 멀리 떨어진 수송 타깃의 영향을 제한한다. 두 변경은 각각 매칭 대상과 집계 방식을 결정한다. 이 문제는 Chizat 등의 scaling 알고리즘으로 풀리며, balanced Sinkhorn과의 차이는 로그 도메인 dual 업데이트가 ρ=τ/(τ+ε)로 감쇠된다는 점뿐이고 ρ→1이면 balanced 반복으로 복원된다. Proposition 3에 따르면 τ가 무한대로 갈 때 AUOT는 balanced entropic OT로 수렴한다. 중요한 전제는 partial matching이 프레임별 공간 토큰 OTD 항만 완화한다는 것이다. DMD와 adversarial 손실은 여전히 전체 생성 분포를 제약하므로, 질량이 줄어든 토큰은 전역 지도가 아니라 국소 대응만 약해진다.

어떻게 쓰나

여기에 세 가지 훈련 설계가 더해진다. 분포 매칭과 adversarial refinement를 sequential backward pass로 결합해, 증류 손실을 역전파한 뒤 그래프를 해제하고 같은 샘플로 adversarial 손실을 다시 실행하여 두 그래디언트를 누적한 뒤 한 번의 optimizer step을 수행한다. 이렇게 하면 14B 규모에서도 단일 backward pass의 최대 메모리로 결합 목적함수를 유지한다. adversarial 항은 F_φ에 내장된 경량 discriminator head D_ω와 relativistic GAN 손실, APT의 finite-difference R1 페널티로 구성되고, 가중치를 작게 두어 국소 외형 보정 역할만 하도록 한다. 마지막으로 score network는 학습 후 버려지므로 generator보다 클 수 있다는 점을 이용한 cross-scale 증류를 쓴다.

전제와 한계

실험은 VACE-Wan2.1-14B, Wan2.1-T2V-14B, Wan2.1-I2V-14B를 하나의 레시피로 4스텝 generator로 증류하고, UVCBench·VBench·VBench-I2V·VACE benchmark에서 평가한다. 결과적으로 4스텝 생성기가 세 과제군 모두에서 many-step teacher와 강한 few-step 베이스라인에 견줄 만하다. T2V에서는 few-step 베이스라인과 many-step teacher를 통틀어 가장 좋은 normalized average를 기록했고, I2V에서도 teacher를 넘어섰으며 향상 폭은 정적인 외형 보존보다 motion 쪽에서 컸다. UVCBench에서는 dense pose·flow·greyscale 조건에서 VDOT와 비슷했지만 outpainting과 R2V에서 normalized average가 개선됐다. 조건이 약해질수록 이득이 motion과 imaging quality에 집중되고 temporal·subject consistency는 안정적으로 유지되는 패턴이 일관되게 나타난다.

Ablation 수치도 원문에 제시된다. matching(balanced/partial) × cost(ℓ2/ℓ1)를 교차한 실험에서 강하게 조건화된 VACE에서는 모든 변형이 비슷했지만, T2V에서는 partial matching과 ℓ1 각각이 balanced ℓ2보다 좋았고 둘의 결합이 가장 강했다. 비대칭 대칭 비교에서는 source-side relaxation이 가장 높은 Dynamic Degree와 normalized average를 냈고 Imaging Quality는 72.83으로, symmetric relaxation의 최고값 72.95에 근접했다. adversarial refinement는 주로 imaging quality를 개선했고, joint accumulation이 alternating update보다 안정적이었다. cross-scale 실험에서는 Wan2.1-T2V-1.3B generator에 score network를 1.3B에서 14B로 키웠을 때 DMD2가 77.87→78.15, VDOT++가 79.98→80.51로 올랐고, 14B score network를 쓰면 1.3B VDOT++ generator가 14B many-step teacher를 normalized average에서 능가했다. 큰 score network는 학습에만 쓰이고 배포는 4스텝 1.3B generator 그대로라 추론 비용은 변하지 않는다.

개발자 관점에서 이 논문의 실용적 메시지는 조건 강도에 따라 증류 손실 설계를 달리해야 한다는 것이다. depth나 pose처럼 조밀한 조건이 공간 대응을 확정해 주는 작업에서는 완화된 목적함수가 balanced OTD와 비슷하게 동작하므로 굳이 복잡한 변형을 도입할 이유가 약하다. 반대로 텍스트만 주어지거나 첫 프레임만 고정되는 작업처럼 출력 공간이 넓을 때는 강제 대응과 평균 집계를 피하는 쪽이 유효 motion과 세부 묘사를 보존한다. 도입을 검토한다면 학습 시에만 큰 score network가 필요하다는 점, 메모리 예산을 맞추기 위한 gradient-fused 스케줄, 그리고 수송 계획이 학습 중에만 계산된다는 점을 확인해야 한다.

저자들이 밝힌 한계는 명확하다. 현재 방법은 대응하는 temporal-frame 쌍 안에서 공간 토큰 OT를 독립적으로 풀기 때문에, 프레임 사이로 토큰을 수송하거나 시공간 계획을 공동으로 최적화하지는 않는다. 즉 미세한 공간 대응은 모델링하지만 모션 수준의 대응은 다루지 못한다. 향후 과제로 시공간·궤적 인지 수송, 조건 강도나 수송 신뢰도에 따라 완화 정도를 조정하는 adaptive marginal penalty를 제시한다. 또한 현재의 4스텝 양방향 설정을 one-step, streaming, autoregressive 생성으로 확장하려면 더 강한 rollout 오류와 support mismatch를 처리해야 한다고 적고 있다.