DMD 증류의 critic 오차를 잔차 투영으로 걸러내는 PDMD

PDMD: Projected Distribution Matching Distillation for Video Diffusion Models

arXiv2609.35768v1

Zimo Wang2026-09-28조회 2

무엇인가

비디오 확산 트랜스포머는 긴 시공간 토큰 시퀀스를 수십 번 노이즈 제거해야 해서 추론 비용이 크다. 스텝 증류는 이 비용을 몇 번의 함수 평가(NFE)로 줄이지만, 널리 쓰이는 Distribution Matching Distillation(DMD)은 학습이 진행되면서 샘플이 점점 과포화되고 인공적인 텍스처가 생기다가 결국 품질이 무너진다. 이 논문은 그 원인을 critic 오차로 지목한다. DMD는 student와 번갈아 학습되는 온라인 critic의 score와 고정된 teacher score의 차이 d = s_critic − s_teacher를 student 업데이트로 쓰는데, critic은 근사 오차를 갖고 움직이는 student를 뒤늦게 따라가므로 그 오차가 매 업데이트에 실려 누적된다는 것이다. 실제로 MiniMax-H3에서 DMD는 500 iteration부터 눈에 띄게 과포화된다.

어떻게 동작하나

PDMD(Projected Distribution Matching Distillation)가 하는 일은 단순하다. critic score는 추가 모델 패스 없이 one-step 엔드포인트 x0^c = (x_t + σ_t² s_critic)/α_t로 선형 변환할 수 있고, student 엔드포인트 x0^s와의 잔차 r = x0^c − x0^s를 계산할 수 있다. PDMD는 DMD 업데이트 d에서 r에 평행한 성분을 빼서 d⊥ = d − (⟨d, r⟩/‖r‖²) r을 대신 사용한다. r = 0이면 업데이트를 그대로 둔다. 손실, 네트워크, 모델 패스, 데이터, 다단계 학습 중 어느 것도 추가하지 않으며 DMD 코드 한 줄 수정에 해당한다. critic 학습 방식과 score 네트워크는 그대로 둔다.

무엇과 다른가

이론적 근거는 잔차가 critic 오차의 추정치라는 것이다. critic은 student 엔드포인트를 재노이즈한 쌍으로 학습되므로 고정된 noisy query q에서 population-optimal critic 엔드포인트는 조건부 평균 c*(q) = E[S|Q=q]이고, 학습된 critic 엔드포인트의 오차는 e = x0^c − c*(q)다. 잔차 R = x0^c − S = e − ξ이고 조건부 평균이 E[R|Q=q] = e이므로 잔차는 편향 없는 critic 오차 추정치다. 저자들은 제거되는 critic 오차 에너지 비율 γ_e의 기대값이 ‖e‖²/(‖e‖² + tr Σ(q)) 이상임을 보인다. 예컨대 tr Σ(q) = ‖e‖²이면 평균적으로 critic 오차 에너지의 최소 50%가 제거된다. 고차원 가정에서는 critic 오차의 상수 비율을 제거하면서 이상적인 DMD 신호는 소멸하는 비율만 버린다. MiniMax-H3에서 투영은 대부분의 학습 구간에서 업데이트 노름의 80% 이상을 유지했다. 2D 검증에서는 정확한 teacher score를 쓰는 8개 가우시안 링에서 PDMD가 DMD 대비 이상적 업데이트에 대한 평균제곱오차를 28% 줄였고(σ ∈ [0.15, 1.1]), 두 모드 타깃에서 critic 학습률을 student의 1/20로 낮춘 붕괴 실험에서 DMD는 14/20, 19/20 런이 붕괴한 반면 PDMD는 3/20, 12/20만 붕괴했다. 무작위 투영은 16/20, 19/20이었다.

어떻게 쓰나

Wan2.1-T2V-1.3B 실험은 4 NFE, 480p, 944개 AnyFlow-augmented VBench 프롬프트, 프롬프트당 5 시드로 수행됐다. PDMD는 VBench 총점 83.73으로 AnyFlow 83.54, 50-step teacher 83.06, 동일 조건 DMD† 82.70을 앞선다. DMD†는 1,500 iteration에서 정점을 찍고 5,000에서 63.04, 7,500에서 56.09로 무너지지만 PDMD는 5,000에서 83.44, 10,000까지 83.5 이상을 유지한다. GAN 손실 없이 DMD2†보다 0.29점 높고 dynamic degree도 89.72 대 76.67로 높다. 주석자들은 시각·모션 품질에서 50-step teacher를 포함한 모든 비교 대상보다 PDMD를 선호했고 텍스트 정렬은 대부분 무승부였다.

전제와 한계

MiniMax-H3-33B 공동 비디오-오디오 증류는 rank-128 LoRA(스케일 128)로 4 NFE, 544p, 387개 VideoGen-Eval 프롬프트에서 이뤄졌다. PDMD는 VideoGen-Eval 시각 총점 83.17로 DMD 82.76, AnyFlow 81.97을 앞서고 가장 강한 증류 베이스라인보다 0.41점 높다. 비교한 4-NFE 모델 중 6개 오디오 지표 전부에서 최고이며 production quality(PQ)는 50-step teacher와 0.04 차이다. 사용자 연구에서도 모든 4-NFE 모델보다 선호되었고(텍스트 정렬은 64~80%가 무승부), 다만 50-step H3 teacher는 종합 37.0%p, 시각 품질 35.4%p 차이로 여전히 선호되었다. 저자들은 frontier teacher의 품질 상한이 높아 4-step 증류가 Wan2.1보다 어렵다고 해석한다.

절제 실험은 방향이 크기보다 중요함을 보여준다. 무작위 투영은 업데이트 노름을 거의 제거하지 않고 DMD처럼 행동한다. PDMD는 업데이트 노름의 중앙값 12%를 제거하고도 안정적이며, 잔차에 평행한 성분만 남기는 변형은 11%만 유지하고 가장 빠르게 나빠진다. 제거된 성분의 절반을 되돌려도 DMD보다 늦지만 결국 열화된다. student 학습률을 1.25배로 올려도 5,000 iteration까지 안정적이며 83.18로 끝난다. DMD는 학습률을 1/10로 낮춰도 과포화되어 5,500에서 82.76에 그친다. student 업데이트당 critic 업데이트를 1회로 맞춘 조건에서도 PDMD 82.90 대 DMD 82.37이다.

개발자 관점에서 이 논문의 실용성은 기존 DMD 계열 증류 파이프라인에 한 줄짜리 투영만 추가해 학습 안정성과 샘플 품질을 얻는다는 데 있다. 별도 판별자, 추가 네트워크, 추가 모델 패스, 다단계 레시피가 없어 메모리와 학습 비용이 늘지 않는다. 다만 이득은 online critic을 두고 DMD 업데이트와 잔차를 계산할 수 있는 증류 설정에 한정되며, 학습률과 critic 업데이트 비율 같은 하이퍼파라미터는 여전히 튜닝 대상이다. 도입 전에는 자신의 파이프라인에서 투영이 제거하는 업데이트 비율과 잔차 노름을 로깅해, 무작위 투영 대조군과 비교해 보는 것이 좋다.

한계로 저자들은 single-step 품질이 여전히 제한적이며 판별자 손실 같은 추가 목적함수가 필요할 수 있다고 밝힌다. 2-NFE 결과는 부록에 있고, 윤리 진술에서는 증류된 student가 teacher의 능력과 편향을 물려받고 빠른 생성이 오해를 부르는 영상 제작 비용을 낮추며, 증류가 기반 모델의 안전 동작을 보존하는지는 평가하지 않았다고 적는다.