롤아웃 청크를 독립 채점해 장기 영상 생성의 품질 붕괴를 막는다

Rollout-Marginal Distillation for Long-Horizon Autoregressive Video Generation

HF Daily2609.37925

Chenjian Gao, Zhihao Hu, Jianqi Ma2026-09-29조회 3

무엇인가

자동회귀(AR) 영상 확산 모델은 청크를 하나씩 이어 붙여 낮은 지연으로 스트리밍 생성을 가능하게 하지만, 각 청크에 섞인 작은 예측 오차가 다음 청크의 조건(context)으로 들어가면서 롤아웃이 길어질수록 눈에 띄게 증폭된다. 자율주행 시뮬레이션이나 상호작용형 월드 모델처럼 긴 시퀀스가 필요한 응용에서는 이 오차 누적이 치명적이다. 자기 롤아웃 학습은 생성기가 자신의 불완전한 예측을 조건으로 받게 해 이 문제를 완화하려 하지만, 생성된 영상에 대응하는 정답 연속 시퀀스가 없기 때문에 분포 매칭 증류(DMD)로 감독 신호를 대신 만든다.

어떻게 동작하나

논문이 지목하는 근본 원인은 기존 비디오 수준 DMD의 결합(coupling) 구조다. 비디오 교사 모델이 롤아웃 전체를 한꺼번에 채점하면, 특정 청크의 보정 신호가 그 과거와 미래 프레임에 묶인다. 배경에 색 왜곡이나 텍스처 손상이 쌓인 상태에서 현재 청크만 깨끗하게 만들면 시퀀스의 시간적 일관성이 깨지므로, 교사는 시간적 일관성을 지키려고 누적된 오류를 그대로 유지하는 쪽으로 real score를 예측한다. 결과적으로 국소적 시각 품질을 바로잡을 능력이 시간적 일관성 제약에 의해 구조적으로 제한된다.

무엇과 다른가

Rollout-Marginal Distillation(RMD)은 이 결합을 끊는다. 생성기는 여전히 자신이 만든 과거를 조건으로 다음 청크를 예측하지만, 교사는 그 청크를 과거·미래 없이 독립적으로 채점한다. 이를 위해 연속 청크의 주변 분포(marginal)를 롤아웃 전체에 걸쳐 평균으로 정의하고, 첫 번째 잠재 프레임은 시간 압축이 없어 통계가 다르므로 초기 청크와 연속 청크를 분리해 각각 다른 교사 목표에 매칭한다. 목적함수는 초기 청크에 1/T, 연속 청크에 (T-1)/T의 가중치를 준다. 연속 청크용 교사는 Wan 14B 비디오 교사를 원래 모델이 생성한 영상에서 잘라낸 연속 청크들로 LoRA 적응시켜 만든다. 또 샘플링 궤적의 어느 디노이징 단계에서 손실을 걸지 비대칭으로 정한다. 초기 청크는 무작위 중간 종료 단계에서, 연속 청크는 국소 디테일을 다듬는 최종 저잡음 단계에서만 감독해 사전학습된 시간적 역학을 보존한다. 그래디언트는 체크포인트 자기 강제(Solaris의 replay) 방식으로 계산 그래프 없이 롤아웃을 만든 뒤 미분 가능한 재생으로 역전파한다.

어떻게 쓰나

독립 채점은 청크 간 관계를 제약하지 않으므로, RMD는 2단계로 비디오 수준 DMD를 다시 적용해 시간적 일관성을 복원한다. 이 정련 단계는 청크 주변 목적함수로 이미 학습된 생성기에서 시작하고, 더 작은 학습률로 변화 폭을 제한한다. 즉 공간적 사실성과 시간적 일관성을 서로 다른 단계로 분리해 감독한다.

전제와 한계

실험은 Wan 14B 비디오 확산 모델을 Causal Forcing의 인과 ODE 체크포인트에서 초기화한 Wan 1.3B 인과 생성기로 증류한다. Self Forcing에서 가져온 7만 개 프롬프트로, 81프레임 고정 지평에서만 학습하고 더 긴 롤아웃은 학습 중에 하지 않는다. 평가는 VBench-Long의 944개 프롬프트, 프롬프트당 5회 생성, 832×480 해상도, 16 FPS, 약 60초 길이로 수행한다. 청크 크기 1에서 RMD는 총점 81.26으로 Self Forcing 70.94, Causal Forcing 69.88을 10점 이상 앞서고 품질 84.52, 의미 68.24를 기록했다. 청크 크기 3에서는 총점 81.48, 품질 85.03, 의미 67.24다. 10초에서 60초로 늘려도 품질 점수가 84.68에서 84.52로 거의 변하지 않는 반면, Self Forcing 총점은 79.12에서 70.94로 급락한다.

절제 실험도 논지를 뒷받침한다. 비디오 수준 DMD만 적용하면 총점 72.44에 그치고 색 아티팩트로 빠르게 붕괴한다. 주변 목적함수만 쓰면 품질 84.90까지 오르지만 청크 간 제약이 없어 시공간 슬라이스에서 톱니형 깜빡임이 나타난다. 두 단계를 모두 쓰면 총점 81.26, 의미 68.24로 최고 성능을 내면서 궤적이 매끄러워진다. 모든 청크에 무작위 단계 종료를 균일 적용한 변형은 시간적 흔들림이 심해져 총점 78.29, 품질 82.48로 떨어진다.

개발자 관점에서 RMD는 추론 시 추가 연산이 전혀 없다는 점이 실용적이다. 고정 프레임 앵커나 프레임 싱크, 별도 메모리 장치, 생성기 구조 변경 없이 표준 슬라이딩 윈도우 프로토콜을 그대로 쓰기 때문에, 기존 인과 생성기 학습 파이프라인에서 증류 목적함수만 교체하는 방식으로 적용할 수 있다. 다만 연속 청크용 교사를 LoRA로 별도 적응시켜야 하고, 청크 크기에 따라 가짜 점수 학습률과 학습 스텝 수를 다르게 가져가는 등 하이퍼파라미터 민감도가 있으므로, 자신의 청크 크기와 학습 지평에서 재현 검증이 필요하다.

저자들이 밝힌 전제와 한계도 분명하다. 학습은 81프레임(약 5초) 고정 지평에서만 이루어지고, 60초 정량 평가와 500초 예시는 학습 지평을 훨씬 넘어선 외삽 결과다. 특히 500초 롤아웃은 정성적 예시일 뿐 집계 지표에는 포함되지 않는다. 또한 주변 목적함수 단독으로는 시간적 일관성이 부족해 반드시 비디오 수준 정련이 뒤따라야 하며, 정련 단계의 학습률을 낮춰야 앞 단계에서 얻은 시각 품질을 훼손하지 않는다는 조건이 붙는다.