비디오 생성 증류 LoRA를 한 번만 학습해 54개 하위 모델에 재사용한다

LongLive-Plug: Once-for-All Distillation for Video Generation

arXiv2609.38154v1

Shuai Yang2026-09-29조회 4

무엇인가

비디오 확산 트랜스포머는 이제 다양한 하위 작업의 기반이 되지만, 특화 모델을 만들 때마다 증류 단계가 따라붙는다. 샘플링을 가속하거나 장기 비디오 품질을 올리기 위한 증류인데, 이 과정은 새 모델마다 데이터 준비와 교사 감독, 최적화를 다시 요구한다. LongLive-Plug는 이 반복 비용을 없애자는 제안이다. 기반 모델에서 재사용 가능한 능력을 LoRA로 한 번 증류해 두고, 호환되는 하위 모델에는 추가 학습 없이 붙였다 떼는 방식으로 배포한다.

어떻게 동작하나

핵심은 세 가지 기능성 LoRA다. 첫째는 CFG 증류로, 조건부·무조건부 두 번의 모델 평가를 한 번으로 합친다. 교사 예측은 v_cfg = v_∅ + w(v_c - v_∅)로 정의되고, 고정된 학습 스케일 w_train에서 CFG LoRA가 단일 패스 조건부 출력으로 이 교사 예측을 근사하도록 학습된다. 추론 시에는 CFG LoRA의 가중치 λ_cfg가 가이던스 다이얼 역할을 한다. 논문은 F ≈ v_c + λ_cfg(v_cfg - v_c) ≈ v_cfg(w̃), w̃ = 1 + λ_cfg(w_train - 1)의 근사 관계를 제시하며, λ_cfg가 0이면 조건부 모델, 1이면 완전히 증류된 어댑터, 그보다 크면 외삽이 된다고 설명한다.

무엇과 다른가

둘째는 few-step 증류로 DMD2를 써서 4스텝 샘플링을 가능하게 한다. 셋째는 장문맥 증류로, 인과적 자기회귀 추론을 지원하는 모델에서 누적 오차를 보정한다. 여기서 중요한 설계는 CFG와 few-step을 분리해 증류한다는 점이다. CausVid나 Self Forcing 같은 기존 방법은 둘을 함께 증류해 가이던스 스케일이 학습 시점 값에 고정되는데, LongLive-Plug는 별도 LoRA 두 개를 만들어 W̃ = W + λ_step·ΔW_step + λ_cfg·ΔW_cfg 형태로 각각 가중합한다. λ_step을 고정한 채 λ_cfg만 조절하면 하위 작업의 가이던스 취향에 맞출 수 있다. 장문맥 LoRA는 고정된 인과 AR 기반 모델 위에서 Streaming Long Tuning과 분포 매칭 증류(DMD)로 학습하며, 학생이 캐시된 히스토리에서 짧은 클립을 생성하고 교사가 이를 감독하되 이전 히스토리는 detach해 그래디언트를 현재 클립에 국소화한다.

어떻게 쓰나

실험은 Wan2.2-TI2V-5B를 기반 모델로 삼아 월드 모델링(SCOPE)과 ControlNet 기반 생성(Wan2.2-Fun-5B-Control) 두 하위 작업에서 이뤄졌다. SCOPE의 CrossFPS 클립 1,378개와 깊이 조건 PAI-Bench-C 600개를 FVD·LPIPS·SSIM·DOVER로 평가했다. SCOPE에서 LongLive-Plug는 FVD를 805.5에서 478.7로 낮춰 SCOPE 전용 증류(502.1)와 비슷한 수준을 보였고, ControlNet에서는 naive 4스텝 대비 6개 지표를 모두 개선해 깊이 si-RMSE가 2.135에서 1.641로, DOVER가 8.90에서 10.11로 올랐다. 사용된 가중치는 SCOPE에서 (λ_step, λ_cfg) = (1, 3), ControlNet에서 (1, 1)이다.

전제와 한계

전이 범위와 비용도 논문의 핵심 주장이다. Wan2.1-14B, Wan2.2-TI2V-5B, MiniMax-H3 세 백본 패밀리에서 총 54개 하위 모델(각 Wan 백본당 24개, H3 6개)을 검증했고, 월드 모델링·로보틱스·구조 조건 생성·카메라/궤적 제어·편집/복원·아바타 생성·오디오/RGBA 생성·도메인 적응까지 8개 범주를 아우른다. 20~50스텝 네이티브 스케줄 기준으로 디노이징 스텝을 5~12.5배 줄인다. 누적 비용 그래프에서는 기반 증류에 약 80 H100 GPU-시간(32 GPU로 700 iteration, 약 2.5시간)이 들고, 태스크별 증류는 깊이 조건 83.9, 월드 모델링 150.0, 포즈 조건 86.8, 로보틱스 시뮬레이션 56.1 H100 GPU-시간을 더해 총 456.8시간이 된다. LongLive-Plug는 이 추가분 없이 80시간짜리 어댑터를 재사용한다.

가이던스 제어와 전이 설계에 대한 실험도 구체적이다. w_train = 5로 증류한 뒤 네이티브 50스텝 FlowUniPC 스케줄에서 λ_cfg를 1에서 2, 3으로 올리면 우유가 튀는 표현이 강해진다. SCOPE에서는 결합 LoRA가 프롬프트 변화에 약하게만 반응한 반면, 별도 CFG LoRA를 λ_step = 1로 고정하고 λ_cfg를 1, 3, 5로 올리면 요청한 눈과 크리스탈 속성이 강화됐다. 반대로 결합 LoRA를 전역 스케일링하면 장면이 어두워지고 왜곡되며 가중치 5에서 심하게 붕괴한다. 어댑터 rank를 16에서 128로 세 번 두 배씩 늘리면 전이 FVD가 21% 단조 개선됐고, 증류 프롬프트 다양성이 낮아지면 FVD가 12% 상승했다.

장문맥 LoRA 전이는 약 8초 윈도로 학습된 ReWorld에서 24스텝 네이티브와 4스텝 +Long을 16~64초 구간에서 비교해, 64초에서 7차원 평균을 73.51에서 75.77로 올렸고 학습 길이의 8배까지 기반 모델을 앞섰다. Matrix-Game 3.0에서는 62.18초 기준으로 50스텝 네이티브 83.73, 공식 3스텝 태스크 전용 증류 84.30, 4스텝 +Long 84.34로 태스크 전용 증류와 경쟁력 있는 수치를 냈다.

저자들이 명시한 전제는 분명하다. once-for-all 재사용은 각 기반 모델의 호환되는 후속 모델에서만 성립하고, 장문맥 전이는 기존 인과 AR 추론이 이미 있는 모델을 요구한다. LoRA 업데이트만으로는 어텐션 마스크를 바꿀 수 없기 때문이다. 전이 품질에는 태스크별 트레이드오프가 있고, CFG LoRA 가중치에 의한 가이던스 제어는 근사적이어서 전이 후 재조정이 필요할 수 있다. 실무에서는 대상 모델이 같은 백본 패밀리인지, 인과 AR 추론을 지원하는지, 어댑터 rank와 증류 데이터 다양성이 충분한지를 먼저 확인해야 한다.