Salt++가 인과 문맥 정렬 후처리로 4스텝 스트리밍 영상 생성을 구현한다

Salt++: Context-Aligned Post-Training for Few-Step Streaming Multimodal Generation

HF Daily2609.36995

Xingtong Ge, Yutong Wang, Lunjie Zhu2026-09-29

무엇인가

이 논문은 실시간 상호작용이 가능한 스트리밍 오디오-비디오 생성이라는 문제를 다룬다. 기존 통합 오디오-비디오 확산 모델은 시간축 양방향 아키텍처라 클립 전체를 다 만들기 전에는 출력을 보여줄 수 없고, 고품질 샘플링에 다단계 ODE 적분이 필요해 느리다. 해법은 두 축이다. 하나는 블록 인과 어텐션으로 앞선 블록만 조건으로 삼는 자기회귀 생성, 다른 하나는 샘플링 궤적을 몇 번의 평가로 압축하는 스텝 증류다. 그런데 기존 레시피는 단계마다 목적함수를 바꾸는 긴 파이프라인(teacher forcing으로 인과 교사 획득 → ODE 매칭이나 일관성 증류로 few-step 생성기 초기화 → 자체 롤아웃에 대한 분포 매칭 정제)을 쓴다. 저자들은 여기서 문맥과 관련된 두 가지 문제를 지적한다. 첫째, teacher forcing은 깨끗한 히스토리와 노이즈 낀 타깃을 짝지어 주지만 문맥 표현을 속도 예측을 통해서만 간접적으로 감독한다. 둘째, 인과 DMD에 양방향 스코어 모델을 그대로 재사용하면 생성 문맥과 스코어링 문맥이 어긋난다.

어떻게 동작하나

첫 번째 문제를 푸는 것이 Causal Self-Flow(CSF)다. 같은 노이즈 타깃 블록을 두고 학생은 노이즈가 섞인 히스토리를, EMA 교사는 깨끗한 히스토리를 본다. 각 선행 블록 i에 대해 γ_i ~ U(γ_min, γ_max)를 독립 샘플링해 z̃_i = (1-γ_i)z_i + γ_i ε_i로 히스토리를 오염시키되, 시간축으로 정렬된 비디오와 오디오는 같은 γ를 공유하고 가우시안 노이즈는 따로 뽑는다. 학생의 얕은 층 표현을 2층 프로젝션 헤드로 사영해 교사의 더 깊은 층 표현과 코사인 유사도로 정렬하고(교사 쪽은 stop-gradient), 이 표현 정렬 손실을 원래의 플로 매칭 손실에 λ_rep로 더한다. 표현 정렬은 선행 히스토리가 있는 블록(k>1)에만 적용한다. 학습 중에는 CSF 업데이트와 표준 clean-history teacher forcing 업데이트를 동일 확률로 번갈아 수행하고, 학습이 끝나면 EMA 브랜치와 프로젝션 헤드는 버리므로 추론 오버헤드가 없다.

무엇과 다른가

두 번째 문제를 푸는 것이 문맥 정렬 AR DMD다. 생성기 샘플링, fake 스코어 학습, real 스코어 평가가 모두 같은 블록 인과 마스크와 같은 오디오-비디오 프리픽스를 공유하게 만든다. fake 모델은 생성기가 샘플링된 그 문맥(깨끗한 프리픽스)에서 생성 블록과 짝지어 학습되고, real 스코어로는 CSF로 학습된 AR 교사를 쓴다. 이렇게 하면 업데이트가 블록 조건부 KL 목적함수의 그래디언트 추정치가 된다. 저자들은 real/fake 스코어의 가시성 조합을 BI-BI, BI-AR, AR-AR로 비교하는데, AR-AR이 가장 좋다. 생성기 업데이트는 real과 fake의 깨끗한 예측 차이를 정규화한 방향 g를 stop-gradient 서로게이트로 주입하는 방식이다. 또한 교사 CFG를 일관성 증류에서 쓰던 고정값 4.0에서 U(1.0, 3.5) 구간의 무작위 샘플링으로 재보정한다. 이후 깨끗한 프리픽스를 생성기 자신의 히스토리로 바꿔 같은 목적함수 그대로 on-policy 적응을 수행하므로, 별도의 일관성 증류 단계가 필요 없다. 추가로 스케일별 후처리 단계에서는 블록마다 LR 2회, HR 2회로 4번의 생성기 평가를 나눠 쓰고, LTX-2 잠재 업샘플러를 인과적 윈도우 형태로 증류한 업샘플러를 통해 1664×960 출력을 같은 예산 안에서 낸다.

어떻게 쓰나

실험은 LTX-2 기반이며 LTX-2 Base를 다단계 참조로, OmniForcing을 4스텝 인과 베이스라인으로 쓴다. 평가는 JavisBench-mini 1,000개 프롬프트와 LTX-2 프롬프트 인핸서 재작성 프롬프트, 832×480 121프레임 24FPS, 그리고 VBench 품질·일관성 지표다. 480p에서 AR-AR DMD 경로는 TF-dCM 경로를 11개 지표 중 8개에서 앞서고 VBench 4개 지표를 모두 이긴다. 전체 4스텝 방법 중 7개 지표에서 최고점이며, OmniForcing 대비 시각 품질 57.1%, 모션 품질 44.5%를 개선한다. 재작성 프롬프트에서는 OmniForcing 대비 보고된 7개 지표를 모두 개선하고 VQ와 MQ가 각각 59.0%, 64.6% 오른다. 고해상도 확장은 40+3스텝 LTX-2 참조를 7개 지표 중 6개에서 앞서며 VQ/MQ가 2.730/0.957 대 2.231/0.607이다. 절제 실험에서 BI-BI의 VQ/MQ 0.837/0.140이 BI-AR에서 1.131/0.157, AR-AR에서 3.147/1.351로 뛰고, TF-dCM 대비 AR-AR TF-DMD는 1.916/0.611에서 3.147/1.351로 오른다. 교사 가이던스 재보정은 VQ를 공식 프롬프트에서 91.5%, 재작성 프롬프트에서 82.9% 개선하고 MQ는 두 설정 모두 두 배 이상으로 만든다.

전제와 한계

개발자 관점에서 이 논문의 실무적 가치는 두 가지다. 첫째, few-step 증류를 도입할 때 스코어 모델의 조건 문맥을 생성기와 반드시 일치시켜야 한다는 것을 통제된 비교로 보여준다. 양방향 스코어를 그대로 쓰는 관행이 얼마나 손해인지(0.837 대 3.147) 숫자로 확인할 수 있다. 둘째, 일관성 증류용 교사 가이던스 값을 DMD에 그대로 물려받으면 안 된다는 실무 규칙을 제시한다. 스트리밍 지연 시간이 중요한 서비스에서 4스텝 인과 생성기를 만들 때 참고할 만한 레시피이며, CSF의 표현 정렬은 추론 시 비용이 들지 않는다는 점도 배포 측면에서 유리하다.

한계와 전제도 분명하다. 저자들은 DeSync 지표가 거의 정적인 BI-AR 출력을 선호한다고 부록에서 설명하는데, 즉 AR-AR이 모든 지표에서 우세한 것은 아니다. 고해상도 확장 단계는 CSF 교사가 480p로 후처리되어 있기 때문에 고해상도 지원이 가능한 양방향 교사를 감독에 사용하며, 이 단계는 블록 조건부 AR-AR 매칭이 아니라 스케일-롤아웃 수준에서 양방향 가시성으로 분포를 맞춘다. 또한 960p 비교에서 OmniForcing은 해상도를 맞춰 학습된 베이스라인이 아니라 외삽한 결과라는 점을 표에 명시하고 있다.