양방향 확산 모델만 학습해 재학습 없이 스트리밍 비디오 편집으로 전이하는 SVEET

Streaming Video Editing with Easy Adaptation

HF Daily2609.24788

Yujia Hu, Jiajun Li, Zihao He2026-09-21조회 4

무엇인가

이 논문은 실시간 스트리밍 비디오 편집 문제를 다룬다. 비디오 확산 모델이 오프라인 생성에서 스트리밍 설정으로 이동하면서, 프레임을 인과적으로 생성해 라이브 스타일 전환, 온라인 인페인팅, 실시간 아바타 합성 같은 저지연 응용을 지원하려는 수요가 커졌다. 그런데 기존 비디오 편집 방법들은 양방향 전체 시퀀스 처리를 전제로 해서 스트리밍 제약과 근본적으로 충돌한다. 스트리밍 편집 모델을 처음부터 학습하는 대안은 비용이 지나치게 크다. 논문은 스트리밍 증류가 128 H100 GPU days를 소모하고 수천 개의 ODE 쌍을 합성해야 한다고 언급한다. 그래서 저자들은 양방향 모델만 학습하고 재학습 없이 편집 능력을 스트리밍 설정으로 전이할 수 있는가를 질문으로 세운다.

어떻게 동작하나

저자들은 먼저 기존 video-to-video 확산 구조를 체계적으로 재검토하고, 세 가지 대표 구조에서 비교 실험을 한다. 백본 파라미터를 학습 중 미세조정하는 Wan-Fun, 완전 시공간 어텐션을 쓰는 VACE, 그리고 시간 독립적 2D 어텐션을 쓰는 VACE 변형이다. 결과는 Wan-Fun이 전이 후 심하게 성능이 무너져 거의 전이에 실패했고, 완전 시공간 VACE는 부분적으로만 편집 능력을 유지하면서 시간적 거동이 불안정했으며, 2D 어텐션 변형이 훨씬 안정적으로 전이됐다. 이 관찰에서 두 원칙이 나온다. 첫째 백본 특징 분리(backbone feature disentanglement): 제어 학습은 양방향 백본과 분리돼 있어야 사전학습 지식이 보존된다. 둘째 조건부 프레임 독립성(conditional frame independence): 소스 비디오 인코딩은 프레임별로, 시간 의존성 없이 이뤄져야 인과적 청크 단위 추론과 충돌하지 않는다.

무엇과 다른가

SVEET의 첫 구성 요소는 시간 독립적 제어 분기다. VACE류 조건부 비디오 확산 백본 위에 제어 경로를 두는데, 이 구조 자체가 이미 백본 특징 분리를 만족한다. 여기서 원래의 완전 시공간 셀프 어텐션을 시간 독립적 2D 공간 어텐션으로 교체한다. 토큰을 프레임 인덱스 t와 공간 인덱스 s로 표기할 때 어텐션 마스크는 M((t,s),(t',s')) = 1 (t = t'일 때), 0 (그 외)로 정의된다. 즉 각 쿼리는 같은 소스 프레임의 토큰에만 어텐션하므로 조건 표현이 해당 프레임에만 의존한다. 생성 비디오의 시간적 일관성은 인과적 스트리밍 백본이 자기회귀 히스토리를 통해 모델링한다. 그 결과 제어 분기는 스트리밍 추론 중 key/value 캐시가 필요 없고, AR 백본 위에 추가적인 캐시 증가 부담을 얹지 않는다.

어떻게 쓰나

두 번째 구성 요소는 직교 분리 학습(Orthogonal Decoupled Training, ODT)이다. 제어 분기는 양방향 백본에서 학습되지만 파라미터와 특징 분포가 다른 인과적 스트리밍 백본에 배치되므로, 그대로 옮기면 전이가 나빠진다. 저자들은 먼저 데이터 기반으로 특징 격차를 측정한다. 소규모 캘리브레이션 세트의 비디오-프롬프트 쌍에 대해 동일 입력을 양방향 모델과 인과 모델에 넣고 블록별 은닉 상태 X_b, X_c를 기록한 뒤, 릿지 회귀 W1 = argmin ||W X_b - X_c||_F^2 + λ||W||_F^2로 두 특징 스트림 사이의 선형 사상을 닫힌 형태로 구한다. 양방향 특징 자체를 기준(W_b = I)으로 두면 잔차 변환 A1 = W1 - I가 양방향 표현을 인과 표현으로 바꾸는 업데이트 방향을 담는다. 이 A1에 얇은 특이값 분해 A1 = U Σ V^T를 적용해 상위 k개 우특이벡터 V_k를 남기면, 이것이 격차 부분공간(discrepancy subspace)의 정규직교 기저가 된다. 그 여공간으로의 직교 사영자는 Π⊥ = I - V_k V_k^T다. 제어 분기의 학습 가능한 업데이트는 A2 = C Π⊥, W2 = W_b + A2로 제약된다. C는 실제로 LoRA 어댑터로 파라미터화되는 제약 없는 학습 업데이트이고, Π⊥는 학습 내내 미리 계산돼 고정된다. 이렇게 하면 제어 업데이트가 양방향에서 인과로 가는 전이의 주된 특징 방향과 겹치지 않는다. 이론적으로도 정리 1은 두 기능별 업데이트 중 하나의 지배적 특이 부분공간을 다른 쪽에서 제거하면 간섭이 그 부분공간 밖 잔여 꼬리 에너지로 상한이 정해진다고 하고, 정리 2는 직교 사영이 두 기능 사이의 고차 상호작용을 잔여 꼬리 특이값으로 묶어 출력 합성 가능성을 개선한다고 주장한다.

전제와 한계

실험은 Wan2.1-1.3B-VACE를 양방향 백본으로, 청크 단위 Causal Forcing을 기본 스트리밍 백본으로 쓴다. VACE 제어 분기는 rank 128 LoRA로 최적화하고 사전학습 백본 파라미터는 모두 동결한다. AdamW, 학습률 1×10^-4, 가중치 감쇠 10^-2를 사용한다. ODT의 층별 사영자는 각 DiT 블록에서 누적 스펙트럼 에너지의 80%를 유지한다. 과제당 10 에폭, 단일 NVIDIA A100(80GB), 배치 크기 1, 480×832 해상도의 81프레임 클립으로 학습한다. 평가 과제는 스타일 전환, 비디오 인페인팅, 깊이→비디오 생성 세 가지다. 학습 데이터는 스타일 전환이 Ditto, 인페인팅과 깊이→비디오가 VPData에서 샘플링했고 깊이 조건은 Video-Depth-Anything으로 추출했으며, 과제당 약 6K~13K 샘플이다. 평가는 Ditto에서 무작위로 뽑은 120개 비디오 쌍(스타일 전환), VPData에서 뽑은 80개 샘플(인페인팅·깊이→비디오)로 구성한 홀드아웃 테스트셋을 쓴다. 비교 대상은 SDEdit+CF, StreamDiffusionV2, Daydream+CF, LiveEdit이고, 오픈소스 실시간 편집 모델이 드물어 같은 파이프라인에 설계만 바꾼 Full-Attn과 Channel-Concat Control 두 통제 베이스라인도 추가한다. 지표는 GPT-4o를 이용한 1~10 리커트 척도 VLM 평가, CLIP-T, 과제 관련 VBench 6개 지표(피사체 일관성, 배경 일관성, 시간적 플리커링, 모션 부드러움, 미학 품질, 전체 일관성), 그리고 10명 참가자가 15개 영상을 편집 정확성·구조 보존·모션 부드러움 기준으로 채점하는 사용자 연구다. 저자들은 대부분의 지표와 과제에서 최고 평균 성능을 냈고, 특히 VLM 점수에서 모든 베이스라인을 뚜렷한 차이로 앞선다고 보고한다. 속도는 보조 가속 기법 없이 단일 H100 GPU에서 15 FPS다.

본문에 실제 숫자가 제시된 것은 절제 실험 표다. VLM 점수와 모션 부드러움 기준으로 3D 어텐션에 ODT 없음이 7.0653과 0.9809, 3D에 ODT 적용이 7.3315와 0.9856, 2D에 ODT 없음이 7.1898과 0.9830, 2D에 ODT 적용이 7.4322와 0.9898이다. 추론 단계 사영(Infer-stage Proj)은 6.4250과 0.9848, 2단계 teacher forcing은 7.0927과 0.9879다. 2D 어텐션은 소스 보존과 스트리밍 안정성을 높이고, ODT는 전이로 인한 외형 드리프트를 추가로 줄이며, 둘을 결합했을 때 최적의 균형을 낸다. 추론 단계 사영은 추정된 사상 행렬로 사후 사영을 하면 구조 드리프트가 크고, 2단계 teacher forcing은 안정성은 개선되지만 국소 내용이 나빠지고 스트리밍 백본을 추가로 적응시켜야 한다. 부분공간 랭크 실험에서는 고정 랭크(k=32, 64, 128)가 적응형보다 전반적으로 뒤처졌고, 작은 고정 랭크는 직접 전이 대비 미미한 개선에 그쳤다. 에너지 비율을 고정하는 적응형(r=60%, 80%)이 더 큰 이득을 냈고 r=80%가 대부분 지표에서 상대적으로 더 좋았다. 다만 본문 텍스트에는 과제별 베이스라인 대비 정량 수치와 사용자 연구 수치가 숫자로 제시되지 않아, 구체적 개선폭은 원문 표를 확인해야 한다.

실무 관점에서 이 논문이 유용한 지점은 이미 쓸 만한 양방향 편집 모델과 스트리밍 백본을 각각 확보한 상황에서, 스트리밍 편집기를 처음부터 학습하거나 증류하는 비용을 피하려는 경우다. 라이브 스타일 전환, 온라인 인페인팅, 실시간 아바타 합성처럼 지연이 중요한 파이프라인에 적용 후보가 된다. 도입 전에 확인할 것은 몇 가지다. 스트리밍 백본의 블록별 특징 공간이 양방향 백본과 얼마나 어긋나는지, ODT를 쓰려면 캘리브레이션용 비디오-프롬프트 쌍을 얼마나 확보할 수 있는지, LoRA rank와 스펙트럼 에너지 비율(r)을 어떤 값으로 둘지, 그리고 제어 분기의 프레임 독립 2D 어텐션이 대상 과제의 시간적 일관성을 감당할 만큼 충분한지다. 제어 분기가 KV 캐시를 필요로 하지 않는다는 점은 스트리밍 서빙에서 메모리 증가를 통제하는 데 직접적인 이점이 된다.

저자들이 밝힌 한계는 명확하다. 이 방법은 기본이 되는 양방향 편집 모델의 능력에 의존하며, 전이 패러다임을 더 넓은 편집 과제와 더 이질적인 백본으로 확장하는 것은 향후 과제로 남긴다. 또한 논문은 스트리밍 백본을 재학습하거나 증류하지 않고 양방향에서 스트리밍으로의 비디오 편집 전이를 연구한 첫 사례라고 주장하지만, 그 전제는 양방향 백본에서 편집 능력이 충분히 학습돼 있다는 것이다. 실험도 스타일 전환, 인페인팅, 깊이→비디오 세 과제에 한정돼 있어 다른 편집 유형에서의 전이 품질은 원문에서 검증되지 않았다.

관련 논문