자기회귀 영상 생성에서 문맥 쓰기와 디노이징의 파라미터를 분리한다
SGF+: Decoupling Gradient Flows for Autoregressive Video Generation
무엇인가
자기회귀 영상 확산 모델은 프레임을 순차적으로 생성하면서 두 가지 일을 동시에 한다. 현재 블록의 노이즈를 제거해 콘텐츠를 만들고(디노이징), 그 결과를 키-값(KV) 표현으로 인코딩해 이후 블록의 문맥으로 넘긴다(문맥 쓰기). 문제는 이 두 역할이 같은 DiT 파라미터를 공유한다는 점이다. Self Forcing(SF)은 계산 가능성을 위해 과거 KV 캐시를 그래디언트가 흐르지 않는 롤아웃 상태로 취급했고, 그래서 미래 생성 손실이 노이즈 낀 타깃 토큰이 역사를 어떻게 읽는가는 감독해도, 이전에 생성된 latent가 미래를 위해 어떻게 KV로 쓰이는가는 감독하지 못한다. 논문은 이를 historical context-gradient gap이라 부른다. Self Gradient Forcing(SGF)이 2-pass 훈련으로 이 경로를 복원했지만, 문맥 쓰기와 디노이징은 여전히 파라미터를 공유한 채였다.
어떻게 동작하나
논문의 출발점은 SGF 훈련 중 같은 생성 목적함수 아래에서 두 역할의 그래디언트 기여를 분리 측정한 관찰이다. 공유 선형 가중치 W에 대해 g_C는 문맥 쓰기 토큰의 기여, g_D는 디노이징 토큰의 기여이고 g_W = g_C + g_D로 놓은 뒤 코사인 유사도로 방향 일치도를 쟀다. 각도 거리 t-SNE에서 두 그래디언트 분포는 Attention과 FFN 모두에서 뚜렷하게 갈라졌고, 모듈 패밀리별 평균 그래디언트 방향의 각도 차이는 Attention 104.2도, FFN 106.3도로 둘 다 90도를 넘었다. 프롬프트와 디노이징 타임스텝을 가로지른 512개 쌍 전부에서 코사인 유사도가 음수였다. g_W = g_C + g_D이므로 두 기여는 공유 파라미터 위에서 부분적으로 상쇄된다.
무엇과 다른가
SGF+는 이 상쇄를 피하기 위해 역할별 파라미터화를 도입한다. 문맥 작성자 C_θc와 디노이저 D_θd를 두고, 둘 다 같은 자기회귀 확산 모델에서 초기화한다. 1패스는 SGF와 동일하게 그래디언트 없는 자기 롤아웃이다. D_θd가 각 블록을 생성하고 C_θc가 그 clean 추정값을 캐시에 기록한다. 2패스에서는 M_θc = C_θc(sg(X), t_ctx | M_rec)로 문맥 은닉 상태와 KV 투영을 그래디언트 추적 하에 재계산하고, X̂_tar = D_θd(Z*, t* | M_θc, M_rec)로 타깃을 복원한 뒤 L = L_DMD(X̂_tar)를 최소화한다. 샘플링된 latent와 캐시 궤적은 detach된 채로 남고 2패스 재구성만 미분 가능하다. 미래 생성 목적함수는 미분 가능한 KV 상태 M_θc를 통해 θc에, 타깃 디노이징을 통해 θd에 도달한다. 두 역할은 causal attention 구조로 전방 결합을 유지한 채 함께 훈련되지만 업데이트는 같은 가중치에 누적되지 않는다. 보조 문맥 손실도, 그래디언트 프로젝션도 쓰지 않는다.
어떻게 쓰나
실험은 Causal Forcing이 공개한 가중치로 Teacher Forcing(TF) 초기화를 하고, VidProM에서 필터링·확장한 프롬프트로 5초 비디오 윈도우에서 훈련한다. 학생 모델은 Wan2.1-T2V-1.3B 기반 causal video diffusion student, 교사는 frozen Wan2.1-T2V-14B, 별도로 훈련한 fake-score 네트워크는 Wan2.1-T2V-1.3B에서 초기화했다. SF, SGF, SGF+를 framewise와 chunkwise 두 생성 방식에서 5초·60초·240초 지평으로 비교하므로 60초와 240초 평가는 훈련 지평을 넘어선 네이티브 외삽을 시험한다. 60초는 VBench-Long 프롬프트, 240초는 128개 MovieGen 프롬프트를 쓴다. 지표는 Subject Consistency, Background Consistency, Temporal Flickering, Motion Smoothness, Dynamic Degree, Aesthetic Quality, Imaging Quality 일곱 가지이며 100을 곱해 보고한다.
전제와 한계
결과적으로 SGF+는 두 생성 단위와 두 장기 지평 모두에서 대부분의 품질·일관성 지표에서 SF와 SGF를 앞선다. 다만 Dynamic Degree만은 예외로 SF나 SGF가 더 높은 점수를 낸다. 저자들은 이것이 더 나은 움직임 품질을 뜻하지 않는다고 반박한다. 장면 점프, 객체 변형, 피사체 소실, 추가 인물 등장 같은 현상이 크지만 비일관적인 겉보기 움직임을 만들어 Dynamic Degree를 부풀릴 수 있다는 것이다. 정성 비교에서는 금광 마을 장면에서 SF의 배경 왜곡과 SGF의 녹색 줄무늬 아티팩트를 SGF+가 피했고, 소금 사막 장면에서 탐험가 외형과 하늘 아티팩트를, 창고-꽃 장면에서 꽃송이 형태와 스케일 변화를 더 잘 보존했다. 표 1의 지표별 개별 점수는 본문에 인용된 범위에서는 제시되지 않았다. 5초 롤아웃만으로 훈련한 모델이 장기 비디오 파인튜닝 없이 최대 24시간 연속 생성을 지원한다는 점이 이 논문의 대표적 주장이다.
절제 실험은 파라미터 분리를 Attention과 FFN 중 한쪽에만 적용한 변형이 품질·일관성 지표에서 전체 모델에 못 미친다는 것을 보인다. FFN에만 역할 전문가를 두는 MoE 스타일 설계로는 충돌을 완전히 없앨 수 없다는 뜻이다. Attention만 분리한 변형은 Dynamic Degree가 가장 높지만 나머지 대부분 지표에서 FFN만 분리한 변형과 전체 모델보다 크게 낮았다. 효율은 생성기 파라미터가 1.4B에서 2.8B로 두 배가 되지만, 한 번의 전방 패스에서 각 토큰이 자기 역할의 파라미터만 쓰기 때문에 연산이 두 배가 되지는 않는다. 81프레임 워크로드에서 추론 시간은 SGF 4.962초 대 SGF+ 4.969초로 거의 같았고 메모리는 24.85GB에서 27.96GB로 늘었다. 학습 피크 메모리는 97.83GB에서 98.15GB, 안정 메모리는 70.06GB에서 73.60GB로 증가했고 스텝당 시간은 11.79초에서 12.76초로 약 8.2% 늘었다.
실무 관점에서 이 논문은 자기회귀 영상 생성 파이프라인에서 문맥 관리(캐시 정책, 어텐션 싱크, KV 재캐싱)와는 다른 축의 개입을 제안한다. 긴 영상 파인튜닝이나 추가 비디오 데이터 없이 짧은 학습 창만으로 장기 롤아웃 품질을 끌어올리는 것이 목표라면, 역할별 파라미터 분리는 기존 SGF 계열 학습 루프에 최소 변경으로 얹을 수 있는 선택지다. 다만 파라미터가 두 배가 되므로 메모리 예산과 학습 처리량을 먼저 확인해야 하고, 두 개의 LoRA 어댑터로도 같은 분리를 구현할 수 있다는 점은 저비용 대안으로 기억할 만하다. Dynamic Degree 같은 단일 지표가 개선을 반영하지 않을 수 있다는 경고도 실무 평가 설계에 그대로 적용된다.
저자들이 밝힌 전제와 한계도 분명하다. 파라미터 분리는 충돌하는 역할 업데이트를 막는 가장 단순하고 직접적인 방법일 뿐이며, 모델 병합 같은 다른 접근은 향후 과제로 남긴다. 역할별 그래디언트 차이와 충돌은 SGF 훈련 이전, 즉 Teacher Forcing 초기화 단계에서 이미 관찰된다. 확산 타임스텝 인덱스 0에서 1로 넘어갈 때, 깨끗한 문맥 쓰기에서 노이즈 낀 디노이징으로 전환되는 지점에서 방향이 급격히 바뀐다. 이 관찰은 TF로 훈련되는 월드 액션 모델에도 역할 인식 파라미터화를 확장할 여지를 시사한다. 또한 이번 구현은 LoRA 두 개가 아니라 두 개의 전체 파라미터 세트를 썼고, 24시간 생성 주장은 정성적 그림과 부록에 근거한다는 점을 감안해 읽어야 한다.