KV 캐시의 출처를 학습 분포 안에 묶어 분 단위 영상 생성을 안정화한다

In-Distribution Forcing for Long Video Generation at Test Time

HF Daily2610.03120

Jeongwoo Shin, Youngyoon Choi, Sangwoo Jo2026-10-02

무엇인가

자기회귀(AR) 영상 확산 모델은 짧은 영상은 잘 만들지만, 생성을 길게 이어가면 색과 질감이 서서히 밀리고 움직임이 죽는 드리프트가 나타난다. 기존 연구는 대부분 KV 컨디셔닝, 즉 캐시된 key-value 항목 중 무엇을 읽을지 고르거나 시간 위치 임베딩을 수정하는 방식으로 이 문제를 다뤘다. 이 논문은 그 접근이 조용히 깔고 있는 가정, 즉 캐시된 KV 항목이 학습 분포 안에 있다는 가정 자체가 학습 지평선을 넘어가면 깨진다고 지적한다. 롤아웃 중에 KV 항목이 어떤 문맥 위에서 만들어졌는지를 아무것도 통제하지 않기 때문에, 캐시 항목 자체가 분포 밖(out-of-distribution)으로 밀려난다는 것이다. 저자들은 이를 KV-provenance 문제라고 부른다.

어떻게 동작하나

핵심 관찰은 같은 깨끗한 청크라도 캐싱 윈도우에 어떤 KV 항목들이 있었는지에 따라 KV 공간의 전혀 다른 점으로 사상된다는 것이다. 학습 중에는 컨디셔닝 윈도우와 캐싱 윈도우가 같은 집합이고 청크가 추가되기만 하지만, 테스트 타임 롤링 윈도우는 가장 오래된 항목을 밀어내므로 남은 KV 항목들이 원래의 provenance를 잃는다. 논문은 두 가지 관찰을 제시한다. 학습 지평선을 넘은 청크의 생성에서 드리프트가 들어올 수 있는 유일한 경로는 컨디셔닝 윈도우의 KV 항목이며, 그 항목들이 분포 안에 있으려면 각각이 학습이 실제로 수행한 provenance 아래에서 캐싱되어야 한다.

무엇과 다른가

이를 해결하는 것이 In-Distribution Forcing(ID-Forcing)이다. 학습이 필요 없는 테스트 타임 프레임워크로, KV 캐싱과 KV 컨디셔닝 두 층을 모두 학습 때의 설정에 맞춘다. 캐싱 층의 메커니즘은 self-caching이다. 길이 L의 컨디셔닝 윈도우에 대해 앞의 ℓ개 항목은 자기 자신만 보고 캐싱하고(E(x_j; ∅)), 나머지 L−ℓ개는 마지막 self-cached 항목 위에 자기회귀적으로 얹어 캐싱한다. 학습이 κ0 위에 κ1, κ2를 쌓던 방식과 같은 형태를 유지해, 학습에서 본 적 없는 provenance가 아예 만들어지지 않게 막는다.

어떻게 쓰나

컨디셔닝 층에서는 두 가지를 강제한다. 첫째, 첫 청크 κ0를 슬롯 0에 영구히 고정한다. causal 3D-VAE가 초기 잠재 프레임을 단일 픽셀 프레임에서 인코딩하는 반면 이후 프레임은 여러 프레임을 집계하기 때문에, κ0는 분포적으로 대체 불가능하고 윈도우가 굴러가며 κ0를 밀어내는 것 자체가 분포 밖 행동이라는 논리다. 이는 경험적 안정화 효과를 위해 여러 초기 항목을 남기는 attention sink와 동기·형태가 다르다. 둘째, 윈도우 길이를 L < N으로 묶고 κ0와 최근 L−1개 항목만 유지하며, 청크를 생성할 때마다 가장 오래된 비-sink 항목을 밀어내고 남은 항목을 R_{−f}로 재회전한다. 그 결과 윈도우 안의 모든 시간 거리가 학습에서 관측된 상태와 일치한다. self-caching 덕분에 밀어내기가 일어나도 남은 항목이 잃을 외부 provenance가 없어 표현이 학습 분포를 벗어나지 않는다.

전제와 한계

실험은 Wan2.1-T2V-1.3B 아키텍처 위에서 Self-Forcing과 LongLive 두 베이스 모델에 적용했고, Deep Forcing, ∞-RoPE, MemRoPE와 비교했다. 청크는 잠재 프레임 3개, 4스텝 디노이징(타임스텝 1000, 750, 500, 250)이며, Self-Forcing에는 L=3, ℓ=2를, 분 단위 영상으로 학습된 LongLive에는 첫 청크부터 L=3, ℓ=3을 적용했다(ℓ은 sink κ0를 포함). MovieGen 프롬프트 중 Qwen2.5-7B-Instruct로 정제한 앞 128개를 사용해 480×832 해상도로 120초·240초 영상을 생성하고 VBench-Long과 색 드리프트·움직임 드리프트 지표로 평가했다. 저자들에 따르면 ID-Forcing은 두 드리프트 지표에서 모든 베이스라인을 크게 앞서고, Dynamic Degree에서는 모든 설정에서 최고 점수를 낸다. Aesthetic Quality, Imaging Quality, Subject Consistency에서도 경쟁력이 있으며, 국소 프레임 간 안정성을 재는 Motion Smoothness만 움직임이 적은 방법에 유리하게 편향돼 예외가 된다고 밝힌다. 구체적 수치 자체는 Tab. 1에 담겨 있고 본문에 인용된 범위에는 숫자가 제시되지 않았다.

사용자 연구는 2AFC 프로토콜로 20명이 Self-Forcing 기반 4개 베이스라인과 20개 프롬프트를 비교했고, 색 일관성·배경 일관성·피사체 일관성·Dynamic Degree·시간적 플리커·전체 선호의 6개 차원 모두에서 참가자가 ID-Forcing을 일관되게 선호했다. 절제 실험에서는 구성 요소를 모두 빼면 Self-Forcing이 학습 지평선을 넘어 급격히 붕괴하고, 첫 청크 sink만 남기면 생성은 안정되지만 색·질감 드리프트와 플리커, 이전 장면으로 되돌아가는 현상이 남는다. 재회전을 더하면 개선되지만 KV 캐싱이 여전히 분포 밖이라 드리프트가 지속되고, self-caching까지 넣어야 색·질감 드리프트가 크게 줄면서 움직임이 보존된다.

개발자 관점에서 이 논문은 재학습 없이 추론 루프만 손보는 처방이라는 점이 실용적이다. 자기회귀 롤아웃을 길게 돌리는 스트리밍 생성이나 월드 모델 서빙에서 KV 캐시를 어떻게 쓰고(컨디셔닝) 어떻게 쓰는지(캐싱)를 분리해 관리해야 한다는 설계 지침을 준다. 특히 첫 청크를 sink로 고정하고 윈도우 길이를 학습 예산 안으로 묶는 규칙, 청크마다 남은 항목을 재회전하는 절차는 기존 롤링 윈도우 구현에 비교적 적은 변경으로 얹을 수 있다. 다만 L과 ℓ 같은 하이퍼파라미터가 베이스 모델의 학습 지평선 N에 종속되므로, 자체 백본을 쓴다면 N과 청크 크기, 디노이징 스텝 수를 먼저 확인해야 한다.

한계와 전제도 분명하다. 이 방법은 학습 지평선을 넘는 외삽이 임의 길이 생성에서 본질적으로 불가피하다는 전제 위에 서 있고, 학습 지평선을 늘리는 연구와는 직교한다고 저자들은 말한다. 또한 첫 청크가 분포적으로 대체 불가능하다는 논증은 causal 3D-VAE 구조에 의존하며, 윈도우 길이를 L ≤ N−1로 묶는 제약이 따라붙는다. 드리프트 억제와 달리 Motion Smoothness에서는 베이스라인 대비 열세가 나타날 수 있고, 평가는 128개 프롬프트와 20명 규모의 사용자 연구에 기반한다.