실제 긴 영상으로 자기회귀 비디오 생성의 장기 동역학을 유지하는 LongTake

LongTake: Learning to Sustain Dynamics in Long-Horizon Video Generation

HF Daily2609.38562

Byoungwoo Park, Jaemoo Choi, Juho Lee2026-09-29조회 1

무엇인가

자기회귀(AR) 비디오 확산 모델은 KV 캐시에 담긴 앞선 프레임을 조건으로 다음 청크를 생성한다. 문제는 대부분 5초 내외의 짧은 클립으로 학습되기 때문에, 몇 분짜리 롤아웃으로 나가면 장면이 거의 정지하거나 화질이 무너진다는 점이다. 논문은 그 원인을 짧은 영상 지도가 '장면 동역학이 긴 시간에 걸쳐 어떻게 전개되는지'에 대한 직접적인 감독을 주지 못하는 데서 찾는다. 게다가 일관성 위주의 지표는 정적인 영상을 오히려 선호해서, 프롬프트가 요구한 동작이 멈춰도 점수가 잘 나온다. 저자들은 이 실패를 teacher gap(짧은 학습 지평을 넘어선 위치에서의 감독 부재)과 student gap(정답 프리픽스 대신 자기 생성 프리픽스를 쓰는 학습-추론 불일치)으로 나눠 설명한다.

어떻게 동작하나

LongTake의 1단계는 실제 긴 영상 데이터셋에서 Long-Horizon Teacher Forcing을 수행한다. 짧은 학습 지평 N(예: 21 잠재 프레임)보다 훨씬 긴 목표 지평 M을 두고, 긴 정답 영상 프리픽스로 조건 KV 캐시를 만든 뒤 그 뒤에 오는 프레임들을 직접 예측하도록 흐름 매칭 손실을 건다(식 5). s=0이면 캐시가 비어 기존 TF와 같아진다. 캐시는 sink retention + FIFO eviction 또는 EMA 확장(병렬 prefix scan) 규칙으로 만들어지며, 캐시 구성과 타깃 예측을 두 번의 forward pass로 분리해 병렬 계산한다. 이 감독이 긴 프리픽스에서 유지되는 시간적 맥락과 이후 프레임의 관계를 학습시켜 teacher gap을 겨냥한다.

무엇과 다른가

핵심 발견은 이렇게 학습된 AR 모델이 별도의 few-step 초기화 단계(ODE 증류·일관성 증류) 없이 곧바로 자기 롤아웃 DMD의 초기값으로 쓰일 수 있다는 것이다. 표준 3단계 파이프라인을 2단계로 줄이면서도, 동일한 5초 DMD 설정에서 짧은 지평 TF 초기화보다 30초 롤아웃의 동적 정도가 크게 오르고 미학적 품질은 비슷하게 유지된다. Hybrid DMD는 여기서 한 걸음 더 나아가, 이 Long-Horizon AR 교사를 동결된 교사로 재사용해 학생 자기 롤아웃의 뒤쪽 프레임까지 조건부 DMD로 감독한다. 앞쪽 N 길이 윈도우는 기존 양방향 교사가 결합 분포로 감독하고, 그 이후는 학생이 만든 프리픽스로 구성한 KV 캐시를 조건으로 청크별 조건부 감독을 건다(식 6, 7). λ=0.2로 두 항의 비중을 조절한다.

어떻게 쓰나

실험은 Wan2.1-T2V-1.3B를 832×480, 16 FPS, AR 청크당 잠재 프레임 3개, 디노이징 4스텝으로 돌린다. Long-Horizon TF는 OpenVidHD를 포함한 4만3천 개 영상-텍스트 쌍으로 3,000 업데이트, 최대 30초까지 감독한다. LongTake는 21 잠재 프레임 롤아웃에서 1,200회 결합 DMD를, Hybrid DMD 변형은 42 잠재 프레임 롤아웃에서 800회 결합 DMD 뒤 400회 하이브리드 DMD를 쓴다. 양방향 교사는 Wan2.1-T2V-14B이고 학생 어텐션 윈도우는 12 잠재 프레임으로 고정한다. 비교 대상은 Self Forcing, Causal Forcing, LongLive, Reward Forcing, MemRoPE, Rolling Forcing, SGF, Context Forcing의 공개 1.3B 체크포인트이며, 평가는 30초에 MovieGen 확장 프롬프트 128개, 60초에 VBench-Long 프롬프트 251개를 쓴다.

전제와 한계

결과에서 베이스라인들은 동작과 품질을 맞바꾼다. LongTake보다 미학 점수가 높은 베이스라인은 동적 정도가 최대 58에 그쳤고, 90을 넘긴 유일한 Rolling Forcing은 미학 점수에서 LongTake에 3.9점 뒤졌다. LongTake는 30초·60초 모두 동적 정도 대 미학 품질의 파레토 프론트에 있고, 같은 프론트의 다른 방법 대비 미학 2점 미만 손실로 동적 정도 33~42점을 더 얻는다. 60초에서 품질이 가장 좋은 베이스라인인 Reward Forcing은 미학 품질은 LongTake와 비슷하지만 동적 정도가 14.5점 낮다. 5초 결합 DMD만 쓴 LongTake도 두 길이 모두에서 모든 베이스라인의 Quality를 앞선다. Hybrid DMD는 30초·60초 모두 최고 동적 정도를, 30초에서는 최고 Quality를 기록했고, 60초에서는 결합 DMD 쪽이 Quality가 더 높았다. 시각적 안정성 지표(ΔIQ, VLM exposure)에서도 LongTake는 30초 최고 VLM 점수를 기록하고 두 길이 모두 Context Forcing과 비슷한 ΔIQ를 보이면서 더 강한 동역학을 낸다.

실무적으로 이 논문은 긴 영상 생성에서 '프레임이 선명한가'만 보면 안 된다는 경고로 읽힌다. 정지에 가까운 영상이 일관성 지표에서 높은 점수를 받을 수 있으므로 동적 정도를 품질 지표와 함께 봐야 한다. 또 긴 영상 데이터로 교사 모델을 한 번 더 학습시켜 두면 별도의 few-step 증류 단계를 생략하고 바로 자기 롤아웃 DMD로 넘어갈 수 있다는 점은 학습 파이프라인을 단순화하려는 팀에 실질적인 선택지다. 다만 공개된 결과는 1.3B 백본 기준이고, 캐시 정책(sink retention, FIFO, EMA)과 학생 어텐션 윈도우 길이가 결과에 직접 영향을 주므로 자신의 캐시 설정에서 재현해 확인해야 한다.

저자들이 밝힌 한계는 두 가지다. Hybrid DMD의 효과는 뒤쪽 프레임을 감독하는 Long-Horizon AR 교사의 예측 품질에 의존하는데, 학생 자기 롤아웃에서 누적된 오류가 프리픽스에 쌓이면 교사가 흔들릴 수 있다. 이에 대한 후속으로 SVI처럼 오류 재활용(error-recycling) 파인튜닝을 붙이는 방향을 제안한다. 또한 평가가 1.3B 백본과 최대 60초 롤아웃으로 제한되어 있어, 더 큰 백본이나 더 긴 롤아웃에서의 성능은 검증되지 않았다.