미래 정보 수요로 과거 프레임을 골라 긴 영상 생성을 안정화한다

FrameMorrow: Future-guided Frame Selection with Prospective Tokens for Long-Horizon Video Generation

HF Daily2609.38839

Bo Yin, Xiaobin Hu, Jiaqi Zhao2026-09-30

무엇인가

긴 호라이즌 영상 생성은 생성 이력이 길어질수록 과거 내용을 전부 유지하는 비용과 중복이 커진다는 문제를 안는다. 기존 방법들은 대개 현재 보이는 내용과의 관련성을 기준으로 과거를 검색한다. 논문은 이 전제를 정면으로 반박한다. 지금 눈앞의 장면과 잘 맞는 이력이 다음 생성에 도움이 된다는 보장이 없고, 지금은 무관해 보이는 과거가 나중에 다시 중요해질 수 있다는 것이다. 저자들이 세운 핵심 통찰은 과거 정보를 미래 정보 수요와의 관련성으로 선택해야 한다는 것이며, 이를 위해 미래를 통째로 생성할 필요 없이 다음에 중요해질 내용을 담은 압축 표현만 있으면 충분하다고 본다.

어떻게 동작하나

제안 방법 FrameMorrow는 롤아웃 스텝 t에서 최근 컨텍스트 L_t(백본이 이미 보고 있는 최근 프레임들)와 검색 후보인 장기 이력 H_t를 분리한다. 최근 컨텍스트는 어떤 과거를 떠올릴지 알려주는 역할만 하고, 메모리 예산은 H_t에서만 소모된다. 선택기는 텍스트 프롬프트·행동 시퀀스·제어 신호 같은 롤아웃 조건 c_t+(미래 관측이나 이후 사용자 입력은 포함하지 않음)를 함께 받아, 인과적 트랜스포머 F_ψ로 M개의 전망 토큰 q_t^1…q_t^M을 자기회귀적으로 예측한다. 기본값은 M=4다. 이 토큰들을 학습된 W_Q, W_K로 투영해 각 이력 프레임과의 스케일드 닷프로덕트 어텐션 로짓을 계산하고, τ_q로 조절되는 smooth maximum(로그-평균-지수)으로 프레임별 점수 r̂_t,i를 만든다. 프레임은 여러 전망 토큰 중 하나라도 잘 맞으면 높은 점수를 받을 수 있다. 이후 TopK로 K개(기본 K=4)를 골라 타임스탬프 순으로 정렬한 뒤 백본에 넘긴다.

무엇과 다른가

학습은 미래 기반 랭킹 증류로 이뤄진다. 각 학습 궤적은 이력, 최근 컨텍스트, 조건, 그리고 실제로 이어진 미래 프레임 Y_t+를 제공한다. 동결된 DINOv2 인코더 Φ로 이력 프레임과 미래 프레임의 코사인 유사도를 구하고, 미래 프레임들에 대한 smooth maximum으로 교사 점수 r_t,i^F를 만든다. 교사는 (H_t, Y_t+)만 보고, 학생은 학습과 추론 모두에서 (H_t, L_t, c_t+)만 본다. 교사·학생 점수를 각각 소프트맥스 분포로 정규화한 뒤 리스트와이즈 손실(분포 정렬)과 페어와이즈 손실(마진 δ 이상 벌어진 순서쌍 보존)을 λ로 가중 합산한다. 추론 시에는 미래 기반 타깃 생성이 제거되고, 선택기는 관측된 입력만으로 전망 토큰을 다시 만든다.

어떻게 쓰나

통합 방식이 이 논문의 실용적 핵심이다. FrameMorrow는 모델 내부 상태가 아니라 명시적인 과거 프레임을 출력하고, 동결된 백본 b는 자신의 기존 어댑터 Γ_b로 그 프레임을 받아 처리한다. 새로운 컨디셔닝 모듈을 학습할 필요가 없어, 참조 프레임 인터페이스만 있으면 폐쇄 소스 모델에도 그대로 붙는다. 전망 토큰 몇 개와 프레임 몇 개만 다루므로 추가 추론 비용도 작다.

전제와 한계

실험은 5개 벤치마크, 11개 생성 모델에 걸쳐 있다. 텍스트 조건 생성은 OpenVidHD 1만 개 영상으로, 행동 조건 월드 모델은 Sekai Game-Walking 1만 개 청크에 카메라 모션 기반 의사 행동을 붙여 학습했다. 60초 MovieGenBench에서 Self-Forcing·LongLive 1.0·Causal Forcing 세 백본 모두 평균 순위 1위(각 1.33, 1.25, 1.33)를 기록했고, Self-Forcing에서 이미징 품질 62.22→68.47, 다이내믹 정도 51.72→64.56으로 올랐다. 다만 지표별 우위가 균일하지는 않아 Self-Forcing에서 LongLive-RAG가 배경·모션 점수는 더 높게 유지했다. 인터랙티브 단일 샷에서는 Self-Forcing 일관성이 84.95→89.30으로 상승했고, 구간별 CLIP 점수 이득이 첫 10초 0.16에서 마지막 10초 2.99로 커져 후반부 프롬프트 정합 개선이 두드러졌다. 멀티 샷에서는 ShotStream 일관성이 4.01점 올랐지만 미학 점수는 0.56 떨어졌다. 폐쇄 소스인 Seedance 2.0과 Kling O3에서는 참조 인터페이스를 통해 일관성이 각각 1.29점, 1.33점 개선됐고, 동일 예산의 균일 선택보다 세 지표 모두 우세했다. 월드 모델에서는 행동 정합성이 Matrix-Game 3.0 +0.019, WorldMem +0.023, YuMe 1.5 +0.029 올랐고 모션 품질은 대체로 유지됐다.

절제 실험은 설계 선택을 뒷받침한다. 미래 감독을 쓰지 않은 대조군은 네이티브 84.95 대비 1.25점, 미래 증류는 4.35점, 미래를 직접 참조하는 오라클은 5.65점을 얻어 증류가 오라클 격차를 4.40점에서 1.30점으로 줄였다. 프레임 예산에서는 K=2로 88.00을 달성해 16개를 균일 샘플링한 87.10을 앞섰고, K를 4에서 8로 늘려도 0.40점, 16으로 늘려도 추가 이득이 없었다. 전망 토큰은 M=1→4에서 87.20→89.30으로 오르고 M=4에서 자기회귀가 병렬 예측보다 1.00점 높았으며, M=8은 0.30점, M=16은 이득이 없었다. 최근 K개 선택, 균일 샘플링, 최근 컨텍스트 특징 유사도 기반 매칭, CLIP 프롬프트 매칭, 전망 토큰 없이 직접 점수화하는 방식 등 다섯 전략과의 비교에서도 FrameMorrow가 앞섰다.

개발자 관점에서 이 방법은 생성 백본을 재학습하거나 내부 캐시를 뜯어고치지 않고도 긴 영상 파이프라인의 장거리 일관성을 끌어올리는 선택지다. 참조 프레임 인터페이스가 있는 모델이면 폐쇄 소스 API에도 적용 가능하고, K=4·M=4·5초마다 선택 갱신이라는 설정이 기본값으로 제시돼 있다. 다만 도입 전에 확인할 것은 세 가지다. 첫째, 선택기 처리 비용이 후보 프레임 수·최근 컨텍스트 길이·조건 길이에 따라 늘어난다는 점(논문은 추론 오버헤드 표를 제시하지만 본문에는 구체 수치가 없다). 둘째, 지표별 트레이드오프가 실제로 존재한다는 점이다. 셋째, 학습에 필요한 미래 기반 랭킹 감독은 실제 미래 관측이 있는 오프라인 데이터로만 구성되므로, 자체 도메인 데이터로 선택기를 다시 학습할 계획이라면 이 감독 신호를 만들 수 있는지부터 따져야 한다.

저자들이 명시한 한계도 분명하다. 교사의 미래 기반 점수는 시각적 관련성의 대리 지표일 뿐, 최근 컨텍스트를 넘어서는 증분적 생성 효용을 측정하지도, 미래 구간 전체를 커버한다고 보장하지도 않는다. 목적 함수는 전망 토큰이나 선택 프레임 사이의 다양성을 명시적으로 강제하지 않으며, 특정 미래 요인을 개별 토큰에 배정하지도 않는다. 또한 전망 토큰은 매 롤아웃 스텝마다 현재 입력으로부터 새로 생성되므로, 선택 결과가 스텝마다 흔들릴 여지가 구조적으로 남아 있다.