MosaiChunk가 과거 KV 조각을 모아 장기 영상 재등장 일관성을 높인다
MosaiChunk: Compositing Spatio-Temporal Memory for Autoregressive Video Generation
무엇인가
자기회귀 방식의 장기 영상 생성은 컨텍스트 윈도우가 유한하다는 제약을 안고 있다. 슬라이딩 윈도우 추론은 가장 최근 항목만 남기고 오래된 KV 캐시를 밀어내는데, 어떤 객체나 장면이 윈도우 밖으로 나가면 그 세부 외형 정보에 접근할 수 없게 된다. 논문이 드는 예시는 비스킷 통이다. 통을 닫았다가 몇 초 뒤 다시 여는 프롬프트에서, 모델은 안에 있던 비스킷의 모양을 이미 한 번 생성했음에도 그것을 재사용하지 못하고 다른 비스킷을 새로 지어낸다. 전부 기억하는 것은 KV 캐시와 어텐션 비용 때문에 불가능하므로, 문제는 "얼마나 많이 기억하나"가 아니라 "현재 이어질 장면에 필요한 소수의 과거 KV를 어떻게 되찾아오나"가 된다.
어떻게 동작하나
저자들의 출발점은 관찰 하나다. 고정된(frozen) 영상 생성기는 연속적이지 않은 과거 KV 조각을 그대로 입력받아 해당 시각 콘텐츠를 복원할 수 있다. 논문은 이전 청크의 KV 사본을 남겨두고 비스킷 영역을 수동으로 표시해 대응하는 키·값만 골라 슬라이딩 윈도우와 함께 넣어주는 실험을 보여주는데, 생성된 프레임이 분홍 별 모양 쿠키의 외형을 유지했다. MosaiChunk는 이 관찰을 자동화한다. 생성기 가중치는 건드리지 않고, 어떤 과거 구간을 모자이크에 넣을지 결정하는 경량 라우터만 학습한다.
무엇과 다른가
메모리 라우터는 세 단계로 동작한다. 1단계는 인코딩·저장이다. 각 청크의 회전되지 않은 KV를 balanced k-means로 같은 크기의 그룹으로 나누고 이를 섹션(section)이라 부른다. 이웃 청크의 섹션들은 키가 서로 비슷한 강한 시간적 중복성을 보이므로, 섹션의 풀링된 키를 디스크립터 d(s)로 매핑하는 경량 디스크립터 인코더를 학습시킨다. 이 디스크립터 공간은 시간적 근접성이 아니라 의미적 관련성을 반영하도록, 즉 최신성 편향(recency bias)에 반하는 방향으로 학습된다. 원본 KV와 디스크립터는 CPU 메모리의 섹션 뱅크에 저장된다. 2단계는 점수화다. 청크 c_t를 생성할 때 직전 청크 c_{t-1}의 섹션들이 질의 집합 Q가 되고, 슬라이딩 윈도우 밖의 과거 섹션들이 후보 집합 H가 된다. 후보 h의 점수는 Q의 모든 섹션에 대한 코사인 유사도 중 최댓값, 즉 score(h) = max_{q∈Q} cos(d(q), d(h))로 정의된다. 3단계는 추출·합성이다. 모든 후보를 통째로 순위 매겨 전역 top-N을 뽑고, 후보 점수에 소프트맥스를 적용해 가중치를 구한 뒤 선택된 가중치를 평균 1로 정규화해 해당 섹션의 값(value)을 스케일링한다. 이렇게 합쳐진 KV가 MosaiChunk이며, 고정된 DiT가 슬라이딩 윈도우와 나란히 읽는다. N이 곧 far-memory 예산이다.
어떻게 쓰나
학습은 자기 증류(self-distillation)로 이뤄진다. 교사와 학생은 동일한 고정 DiT, 동일한 노이즈 latent, 동일한 슬라이딩 윈도우로 한 번씩 순전파하며 오직 far memory만 다르다. 교사는 다시 그려야 할 과거 콘텐츠를 온전히 덮는 통짜 과거 청크를 받는다. 이 청크는 T2V에서는 입력 프롬프트 스케줄로, I2V에서는 일치하는 입력 카메라 포즈로 식별한다. 학생은 더 작은 예산 아래 라우터가 조립한 MosaiChunk를 받는다. 손실은 두 예측의 평균제곱오차, 즉 L_distill(θ) = E[||v_S(θ) − v_T||²]이다. 교사 예측은 고정된 타깃이고, 그래디언트는 이산적인 top-N 인덱스가 아니라 학생의 값 가중치를 거쳐 디스크립터 인코더로 흐른다. 저장된 KV와 백본 파라미터는 변하지 않으며, 렌더링된 정답 영상이 없어도 학습이 가능하다. 교사의 통짜 청크는 같은 콘텐츠를 훨씬 이전에 방문한 시점에서 오기 때문에, 이 신호는 최신성이 아니라 내용으로 섹션을 고르도록 디스크립터 공간에 반(反)최신성 편향을 형성한다.
전제와 한계
평가를 위해 논문은 재등장 벤치마크 RememBench를 새로 만든다. WBench, WorldMark, PersistBench 같은 기존 벤치마크는 화질과 일관성을 보지만, 목표 콘텐츠의 외형을 확립한 프레임이 슬라이딩 윈도우에서 밀려난 뒤의 장기 재등장을 체계적으로 시험하지 않는다는 것이 저자들의 지적이다. T2V 분할은 라우터 학습과 겹치지 않는 시나리오 100개로 구성되며, Ring Forcing의 등장–퇴장–재등장 3단계 설계를 객체가 시야 밖에 머무는 구간을 별도로 둔 4개 프롬프트 세그먼트로 확장한다. I2V 분할은 실내 50개, 실외 100개 총 150개 장면으로, DL3DV의 초기 프레임과 장면 설명 프롬프트, 카메라 궤적을 입력으로 받는다. 150개 장면 모두 90도·180도·360도 제자리 회전 궤적을 가지며, 실외 100개는 회전과 이동을 결합한 궤적도 포함한다.
결과는 두 백본에서 나온다. T2V는 고정된 H3-AR, I2V는 LingBot-World-Infinity를 쓴다. 비교 대상은 슬라이딩 윈도우 베이스라인(Base)과 통짜 청크 검색 기법인 Mixture of Contexts(MoC)다. T2V에서 MosaiChunk는 1청크·2청크 예산에서 중앙값 CLIP을 Base 대비 각각 0.144, 0.185만큼, MoC 대비 각각 0.067, 0.095만큼 개선했고 LPIPS도 같은 순서를 보였다. 절대값으로는 180도 회전 후 재등장에서 중앙값 재등장 CLIP이 T2V 0.841에서 0.936으로, I2V 0.807에서 0.863으로 올랐다. I2V의 180도 회전 실험에서 1청크 예산일 때 회전만 있는 경우 Base 대비 0.072, 이동이 결합된 경우 0.060 개선이며 MoC 대비로는 0.033, 0.036이다. 2청크에서는 Base 대비 0.070, 0.049, MoC 대비 0.056, 0.032다. 네 설정 모두 LPIPS도 좋아졌고, 각 예산·궤적에서 TempSSIM과 Local Scene Drift는 기법 간 차이가 0.01 미만으로 롤아웃 품질은 비슷했다. 공개 벤치마크인 WBench와 WorldMark에서도 두 예산 모두 슬라이딩 윈도우 베이스라인보다 모든 일관성 점수를 개선하면서 화질을 유지했다.
절제 실험은 설계 선택 두 가지를 확인한다. 학습된 디스크립터 공간을 평균 풀링된 키의 코사인 유사도로 바꾸면 두 예산 모두 CLIP이 낮아지고 LPIPS가 나빠졌다. 또 MoC식 질의별 top-k 선택을 같은 메모리 예산 아래 적용하면, 시야에서 떠나지 않은 콘텐츠는 슬라이딩 윈도우에 이미 남아 있는데도 예산을 낭비하게 되어 전역 top-N보다 성능이 떨어졌다. 150개 I2V 회전 장면에서 전체 설계가 가장 좋은 변형이었다.
실무 관점에서 이 논문의 매력은 백본을 재학습하지 않는다는 점이다. 이미 돌리고 있는 자기회귀 영상 생성 파이프라인에 CPU 메모리 기반 섹션 뱅크와 경량 라우터만 얹어, 고정 예산 안에서 재등장 일관성을 얻는 구조다. 다만 도입 전에 확인할 것은 라우터 학습에 필요한 프롬프트 스케줄(T2V) 또는 카메라 포즈(I2V)를 자신의 파이프라인에서 얻을 수 있는지, 그리고 섹션 분할을 위한 k-means와 KV 원본을 CPU로 내리는 비용이 실제 지연 예산에 맞는지다. 저자들도 한계를 명시한다. 생성 품질은 교사의 능력에 묶여 있고, 백본 가중치가 고정이므로 지시 따르기 성능과 학습된 생성 분포의 한계를 그대로 물려받는다. 향후에는 사전학습이나 사후학습 단계에서 생성기 자체가 과거 시각 콘텐츠를 네이티브로 재사용하도록 메모리를 내장하는 방향을 제안한다.