Memorizon이 긴 영상 학습의 구간과 어텐션 비용을 분리한다
Memorizon: Training World Models Beyond Their Context Window
무엇인가
스트리밍 월드 모델은 카메라가 떠났다가 다시 돌아온 장소를 처음 봤을 때와 같게 그려야 한다. 이걸 직접 감독하려면 두 번의 방문을 함께 담은 학습 샘플이 필요하고, 그 구간은 분 단위로 늘어난다. 문제는 전체 구간에 dense attention을 걸면 비용이 제곱으로 커진다는 점이다. 저자들이 사용한 코퍼스에서 가장 짧은 진짜 재방문도 13.25초이고, 더 엄격한 정의를 쓰면 28초를 넘는다. 30초 창은 10초 창보다 활성화 메모리가 약 3배 더 필요한데, 그런 창 가운데 실제 재방문을 포함하는 비율은 3.8%에 불과하다. 창을 늘리는 것만으로는 감독이 되지 않는다는 뜻이다.
어떻게 동작하나
Memorizon의 핵심은 구간과 어텐션을 분리하는 것이다. 학습 샘플은 첫 프레임 A와 그 뒤 m개 청크를 덮는데, m은 샘플마다 [m_min, m_max]에서 뽑는다. 이 가운데 마지막 k개 청크만 채점 대상이고, 그 앞 r개는 최근 블록, 나머지 η=m−k−r개는 히스토리다. 히스토리는 토큰화되지 않는다. 대신 각 채점 청크가 카메라 공가시성으로 자신의 top-K 잠재를 검색하고, 그 요청들의 합집합이 하나의 공유 뱅크를 이룬다. 뱅크 크기는 kK로 상한이 걸려 있어 구간이 아무리 길어도 시퀀스 길이는 늘지 않는다. 어텐션은 청크 안에서는 양방향, 청크 사이에서는 인과적이며 r+1개 청크짜리 슬라이딩 윈도로 제한된다. 첫 프레임은 attention sink 역할을 하고, 청크별 마스크가 각 청크에게 자기 검색 항목만 읽게 한다. 그래서 채점 청크 하나가 어텐션하는 위치는 최대 1+K+(r+1)c개로, 구간 길이나 뱅크 크기와 무관하게 고정된다. 위치 인코딩은 첫 프레임이 0, 뱅크 항목이 전부 1, 이후 최근·채점 청크가 순서대로 이어지는 식이라 검색된 프레임의 나이가 모델에 노출되지 않는다. m=k로 두면 최근 블록과 히스토리가 모두 비어 표준 학습과 정확히 같아진다.
무엇과 다른가
검색 기준은 카메라 포즈만으로 추정한 공가시성이다. 점수는 S(q,c)=O(q,c)−λD(q,c)로, O는 쿼리 뷰에서 샘플한 점이 후보의 frustum 안에 들어가는 비율, D는 카메라 중심 거리와 광축 사이 각도에 가중치 w를 곱한 값의 합이다. λ=0.2, w=4를 써서 15도 회전이 약 1단위(4m) 이동과 비슷한 무게를 갖게 했다. 학습 시에는 정답 잠재가 있으므로 검색 규칙 자체를 채점할 수 있는데, frustum overlap만 쓰면 달성 가능한 이득의 47.4%, 포즈 거리만 쓰면 55.9%, 둘을 섞으면 57.2%에 도달한다. 카메라 중심만으로 순위를 매기면 19.8%로 떨어지는데, 이 카메라들이 이동보다 회전을 훨씬 많이 하기 때문이다.
어떻게 쓰나
실험은 Wan2.2-TI2V-5B에서 초기화하고 PRoPE 카메라 브랜치를 붙여 청크 단위 인과적 확산 트랜스포머로 학습했다. 청크당 잠재 4개, 채점 청크 10개, 최근 청크 1개, K=6, m은 10에서 m_max까지 균등 분포, 6000 스텝, 배치 32, H200 32장이다. 평가는 시드 5개 롤아웃 평균, 디노이징 20스텝, CFG 4를 쓴다. 평가셋은 학습 장면 10개에서 뽑은 60초 클립 20개, 홀드아웃 장면 4개에서 뽑은 16개, 웹 사진 20장이다. 재방문은 두 카메라가 0.5단위·15도 안에 있고 최소 8초 떨어져 있으며 그 사이 카메라가 자리를 비운 경우로 정의한다. 공개 월드 모델들과 비교했을 때 Memorizon과 CaR만 뚜렷한 메모리를 보였고, 8개 메모리 지표 중 Memorizon이 5개, CaR이 3개에서 앞섰다. 시작 포즈 재방문에서 Memorizon 0.365, 중간 경로 재방문에서 0.447로, 다른 베이스라인 중 가장 강한 Matrix-Game 3.0의 0.254·0.283을 크게 앞선다. 같은 시간 간격의 대조 쌍 상관을 빼는 Gain 지표에서는 차이가 더 분명하다. 다른 다섯 베이스라인은 최대 0.089, LingBot-World 2.0은 시작 포즈에서 −0.006인 반면 Memorizon은 0.230과 0.329다. 다만 VBench에서는 앞서지 못한다. HY-WorldPlay 1.5가 주제·배경 일관성에서 0.839·0.908로 Memorizon의 0.778·0.857보다 높고, 이미징 품질은 6개 베이스라인 중 4개가 최대 0.761로 Memorizon의 0.705보다 높다.
전제와 한계
절제 실험은 재료를 하나씩 더한다. 10초 클립만 학습한 모델에서도 청크별 검색을 넣으면 모든 분할에서 Revisit이 오르고 Gain은 몇 배가 된다. 반대로 채점 블록 전체에 검색을 한 번만 적용하는 Context-as-Memory 방식은 같은 구간에서 모든 분할의 Revisit과 Gain을 떨어뜨리며, 웹 사진에서는 약 3분의 1이 줄어든다. 학습 구간을 늘리면 200초까지는 추가 이득이 있고 400초에서는 오히려 후퇴한다. 100·200·400초 구간이 재방문 잠재의 첫 방문에 도달하는 비율은 각각 64%, 84%, 93%이고, 뱅크는 200초를 넘으면 거의 자라지 않는다. K=6일 때 뱅크는 100초에서 28개, 400초에서 31.5개 항목을 담는 반면 후보 풀은 50초에서 400초로 10배 커진다. 비용 면에서는 구간을 100초에서 400초로 늘려도 스텝 시간이 12%만 늘고, 뱅크를 공유하면 채점 잠재당 1.82슬롯으로 청크별 개별 복사(3.75슬롯)의 절반 수준이다. 뱅크를 다른 에피소드의 프레임으로 채우면 재방문 상관이 83% 떨어져, 모델이 검색해 온 내용을 실제로 사용한다는 것이 확인된다.
학습 창을 넘어서는 재방문도 측정했다. 웹 사진을 400초까지 롤아웃하고 방문 간격별로 채점하면, 10초 top-K 모델은 간격이 커질수록 0.390±0.023(30초 미만)에서 0.303±0.025(2~4분), 0.145±0.044(4분 이상)로 떨어진다. 200초 모델은 같은 재방문에서 모든 구간에 앞서며 각각 +0.106±0.022, +0.148±0.040, +0.103±0.061만큼 높다. 400초 모델은 이 추세를 이어가지 못한다.
실무 관점에서 이 논문이 주는 것은 긴 영상 학습의 비용 구조를 바꾸는 레시피다. 학습 샘플의 구간을 감독 범위로만 쓰고 어텐션은 고정 크기로 유지하므로, 컨텍스트 창을 늘리지 않고도 수 분 떨어진 재방문을 학습 신호로 만들 수 있다. 특히 m_min=k로 두면 기존 학습 파이프라인이 그대로 최단 구간 케이스가 되기 때문에, 기존 코드에 검색 뱅크와 청크별 마스크를 얹는 방식으로 점진적으로 도입할 수 있다. 다만 검색은 카메라 포즈에 의존하므로 포즈 추정 품질과 장면 스케일 단위에 민감하고, 이미지 품질과 재방문 일관성이 서로 맞바뀌는 관계라는 점을 감안해 지표를 함께 봐야 한다.
저자들이 밝힌 한계는 분명하다. 이 방법은 정적 장면, 즉 카메라만 움직이고 장면 자체는 변하지 않는 경우를 주로 다룬다. 물체가 움직이거나 장소가 방문 사이에 변하는 장면에서는 다르게 그리는 것이 오히려 정답일 수 있고, 일관성을 무엇과 비교해야 하는지가 달라진다. 이미지 품질 손실은 학습 시 뱅크와 최근 청크가 깨끗한 정답인데 추론 시에는 모델 자신의 출력이 들어가는 노출 편향에서 온다. 저자들은 Self Forcing과 분포 매칭 증류를 뱅크에도 적용했지만, 그 격차를 얼마나 줄였는지는 아직 측정되지 않았다고 적는다.