WorldCrafter는 3D 메모리로 장기 일관성을 확보한 비디오 월드 모델이다

WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory

arXiv2609.24984v1

Wangbo Yu2026-09-21조회 4

무엇인가

비디오 월드 모델은 사용자가 카메라를 움직이면 그에 맞는 새로운 관측을 생성함으로써 동적 환경을 대화형으로 탐험하게 해준다. 문제는 최근 컨텍스트 창을 넘어서는 장기 기억이다. 이전에 본 장면을 다른 시점에서 다시 방문했을 때 그 내용이 그대로 유지되어야 세계가 일관된다. 기존 선택지는 모두 대가가 있다. 전체 히스토리 어텐션은 계산 비용이 크고, 히스토리 일부만 검색하는 방식은 시점 커버리지를 효율과 맞바꾼다. 명시적 공간 메모리는 공유된 3D 기준을 주지만 정확한 기하 추정에 의존하고 동적 장면에서 취약하다. 암시적 메모리는 히스토리를 학습된 표현으로 압축하지만, 최근의 기하 지향 표현들은 이전에 본 장면을 재현하는 데 필요한 외형 충실도보다 기하 예측을 우선한다.

어떻게 동작하나

WorldCrafter의 핵심 발상은 요청된 시점이, 여러 시점의 증거를 비디오 생성기의 제한된 토큰 예산 안에 어떻게 압축할지를 결정하게 만드는 것이다. 표준 청크 단위 자기회귀 흐름 dzt/dt = vθ(zt, t | zr, y)를 확장해, 누적 히스토리 zh에서 유도된 메모리 M과 목표 카메라 궤적 C를 함께 조건으로 넣는다. 즉 dzt/dt = vθ(zt, t | M, zr, C, y) 형태가 된다. 각 디노이징 단계에서 DiT는 [M; zr; zt]를 하나의 잠재 시퀀스로 처리한다. 최근 히스토리 zr은 보이는 움직임의 연속성을 담당하고, 메모리 M은 과거 장면 정보를 담당하는 별도의 스트림이다. 카메라 조건화는 PRoPE처럼 상대 카메라 기하를 자기어텐션 내 위치 변환으로 인코딩하며, UCPE의 병렬 카메라 어텐션 브랜치(독립적인 query/key/value 투영 후 zero-initialized 투영으로 원래 자기어텐션에 합산)로 구현한다. 이 브랜치는 잡음이 섞인 zt에만 적용되고, 메모리 M과 최근 컨텍스트 zr에는 카메라가 주입되지 않는다.

무엇과 다른가

메모리 쓰기는 메모리 인코더 Φ가 누적 히스토리 잠재 프레임 zh와 그 카메라 파라미터 Ch를 받아 R = Φ(zh, Ch) ∈ R^{|zh|L×d}, 즉 히스토리 잠재 프레임마다 L개 토큰(차원 d)을 만드는 방식이다. 인코더는 LagerNVS 인코더의 아키텍처와 가중치로 초기화하되 얕은 이미지 처리 층을 버리고 잠재 프레임을 직접 표현 공간으로 매핑하는 패치 임베딩 층을 새로 붙인다. 히스토리 카메라 포즈는 zh의 최신 잠재 프레임 기준 상대값으로 카메라 토큰에 주입된다. 이 표현은 명시적 3D 재구성을 물질화하지 않고도 기하와 외형 정보를 함께 집계한다. 인코더 비용을 묶어두기 위해 입력은 k개의 히스토리 잠재 프레임으로 제한하며, 추론 시에는 최신 프레임을 유지한 채 다가올 카메라 궤적상 목표 영역을 공동으로 최대한 덮는 k-1개의 상보적 프레임을 탐욕적으로 고른다(최대 커버리지 검색). 읽기는 고정 토큰 예산 아래 두 가지를 비교했는데, 목표 궤적에서 샘플링한 고정 크기 질의 포즈 Cq로 표현을 질의하는 포즈 유도 읽기(pose-guided readout)가 포즈 없는 읽기보다 재방문 일관성과 카메라 제어 모두에서 우수해 채택되었다. 읽기 모듈은 LagerNVS의 얕은 디코더 층으로 초기화하고 DiT 토큰 공간으로 사상하는 투영 층을 추가한다.

어떻게 쓰나

학습 데이터는 Open-Sora-Plan(OSP), DL3DV, MIND의 합성 영상이며, Depth Anything 3로 미터 스케일 카메라 포즈를, Qwen2.5-VL로 캡션을 생성했다. 카메라가 움직이는 피사체를 따라가는 OSP 하위 집합을 별도로 큐레이션해 카메라와 피사체 움직임의 협응을 학습시켰다. 비디오 DiT는 Helios-base에서 초기화하고 4단계로 학습한다. 1단계는 수정된 추론 윈도우 적응(OSP 76만 영상, 5,000 이터레이션, 32 GPU, 전역 배치 32), 2단계는 DiT 백본을 동결한 채 UCPE 기반 카메라 조건화 브랜치 학습(필터링된 OSP 4만 + DL3DV 6,000, 배치 128), 3단계는 VAE 잠재를 처리하도록 메모리 인코더 적응(9개 잠재 프레임 고정 입력, 5,000 이터레이션, 16 GPU, 배치 16), 4단계는 메모리 읽기 모듈을 인코더·DiT·카메라 브랜치와 공동 학습(4개 프레임 토큰 수에 해당하는 고정 메모리 토큰 출력, DL3DV+OSP 8,000 이터레이션 후 MIND 합성 1,000 이터레이션 추가)이다. 실시간화를 위해 Helios식 coarse-to-fine 피라미드 디노이징에 분포 매칭 증류를 적용해 3개 해상도, 해상도당 2 디노이징 스텝으로 줄였고, 합성 데이터 증류가 만드는 번짐 문제를 피하려고 저잡음 모델(합성 적응 이전, 마지막 스텝 담당)과 고잡음 모델(합성 적응 이후, 그 앞 스텝 담당)을 따로 증류하는 하이브리드 구성을 썼다. 증류 후 WorldCrafter-fast는 4-GPU 머신에서 16 fps를 낸다.

전제와 한계

평가는 145개 이미지(동적 객체 중심 83, 정적 62)에 5개 미터 카메라 궤적을 붙여 방법당 725개 영상, 궤적당 528~1,648 프레임 규모로 구성했고 폐루프 재방문을 포함한다. 비교 대상은 DreamX-World, Alaya-EVOKE, HY-WorldPlay, Lyra 2.0, Echo-WM, LingBot-World 2, Matrix-Game 3.5, SANA-WM이다. 재방문 일관성(MEt3R, LPIPS, PSNR, SSIM)에서 두 변형이 4개 지표 모두 상위 2위를 차지했고 WorldCrafter-fast가 가장 좋았다. Lyra 2.0 대비 LPIPS는 0.487에서 0.255로, PSNR은 14.050 dB에서 18.016 dB로 개선됐다. 카메라 제어(RotErr, TransErr, CamMC)에서는 WorldCrafter가 3개 지표 모두 최저 오차, WorldCrafter-fast가 각 지표 3위다. VBench 시각 품질에서는 8개 항목 중 5개에서 최고를 기록했고 WorldCrafter가 종합 81.910으로 가장 높았으며, WorldCrafter-fast가 Temporal Flickering에서 최고였다. 논문은 재방문 일관성에서最强 베이스라인 대비 47.6% 개선을 기여로 내세운다.

절제 실험은 설계 선택을 뒷받침한다. 메모리 토큰을 검색된 히스토리 잠재 프레임 4개로 바꾼 컨텍스트 메모리 변형은 재방문 일관성과 카메라 제어를 모두 떨어뜨렸고, 재방문 LPIPS를 초기 관측과의 프레임 간격에 대해 그리면 WorldCrafter의 오차 증가가 더 완만해 간격이 길수록 격차가 벌어진다. 인코더를 동결한 변형은 공동 최적화보다 검증 재방문 오차가 더 늦게 줄고 이점도 유지되지 않았다. 포즈 없는 읽기와 유사도 기반 히스토리 검색(최대 커버리지 대신 쌍별 FoV 유사도 순위)도 각각 열등했다. 효율 비교에서는 깊이 기반 공간 메모리가 640×384 해상도, 9개 잠재 프레임 청크, 히스토리 4프레임 조건에서 Depth Anything 3 깊이 추정·정렬 0.409초 + 배치 워핑 0.937초로 청크당 총 1.346초가 걸리는 반면, WorldCrafter는 히스토리 잠재를 직접 다뤄 인코딩 0.049초 + 읽기 0.013초로 총 0.062초, 즉 21.7배 절감된다.

개발자 관점에서 이 논문이 주는 실무적 신호는 세 가지다. 첫째, 장기 일관성을 위해 명시적 깊이 추정과 워핑 파이프라인을 유지할 필요 없이, 사전학습된 다시점 표현 인코더를 생성기와 공동 학습시키는 것만으로 20배 이상 저렴한 메모리 계층을 얻을 수 있다는 점이다. 둘째, 메모리 토큰을 만들 때 목표 시점을 질의로 넣는지 여부가 카메라 제어 정확도를 실제로 바꾸므로, 고정 토큰 예산을 어디에 쓸지가 설계 변수라는 점이다. 셋째, 히스토리 프레임을 유사도로 개별 랭킹하는 대신 목표 영역을 공동으로 덮는 상보적 뷰를 고르는 검색이 같은 입력 개수로 더 나은 결과를 낸다는 점이다. 다만 이 수치들은 640×384 해상도, 특정 벤치마크(145 이미지, 725 영상)와 특정 베이스라인 조합에서 나온 것이므로, 자체 도메인에 적용할 때는 재방문 지표와 카메라 오차를 직접 재측정해야 한다.

저자들이 밝힌 한계는 분명하다. 특히 복잡하거나 매우 긴 궤적에서는 일관성이 여전히 깨질 수 있다. 또한 매 청크마다 히스토리를 다시 인코딩하기 때문에 추가 지연이 발생한다. 이에 대한 유망한 방향으로, 새로 생성된 청크를 메모리 상태에 점진적으로 통합해 히스토리에 대한 반복 계산을 줄이는 자기회귀 스트리밍 메모리 인코더를 제안한다.

관련 논문