기하를 토큰 주소로 삼아 장기 영상 생성의 재방문 일관성을 확보한다

Geometry as Address: Routing Attention to Visual Memory for Long-Horizon Camera-Controlled Video Generation

HF Daily2609.34722

Zesong Yang, Weikai Chen, Liyuan Cui2026-09-28조회 3

무엇인가

장기 카메라 제어 영상 생성은 정해진 카메라 궤적을 따라가면서, 이미 지나간 장면을 다시 마주쳤을 때 그 내용을 과거 관측에서 복원해야 한다. 이때 문제는 그럴듯한 다음 프레임을 만드는 것이 아니라, 목표 영역마다 어떤 과거 관측을 읽어야 하는지를 찾아내는 메모리 접근 문제가 된다. 기존 연구는 크게 두 갈래였다. 과거 프레임을 컨텍스트로 붙들고 어텐션으로 뒤지는 암묵적 방식은 시각 정보는 풍부하지만 히스토리가 길어질수록 토큰 집합이 커져 접근 비용이 늘고 무관한 컨텍스트에 취약하다. 반대로 과거 관측을 전역 3D 표현으로 융합해 목표 시점으로 재투영하는 명시적 방식은 공간 주소는 자연스럽지만, 국소적인 기하 오차가 전역 융합을 거치며 영속화되고 이후 생성으로 전파된다. 프레임 검색이나 히스토리 압축은 부담을 덜어주지만 입자도가 거칠거나 정밀한 재방문에 필요한 정보를 버린다.

어떻게 동작하나

저자들의 핵심 주장은 기하가 장면을 설명할 필요가 없다는 것이다. 기하는 시각 메모리를 어디서 읽을지만 정하고, 무엇을 복원할지는 어텐션이 결정하면 된다. GEAR는 이 역할 분담을 토큰 수준 주소 지정으로 구현한다. 과거 관측을 영속적인 전역 3D 표현으로 융합하지 않고 프레임 레이턴트로 그대로 보관하며, 프레임별 기하는 목표 시점과의 토큰 단위 대응 관계를 세우는 데만 쓴다. 기하가 영속적 장면 상태가 아니라 일시적인 주소로 동작하기 때문에, 대응 오차는 개별 메모리 접근 안에 머물고 여러 뷰를 거치며 누적되지 않는다.

무엇과 다른가

대응 관계는 각 과거 프레임의 국소 기하에서 독립적으로 유도한다. 프레임마다 추정된 깊이와 카메라 내·외부 파라미터로 픽셀을 3D로 역투영하고 이미지 그리드 위상대로 연결해 국소 삼각 메쉬를 만든다. 이때 메쉬는 원본 이미지 해상도에서 구성하는데, 최신 비디오 VAE가 공간 해상도를 16배가량 압축해 하나의 레이턴트 토큰이 여러 표면에 걸칠 수 있기 때문이다. 같은 소스 메쉬를 소스 카메라와 목표 카메라 양쪽에서 레이턴트 해상도로 래스터라이즈하면 면 인덱스 맵 두 장이 나오고, 같은 면 ID를 공유하는 토큰 쌍이 곧 기하 대응이 된다. 이 대응을 모든 히스토리-목표 프레임 쌍에 대해 모아 패치 대응 캐시를 만든다. 같은 장면 영역이 여러 시점에서 관측됐다면 목표 패치에 여러 소스 후보가 붙는데, 저자들은 유효한 후보를 모두 남겨둔다.

어떻게 쓰나

이 주소를 실제 메모리 조회로 바꾸는 것이 Geometric Correspondence Attention(GCA)이다. GCA는 목표 토큰마다 기하적으로 매칭된 과거 토큰 집합에 대해서만 키와 값을 만들고, 어텐션 가중치를 그 매칭 집합 안에서만 정규화해 집계한다. 매칭 집합이 비어 있으면 출력을 0으로 두어, 관측된 적 없는 영역은 사전학습된 비디오 모델의 생성 사전이 채우도록 한다. 집계된 특징은 잔차 연결로 백본 특징 공간에 되돌려지고, 원래의 자기어텐션은 사전학습된 시공간 모델링을 그대로 유지한다. 다만 기하적으로 투영 가능하다는 것이 목표 뷰에서 보인다는 뜻은 아니다. 소스에서 보이던 표면이 목표 뷰에서는 가려질 수 있다. 이를 걸러내기 위해 Invisible Octree를 두고 관측이 진행되며 가시성 증거를 누적한다. 이 옥트리는 외형을 저장하지 않고 렌더링 조건으로도 쓰이지 않으며, 대응 관계에 대한 거친 이진 필터 역할만 한다. 갱신은 보수적으로 이뤄져 새 관측이 기존 증거를 덮어쓰지 않고, 희소·적응적 구조 덕분에 비한정 환경의 장기 생성도 감당한다.

전제와 한계

학습은 DL3DV-10K에서 55프레임 클립, 480×832 해상도로 진행했다. 카메라 포즈와 프레임별 깊이는 Depth Anything 3로 추정하고 캡션은 Qwen3-VL-8B-Instruct로 생성했다. 두 가지 조건 모드를 섞는데, 이미지-투-비디오 모드는 첫 32프레임으로 학습하며 첫 프레임의 기하가 Invisible Octree 초기화와 목표 뷰 대응 수립에 쓰인다. 히스토리-투-비디오 모드는 첫 32프레임을 히스토리 뱅크로 두고 그중 9개 키프레임을 검색해 대응 캐시를 만들며, 나머지 23프레임이 생성 대상이다. 백본은 Wan2.1-I2V-14B를 완전히 동결하고 rank-32 LoRA와 GCA 모듈만 학습한다. GCA는 짝수 인덱스 DiT 블록마다 은닉 차원 640으로 삽입되며 파라미터는 2억 6200만 개로 백본의 1.9%에 불과하다. 32개 GPU에서 AdamW, 학습률 1e-4, 1K 워밍업으로 1만 이터레이션 학습한다. 학습-추론 불일치를 줄이기 위해 8K 이터레이션부터 확률 40%, 최대 노이즈 0.3으로 히스토리를 열화시키는 증강을 적용한다. 과거 레이턴트에 약한 노이즈를 섞고 현재 모델로 역방향 플로우 한 스텝을 적용한 뒤 stop-gradient로 떼어내 조건 컨텍스트로 대체하는 방식이다.

장기 추론은 스트리밍 방식이다. 모든 과거 프레임을 유지하면 비용과 시점 중복이 커지므로, 각 과거 프레임의 국소 기하를 목표 뷰에 투영해 새로 덮이는 영역을 최대화하는 프레임을 탐욕적으로 고른다. 장면 정체성을 위한 첫 프레임과 청크 간 연속성을 위한 마지막 프레임은 항상 유지한다. 청크를 생성한 뒤 새 프레임은 카메라 파라미터·깊이와 함께 히스토리 뱅크에 추가되고 Invisible Octree도 함께 갱신된다. 이 검색-생성-갱신 루프를 반복해 분 단위 영상을 만든다.

비교 대상은 명시적 3D 계열의 Lyra2, Spatia, HY-WorldStereo, UCM과 암묵적 계열의 HY-WorldPlay, Lingbot-World, Infinite-World다. DL3DV-Evaluation에서 같은 초기 프레임과 정답 카메라 궤적을 주고 자기회귀 생성한 뒤 SSIM, LPIPS, FVD를 측정하고, 생성 영상에서 ViPE로 포즈를 복원해 Umeyama 정렬 후 TransErr, RotErr, ATE를 보고한다. 원문 본문에 명시된 수치는 ATE를 최강 베이스라인 대비 80.3% 줄였다는 것이며, SSIM·LPIPS·FVD의 구체적 값은 본문에 제시되지 않았다. WorldScore Static 세트에서 무작위로 뽑은 50개 장면에 폐루프 궤적을 적용한 재방문 평가에서는 Content Alignment, Photometric Consistency, Style Consistency, Revisit 성능에서 최고를 기록했다고 주장한다. 정성 비교에서는 Lyra2가 카메라 제어는 경쟁력 있으나 빠르거나 긴 카메라 이동에서 화질 저하와 궤적 드리프트가 커지고, Spatia와 WorldStereo는 재구성 오차 누적으로 점진적 왜곡을 보이며, UCM은 초반에는 일관되지만 롤아웃이 길어지면 벗어난다고 서술한다. 절제 실험에서는 GCA를 빼면 시간적 불안정과 카메라 운동 이탈이 커지고, GCA를 유지하되 조밀 어텐션으로 바꾸면 카메라 제어와 화질이 떨어지며, Invisible Octree를 빼면 가려진 대응이 국소 외형 오류를 넘어 자기회귀 히스토리를 통해 구조적 불일치로 전파되고, 열화 히스토리 증강을 빼면 장기 롤아웃에서 물방울 모양 플로터가 생긴다고 보고한다. 또 9개 관측 중 2~3개만 유효하게 남기고 나머지를 64~128픽셀 교란해도 성능이 비슷하게 유지됐다고 한다.

실무 관점에서 이 논문이 주는 신호는 장기 영상 생성의 병목을 더 큰 컨텍스트나 더 정확한 3D 재구성이 아니라 메모리 주소 지정으로 재정의했다는 점이다. 기하 추정기를 생성 모델과 분리해 두고, 그 출력을 전역 상태가 아닌 조회 주소로만 쓰는 구조는 기존 비디오 백본에 LoRA와 소규모 어텐션 모듈만 얹어 붙일 수 있다는 것을 보여준다. 다만 저자들이 밝힌 한계는 깊이 추정을 외부 3D 모델에 의존한다는 것이고, 이 때문에 추가 연산 오버헤드가 발생한다. 향후 과제로 기하와 메모리 주소 지정을 생성 모델 안에서 함께 학습하는 방향을 제시한다. 실무에서 도입을 검토한다면 깊이 추정 품질이 대응 정확도와 재방문 일관성에 직접 영향을 준다는 점, 그리고 Invisible Octree가 외형을 저장하지 않는 대신 가시성 판단의 정확도에 의존한다는 점을 먼저 확인해야 한다.