기하 잠재 공간에 비디오 사전을 주입해 시점 일관성을 확보한 새 시점 합성 프레임워크 GeoVerse

GeoVerse: World-Consistent Novel View Synthesis in Geometric Latent Space

arXiv2609.35734v1

Kerui Ren2026-09-28조회 2

무엇인가

희소한 이미지 몇 장에서 새로운 시점의 영상을 만드는 신경망 기반 시점 합성(NVS)은 두 가지 요구를 동시에 만족해야 한다. 관측된 영역은 충실하게 재구성하면서, 보이지 않는 영역은 그럴듯하게 채워 넣고, 시점이 바뀌어도 장면이 하나의 세계처럼 일관되게 유지되어야 한다. 논문은 이 둘을 각각 재구성 충실도와 생성적 완성 능력으로 부르며, 기존 방법들이 한쪽에 치우쳐 있다고 진단한다.

어떻게 동작하나

기하 기반 방법(NeRF, 3DGS, 그리고 VGGT·AnySplat·WorldMirror 같은 피드포워드 3D 파운데이션 모델)은 관측 구조를 잘 보존하지만 결정론적 기하 공식에 묶여 있어 큰 카메라 이동에서 흐림, 아티팩트, 빈 공간이 생긴다. 반대로 비디오 확산 모델(ViewCrafter, NeoVerse, GEN3C)은 풍부한 외관 사전을 제공하지만 프레임을 순차 생성하면서 시점 간 불일치와 드리프트가 누적된다. 비디오 확산 특징을 3D 표현에 정렬하는 하이브리드(Geometry Forcing, Gen3R)도 조밀한 비디오 프레임 생성 비용이 크다. GLD는 DA3의 기하 특징 공간을 확산 잠재 공간으로 재활용해 한 번에 목표 시점을 생성하지만, 학습 분포가 좁아 실제 야외 장면에서 생성 품질과 안정성이 떨어진다.

무엇과 다른가

GeoVerse는 GLD의 기하 잠재 확산 위에 세 가지를 얹는다. 첫째, Wan2.2 VACE 비디오 확산 모델에서 블록 0, 5, 10, 15의 중간 특징을 한 번의 순전파로 추출해, ControlNet 스타일 어댑터로 기하 잠재 디노이저에 주입한다. 영상 VAE로 만든 프록시 잠재에 목표 시점 영역에만 σ=0.1 노이즈를 넣고, 합성곱 모듈로 해상도와 채널을 맞춘 뒤 영점 초기화된 투영을 통해 잔차로 더한다. 둘째, 생성 자체는 동결된 DA3 인코더의 다중 레벨 기하 잠재에서 수행한다. 레벨-1을 합성 경계로 두고 플로우 매칭으로 X_t=(1-t)F1+tε, 목표 속도 u_t=ε-F1을 학습하며, 조건으로 문맥 이미지와 공간 메모리 투영, 카메라 플뤼커 광선 임베딩, Wan 특징, 투영 깊이와 유효성 마스크를 받는다. 이후 레벨-0 캐스케이드와 동결된 DA3 블록이 상위 특징을 만들고, RGB 헤드와 기하 헤드가 각각 목표 외관과 깊이·레이맵을 디코딩한다.

어떻게 쓰나

셋째, 여러 라운드에 걸친 시점 확장을 위해 전역 공간 메모리를 유지한다. 문맥 관측으로 초기화한 컬러 포인트 클라우드에 매 라운드 생성된 깊이를 카메라 중심 유사변환으로 스케일 정렬해 역투영하고, 신뢰도 가중치와 함께 누적 융합한다. 목표 카메라마다 깊이 인식 포인트 스플래팅으로 메모리를 RGB-D 가이던스와 유효성 마스크로 렌더링하는데, 유효 픽셀은 알려진 구조를 고정하고 마스크된 영역은 생성 사전이 채우도록 유도한다. 추론 속도는 reflow 증류로 줄였다. 레벨-1에 3스텝, 레벨-0 캐스케이드에 1스텝, 총 4스텝만 쓰도록 학생 모델을 구간별 reflow로 학습시켜, 추론 지연을 100초 이상에서 10초 미만으로 낮췄다.

전제와 한계

학습은 GLD 사전학습 모델에서 출발해 15개 실제·합성 다시점 데이터셋(기존 4개에서 확대), DA3-Base, 504×504 해상도, 샘플당 8개 정렬 시점(1~4개를 문맥으로 선택)으로 진행했다. 300k 반복 적응 학습(학습률 3e-5) 후 최대 50k 반복 reflow 증류(1e-5), 32개 A800 GPU, AdamW, 전역 배치 32다. 평가는 도메인 내 RealEstate10K·DL3DV, 도메인 외 Mip-NeRF 360·ScanNetv2(장기 시퀀스)에서 했고, 라운드당 문맥 2시점·목표 6시점을 쓴다. 지표는 PSNR·SSIM·LPIPS, VGGT 추정 포즈 기반 ATE와 상대 포즈 오차, 재투영 오차, MEt3R, 추론 시간이다.

결과는 GLD 대비 DL3DV에서 PSNR 2.23dB, Mip-NeRF 360에서 2.45dB 높다. Mip-NeRF 360의 ATE는 GLD 0.105에서 0.071로 32.4% 개선됐다. ScanNetv2 3라운드 장기 시퀀스에서는 PSNR이 15.33dB(GLD)에서 19.65dB로 올라 대형 실내 구조에서 시간적 안정성을 유지했다. 6개 목표 시점 합성에 약 9초가 걸려 GLD보다 약 18배 빠르다. 다만 일부 데이터셋의 재투영 오차나 이동 오차에서는 개별 베이스라인이 더 낮은 값을 기록하기도 하는데, 저자들은 GeoVerse가 전역 장면 일관성에서 더 낫다고 주장한다.

절제 실험(ScanNetv2)에서 Wan2.2 비디오 사전을 제거했을 때 시각적 열화가 가장 심했고, 공간 메모리를 끄면 시각 충실도와 시점 간 정렬이 모두 나빠졌다. 가산 잔차 대신 키-값 어텐션을 쓰는 Mixture of Transformers 변형도 실험했지만, 동일 학습 조건에서의 비교가 필요하다고 밝힌다. RGB 지도 학습을 빼면 시각 품질이 중간 정도 떨어지고, 깊이 지도를 빼면 기하 일관성이 약해진다. 스텝 예산 분석(DL3DV)에서는 레벨-1을 3스텝에서 1스텝으로 줄이면 실행 시간이 9.24초에서 6.07초로 줄지만 LPIPS가 0.339에서 0.367로 나빠지고, 레벨-0 캐스케이드를 49스텝에서 1스텝으로 줄이면 LPIPS 0.342로 거의 손해 없이 지연이 크게 준다. 그래서 3+1 배분을 택했다.

개발자 관점에서 이 논문은 희소 입력으로 다시점 영상을 만들어야 하는 파이프라인, 예컨대 3D 재구성·장면 편집·월드 모델 계열 작업에서 참고할 만하다. 눈여겨볼 지점은 세 가지다. 비디오 확산 모델을 샘플링하지 않고 특징 추출기로만 한 번 써서 기하 잠재 공간에 주입한다는 설계, 포인트 클라우드 메모리를 목표 시점으로 재투영해 유효 픽셀과 마스크를 나눠 조건으로 넣는 방식, 그리고 4스텝 추론으로 10초 미만을 달성한 증류 전략이다. 다만 DA3-Base와 Wan2.2 VACE, GLD 사전학습 모델이라는 무거운 의존성이 있고, 32개 A800으로 300k+50k 반복을 돌리는 학습 비용도 감안해야 한다. 또한 공개된 코드 저장소나 프로젝트 페이지는 원문에 제시되지 않았다.

저자들이 밝힌 한계는 두 가지다. 첫째, 최대 시각 충실도가 DA3 특징 공간의 외관 표현력에 묶여 있어, 속도를 위해 압축된 특징 조건을 택한 대가로 대규모 비디오 확산 모델 수준의 미세 텍스처 풍부함에는 못 미칠 수 있다. 둘째, 다중 라운드 일관성이 기하 백본과 합성 RGB의 일관성에 동시에 의존하기 때문에, 텍스처가 없거나 복잡한 영역에서는 초기 깊이 오차와 외관 드리프트가 공간 메모리 갱신을 통해 누적되어 긴 궤적에서 시점 간 정렬이 흐트러질 수 있다. 3D 기하와 광도 안정성을 함께 개선하는 것이 향후 과제라고 밝힌다.