확산 없이 다음 스케일 자기회귀로 희소 시점 3D 뷰를 합성한다

NAMVIS: Next-Scale Autoregressive Multi-View Image Synthesis

arXiv2610.04722v1

Ramil Khafizov2026-10-03

무엇인가

이 논문이 푸는 문제는 포즈가 알려진 희소 시점 영상으로부터 새로운 시점의 이미지를 만드는 제로샷 신시점 합성(NVS)이다. 소스 이미지 한 장 또는 몇 장과 그 카메라 포즈, 그리고 원하는 타깃 카메라 포즈가 주어졌을 때, 장면별 최적화나 명시적 3D 복원 없이 타깃 뷰를 생성하는 것이 목표다. AR·로보틱스·3D 콘텐츠 제작의 핵심 작업이지만, 사진 한 장은 무한히 많은 일관된 3D 장면을 허용하기 때문에 모델이 기하·외형·조명에 대한 강한 사전지식을 공급해야 한다. NeRF나 3D 가우시안 스플래팅, 메시 기반 초기 방법들은 수십에서 수백 장의 뷰를 요구하고 few-image 영역에서 깊이·형상 모호성 때문에 무너졌으며, Zero-1-to-3가 사전학습된 2D 확산 모델에 상대 포즈 조건을 붙여 제로샷 NVS를 가능케 한 이후 확산 기반 방법들이 주류가 됐다. 다만 확산은 반복 디노이징 때문에 여러 타깃 뷰를 생성할 때 추론 비용이 커진다는 것이 이 논문이 지적하는 출발점이다.

어떻게 동작하나

NAMVIS는 이 문제를 기하 조건부 다음 스케일 자기회귀(geometry-conditioned next-scale autoregression)로 재정식화한다. 함수 F_θ(I_src, P_src, P_tgt)를 Infinity 아키텍처 위에 올린 next-scale 자기회귀 트랜스포머로 구현하는데, 이는 VAR의 다음 스케일 모델링을 확장한 것이다. 동결된 다중 스케일 VQ-VAE가 소스와 타깃 이미지를 연속 특징맵으로 인코딩하고, 타깃에 대해서만 해상도가 점점 커지는 K개의 잔차 토큰맵을 계산한다. 트랜스포머는 코드북 양자화 대신 Infinity의 비트 단위 표현을 유지해 각 토큰을 {-1,+1}^d 이진 코드로 양자화하고 d개의 이진 분류기로 비트를 독립 예측하며, 스케일 재가중 교차엔트로피 손실로 학습한다. 추론에서는 디노이징 없이 K번의 스케일 스텝으로 거칠게에서 세밀하게 디코딩하고, 같은 스케일 안의 토큰들과 여러 타깃 뷰의 토큰들을 병렬로 예측한 뒤 이후 스케일이 앞선 스케일을 조건으로 삼는다. 여러 뷰를 동시에 생성하기 위해 토큰 시퀀스를 스케일 단위로 인터리빙하고, 블록 인과(block-causal) 어텐션 마스크로 스케일 k의 토큰이 모든 뷰의 이전 스케일 토큰에는 어텐션하되 미래 스케일에는 못 하도록 막는다. 같은 스케일 블록 안에서는 서로 다른 뷰의 토큰들이 자유롭게 어텐션해 모든 해상도에서 다중 뷰 통신이 일어나며, 학습된 스케일 임베딩을 첫 트랜스포머 블록 전에 더해 현재 해상도를 구분한다.

무엇과 다른가

카메라 기하를 명시적으로 주입하는 장치가 Multi-scale Projective Pose Encoding이다. 2D RoPE가 이미지 평면 위치만 담고 카메라 간 3D 관계를 담지 못한다는 문제의식에서, ProPE를 다음 스케일 자기회귀 다중 뷰 생성에 맞게 확장했다. 각 어텐션 헤드를 하나의 projective 파트와 두 개의 로컬 rotary 파트로 쪼개고, 뷰 v와 스케일 s에 대해 projective 성분에는 브랜치별 행렬 M_q(P_v)=P_v^T, M_kv(P_v)=P_v^-1, M_o(P_v)=P_v를 곱하며, 나머지 두 성분에는 해당 스케일의 토큰 그리드 좌표로 RoPE를 적용한다. 스케일마다 별도의 좌표 그리드와 rotary 계수를 구성한다. 이 연산자는 두 어텐션 경로에 모두 쓰인다. 타깃 자기 어텐션에서는 query·key/value·output 모두 타깃 뷰 카메라를 쓰고, 소스-타깃 교차 어텐션에서는 타깃 토큰이 query, 소스 특징이 key/value이므로 query와 output은 타깃 카메라, key/value는 소스 카메라를 쓴다. 이때 소스 특징은 현재 타깃 스케일로 다운샘플되지 않고 VQ-VAE의 조밀한 원해상도로 유지되는데, 이 비대칭 덕분에 가장 거친 자기회귀 단계에서도 고해상도 소스 근거에 닻을 내릴 수 있다.

어떻게 쓰나

이미지 조건은 두 경로로 들어간다. 전역 경로는 학습 가능한 query가 소스 특징에 교차 어텐션해 얻은 풀링 벡터를 [SOS] 토큰으로 시퀀스 앞에 붙이고, 동시에 매핑 네트워크를 거쳐 AdaLN의 스케일·시프트 파라미터를 만들어 모든 트랜스포머 블록을 변조한다. 다중 뷰 생성 시 [SOS] 토큰은 출력 시퀀스마다 복제된다. 조밀 경로는 풀링되지 않은 VQ-VAE 소스 특징에 대해 모든 블록이 교차 어텐션을 수행하며, 이 교차 어텐션이 ProPE로 변조되어 소스-타깃 기하 관계에 따라 소스 특징을 집계한다. 학습 시에는 소스 조건을 10% 확률로 드롭해 무조건 임베딩으로 대체함으로써 추론 시 classifier-free guidance를 가능하게 한다. 추론 비용을 줄이기 위해 표준 KV 캐싱과 함께, 소스-타깃 카메라 구성과 자기회귀 스케일마다 ProPE 투영 텐서를 한 번만 계산해 전역 캐시로 모든 레이어에서 재사용하는 ProPE 캐싱을 쓴다.

전제와 한계

실험은 Objaverse, GSO, OmniObject3D 세 데이터셋에서 256×256 해상도로 수행됐고, 1-to-1부터 3-to-3까지 9개 소스-타깃 뷰 구성에 대한 평균을 보고한다. 학습 데이터는 Objaverse-XL을 렌더 실패·낮은 전경 점유·결손 텍스처·기하 아티팩트 제거, 미학 품질 점수 기반 필터링, 캡션 품질 필터링의 3단계로 걸러낸 약 20만 객체이며, 객체당 100장의 포즈된 RGBA 뷰와 카메라 내·외부 파라미터, 마스크, 포인트맵, 캡션을 함께 공개한다. 비교 대상은 Zero-1-to-3, Zero-1-to-3 XL, Wonder3D, SyncDreamer, EscherNet이다. 인도메인 Objaverse에서 NAMVIS는 PSNR 22.485, SSIM 0.861, LPIPS 0.091로 모든 확산 베이스라인을 앞섰고, 제로샷 GSO에서 21.715/0.843/0.111, OmniObject3D에서 21.098/0.845/0.104를 기록했다. 특히 LPIPS 개선이 두드러져 지각적으로 더 선명하고 충실한 뷰를 만든다고 저자들은 해석한다. 속도는 1-to-1 설정에서 타깃 뷰당 0.6초로, 가장 빠른 확산 베이스라인 Wonder3D의 2.0초보다 약 3.3배 빠르다. 뷰 개수 확장 실험에서는 6→6 동시 생성에서 PSNR 26.12, SSIM 0.9015, LPIPS 0.0473, 추론 1.56초, 최대 VRAM 5.0GB를 기록했다. 2D 지표가 놓치는 다중 뷰 일관성은 COLMAP 재구성 가능성으로 측정했는데, NAMVIS가 평균 221개의 희소 포인트를 복원해 EscherNet 214, Wonder3D 172, SyncDreamer 151을 앞섰고, 30개 장면 카메라 등록 실험에서도 240뷰 중 162개(67.5%)를 등록해 EscherNet의 145개(60.4%)를 넘고 정답 이미지의 70.0%에 근접했다. 절제 실험에서는 LoRA(r=256) 튜닝이 전체 파인튜닝보다 크게 나빴고, ProPE가 Plücker 광선 조건보다 우수하며, 조밀 교차 어텐션이 세부 공간 정보 보존에 결정적이고, VQ-VAE 소스 특징이 CLIP이나 별도 학습 특징보다 낫다는 결과가 부록에 제시된다.

개발자 관점에서 이 논문의 실용적 의미는 명확하다. NAMVIS는 메시·방사 필드·가우시안 같은 명시적 3D 표현을 만들지 않고 포즈된 타깃 이미지를 직접 합성하므로, 3D 자산 파이프라인에 별도 리깅이나 재구성 단계를 끼워 넣지 않고도 여러 시점 이미지를 뽑아낼 수 있다. 뷰당 0.6초, 6→6에서 1.56초·5.0GB라는 수치는 다중 뷰 생성을 배치로 돌리는 서비스에서 지연과 메모리 예산을 크게 낮춘다. 다만 도입 전에 확인할 점이 있다. 첫째, 평가가 256×256 고정 해상도에서 이뤄졌고 학습도 그 해상도로만 진행됐다. 둘째, 베이스라인별로 카메라 고도 프로토콜이 달라(Wonder3D는 0도, 나머지는 30도, NAMVIS는 두 각도 모두) 공정 비교 범위를 따져봐야 한다. 셋째, COLMAP 재구성·등록 지표는 저자들이 밝히듯 기하 일관성의 대리 지표일 뿐 절대적 품질 척도가 아니다.

저자들이 명시한 한계는 다음과 같다. 현재 체크포인트는 256×256에서만 학습됐기 때문에 512×512 추론을 하려면 추가 학습이나 파인튜닝이 필요하다. 또한 모든 이전 타깃 스케일에 대한 완전한 블록 인과 어텐션은 고해상도에서 메모리와 KV 캐시 비용을 키우는데, Switti 같은 최근 연구처럼 현재 스케일 표현이 이미 하위 스케일 정보를 누적하고 있다는 점을 이용해 스케일 국소·윈도우 타깃-타깃 어텐션으로 대체하되 기하 인식 소스-타깃 교차 어텐션은 유지하는 방향이 향후 과제로 제안된다. 또 학습 데이터가 객체 중심 Objaverse-XL이라 복잡한 실세계 장면으로 기하 사전지식이 그대로 전이되지 않을 수 있으며, 포즈 노이즈에 대한 강건성과 장면 수준 다중 뷰 설정으로의 확장도 남은 과제로 꼽힌다.