디코더를 줄여 인코더에 3D 기하를 몰아넣는 자기지도 표현학습
Less Decoder is More Encoder: Geometric Representation Learning from Novel View Synthesis
무엇인가
새 시점 합성(NVS)은 posed 이미지만으로 3D 장면 구조를 추론하게 만드는 자기지도 신호원이라, 값비싼 dense 3D 정답 없이 기하 표현을 얻을 수 있는 대안으로 주목받아 왔다. 그런데 기존 feed-forward NVS 모델의 인코더 표현은 하위 기하 과제로 잘 전이되지 않는다. 이 논문은 그 원인이 감독 신호 부족이 아니라 눈에 잘 띄지 않는 아키텍처 선택에 있다고 주장한다. 첫째, 공간적으로 표현력이 큰 디코더가 과제의 표현 부담을 흡수해 인코더가 구조적이고 국소적으로 판별력 있는 특징을 유지할 압력을 잃는다. 둘째, 픽셀 공간 재구성 목표는 3D 구조·의미와 약하게만 연관된 고주파 앨리어싱 통계를 모델링하도록 그래디언트를 만든다.
어떻게 동작하나
제안 방법 SNAP은 두 단계로 동작한다. 1단계는 포즈 없는 다중뷰 인코더로, 각 참조 이미지를 동결된 DINOv3 ViT-B로 패치화한 특징을 선형 투영하고 RoPE2D로 이미지 내 2D 패치 격자 위치를 부호화한 뒤, 여러 참조 뷰의 패치가 서로 모두를 주목하는 cross-view self-attention 블록을 통과시켜 장면 토큰 Z를 만든다. 이 단계에는 카메라 파라미터가 전혀 들어가지 않는다. 2단계는 포즈 조건부 패치 디코더로, 학습된 단일 특징 쿼리를 L개 타깃 패치 쿼리로 복제한 뒤 PRoPE로 회전시킨 cross-attention을 Z에 수행한다. PRoPE는 투영행렬 P=K̂·T⁻¹를 만들어 쿼리와 키를 회전시키고, 월드 공간 광선이 정렬된 토큰 쌍에 높은 어텐션을 주는 일종의 소프트 에피폴라 탐색을 구현한다. 이때 타깃 쿼리 사이의 self-attention은 겹치지 않는 RF×RF 블록 안에서만 허용하는 BlockNN 마스크로 제한되며, 최적 설정에서는 RF=1로 두어 이 연산이 사실상 패치별 잔차 MLP로 축소된다.
무엇과 다른가
학습 목표는 RGB가 아니라 동결된 DINOv3 교사 특징에 대한 잠재 공간 재구성이다. 두 특징을 모두 단위 구면에 ℓ2 정규화한 뒤 L1 손실을 적용하고, 여기에 2D 토큰 격자에 대한 1차 유한차분 잔차를 페널티로 더한다. 이 그래디언트 항은 보조적 요소가 아니라 필수적인데, 없으면 디코더가 국소 구조를 평균내는 공간적으로 균일한 예측으로 특징 손실을 만족시켜 인코더가 담아야 할 기하 신호가 붕괴하기 때문이다. 저자들은 어떤 DINOv3 층을 입력으로 쓰고 어떤 층을 예측 대상으로 삼을지 전수 조사했고, 입력은 11층, 타깃은 더 깊은 층을 쓰는 구성을 택했다.
어떻게 쓰나
분석 실험은 두 설계 축의 효과를 분리해 보여준다. 디코더 수용장을 1×1, 2×2, 4×4, 8×8, 16×16으로 키우면 특징 재구성 오차는 좋아지지만 점 대응, 시각적 위치추정, 포즈 추정 성능은 모두 나빠진다. 즉 재구성 품질은 표현 품질의 대리 지표가 되지 못한다. 예측 공간 실험에서는 (입력 9층, 타깃 2층) 조합이 재구성 오차가 가장 낮았지만, 하위 기하 성능은 더 깊은 층을 예측할 때 좋아졌다. 입력 층 선택에는 트레이드오프가 있어 4층 입력이 11층 대비 in-distribution PCK와 MRR을 각각 약 5.8%, 5.2% 개선했으나 내재 차원이 약 53% 더 컸고, 저자들은 더 압축되고 불변한 표현을 위해 11층을 입력으로 채택했다.
전제와 한계
본 실험은 인코더를 동결하고 가벼운 과제별 헤드만 학습하는 프로토콜로 다섯 과제를 평가한다. 점 대응에서는 RealEstate10K의 모든 픽셀 임계값에서 자기지도 베이스라인을 앞섰고, 장면 복잡도가 높은 DL3DV에서는 dense 3D 감독을 전혀 쓰지 않고도 VGGT와 근소한 차이로 경쟁했다. 이는 VGGT가 518×518로 처리하는 것을 SNAP이 256×256으로 처리하면서 얻은 결과다. 시각적 위치추정에서는 자기지도 모델 중 새로운 수준을 세웠고, 상대 포즈 추정에서도 NVS 계열 중 높은 회전 정확도를 보이면서 국소 판별 구조와 전역 기하 추론을 동시에 유지했다. 로봇 조작에서는 MimicGen의 카메라 이동 0.0~1.0 라디안 조건에서 DINOv3·ResNet 같은 의미 백본이 0.2 라디안을 넘어서면 급격히 무너지는 반면, SNAP은 동결 DINOv3 교사보다 좋은 성능을 냈고 전용 베이스라인 Adapt3R을 대체로 앞서며 완전 기하 감독 모델인 VGGT를 바짝 따라갔다. 상대 깊이 추정에서는 NVS 기반 인코더들을 앞섰지만 명시적 3D 감독을 쓰는 VGGT가 더 우수했고, Hypersim으로 사전학습한 LagerNVS가 합성 데이터에서 높은 δ1을 얻은 것과 달리 SNAP은 실제 데이터셋인 7Scenes에서 강한 일반화를 보였다.
효율 측면도 설계의 일부다. 256×256 이미지에 패치 크기 16을 쓰면 시퀀스 길이가 레지스터 포함 256N+8 토큰에 불과해, 518×518·패치 14로 1369N+5 토큰을 만드는 VGGT와 비교해 뷰 수가 12개를 넘어야 어텐션 비용이 비슷해진다. 16헤드 8그룹의 Grouped Query Attention으로 KV 비용도 줄였다.
실무 관점에서 이 논문이 주는 지침은 명확하다. NVS를 표현 사전학습에 쓸 때 재구성 지표를 올리는 방향으로 디코더를 키우면 다운스트림 기하 성능이 오히려 떨어진다. 디코더의 타깃 뷰 self-attention 수용장을 좁히고, 픽셀 대신 의미 구조가 있는 잠재 특징을 예측 대상으로 삼는 편이 전이 가능한 표현을 얻는다. 또한 인코더를 동결한 채 가벼운 헤드만 붙여 평가하는 프로토콜은 사전학습 표현의 순수한 공간 구조를 확인하는 데 유용하다. 다만 부록 D에 따르면 이 개선이 특정 교사에 국한되지 않고 DINOv3, SAM, MAE 모두에서 대응 성능이 향상되지만, 자신의 데이터 도메인과 해상도에서 층 선택 트레이드오프를 다시 확인할 필요가 있다.
저자들이 밝힌 한계도 분명하다. 현재 사전학습은 posed 비디오 시퀀스와 정적이고 텍스처가 있는 장면에 의존하며, 고정된 컴퓨트·데이터 예산 아래에서 수행되어 이 아키텍처의 스케일링 법칙이 아직 드러나지 않았다. 동적 비디오로 이 패러다임을 확장하는 것이 다음 단계로 남아 있다.