MGE가 3D 파운데이션 모델의 시점 연결을 끊어 강건성을 높인다
Less Context, Better Geometry: Masked Geometric Encoder for Robust 3D Foundation Models
무엇인가
피드포워드 3D 파운데이션 모델은 여러 장의 이미지를 한 번에 넣어 카메라 파라미터와 조밀한 장면 기하를 동시에 뽑아낸다. 문제는 이 모델들이 모든 프레임이 모든 프레임을 보는 전역 어텐션(all-to-all global attention) 위에 세워져 있다는 점이다. 계산량이 프레임 수의 제곱으로 늘어 긴 시퀀스 추론이 사실상 막히고, 더 나쁜 것은 시점 간 상호작용에 제약이 없어 가려진 뷰나 겉모습은 비슷하지만 기하적으로 먼 뷰(도플갱어)에서 나온 신뢰할 수 없는 증거가 그대로 전파된다는 것이다. 전통적인 SfM 파이프라인인 COLMAP은 뷰 그래프에서 중복되거나 모호한 이미지 쌍을 잘라내는 명시적 장치를 갖고 있지만, 학습 기반 모델에는 그에 대응하는 장치가 없다. 저자들은 여기서 출발해 "3D 파운데이션 모델이 빠진 프레임에 더 강건한 표현을 학습할 수 있는가"를 묻는다.
어떻게 동작하나
제안하는 Masked Geometric Encoder(MGE)의 핵심은 이미지 내용이 아니라 프레임 간 연결을 마스킹한다는 점이다. 프레임 수준 연결 행렬 A를 두고 대각선은 항상 1로 유지해 각 프레임이 자기 자신은 볼 수 있게 하면서, 비대각 원소는 Bernoulli(1-ρ)로 샘플링해 특정 시점 쌍의 연결을 끊는다. 이 프레임 수준 마스크를 토큰 수준으로 확장해 전역 어텐션의 로짓에 더한다. 연결이 살아 있으면 0, 끊겼으면 -∞를 더하는 방식이라 소프트맥스에서 해당 키가 완전히 차단된다. 중요한 것은 이 마스킹이 전역 어텐션에만 적용되고 프레임 어텐션은 그대로 둔다는 점이다. 각 이미지는 자기 안의 공간 구조를 온전히 모델링하면서, 프레임 사이 정보 교환만 샘플링된 연결 패턴에 따라 제한된다. 학습 중 반복마다 다른 연결이 끊기므로, 인코더는 서로 다른 부분집합의 시점 정보로부터 같은 3D 기하를 복원하도록 강제된다. MGE는 특정 아키텍처에 묶이지 않는 프레임워크이며, 본문에서는 π³를 주 구현으로 쓰고 VGGT에도 적용한 실험을 부록에 둔다.
무엇과 다른가
마스킹만 걸면 표현이 망가질 수 있으므로, 저자들은 사전학습된 전체 문맥 교사 모델로부터의 자기 증류를 붙인다. 교사는 조밀한 전역 어텐션으로 평가되고 학생은 마스킹된 전역 어텐션을 쓴다. 감독 신호는 두 층위다. 기하 증류는 스케일 불변 포인트맵 손실에 표면 법선, 신뢰도, 상대 카메라 포즈 손실을 더한 형태이고, 포인트맵은 장면 수준 스케일까지만 정의되므로 단일 스케일 인자 s*로 학생 예측을 교사 의사 타깃에 정렬한 뒤 깊이로 가중한 L1 거리를 쓴다. 교사 쪽에는 stop-gradient가 걸린다. 특징 증류는 예측 헤드 이전의 최종 레이어 특징을 레지스터 토큰과 이미지 토큰으로 나눠 각각 코사인 거리로 정렬한다. 최종 목적함수는 기하 손실과 가중치를 곱한 특징 손실의 합이다. 저자들은 정답 라벨이 희소해 직접 지도학습이 느리게 수렴하고 재구성 오차도 크다는 점을 들어, 정답 대신 교사 예측을 감독으로 쓰는 설계를 택했다고 밝힌다.
어떻게 쓰나
추론 단계에서는 MGE가 만든 표현을 활용하는 Anchor-Guided Adaptive(AGA) 토큰 병합을 제안한다. 기존 토큰 병합은 토큰 유사도가 기하적 중복을 뜻한다고 가정하지만, 건물 외벽의 반복되는 창문처럼 특징은 비슷해도 3D 위치가 다른 경우가 있어 공격적인 병합이 공간적으로 구분되는 기하 증거를 지워버린다. AGA는 토큰 수준이 아니라 프레임 수준에서 압축한다. 입력 시퀀스 전체에 고르게 앵커 프레임을 표본으로 뽑아 전체 토큰 해상도로 유지하고, 나머지 프레임은 DINOv2 토큰을 평균 풀링한 프레임 디스크립터와 앵커 사이의 최대 코사인 유사도로 중복 점수를 매긴다. 점수가 높으면 앵커 문맥이 이미 대표하는 중복 뷰이므로 더 세게 병합하고, 점수가 낮으면 상보적 내용을 담고 있으므로 토큰을 더 남긴다. 병합 비율은 중복 점수의 선형 함수로 두되, 전체 병합 토큰 수가 목표치가 되도록 계수를 보정하고 상한을 둔다. 앵커 프레임은 병합 비율 0으로 압축하지 않는다. 실제 병합은 ToMe 방식의 이분 매칭으로 수행하고, 전역 어텐션은 전체 해상도 앵커 토큰과 압축된 비앵커 토큰 위에서 계산한 뒤 기록해 둔 병합 할당으로 원래 토큰 배치를 복원한다. 아키텍처 변경 없이 추론만 바꾸는 구조다.
전제와 한계
실험은 13개 데이터셋(ARKitScenes, BlendedMVS, Co3Dv2, HyperSim, MegaDepth, MVS-Synth, OmniObject3D, PointOdyssey, ScanNet, Spring, Virtual KITTI, Waymo, WildRGB)을 섞은 다중 도메인 혼합으로 증류한다. 시각적 모호성 평가를 위해 공식 다중 뷰 도플갱어 벤치마크가 없어서, Heinly 등의 데이터로 43개 서브셋을 직접 구축했다. 각 서브셋은 기하적으로 일관된 참조 뷰 15장과 시각적으로 유사하지만 기하적으로 어긋나는 도플갱어 뷰 5장으로 구성되고, 모델은 20장을 한 번에 처리한다. 전통적 매칭 베이스라인인 LoFTR은 참조 쌍에서 AUC@30이 가장 높았지만 일부 이미지가 아예 등록되지 않았고 참조-도플갱어 교차 쌍에서는 성능이 크게 떨어졌다. 피드포워드 방법 중에서는 MGE가 전체, 참조 쌍, 교차 쌍 평가 모두에서 최고 성능을 냈다. 가려짐 강건성은 ETH3D에서 뷰의 10%/30%/50%를 중앙 흰 패치로 오염시켜 평가했는데, MGE는 중간·대규모 가려짐에서 가장 좋았다. 깨끗한 입력에서 대규모 가려짐으로 갈 때 VGGT와 π³는 정확도 오차가 각각 119%, 128% 늘어난 반면 MGE는 48% 증가에 그쳤고, 심한 가려짐에서 포즈 추정은 오히려 4% 좋아졌다. 토큰 병합을 쓰는 빠른 변형들은 상대적 열화 폭은 작지만 병합 때문에 시작점 자체의 재구성 품질이 낮아 전체 정확도는 여전히 뒤진다.
토큰 병합 성능은 NRGBD에서 예측 포인트맵과 정답 포인트 클라우드 사이 거리로 측정했고, 스트리밍 계열인 TTT3R, StreamVGGT와 기존 토큰 병합 기법 FastVGGT를 여러 시퀀스 길이에서 앞섰다. 원래 VGGT에 AGA만 붙여도 FastVGGT보다 꾸준히 좋았고, AGA와 MGE를 결합하면 특히 공격적 병합이 중요한 기하 증거를 버리기 쉬운 제한된 뷰 설정에서 강건성이 더 올라간다. 표준 벤치마크(Sintel, TUM-Dynamics, ScanNet)의 카메라 포즈 추정에서 마스킹된 학생 모델은 교사와 경쟁력 있는 수준을 유지했는데, TUM-Dynamics에서는 동등했고 Sintel과 ScanNet에서는 소폭 개선됐다. 저자들은 이 간헐적 향상이 MGE가 조밀한 교사를 근사하는 데 그치지 않고 효과적인 정규화기로 작동한다는 증거라고 해석한다. 절제 실험에서는 마스킹 비율이 표현 독립성과 재구성 충실도 사이의 트레이드오프를 만든다는 점을 확인했고, 실제로는 ρ=0.3~0.5의 중간 수준이 최적이었다. 병합 설계에서는 토큰 수준 보호보다 앵커 프레임 보호가 재구성 품질을 크게 올렸고 적응적 병합이 추가 이득을 줬다. 증류 전략 비교에서는 직접 정답 지도가 가장 느리게 수렴하고 오차가 컸으며, 의사 감독이 개선하고 특징 감독이 교사와의 격차를 더 좁혔다.
개발자 관점에서 이 논문이 주는 실용적 시사점은 두 갈래다. 하나는 추론 쪽으로, AGA는 재학습 없이 기존 VGGT 계열 모델의 추론 파이프라인에 얹을 수 있는 토큰 병합 전략이다. 프레임 수가 많은 스캔이나 영상 시퀀스를 다룰 때 균일한 토큰 축소 대신 앵커 프레임을 남기고 중복 뷰를 세게 압축하는 편이 저텍스처·반복 구조 장면에서 유리하다는 것이 실험으로 확인된다. 다른 하나는 학습 쪽으로, 전역 어텐션의 시점 연결을 무작위로 끊고 전체 문맥 교사로 증류하는 방식이 도메인 특화 파인튜닝에서 가려짐과 반복 구조에 대한 정규화로 쓸 수 있다는 아이디어다. 다만 마스킹 비율이 성능에 직접 영향을 주므로 0.3~0.5 범위에서 자체 데이터로 검증해야 하고, 증류에는 조밀한 전역 어텐션을 쓰는 교사 체크포인트가 필요하다는 전제가 붙는다.
저자들이 명시적으로 밝힌 한계는 마스킹 강도의 트레이드오프다. 마스킹이 강할수록 각 프레임이 조밀한 시점 간 통신에 덜 의존하게 되지만, 과도하게 희소화하면 유용한 기하 문맥까지 사라져 추론 시 모든 토큰을 유지하더라도 재구성이 나빠진다. 반대로 약한 마스킹은 재구성 품질은 지키지만 긴 시퀀스에서 후속 토큰 병합의 효과를 떨어뜨린다. 또한 시각적 모호성 평가에 쓸 공식 다중 뷰 도플갱어 벤치마크가 존재하지 않아 COLMAP과 Doppelgangers++ 재구성을 의사 정답으로 삼아 43개 서브셋을 자체 구축했다는 점은 평가의 전제 조건이다. 정답 라벨 대신 교사 예측을 감독으로 쓰는 설계 역시 교사 모델의 품질에 결과가 종속된다는 뜻이며, 저자들은 정답 라벨이 희소하다는 점을 그 근거로 제시한다. 토큰 병합의 상세 정량 결과는 부록 A.6에 있다고만 밝히고 본문에는 수치를 싣지 않았다.