3D 장면 좌표에서 중복을 제거해 1000프레임 전역 밀집 추적을 가능케 한 TrackEverything

TrackEverything: Long Horizon Dense Tracking via De-Duplicating 3D Scene Representations

arXiv2609.30222v1

Ayush Jain2026-09-24조회 14

무엇인가

점 추적 모델은 오랫동안 양자택일을 강요받아 왔다. 희소 추적기는 사용자가 지정한 소수 질의 점만 긴 시간 추적할 수 있고, 밀집 추적기는 프레임 로컬 픽셀 공간에서 동작하기 때문에 같은 표면을 매 프레임 다시 인코딩하면서 계산량이 영상 길이에 비례해 폭발한다. 그 결과 기존 밀집 기법은 첫 프레임에 보이는 점만 추적하거나 48~64프레임의 짧은 클립에 갇혀 있었다. 논문은 512×512, 200프레임 영상의 모든 점을 추적하려면 10의 10제곱 규모의 예측이 필요하다고 계산하며, 영상이 3D 세계의 2D 투영이라는 사실을 이용해 모델 복잡도를 프레임 수가 아니라 고유한 물리적 장면 기하에 비례시키자고 제안한다.

어떻게 동작하나

TrackEverything은 영상을 16프레임짜리 겹치지 않는 슬라이딩 윈도우로 처리한다. 각 프레임은 동결된 DINOv3-small 백본과 학습 가능한 ViT 어댑터 헤드로 인코딩되어 (L, H/4, W/4, 384) 특징맵을 만들고, VGGT-Ω 같은 재구성 모델이나 센서에서 얻은 월드 좌표 포인트맵을 이용해 3D 특징 클라우드로 역투영된다. 이때 프레임 내부에서만 좌표를 복셀 인덱스로 양자화해 같은 복셀의 토큰을 평균 풀링으로 병합한다. 프레임 간 병합을 여기서 하지 않는 이유는 서로 다른 시각에 같은 3D 영역을 차지하는 별개 표면이 잘못 합쳐지는 것을 막기 위해서다.

무엇과 다른가

첫 번째 핵심 모듈인 엔드포인트 리파이너는 각 점의 윈도우 경계 시점 위치를 반복적으로 갱신하면서 가시성과 정적·동적 분류를 함께 예측한다. 각 점에는 출생 프레임을 뜻하는 소스 시점과 목적지 시점이 부여되고, 추론 시 목적지 시점은 항상 윈도우 경계(L-1)로 고정된다. 특징에는 소스 좌표, 현재 목표 좌표, 소스 시점, 목표 시점에 대한 네 개의 사인파 임베딩이 더해진다. 여기에 논문이 3D WAFT라고 부르는 연산이 붙는데, 목표 위치 추정값을 목표 프레임의 2D 특징맵에 투영해 이중선형 샘플링한 특징과 출생 위치에서 한 번만 샘플링한 소스 특징을 원래 특징에 이어 붙여 [f_i; g_src; g_tgt]를 만든다. 소스와 목표 특징이 비슷하면 현재 추정이 맞고, 다르면 정제가 필요하다는 암묵적 템플릿 매칭 신호를 주는 셈이다. 이 특징은 다중 헤드 셀프 어텐션 층을 거친 뒤 MLP 헤드에서 3D 잔차, 가시성 로짓, 정적·동적 로짓으로 디코딩되고, 위치는 이전 추정값에 잔차를 더해 갱신된다. 메모리를 크게 먹는 4D 상관 볼륨을 쓰지 않는 것이 이 설계의 요점이다.

어떻게 쓰나

두 번째 모듈인 궤적 리파이너는 정적이라고 분류된 점을 건너뛰고 동적 점에 대해서만 윈도우 길이의 밀집 궤적을 디코딩한다. 궤적은 소스와 목표 위치 사이 상수 속도 보간으로 초기화되고, 각 시점마다 트랜스포머 출력 특징과 소스 특징, 상수 속도 추정 위치에서 샘플링한 2D 특징을 이어 붙인 뒤 트랙 요약 역할의 [cls] 토큰을 덧붙인다. 디코더는 트랙 내부 시간축 셀프 어텐션과 [cls] 토큰에서 전체 특징 클라우드로 향하는 크로스 어텐션을 교대로 수행하며, 트랙끼리는 서로 어텐션하지 않는다. 이 독립성 덕분에 학습 때는 일부 트랙만 디코딩하고 테스트 때는 전체를 디코딩해도 분포 이동이 생기지 않는다. 윈도우가 끝나면 예측된 목표 위치를 기준으로 특징 클라우드를 다시 복셀화해 여러 프레임에서 온 점들을 병합하는데, 같은 시각에 두 물체가 같은 복셀을 차지할 수 없다는 규칙을 이용한 것이다. 이 교차 프레임 중복 제거가 표현 크기를 영상 길이가 아니라 새로 드러난 장면 기하에만 비례하게 만든다.

전제와 한계

실험은 TAPVid-3D 벤치마크의 ADT(약 300프레임 자아중심 실내), DriveTrack(25~300프레임 주행), PStudio(약 150프레임 다중 카메라 실험실) 각 50개 minival 클립에서 수행됐다. all-frame 밀집 3D 추적기 중에서는 VDPM을 평균 20% 이상 APD-P로 앞섰고, D4RT는 48프레임 DriveTrack과 PStudio에서 더 높은 수치를 보고했지만 약 20배 많은 파라미터와 비공개 데이터를 쓰고 공개 코드·가중치가 없으며 48프레임을 넘어서지 못한다. 첫 프레임 밀집 추적기인 DeltaV2와는 같은 VGGT-Ω 백엔드를 쓸 때 평균과 ADT에서 앞서고 DriveTrack·PStudio에서 근소하게 뒤졌는데, DeltaV2는 첫 프레임에서 시작한 점만 밀집 추적하는 반면 이 방법은 모든 프레임의 모든 점을 추적한다는 점이 다르다. 전체 길이 영상에서는 훨씬 많은 점을 추적하면서도 최신 희소 3D 추적기와 경쟁적인 성능을 유지했다. 모델은 동결된 20M DINOv3-small을 포함해 61M 파라미터이고, Kubric·PointOdyssey·Dynamic Replica로 8대의 L40S-46GB에서 학습됐다.

복잡도 분석은 PointOdyssey 검증셋(1000프레임 이상, 1만 개 이상 주석)에서 이뤄졌다. 900프레임에서도 최대 GPU 메모리가 30GB 아래로 유지된 반면, Any4D는 96프레임, SpatialTracker-v2와 DeltaV2-dense는 약 200프레임, DeltaV2-sparse는 약 500프레임, CoTracker3는 약 600프레임에서 메모리를 초과했다. 지연 시간에서는 CoTracker3가 가장 빨랐지만 384개 질의 점만 추적하는 반면 이 방법은 영상의 모든 점을 추적한다. 질의 점 수를 늘리는 실험(120프레임 고정)에서는 DeltaV2-sparse가 약 750점, CoTracker3가 약 2000점에서 TrackEverything의 지연을 추월했고, SpatialTracker-v2는 1000점에서 메모리를 초과했다. TrackEverything은 최대 1만 개의 추가 질의 점을 받아들이면서도 지연이 거의 일정하게 유지된다.

어블레이션에서도 근거가 제시된다. 포인트맵 소스를 Pi3에서 VGGT-Ω로 바꾸면 재학습 없이 PStudio APD-P가 30.1(+6.6), ADT가 45.7(+6.4)로 올랐고, 센서 기하를 쓰면 PStudio 71.7, ADT 46.5로 D4RT(49.6, 40.8)를 앞선다. 정적·동적 분류기는 Dynamic Replica와 PointOdyssey에서 F1 93.1과 92.5를 기록했고, 모든 점을 동적 궤적 디코더로 강제로 통과시켜도 정확도는 31.2 APD-P로 동일했지만 지연이 4.8배, 최대 메모리가 2.5배로 늘었다. 반복 궤적 정제를 제거하면 31.2에서 26.4로, 3D WAFT 특징 샘플링을 제거하면 29.3으로 떨어진다. 복셀화를 아예 하지 않으면 메모리가 곧바로 초과되며, 복셀 크기 0.005~0.02 구간에서는 약 31 APD-P로 정확도가 안정적이고 0.005에서 0.23초/프레임·24.0GB, 0.2에서 0.03초·10.7GB가 된다. 기본값은 v=0.02다. 윈도우 길이는 L=8이 31.3, L=16이 31.2, L=24가 29.8이었고 L=16 학습이 스텝당 26% 빨라 L=16을 채택했다.

저자들이 밝힌 한계는 분명하다. 복셀 중복 제거가 메모리 증가를 장면 내용에 묶어 두지만, 끝없이 새로운 공간을 탐험하는 open-world 상황에서는 활성 메모리가 계속 늘어나므로 시간 단위 궤적을 위한 공간 캐시 축출이 다음 과제다. 또한 외부 기하에 의존하기 때문에 성능이 입력 포인트맵 품질에 묶인다. 가장 주의할 점은 교차 윈도우 병합이 윈도우 경계의 공간적 근접성만으로 이뤄지고 평균 풀링이 비가역적이라는 것이다. 추적 오류가 있으면 서로 다른 물리적 표면이 하나의 정규 트랙으로 영구히 붕괴되어 이후 프레임에서 분리할 수 없다. 중요한 점은 복셀화에서 제외되는 질의 점 브랜치로 보호할 수 있지만, 병합 메커니즘 자체의 개선은 향후 과제로 남는다. 실무에서는 단일 40GB GPU에서 장시간 영상의 전역 밀집 3D 추적이 필요할 때 후보가 되며, 도입 전에 사용하는 포인트맵 백엔드의 정확도와 복셀 크기에 따른 정확도·지연·메모리 트레이드오프, 그리고 병합의 비가역성을 반드시 확인해야 한다.