SPW-Nav가 언어 지시로 2K 파노라마 영상을 실시간 스트리밍한다

SPW-Nav: A Streaming Panoramic World Model for Language-Guided Navigation

HF Daily2610.08941

Yunheng Liu, Ziqi Cai, Siqi Yang2026-10-06

무엇인가

파노라마 영상 생성은 3D 장면 탐색, VR, 임바디드 에이전트 학습에 쓰이지만, 기존 파노라마 생성기는 미리 정해진 궤적을 따르고 인터랙티브 월드 모델은 원근 뷰에서 키보드 같은 저수준 행동으로만 조작된다. "카메라 뒤에 있는 문으로 걸어가라"처럼 장면 내용을 가리키는 지시는 어느 쪽도 이해하지 못한다. 게다가 이런 지시의 의미는 모델이 방금 자기가 생성한 파노라마에 달려 있어서 사전에 운동으로 바꿔둘 수 없고, 파노라마 회전은 보이는 내용을 재배열할 뿐인데 기존 생성기는 이를 합성으로 만들어내며, 2K 스트리밍에서는 프레임당 네트워크 평가 횟수가 극히 적다. SPW-Nav는 이 세 가지를 동시에 다룬다.

어떻게 동작하나

구조는 두 개의 백본으로 나뉜다. 비전-언어 백본(Qwen3-VL-8B, 언어 모델 어텐션에 rank-16 LoRA, 비전 인코더는 동결)이 직전에 생성된 파노라마를 읽고 각 지시를 두 종류의 운동 타깃 중 하나로 바꾼다. 변위 타깃은 현재 카메라 기준 최대 3개의 웨이포인트 (x, z, ψ)를 미터·도 단위로 나열해 다단계 이동과 정지, 보정을 포괄하고, 목표 타깃은 이름이 불린 물체나 장소를 이미지 경계를 넘어 감쌀 수 있는 바운딩 박스와 접근 거리 r로 표시한다. 박스의 정규화된 수평 중심을 c라 하면 카메라는 방위 ψ*=2π(c−1/2)로 돌고 나서 r만큼 전진한다. 이 타깃은 이전 세그먼트 끝 포즈 T_{k−1}에 대한 상대 변환 ΔT_{k,j}로 보간되어 SE(3) 궤적 A_k가 된다.

무엇과 다른가

비디오 백본(Wan2.2-TI2V-5B, LoRA 파인튜닝, 1024×2048, 재생 16 FPS)은 세 가지 장치로 병진만 모델링한다. 첫째, 구면 회전 분리(SRD)는 카메라 회전이 파노라마에서 새 내용을 드러내지 않는다는 점을 이용해 회전을 구면 위에서 정확히 리샘플링한다. 학습 시 각 프레임을 첫 프레임 방향으로 재샘플링해 궤적을 병진만 남기고, 추론 시에는 초기 파노라마 방향으로 생성한 뒤 회전을 복원한다. 둘째, 포즈 정렬 조건화(PAC)는 월드 프레임 포즈가 장소마다 다르고 이동 거리에 따라 커지는 문제를 막기 위해 모든 포즈를 직전 청크의 첫 프레임 기준 상대 포즈로 표현한다. 청크당 9개 잠재 프레임 각각이 3×4 포즈를 받고, 각 트랜스포머 블록의 zero-init 선형층이 이를 토큰 오프셋으로 더한다. 그래서 (1,0,0)의 상대 병진은 언제나 현재 뷰에서 오른쪽 이동을 뜻하고, 입력은 월드 프레임의 강체 변환에 불변이며 학습 범위를 벗어나지 않는다. 셋째, 노이즈 테일 궤적 학습(NTL)은 카메라 운동과 거친 구조를 좌우하는 높은 노이즈 구간에 학습과 증류를 집중한다. 노이즈 레벨의 λ=0.8을 [0.9, 0.98] 테일에서 뽑고 나머지를 기본 분포에서 뽑는다. 여기에 반대 궤적 가이던스(OTG)가 최상위 스케일에서 명령된 병진과 그 역방향의 속도 차이를 κ=2로 증폭해, 양방향에 공통인 장면 외형 성분을 상쇄하고 이동 방향에 의존하는 성분을 키운다.

어떻게 쓰나

스트리밍은 Helios의 자기회귀 레시피 위에 세운다. 멀티텀 메모리는 가장 최근 잠재 프레임 1개, 그 앞 2개, 더 이전 16개를 담고 오래된 항은 더 거칠게 패치화하며, 스트림 첫 프레임을 고정 앵커로 유지한다. 생성은 회전 없는 방향에서 돌아가므로 회전이 메모리를 교란하지 않는다. 각 청크는 3단계 공간 피라미드에서 스케일당 2스텝(첫 청크는 4스텝)으로 디노이즈되고, 첫 청크 이후 청크당 네트워크 평가 6회에 가이던스 2회가 더해진다. 학생은 교사에 대한 ODE 회귀로 초기화하고 분포 매칭 증류로 학습하며, 추론 시 메모리가 생성 프레임을 담는다는 점을 반영해 ODE 회귀는 모델 자체 롤아웃의 히스토리를 쓰고 증류는 정답 히스토리를 확률 0.9로 노이즈·다운샘플링·포화 이동으로 오염시킨다.

전제와 한계

데이터는 SPW-NavSet으로, Habitat로 HM3D·Replica·ReplicaCAD 장면을 정확한 포즈로 렌더링한 실내 영상과 MUGEN의 실외 거리 영상(추정 포즈)을 합쳐 약 18K 클립, 233시간, 1024×2048이다. 카메라가 정지해 있거나 제자리 회전만 하는 클립은 제거했다. 평가용 SPW-NavBench는 학습 데이터와 소스 영상 수준까지 분리된 실외 클립 100개로, 각각 초기 파노라마와 정답 궤적, 두 개의 지시를 제공한다.

언어 기반 내비게이션 실험(Table 1)에서 SPW-Nav는 ATE를 제외한 모든 지표에서 앞선다. TDE는 56.66°로 베이스라인 최소 62.07°보다 낮고, FVD는 351.6 대 최소 628.8이며, 회전 오차 RE는 어떤 베이스라인의 4분의 1도 안 된다. PanoWorld 두 변형은 PSNR이 약 5dB 떨어지는데 SPW-Nav는 1dB 미만 손실이다. 파인튜닝 백본을 베이스 모델로 바꾸면 TDE가 100.74°로 오르고 MA가 0.028로 떨어진다. 정답 궤적을 주는 카메라 제어 실험(Table 2)에서는 14.01° 명령에 13.59°를 회전해 파노라마 베이스라인(2° 미만)과 큰 차이를 보이고, RE는 PanoWorld-A의 7분의 1 미만이다. 다만 병진에서는 PanoWorld-A가 더 낮은 ATE와 높은 MA를 기록하는데, 이는 PanoWorld-A가 고정 헤딩 960×480 클립에 특화된 반면 SPW-Nav는 임의 회전이 있는 2K 파노라마를 몇 스텝 생성기로 스트리밍하기 때문이다. 1분(960프레임) 장기 생성(Table 3)에서는 폐루프 회전 오차 1.62°로, 차선인 HunyuanWorld-Voyager 8.91°, PanoWorld-A 최대 39.52°를 크게 앞선다. 병진 폐루프 오차도 30.7%로 가장 낮다. 메모리 게인은 Matrix-Game 3.0이 0.249(원근 뷰)·0.204(파노라마)로 SPW-Nav의 0.173보다 높지만, 그쪽 폐루프 회전 오차는 두 설정 모두 22°를 넘는다. 지시 전환 실험은 20개 장면에서 4개 연속 지시를 12청크(약 25초)에 걸쳐 실행했고, 지시 경계를 넘는 프레임 간 LPIPS가 세그먼트 내부보다 높지 않아 시각적 점프가 없었다. 8개 H200 GPU와 희소 어텐션으로 26.6 FPS를 내며, 이는 출력 재생 속도 16 FPS보다 빠르다. 절제 실험에서는 OTG가 TDE를 43.53°에서 24.30°로 낮추고, NTL을 빼면 RE가 0.99°에서 26.58°로 오르며 PSNR이 3dB 이상 떨어지고 FVD가 395.6에서 512.2로 나빠진다. SRD를 빼면 RE가 1.84°에서 31.31°, FVD가 308.0에서 596.5로 악화된다. 비전-언어 백본은 명시적 지시를 전부 정확히 해석하고 가시 목표의 62%를 로컬라이즈했으며, 홀드아웃 장면에서 파인튜닝으로 명시 지시 정확도가 0.663에서 0.925로, 목표 지시가 0.154에서 0.692로 올랐다. 파노라마를 주지 않으면 목표 로컬라이제이션이 0으로 떨어져, 목표를 단어에서 추측하는 게 아니라 이미지에서 찾는다는 것을 보인다. 운동 지시는 98%에서 명령 방향과 일치했고 평균 거리 오차는 0.03m였다.

개발자 입장에서 이 논문의 실용적 요점은 인터페이스 설계다. 비디오 백본이 언어가 아니라 카메라 궤적을 받기 때문에, 운동 타깃을 파노라마 위 클릭이나 외부 플래너에서 받는 것도 가능하다고 저자들이 명시한다. 즉 언어 해석 모듈과 영상 생성 모듈을 분리해 두었으므로, 자체 지시 파서나 경로 계획기를 끼워 넣는 구조를 참고할 수 있다. 다만 8개 H200 GPU가 필요하고, 회전 정확도 이점은 SRD라는 구조적 장치에서 나오므로 다른 백본에 그대로 옮길 때는 구면 리샘플링과 포즈 기준점 설계를 함께 가져가야 한다. 또한 메모리가 생성 프레임만 담는 자기회귀 구조라 오차 누적에 대한 검증이 필요하다.

저자들이 밝힌 한계는 분명하다. 먼 곳을 재방문했을 때의 일관성과 병진 궤적의 형태(shape)가 미해결로 남아 있다. ATE에서 PanoWorld에 뒤지는 것도 이 때문이며, 키워드 매칭 프리셋이 미리 정의된 궤적 형태를 주는 반면 SPW-Nav는 지시와 장면에서 궤적을 추론한다는 차이다. 향후 작업으로 포즈 인덱스 3D 메모리로 먼 재방문 일관성을 높이고, 더 다양한 학습 궤적으로 병진 형태를 개선하는 것을 제안한다.