시야 밖 세계를 파노라마 관측자로 계속 진화시키는 World Observer

World Observer: Joint Actor-Observer Generation for Persistent World Modeling

arXiv2610.02162v1

Hyunwook Choi2026-10-01

무엇인가

비디오 월드 모델은 에이전트의 행동에 따라 환경이 어떻게 변하는지 생성하지만, 구조적으로 액터 중심이다. 카메라가 보는 영역만 갱신되므로 객체가 화면 밖으로 나가는 순간 그 객체가 어떻게 변했는지에 대한 직접적인 시각 증거가 사라진다. 저자들은 이때 나타나는 네 가지 실패 유형을 정리한다. 카메라가 움직여도 객체가 이미지 프레임에 붙어 있는 frame-locked, 나갔다가 돌아봐도 다시 나타나지 않는 lost, 남아는 있지만 역동이 멈춘 frozen, 그럴듯하지만 실제와 어긋난 상태로 재등장하는 impostor다. 기존의 내부 메모리, 생성 사전, 상태 외삽은 모두 과거에 관측한 정보로 보이지 않는 구간을 추론할 뿐이라, 미관측 구간이 길어지거나 장면 역동이 복잡해질수록 상태 드리프트와 시간적 불일치가 커진다. 저자들이 던지는 질문은 "월드 모델이 액터의 현재 시야 너머 영역을 어떻게 계속 관측할 수 있는가"이며, 답은 관측을 행동으로부터 분리하는 것이다.

어떻게 동작하나

World Observer는 하나의 사전학습된 비디오 Diffusion Transformer(Cosmos-Predict2.5)를 3D VAE 잠재 공간에서 파인튜닝해, 에이전트 중심 시점을 렌더링하는 원근 액터 스트림과 선택된 세계 영역을 감시하는 하나 이상의 360도 파노라마 관측자 스트림을 동시에 생성한다. 두 스트림은 각자의 텍스트 프롬프트와 카메라 궤적을 조건으로 받고, 이전 청크의 꼬리 잠재를 히스토리로 삼아 T=77 프레임 단위로 자기회귀적으로 이어진다. 핵심은 view-time alignment로, 같은 세계를 같은 시각에 담고 있으므로 액터와 관측자 잠재에 RoPE 시간축상 동일한 위치를 부여한다. 그러면 재등장하는 객체에 대한 쿼리가 같은 타임스텝의 관측자 영역을 어텐션할 수 있고, 그곳에서 시야 밖 상태가 유지된다. 프롬프트도 분리되어 액터 프롬프트는 국소 시야 안의 사건을, 관측자 프롬프트는 액터가 보지 못하는 영역을 포함한 주변 세계의 사건을 지정한다. 관측자는 이로써 나간 객체가 계속 움직이게 하는 메모리이자, 화면 밖 상호작용 같은 사건을 지시하는 제어 신호가 된다. 학습은 flow matching 목적으로, 두 스트림에 동일한 타임스텝 k를 공유해 보간 잠재를 만들고 각 스트림의 속도장 예측 오차를 합산한다.

무엇과 다른가

기하 정합은 초기 파노라마를 공통 소스로 삼아 확보한다. Depth Anything 3로 얻은 미터 스케일 깊이로 초기 파노라마를 각 스트림의 시점으로 워핑하고, 워핑된 비디오를 3D VAE로 인코딩해 노이즈 잠재 및 유효 픽셀 마스크와 채널 방향으로 결합한다. 두 스트림이 같은 파노라마와 깊이를 쓰므로 기하 일관성이 구조적으로 보장되고, Plücker raymap이 시점을 인코딩한다. 해상도는 분리되어 액터가 1280x704, 관측자가 640x320으로, 표시 출력이 아닌 관측자는 세계 상태 유지에 필요한 거친 구조만 담으면 되므로 전체 360도 커버리지를 감당할 수 있다. 파노라마의 왜곡으로 잃는 미세 외형은 Observer Sink가 보완한다. 초기 파노라마에서 요 방향 90도 간격으로 잘라낸 4장의 고해상도 원근 뷰를 잠재로 인코딩해 시퀀스에 덧붙이되, 생성 대상이 아니라 고정된 참조로 두고 위치 오프셋을 50만큼 떨어뜨린다. 관측자는 시간에 따른 진화를, Observer Sink는 초기 외형을 담당해 재진입 영역이 갱신된 상태와 세부 디테일을 함께 갖게 한다. 관측자는 액터에 묶여 있지 않으므로 액터와 분리 배치하거나 여러 위치에 두어 가려진 영역까지 커버할 수 있고, 다중 관측자 설정에서는 액터 위치에 가장 가까운 관측자 파노라마를 워핑 소스로 선택해 기하 참조가 장면을 따라 전환된다.

어떻게 쓰나

학습 데이터는 두 갈래다. 실제 파노라마 코퍼스에서 안정화한 고해상도 영상 23K개에서 다양한 궤적으로 138K 클립을, CARLA 시뮬레이터의 합성 영상 12K개에서 72K 클립을 뽑았다. 실제 촬영만으로는 얻기 어려운 액터-관측자 분리 배치와 다중 관측자 구성을 합성 데이터가 채운다. 단일 관측자 모델은 8장의 H100에서 AdamW, 학습률 4.8e-5로 배치 16, 12K 반복 학습하고, 다중 관측자 모델은 그 체크포인트에서 합성 데이터 N=2로 배치 8, 6K 반복을 추가한다. 평가는 학습에 쓰지 않은 실제 파노라마 영상과 합성 CARLA 영상 각 100개, 총 200개 시퀀스(T=77 프레임)로 구성했고, 전체 시퀀스가 한 청크에 들어가는 조건에서 수행해 실패를 컨텍스트 부족이나 검색 실패로 돌릴 수 없게 만들었다. 지표는 SAM3 분할과 미터 스케일 깊이 추정으로 객체를 3D로 올려 월드 공간에서 변위를 재는 OOV-F(유효한 이탈-재진입 빈도), OOV-D_gt(프롬프트가 지정한 실제 역동과의 일치), OOV-D_self(이탈 전 운동의 자기 일관성)이며, 여기에 FID, FVD, VBench Image Quality, 회전·이동 오차, 정적 영역의 masked PSNR/LPIPS를 함께 본다.

전제와 한계

결과적으로 World Observer는 시야 밖 역동에서 가장 강한 성능을 내면서 시각적 충실도, 카메라 제어, 3D 정합성에서 경쟁력 있는 수준을 유지한다고 저자들은 보고한다. 다만 본문에 제시된 범위에서는 표의 구체적인 수치가 제시되지 않아, 각 지표의 절대값과 베이스라인 대비 개선폭은 원문 표를 직접 확인해야 한다. 지표 해석에 대해서는 정성적 설명이 있다. OOV-F가 낮으면 객체가 프레임에 붙어 있거나 사라져 유효한 이탈-재진입이 없다는 뜻이고, OOV-F는 높은데 두 OOV-D가 모두 낮으면 재진입은 하지만 frozen이거나 일관성 없이 움직인다는 뜻이며, OOV-D_gt만 높고 OOV-D_self가 낮으면 프롬프트는 따르지만 객체 자체 궤적에서 벗어난 impostor라는 뜻이다. 절제 실험에서 raymap만 쓰는 백본은 카메라 제어가 불안정하고 OOV 점수가 가장 낮았고, 관측자를 제거하면 OOV-F는 높지만 OOV-D가 낮은 impostor 경향이, 액터를 제거하면 파노라마에서 직접 시야 밖을 다뤄 OOV는 강하지만 왜곡 때문에 카메라 제어와 시각 충실도가 떨어졌다. 둘을 함께 생성할 때 가장 높은 OOV-D와 안정적인 OOV-F를 얻었다. Observer Sink를 빼면 OOV-D_self가 낮아지고 3D 정합성, FID, FVD도 나빠진다.

개발자 관점에서 이 논문이 유용한 지점은 두 가지다. 첫째, 시야 밖 상태 유지가 필요한 시스템에서 "기억을 더 잘하는 모델"을 찾는 대신 "관측자를 별도 스트림으로 분리해 계속 굴린다"는 아키텍처 선택지를 제공한다. 관측자는 표시 출력이 아니므로 저해상도로 생성해도 되고, 액터와 독립적으로 배치·이동·프롬프트 제어할 수 있다는 점이 실무 설계에서 재사용하기 좋다. 둘째, 시야 밖 역동을 정량화하는 월드 공간 지표와 벤치마크를 함께 공개했다는 점이다. 기존 VLM 기반 평가는 그럴듯함만 보기 때문에 다중 객체가 화면 밖에서 일관되게 움직였는지 측정하지 못한다. 자체 파이프라인을 평가할 때 OOV-F와 OOV-D 계열 지표를 참고하면 회귀를 잡기 쉽다. 도입 전에는 단일 청크 조건에서 측정된 결과라는 점, 그리고 실제 데이터만으로는 분리 배치 구성을 학습할 수 없어 합성 데이터 의존도가 크다는 점을 확인해야 한다.

저자들이 명시한 전제와 한계는 다음과 같다. 관측자 학습에는 시점이 동기화된 캡처가 필요하지만 실제 세계에서 이런 촬영은 얻기 어려워, 실제 파노라마 영상은 액터와 관측자가 같은 위치에 놓이는 co-located 쌍만 제공하고 액터에서 분리된 관측자 및 다중 관측자 구성은 CARLA 합성 데이터에 의존한다. 평가 역시 전체 시퀀스가 한 청크에 들어가는 조건으로 제한해, 무제한 메모리 상황에서 시야 밖 역동 유지 능력만을 분리해 측정했다. 파노라마 자체의 기하 왜곡은 미세 외형을 잃게 만들어 Observer Sink로 보완해야 하는 구조적 제약으로 남는다.