World Observer가 액터 시야 밖 세계 상태를 관찰자로 계속 유지한다

World Observer: Joint Actor-Observer Generation for Persistent World Modeling

HF Daily2610.02162

Hyunwook Choi, Dahyun Chung, Hyunsung Kim2026-10-01조회 5

무엇인가

비디오 월드 모델은 에이전트의 행동에 따라 환경이 어떻게 변하는지 생성하지만, 구조적으로 액터 중심이다. 즉 세계 상태 갱신이 액터가 지금 보고 있는 영역에 묶여 있어, 객체가 시야를 벗어나면 그 이후의 진화를 관측할 직접적 증거가 사라진다. 논문은 이때 나타나는 네 가지 실패 모드를 정리한다. 카메라가 움직여도 객체가 화면 프레임에 붙어 있는 frame-locked, 시야를 벗어나면 사라졌다가 돌아봐도 안 나오는 lost, 남아는 있지만 역학이 멈춰 마지막 관측 상태 근처로 복귀하는 frozen, 그럴듯하지만 실제와 어긋난 상태로 재등장하는 impostor다. 기존의 내부 메모리·생성 사전·명시적 상태 외삽은 모두 과거 관측으로부터 안 보이는 진화를 추론하는 방식이라, 미관측 구간이 길어지거나 장면 역학이 복잡해질수록 상태 드리프트와 시간적 불일치가 커진다. 저자들이 세운 핵심 질문은 "기억을 잘하는 것"이 아니라 "액터가 어디를 보든 관심 영역을 계속 관측 가능하게 유지하는 것"이다.

어떻게 동작하나

해법은 관측을 행동에서 분리하는 것이다. World Observer는 에이전트 중심 시점을 렌더링하는 원근 액터 스트림 하나와, 선택된 세계 영역을 감시하는 360도 파노라마 관찰자 스트림 하나 이상을 단일 사전학습 비디오 Diffusion Transformer(Cosmos-Predict2.5)로 동시에 생성한다. 두 스트림은 3D VAE 잠재 공간에서 각자의 텍스트 프롬프트와 카메라 궤적을 조건으로 받고, T=77 프레임 청크 단위로 자기회귀적으로 이어지며 이전 청크의 꼬리 잠재를 히스토리로 쓴다. 정렬 방식이 구체적이다. 액터와 관찰자의 잠재를 히스토리 잠재와 함께 하나의 시퀀스로 이어 붙이고 학습 가능한 뷰 임베딩으로 스트림을 구분하되, 같은 시각의 액터·관찰자 잠재에 RoPE 시간축상 동일한 위치를 부여한다. 그래서 재진입하는 객체에 대한 쿼리가 같은 타임스텝의 관찰자 영역을 어텐션할 수 있고, 그곳에 시야 밖 상태가 유지돼 있다. 프롬프트도 분리한다. 액터 프롬프트는 국소 시야 안의 사건을, 관찰자 프롬프트는 액터가 보지 못하는 주변 세계의 사건을 기술한다. 관찰자는 이렇게 메모리이자 제어 신호 역할을 겸한다. 학습은 flow matching 목적으로, 두 스트림에 공유 타임스텝 k를 샘플링해 보간 잠재를 만들고 생성 대상 잠재에만 손실을 건다.

무엇과 다른가

기하 정합은 초기 파노라마를 공통 소스로 삼아 해결한다. DA3로 추정한 메트릭 스케일 깊이를 이용해 초기 파노라마를 각 스트림의 궤적 시점으로 워핑하고, 워핑된 비디오를 노이즈 잠재 및 커버 픽셀을 표시하는 이진 유효성 마스크와 채널 방향으로 결합한다. 두 스트림이 같은 파노라마와 깊이를 쓰므로 기하 일관성이 구조적으로 보장된다. 해상도는 역할에 따라 분리해 액터 1280x704, 관찰자 640x320으로 생성한다. 파노라마 왜곡 때문에 세밀한 외형이 손실되는 문제는 Observer Sink로 보완한다. 초기 고해상도 파노라마에서 요(yaw) 90도 간격으로 잘라낸 4개의 원근 뷰를 잠재로 인코딩해, 디노이징 대상이 아닌 고정 참조로 시퀀스에 덧붙여 생성 토큰이 어텐션할 수 있게 한다(오프셋 Δos=50). 관찰자는 시간에 따른 진화를, Observer Sink는 초기 외형을 담당해 재진입 영역이 갱신된 상태와 세부 디테일을 함께 갖게 한다. 관찰자는 액터에 묶여 있지 않으므로 액터와 분리 배치하거나 고정 시점에 두거나 여러 위치로 확장할 수 있고, N>1 다중 관찰자 설정에서는 관찰자별 학습 임베딩을 더해 각자 스트림을 가지며, 청크 첫 프레임에서 액터 위치에 가장 가까운 관찰자 파노라마를 액터 워핑의 기하 소스로 선택한다.

어떻게 쓰나

학습 데이터는 실제와 합성 두 갈래다. 실제 파노라마 코퍼스에서 안정화한 등장방형(equirectangular) 관찰자 시퀀스와 무작위 궤적으로 렌더링한 동기화 액터 영상을 쓰고, 액터에서 분리된 관찰자 및 다중 관찰자 구성은 CARLA 시뮬레이터로 보충한다. 규모는 실제 23K 비디오에서 138K 클립, 합성 12K 비디오에서 72K 클립이다. 단일 관찰자 모델은 8대 H100에서 AdamW, 학습률 4.8e-5로 배치 16, 12K 반복 학습하고, 다중 관찰자 모델은 그 체크포인트에서 N=2로 합성 데이터 배치 8, 6K 반복을 추가 학습한다. 평가는 학습에 쓰지 않은 실제 파노라마와 합성 CARLA 영상으로 각 100개, 총 200개 시퀀스(T=77 프레임) 벤치마크를 구성해 단일 청크 안에서 수행한다. 메모리 검색 없이 전체 시퀀스가 컨텍스트에 들어가는 조건이라, 실패를 컨텍스트 부족이나 검색 실패로 돌릴 수 없게 만든 설계다. 비교 대상은 일반 비디오 월드 모델, 파노라마 월드 모델, 시야 밖 방법론이며, 파노라마 모델 출력은 정답 카메라 회전으로 원근 뷰를 잘라 직접 비교한다.

전제와 한계

평가 지표가 이 논문의 또 다른 기여다. 기존 벤치마크는 단일 중앙 객체에 치우치고 VLM 기반 지표는 시각적 그럴듯함만 보므로, 저자들은 분할 모델(SAM3)과 메트릭 깊이 추정기로 객체를 3D로 올려 시간에 따른 위치를 추적하는 월드 공간 지표를 제안한다. OOV-F는 객체가 유효하게 시야를 나갔다 돌아오는 비율(frame-locked·lost 실패를 잡음), OOV-D_gt는 시야 밖 움직임이 프롬프트가 지정한 정답 역학과 일치하는지(frozen에 민감), OOV-D_self는 나가기 전 운동을 계속 이어가는지(impostor에 민감)를 측정한다. 그 외 FID·FVD·VBench Image Quality, 회전/이동 오차, SAM3로 분할한 정적 영역의 masked PSNR·LPIPS를 쓴다. 결과적으로 World Observer는 시야 밖 역학에서 가장 강하면서 시각적 충실도, 카메라 제어, 3D 정합성에서 경쟁력 있는 수준을 유지한다고 보고한다. 다만 원문 발췌에는 Tab. 1·Tab. 2의 구체적 수치가 포함돼 있지 않아 개선폭 숫자는 제시할 수 없다. 절제 실험의 정성적 결론은 명확하다. raymap만 쓰는 백본은 카메라 제어가 불안정하고 OOV 점수가 가장 낮다. 관찰자를 제거하면 OOV-F는 높지만 OOV-D_gt·OOV-D_self가 낮아, 보지 못한 객체를 프레임으로 끌어오되 상태가 어긋나는 impostor 경향을 보인다. 액터를 제거하고 파노라마에서 직접 처리하면 OOV는 강하지만 왜곡 때문에 카메라 제어와 시각 충실도가 떨어진다. Observer Sink를 빼면 OOV-D_self가 낮아지고 3D 정합성·FID·FVD도 나빠진다.

개발자 관점에서 이 논문이 유용한 지점은 두 가지다. 첫째, 시야 밖 일관성을 "더 좋은 메모리"가 아니라 "관측 커버리지" 문제로 재정의한다는 발상이다. 로봇 내비게이션, 인터랙티브 시뮬레이션, 장기 계획처럼 에이전트가 현재 관측 밖을 추론해야 하는 시스템을 만든다면, 상태 유지 실패를 frame-locked·lost·frozen·impostor로 분류해 진단하고, 관찰자를 액터와 분리해 원하는 영역에 배치하는 구조를 참고할 수 있다. 둘째, OOV-F·OOV-D_gt·OOV-D_self라는 월드 공간 지표는 자체 월드 모델을 평가할 때 바로 차용 가능한 측정 설계다. 다만 실제 도입 전에 확인할 것은, 관찰자 스트림이 추가되므로 추론 비용과 메모리가 늘어난다는 점, 관찰자를 낮은 해상도로 생성한다는 전제, 그리고 학습에 뷰포인트 동기화 캡처가 필요해 실제 데이터만으로는 부족하고 시뮬레이터 보강이 필수라는 점이다.

한계와 전제는 저자들이 본문에서 직접 밝힌 범위 안에서 다음과 같다. 관찰자와 액터가 시점 동기화된 캡처는 현실에서 얻기 어려워, 액터에서 분리된 관찰자와 다중 관찰자 구성은 CARLA 합성 데이터에 의존한다. 실제 데이터 쌍은 같은 파노라마에서 나오므로 본질적으로 동일 위치에 놓인다. 평가는 단일 청크 안에서만 이뤄져 장기 자기회귀 롤아웃에서의 시야 밖 유지 성능은 이 벤치마크가 직접 측정하지 않는다. 관찰자는 세계 상태 유지가 목적이라 액터보다 낮은 해상도로 생성되며, 파노라마 자체의 기하 왜곡은 Observer Sink로 보완하지만 제거되지는 않는다. 원문 발췌에는 별도의 한계 절과 정량적 수치 표가 포함돼 있지 않아, 이 이상의 수치적 한계 주장은 확인할 수 없다.