토크나이저와 흐름 예측기를 함께 학습해 잠재 세계 모델을 예측 가능하게 만든다

Latent-Foresight: End-to-End Learning Predictable Representations for Latent World Models

HF Daily2610.01942

Efstathios Karypidis, Spyros Gidaris, Nikos Komodakis2026-10-01조회 1

무엇인가

세계 모델링의 핵심 문제는 관측된 과거로부터 장면의 미래 전개를 예측하는 것이다. 자율주행차나 로봇은 안전한 행동을 계획하려면 앞으로 벌어질 일을 미리 알아야 한다. 이 논문이 던지는 근본 질문은 "미래 예측을 어떤 표현 위에서 수행할 것인가"다. 픽셀 수준 예측은 저수준 외형 디테일까지 담아야 해서 계산 비용이 크고, 최근에는 DINOv2 같은 비전 파운데이션 모델(VFM)의 특징 공간에서 예측하는 방식이 주류가 됐다. 문제는 기존 방식이 모두 2단계라는 점이다. 먼저 PCA나 독립 학습된 오토인코더로 VFM 특징을 압축하고, 그 얼어붙은 잠재 공간 위에 별도의 예측기를 얹는다. 표현 학습과 시간적 예측이 분리되어 있으니, 잠재 공간의 기하 구조가 생성적 예측에 유리하리라는 보장이 없다. 저자들은 토크나이저와 흐름 정합(flow-matching) 모델을 애초에 함께 학습하면 되지 않느냐고 묻고, 그 답이 가능하다고 주장한다.

어떻게 동작하나

제안하는 Latent-Foresight는 VFM 특징 토크나이저와 흐름 기반 잠재 동역학 모델을 공동으로 학습한다. 입력은 얼어붙은 DINOv2-Reg ViT-B/14 인코더의 중간층 4개에서 뽑은 밀집 특징을 채널 방향으로 이어 붙인 것으로, 토큰당 3072차원이다. 토크나이저는 트랜스포머 블록 2개짜리 경량 비전 트랜스포머 인코더·디코더 쌍이며, 공간적 Rotary Position Embedding(RoPE)을 넣고 각 프레임 특징 맵을 병목 차원 256의 잠재 표현으로 투영한다. 예측기는 DINO-Foresight 구조를 기반으로 RMSNorm, QK-normalization, SwiGLU 활성화, 시공간 RoPE를 추가하고, 흐름 정합 노이즈 레벨 t를 adaLN-zero로 조건화한다. 시간 모델링은 다음 프레임 하나를 예측하는 방식이고, 긴 지평은 자기회귀적으로 확장한다. 목표 잠재와 가우시안 노이즈 사이를 t로 선형 보간한 뒤, JiT의 x-예측 파라미터화로 깨끗한 잠재를 직접 추정하고 속도 형태의 흐름 정합 손실을 건다. 노이즈 레벨 분포는 로짓-정규 분포를 쓴다.

무엇과 다른가

종단간 공동 최적화는 그냥 하면 무너진다. 잠재 표현이 상수로 붕괴하면서 생성 손실만 최소화하는 퇴화 해로 수렴한다. 저자들이 제시하는 처방은 네 가지다. 첫째, 인코더 출력을 affine 파라미터 없는 배치 정규화로 정규화해 영평균·단위분산을 강제한다. 신호와 노이즈의 스케일을 맞춰 보간이 한쪽으로 치우치지 않게 하려는 것이다. 둘째, 흐름 목표의 속도 항과 노이즈가 섞인 입력 잠재에 stop-gradient를 걸어, 그래디언트가 문맥 잠재를 통해서만 인코더로 흐르게 한다. 셋째, 예측된 잠재를 디코더로 되돌려 원래 VFM 특징과 비교하는 보조 재구성 손실을 추가해, 인코딩된 잠재와 생성된 잠재 사이의 학습-추론 불일치를 줄인다. 넷째, 노이즈 스케줄을 조정한다. 전체 목적함수는 재구성 손실, 보조 재구성 손실, 흐름 정합 손실의 합이며 인코더·디코더·예측기를 한 번에 최적화한다.

어떻게 쓰나

실험은 도심 주행 데이터셋 Cityscapes와 nuScenes, 합성 다중 객체 동역학 벤치마크 Kubric에서 수행했고, 확장성 확인을 위해 Cityscapes·nuScenes·CoVLA를 합친 데이터로 Latent-Foresight+도 학습했다. 비교 대상은 정답 미래 프레임을 쓰는 Oracle 상한, 25억 파라미터에 주행 영상 1740시간으로 학습된 픽셀 수준 잠재 비디오 확산 세계 모델 VISTA, 판별적 방식의 DINO-Foresight, DeltaTok, 2단계 흐름 정합 방식 VFMF, 그리고 PCA 압축과 학습된 오토인코더를 쓰는 2단계 베이스라인이다. 저자들에 따르면 제안 방법은 모든 지표와 예측 지평에서 DINO-Foresight를 앞서고, 지평이 길어질수록 격차가 커진다. DeltaTok도 능가하며, 훨씬 큰 규모의 VISTA는 모든 과제와 지평에서 뒤진다. 데이터와 학습을 늘린 Latent-Foresight+는 전 지표에서 일관되게 향상돼 확장성을 보인다. 2단계 베이스라인 중에서는 학습된 오토인코더가 가장 강했고, 같은 잠재 차원 256의 PCA는 특징 정보를 충분히 보존하지 못해 재구성과 예측 모두 크게 나빠졌다. 다만 본문 발췌에는 표의 구체적 수치가 제시되지 않아 개선폭의 절대값은 확인할 수 없다.

전제와 한계

절제 실험은 설계 선택의 역할을 분리한다. 보조 재구성 손실을 빼면 예측 성능이 일관되게 떨어지고 특히 긴 지평에서 손해가 크다. 배치 정규화를 레이어 정규화로 바꾸면 재구성은 비슷하지만 예측이 나빠지고, 단위 가우시안으로의 KL 정규화는 재구성과 예측을 모두 크게 망가뜨린다. SIGReg는 배치 정규화와 비슷한 수준이다. 정규화를 아예 빼면 학습이 붕괴한다. stop-gradient도 역할이 갈린다. 목표 잠재 쪽을 풀면 학습이 붕괴하고, 노이즈 입력 쪽을 풀면 안정성은 유지되지만 예측 성능이 떨어진다. 병목 차원은 128~512 구간에서 예측이 가장 좋고, 1152는 재구성이 최고지만 중기 예측이 크게 나빠진다. 32처럼 너무 작으면 둘 다 손해다. 노이즈 분포는 로짓-정규를 더 높은 노이즈 쪽(μ=-2)으로 옮기고 표준편차를 1.5로 키울 때 중기 분할 성능이 좋아진다. 정성적으로는 2초를 넘기면 DINO-Foresight 예측이 거의 정지 화면이 되고 경계 부근에 잡음이 남는 반면, 제안 방법은 ego-motion에 따른 차량과 도로변 구조의 겉보기 움직임을 잡아내고 보행자·자전거 같은 작은 객체의 윤곽도 더 오래 유지한다.

실무 관점에서 이 논문의 값은 파이프라인 단순화에 있다. 토크나이저를 따로 학습해 얼리고 예측기를 따로 학습하는 2단계 대신, 한 번의 학습으로 두 구성 요소를 함께 최적화한다. 고해상도 적응 단계에서도 오토인코더 미세조정과 예측기 미세조정을 따로 돌릴 필요가 없다는 점이 특히 실용적이다. 다만 그 대가로 배치 정규화, stop-gradient 위치, 보조 재구성 손실, 노이즈 스케줄이라는 네 가지 안정화 장치가 사실상 필수 조건이 된다. 이 중 하나만 빠져도 학습이 붕괴하거나 예측이 무너지므로, 자체 구현을 시도한다면 이 항목들을 먼저 재현하고 병목 차원은 128~512 구간에서 자기 데이터로 다시 스윕하는 편이 좋다. 재구성 충실도와 시간적 예측 가능성은 서로 맞바꾸는 관계라는 점도 기억할 만하다.

한계로 저자들이 명시적으로 밝힌 것은 병목 차원 실험에서 드러난 재구성 충실도와 시간적 예측 가능성 사이의 트레이드오프다. 재구성 유사도만 높이면 예측이 나빠지므로 중간 차원을 골라야 한다. 또한 보조 재구성 손실은 주 목적함수보다 부차적인 항으로 설계됐고, 노이즈 분포와 정규화 방식 선택이 성능에 민감하게 작용한다는 점도 전제로 깔려 있다. 본문 발췌에는 별도의 한계 절이나 실패 사례 분석이 포함되어 있지 않으며, 절대적 성능 수치와 계산 비용 비교도 표로만 제시될 뿐 본문에 숫자로 적혀 있지 않다.