행동에 쓸모 있는 미래만 압축하는 월드 액션 모델용 예측 상태, ARPS

The Right Future for Action: Learning Action-Relevant Predictive States in World Action Models

arXiv2609.23369v1

Qiwen Gu2026-09-20조회 5

무엇인가

생성 없는 월드 액션 모델(WAM)은 학습할 때는 미래 영상을 예측하지만 추론할 때는 미래 영상을 생성하지 않고 내부 비디오 특징에서 곧바로 행동을 뽑는다. Fast-WAM이 대표적인 예로, 비디오 전문가와 행동 전문가가 마스크된 공유 어텐션으로 상호작용하며 행동 전문가는 현재 프레임 특징 H_t를 받는다. 문제는 이 H_t가 행동을 위해 무엇을 보존해야 하는지가 규정되어 있지 않다는 점이다. 비디오 예측 목적함수는 외형, 기하, 의미, 동역학을 모두 보상하지만 제어에 필요한 것은 그중 일부일 수 있다. 논문은 "예측 상태가 행동을 위해 무엇을 보존해야 하는가"를 정면 질문으로 세우고, 그 답을 세 가지 진단 실험으로 먼저 찾는다.

어떻게 동작하나

진단은 LIBERO 학습셋에서 2,048개 샘플을 에피소드 단위 60/20/20로 나누고, 각 현재 관측과 미래를 32스텝 행동 청크에 짝지어 선형 릿지 프로브의 테스트 R²를 측정하는 방식으로 이뤄진다. 첫째, 예측 가능성과 행동 판독성은 어긋난다. 공간 풀링 행동 프로브에서 V-JEPA2가 R²=0.432, DINOv2가 0.410, VGGT가 0.270이었다. 반면 미래 표현 변화 ΔT_h를 현재 표현에서 예측하는 과제는 VGGT가 R²=0.404로 가장 쉬웠고(V-JEPA2 0.152, DINOv2 0.126), 정작 행동 판독성은 가장 나빴다. 둘째, 관측된 미래 변화는 현재를 넘어서는 행동 정보를 더한다. T+ = [T_t, ΔT_h1, ΔT_h2]로 확장하면 V-JEPA2가 0.432에서 0.538, 0.584로, DINOv2가 0.410에서 0.496, 0.553으로, VGGT가 0.270에서 0.310, 0.352로 올라간다. 두 지평을 더한 순수 이득은 각각 0.152, 0.143, 0.082였다. 셋째, 행동 판독성은 공간적으로 집중된다. V-JEPA2의 128개 위치 전체 판독이 R²=0.5907인데, 검증 데이터로 고정한 상위 8개 위치만으로 0.551을 얻어 필드의 6.25%로 전체의 93.3%를 회복했다.

무엇과 다른가

이 진단에 대응하는 것이 Action-Relevant Predictive States(ARPS)다. ARPS는 비디오 전문가 F_θ의 중간 레이어 ℓ(기본값 15)에서 첫 프레임 히든 토큰 H_t^ℓ을 읽는다. 지평 조건부 상태 예측기 G_ψ는 M=32개의 학습 가능한 상태 쿼리를 두 미래 지평 H={1,2}에 균등 분배하고, 각 그룹에 지평 임베딩 e_h를 더한 뒤 Z_t = concat_{h∈H} Z_t^(h)를 만든다. 중요한 점은 지평 그룹이 파라미터 초기화와 감독 경로만 지정할 뿐 정보 흐름을 격리하지 않는다는 것이다. 모든 예측기 블록에서 마스크 없는 셀프 어텐션이 M개 상태 토큰 전체에 걸쳐 작동해 지평 그룹끼리 정보를 교환하고, 그 결과가 H_t^ℓ에 크로스 어텐션(키·값)한다. 즉 전역적으로 결합되어 있으면서 지평별 감독 경로는 보존하는 구조이며, 예측기는 3블록이다.

어떻게 쓰나

감독은 동결된 V-JEPA2 교사가 담당한다. 정답 궤적에서 현재 공간 필드 T_t와 미래 필드 T_t+h를 뽑고 ΔT_t,h = T_t+h − T_t를 정의하며, 모든 타깃은 detach한다. 상태와 교사 필드는 토큰 수가 다르므로, 위치 쿼리 헤드 D_abs,h와 D_Δ,h가 압축 상태 Z_t^(h)에서 조밀한 교사 필드를 예측해 공간적으로 세밀한 감독을 준다. 표현 손실은 ℓ_rep = 1 − cos + SmoothL1(β=1)이고, 상태 손실은 L_state = (1/|H|) Σ_h [λ_state ℓ_rep(T̂_t+h, T_t+h) + λ_Δ ℓ_rep(ΔT̂_t,h, ΔT_t,h)]로 절대 항과 차분 항을 결합한다. 전체 목적함수는 L_ARPS = L_video(O_t:t+H, θ) + λ_act L_act(A_t | Z_t) + L_state이며, 행동 전문가는 조밀한 WAM 특징을 따로 받지 않고 Z_t만 받는다. 모든 시각 정보가 이 병목을 통과해야 한다. 추론 시에는 교사와 모든 디코딩 헤드가 제거되고 비디오 전문가도 레이어 ℓ에서 멈춰, 경로가 O_t → H_t^ℓ → Z_t → Â_t로 줄어든다.

전제와 한계

실험은 Fast-WAM 위에 Wan2.2-TI2V-5B 비디오 전문가와 1B ActionDiT(비디오 전문가로 초기화)를 올리고 λ_act = λ_state = λ_Δ = 1.0으로 고정해 진행했다. LIBERO에서 평균 99.2%로 비교 방법 중 최고였고, LingBot-VA를 0.7점, Fast-WAM을 전체 1.6점, LIBERO-Long에서 3.8점 앞섰다. RoboTwin 2.0에서는 Clean 91.32%로 최고 성적이며 평균 90.7%를 기록했는데, Fast-WAM 대비 Clean에서 0.9점 이기고 Random에서 1.0점 져 전체적으로는 비슷한 수준이다. 가장 큰 차이는 LIBERO-Plus다. 적응 없이 87.3%를 달성해 Fast-WAM을 39.2%p, 가장 강한 베이스라인인 Cosmos-Policy를 5.1%p 앞섰다. 이득은 Camera 범주에서 74.3%p, Noise에서 58.0%p로 가장 컸고, Robot과 Layout에서는 π0.5가, Background에서는 VLA-JEPA가 더 우세했지만 일곱 개 범주 모두에서 Fast-WAM 백본보다 개선됐다. 단일 NVIDIA H20에서 완전한 행동 청크를 306ms(3.26 calls/s)에 디코딩해 Fast-WAM의 353ms(2.83 calls/s)보다 지연을 13% 줄였다.

절제 실험은 설계 선택 하나하나를 검증한다. 교사 표현을 DINOv2로 바꾸면 LIBERO에서는 1.0점 차이에 그치지만 LIBERO-Plus에서는 34.5점 뒤진다. 상태 감독을 아예 제거하면 OOD 성공률이 24.0%로 떨어지고 VGGT 교사는 20.4%로 감독 없는 변형보다도 낮다. 시간 타깃에서는 present-only 감독이 LIBERO-Plus 49.0%에 그친 반면 기본 미래 목적함수는 87.3%였고, 근미래만 감독하면 72.4%로 두 지평보다 14.9%p 낮았다. LIBERO에서의 격차는 각각 4.0점과 0.7점에 불과해, 이득이 분포 이동에서 집중적으로 나타남을 보여준다. 절대/차분 감독은 차분만 쓸 때 80.4%, 절대만 쓸 때 74.9%, 결합할 때 87.3%로 각각 6.9%p와 12.4%p 개선됐다. 용량은 비단조적이어서 M=16이 80.4%, M=64가 83.7%, M=128이 81.6%, 기본값 M=32가 87.3%였고 LIBERO에서는 모두 0.9점 이내였다. 추출 깊이는 레이어 1이 LIBERO-Plus 33.6%에 그쳤고 레이어 30은 도메인 내 성능은 회복했지만 76.7%로 레이어 15보다 10.6%p 낮았다. 상태 예측기 입력을 detach하면 LIBERO에서 2.4점, LIBERO-Plus에서 15.3점을 잃어, 상태·행동 손실의 그래디언트가 상류 비디오 특징까지 닿는 것이 OOD 이득에 기여함을 확인했다.

논문은 학습된 상태 자체도 분석한다. 256개 쿼리 상태에 대해 미래 궤적이나 디코딩 헤드 없이 코사인 최근접 이웃을 찾고 그 쌍의 32스텝 말단-효과기 궤적을 비교했더니, 평균 궤적 코사인 유사도가 V-JEPA2 0.79, DINOv2 0.70, VGGT 0.48, 교사 없음 0.54였고 랜덤 이웃은 0.01이었다. 같은 시뮬레이터 상태를 조명이나 테이블 텍스처를 바꿔 재렌더링했을 때 상태 이동이 V-JEPA2에서 가장 작았고 해당 교란 범주의 성공률 이득도 가장 컸다. 상태에 RMS 크기 비례 가우시안 노이즈를 주면 최대 용량에서 성공률이 V-JEPA2 6.6%p, DINOv2 14.2%p, VGGT 2.5%p 하락해 배포된 상태가 폐루프 제어에 실제로 쓰임을 보였다. 다만 저자들은 VGGT의 낮은 초기 성공률 때문에 하락폭만으로 상태 유용성을 서열화할 수는 없다고 선을 긋는다.

개발자 관점에서 이 논문의 실용적 메시지는 명확하다. 비디오 월드 모델을 제어에 붙일 때 조밀한 특징을 그대로 정책에 흘려보내는 대신, 행동 판독성이 검증된 표현 공간을 교사로 삼아 소수의 학습된 상태 토큰으로 압축하고, 그 상태가 현재 관측만으로 미래 표현과 그 변화를 예측하도록 감독하라는 것이다. 특히 도메인 내 성능이 포화된 벤치마크(LIBERO 99.2%)만 보면 차이가 드러나지 않고, 분포 이동(LIBERO-Plus)에서 39.2%p 격차가 벌어진다는 점은 로봇 정책 평가에서 OOD 프로토콜을 반드시 함께 봐야 한다는 교훈을 준다. 한계도 분명하다. 저자들은 WAM 사전학습의 막대한 계산 비용 때문에 백본을 하나만 평가했고, 모든 실험이 시뮬레이션에서 이뤄졌으며 실제 로봇 평가는 향후 과제로 남겨두었다고 밝힌다.

관련 논문