월드 액션 모델은 미래를 생성하지 않고 한 번만 준비해도 일반화한다

What Makes World Action Models Generalize? An Empirical Study of Test-Time Future Modeling

HF Daily2609.34981

Renping Zhou, Zanlin Ni, Zihao Fan2026-09-29조회 4

무엇인가

월드 액션 모델(WAM)은 훈련 중 미래 영상과 행동을 함께 예측하지만, 추론 시 미래를 꼭 생성해야 하는지는 논쟁적이다. 명시적 WAM은 매 행동 청크마다 미래를 깨끗한 프레임으로 디노이징하고, 잠재 WAM은 속도를 위해 미래 토큰을 아예 버린다. 이 논문은 두 패러다임을 같은 백본, 데이터, 예산으로 비교해 잠재 WAM이 분포 내 작업에서는 명시적 WAM과 비슷하지만, WAM의 존재 이유인 일반화 이득은 유지하지 못한다는 것을 보인다. 일반화는 환경 교란, 데이터 효율, 작업 일반화의 세 축으로 평가된다.

어떻게 동작하나

통제 실험은 Fast-WAM 구성을 따른다. 비디오 백본은 Wan2.2-5B DiT, 행동 전문가는 1B 규모이며, 명시적과 잠재 패러다임은 행동 토큰이 미래 비디오 토큰을 참조할 수 있는지 결정하는 구조적 어텐션 마스크만 다르다. 추론 시 미래 조건화 특징은 c_t,k = Φθ(Y_t^τk)로 정의된다. 명시적 WAM은 τ를 1에서 0까지 K단계로 끌어내리며 미래를 점점 선명하게 만들고, 잠재 WAM은 미래 토큰을 빼고 현재 프레임만 읽어 특징이 모든 행동 단계에서 일정하다. 저자들은 미래를 얼마나 디노이징하는지 바꾸는 실험에서 이득이 거의 전부 첫 디노이징 단계에서 나온다는 것을 발견한다. 비디오 전문가를 τ=1에서 한 번만 실행해 미래 토큰을 순수 가우시안 노이즈로 둔 경우가 잠재 WAM보다 네 설정에서 각각 26.44, 8.2, 13.4, 89.8점 앞섰고, 이후 아홉 번의 추가 패스는 최대 -1.62, +1.8, +0.8, +0.8점에 그쳤다. 즉 이득은 미래를 생성하는 데서가 아니라 미래 표현을 준비하는 데서 나온다.

무엇과 다른가

이에 따라 제안하는 Simple-WAM은 추론에서 미래 비디오 토큰을 가우시안 노이즈 상태로 남긴 채 비디오 전문가를 한 번만 통과시킨다. 그 특징이 K번의 모든 행동 디노이징 단계를 조건화하며, c_t,k = Φθ(Y_t^τ=1) for all k가 된다. 행동 디노이징 자체는 기존과 같다. 비용은 C_vid + K·C_act로, 명시적 WAM의 K·C_vid + K·C_act보다 훨씬 싸고 잠재 WAM의 C_cur + K·C_act에 가깝다. 훈련에서는 혼합 스케줄을 쓴다. 확률 p=0.5로 미래 비디오 토큰의 플로우 타임 τ를 1로 고정하고, 나머지는 기존 스케줄 S(u)를 따른다. 추론이 읽는 τ=1 지점의 특징을 강화하면서도 나머지 구간에서 비디오 전문가의 감독을 유지한다. 새 모듈이나 손실 항은 추가되지 않는다.

어떻게 쓰나

실험은 LIBERO, RoboTwin 2.0, LIBERO-Plus와 AgileX Aloha 실제 로봇에서 수행된다. 환경 교란 축에서 Simple-WAM은 LIBERO-Plus 일곱 요인 평균 79.5점으로 명시적 WAM 67.7점, 잠재 WAM 53.8점을 앞선다. embodied pretraining이 없는 모델 중 여섯 요인에서 최고이며, 대규모 embodied pretraining을 쓴 π0.5와는 4.9점 차이다. 데이터 효율에서는 LIBERO 5샷 92.4점, 10샷 97.2점, RoboTwin 37.2점을 기록해 명시적 WAM과 비슷했고, 잠재 WAM은 RoboTwin에서 4.8점으로 무너졌다. 작업 일반화에서는 학습에 없던 작업 데이터가 전혀 없을 때 10.1점, 행동 없는 비디오가 있을 때 73.6점으로 명시적 WAM의 6.3점, 69.9점을 앞선다. RoboTwin 대응 수치는 6.2 대 5.4, 44.5 대 47.3이었다. 효율은 행동 청크당 74.7ms로 명시적 WAM 286.9ms보다 3.8배 빠르고, 잠재 WAM 62.0ms와는 12.7ms 차이다.

전제와 한계

실제 로봇 실험에서는 네 작업을 30회씩 평가했다. 분포 내에서는 세 모델이 2.3점 이내로 비슷했지만, 환경 교란에서 잠재 WAM은 25.2점으로 떨어지고 Simple-WAM은 69.2점을 유지했다. 작업당 시연을 50개로 줄였을 때도 Simple-WAM은 69.6점, 잠재 WAM은 37.2점이었다. 학습에서 제외한 Store in Order 작업에서 행동 없는 비디오는 Simple-WAM을 2.2점에서 87.8점으로 끌어올렸고, 명시적 WAM은 68.9점, 잠재 WAM은 10.0점이었다. 절제 실험에서 혼합 스케줄 확률 p는 0.25, 0.5, 0.75가 1.3점 차이로 안정적이었고, p=0과 p=1은 각각 90.8점, 88.6점으로 낮아졌다. 미래 토큰을 학습 가능한 쿼리나 0으로 바꾸면 세 축에서 각각 27.7, 10.2, 86.6점과 22.2, 8.2, 87.4점 하락해, 사전학습과 정렬된 노이즈 토큰 조건화가 중요함을 보였다.

개발자 관점에서 이 논문은 로봇 정책의 추론 비용을 줄일 때 미래 조건화를 통째로 버리는 선택이 분포 내 성능만 보고 안전하지 않다는 경고를 준다. WAM이나 VLA 정책을 경량화하려면 환경 변화, 적은 시연, 미학습 작업에서의 성능을 별도로 확인해야 한다. Simple-WAM 방식은 비디오 사전학습 백본이 있고 미래 토큰을 문맥에 남길 수 있다면, 추가 모듈 없이 한 번의 비디오 전문가 패스와 훈련 스케줄 조정으로 일반화와 지연 시간을 절충할 수 있는 출발점이 된다. 다만 행동 청크 H=32, 청크당 비디오 프레임 9개, K=10 디노이징, CFG 1.0 같은 설정이 전제이므로 자신의 로봇과 센서 구성에서 다시 검증해야 한다.

저자들이 밝힌 한계는 분명하다. 결론은 embodied pretraining 없이 5B 백본으로 얻은 것이며, 더 큰 규모나 embodied pretraining을 쓴 경우에도 성립하는지는 열린 문제다. 또한 통제 비교는 Fast-WAM 아키텍처와 LIBERO, RoboTwin 2.0, LIBERO-Plus, AgileX Aloha의 네 실제 작업에 한정된다. 일반화 세 축과 추론 비용의 관계를 보여주는 강한 실증이지만, 모든 WAM이나 로봇 플랫폼에 그대로 일반화된다고 단정하지는 않는다.