미래 영상 대신 구조화된 로봇 모션으로 미래를 명시적으로 예측하는 효율적 World Action Model
MoWAM: Explicit Future Motion Prediction for Efficient World Action Models
무엇인가
Vision-Language-Action 모델은 관측과 지시를 바로 저수준 행동으로 매핑하지만, 그 행동이 장면을 어떻게 바꿀지는 명시적으로 다루지 않는다. World Action Model(WAM)은 미래 동역학을 정책 학습에 넣어 이 한계를 보완하는데, 기존 방식은 추론 시 미래 영상을 실제로 생성하거나(Motus, DreamZero, LingBot-VA, Joint-WAM, IDM-WAM 등), 아예 미래 생성을 제거하고 관측 특징에 미래 동역학을 암묵적으로 남긴다(Fast-WAM). 전자는 계산과 메모리 오버헤드가 크고, 후자는 분포 이동 상황에서 성능이 눈에 띄게 떨어진다. 논문은 이 지점에서 질문을 던진다. 완전한 미래 영상을 생성하는 비용을 치르지 않으면서도 추론 시점에 명시적 미래 예측을 유지할 수 있는가.
어떻게 동작하나
MoWAM의 답은 미래 영상 대신 구조화된 로봇 모션을 미래의 압축 표현으로 쓰는 것이다. 로봇 조작에서 제어에 중요한 정보는 미래 장면의 전체 외형보다 로봇이 어떻게 움직일지에 더 잘 반영된다는 것이 핵심 통찰이다. 카메라 뷰 j, 미래 시점 t에 대해 왼쪽 손끝 p_t,l^j, 오른쪽 손끝 p_t,r^j, 손바닥 p_t,p^j의 이미지 투영 좌표를 잡고, 그로부터 그리퍼 중심 c_t^j = (p_t,l^j + p_t,r^j)/2, 손끝 간격 s_t^j = p_t,r^j - p_t,l^j, 손바닥 상대 오프셋 r_t^j = p_t,p^j - c_t^j를 정의한다. 동역학 성분은 연속 시점 간 변화 m_dyn,t^j = [c_t^j - c_{t-1}^j; s_t^j - s_{t-1}^j; r_t^j - r_{t-1}^j] ∈ R^6, 구조 성분은 m_str,t^j = [s_t^j; r_t^j] ∈ R^4이며, 둘을 합쳐 m = (m_dyn, m_str)로 쓴다. 중요한 전제는 이 모션이 행동 명령을 이미지에 단순 투영한 것이 아니라, 현재 장면과 상호작용 제약 아래에서 그 행동이 수행될 때 로봇이 어떻게 움직일지를 예측한다는 점이다.
무엇과 다른가
구현은 Mixture-of-Transformer 구조다. Video Transformer G_θ는 학습 중 미래 영상 프레임의 노이즈를 제거하며 장면 동역학을 배우고, Action-Motion Transformer G_ϕ는 행동 청크 a_1:H와 모션 m_1:H를 함께 예측한다. 두 브랜치 모두 현재 관측과 언어 지시에 조건화되지만, 행동과 모션 생성은 생성된 미래 프레임에 의존하지 않는다. Action-Motion Transformer의 어텐션은 H'_am = Attn(Q_am, [K_obv^θ; K_am], [V_obv^θ; V_am]) 형태로, 행동과 모션 토큰이 같은 어텐션 안에서 정보를 교환하면서 Video Transformer가 만든 관측 표현의 키와 값 KV_obv^θ = (K_obv^θ, V_obv^θ)에 직접 접근한다. 같은 관측과 지시에 대해 여러 그럴듯한 미래 모션이 가능하므로 모션은 flow matching으로 조건부 분포로 모델링한다. 학습 목표는 p_θ(v | z_obv, ℓ) · p_ϕ(a_1:H, m_1:H | h_obv^θ, ℓ, s)이고, 추론 시에는 Video Transformer를 한 번만 통과해 KV_obv^θ를 얻고 미래 영상은 전혀 생성하지 않는다. 행동과 모션은 랜덤 노이즈에서 시작해 함께 디노이징되고, 행동 청크는 Action Decoder로 실행 가능한 제어 명령으로 변환된다.
어떻게 쓰나
모션 표현이 작기 때문에 추론 시점 확장이 실용적이 된다. 같은 관측과 지시에 대해 행동-모션 쌍을 여러 개 샘플링하고, 검증기 s_ψ(I, ℓ, m)가 각 후보를 점수화해 가장 높은 것을 실행한다. 검증기는 성공 시연의 모션 m+를 교란한 m-보다 선호하도록 순위 학습되며, 손실은 L_rank = E[max(0, γ - s_ψ(I,ℓ,m+) + s_ψ(I,ℓ,m-))]이다. 음성 샘플은 모션 변화 축소, 완만한 공간 이동 추가, 후반부 잘라내기(조기 종료 모사)로 만든다. 즉 모션은 행동 생성을 위한 미래 표현인 동시에, 서로 다른 행동의 미래 결과를 비교하는 구조적 신호로도 쓰인다.
전제와 한계
실험은 LIBERO(4개 스위트, 각 10개 과제, 과제당 50회 롤아웃), 분포 이동 벤치마크 LIBERO-Plus(7종 이동 유형별 100개 인스턴스, 총 700개 OOD 과제), Franka Research 3 실기 조작(Pick Banana, Close Drawer, Stack Bowls, 과제당 100개 시연과 20회 평가)에서 수행됐다. 베이스는 Wan2.2-5B, 히든 차원 1024, 행동과 모션 지평 32, 비디오는 4배 다운샘플링해 청크당 9프레임, 4대의 A100에서 20000 스텝 학습, 추론은 10 디노이징 스텝에 CFG=1.0이다. LIBERO에서 MoWAM은 embodied pretraining 없이 평균 98.9%로 Fast-WAM을 2.4%p 앞섰고 LaWAM보다 2.5%p 높았다. LIBERO-Plus에서는 평균 81.43%로 Motus(76.00)를 5.43%p, LaWAM(78.43)을 3.0%p, Fast-WAM(70.43)을 11.0%p 앞섰으며 추가 지연은 33.4ms에 불과했다. 밀집 미래 영상을 생성하는 Joint-WAM(80.57)과 IDM-WAM(80.14)과 비슷한 평균을 내면서 지연은 766.3ms, 995.4ms에서 293.5ms로 줄였다. Initial과 Sensor 이동에서 Fast-WAM 대비 각각 12%p, 14%p 향상됐고 Light, Objects, Background에서는 밀집 미래 베이스라인과 동등하거나 앞섰다. 실기에서는 평균 80% 성공률로 Fast-WAM보다 35%p 높으면서 지연은 33.4ms만 늘었고, Motus 대비 1621.9ms를 293.5ms로 줄이면서 평균 성공률은 더 높았다. 후보 수를 1에서 4, 8로 늘리면 Pick Banana 성공률이 65%에서 75%, 80%로 올랐고, MoWAM은 8개 후보를 만드는 데 밀집 미래 방식이 1개 후보를 만드는 시간보다 적게 걸렸다(IDM-WAM은 K=32에서 메모리 부족).
절제 실험은 모션 감독의 두 축이 모두 유효함을 보인다. 동역학 손실을 빼면 76.0%에서 69.14%로, 구조 손실을 빼면 73.71%로 떨어졌다. Video DiT를 동결하고 사전학습 비디오 모델의 관측 특징만 쓰면 모션 모델링을 유지해도 76.0%에서 33.1%로 급락했는데, 이는 미래 영상 학습 없이 모션만 남긴 65.7%보다도 낮다. 즉 학습 시점의 미래 영상 예측은 장면 수준 감독과 사전학습 비디오 사전지식을 제공하는 별개 역할을 하고, 모션은 추론 시점의 압축된 명시적 미래 표현 역할을 한다. 행동 토큰이 모션 토큰을 보지 못하게 하면 70.86%로, 모션 자체를 쓰지 않은 65.71%보다는 낫지만 전체 76%에는 못 미친다. 예측 모션의 정확도도 검증됐다. 실제 실행 궤적과 비교한 ADE가 ID 5.63, OOD 9.38로, 행동을 시뮬레이터 스케일로 투영한 Action-Proj.(77.56, 63.86)보다 오차를 각각 92.75%, 85.31% 줄였다.
실무 관점에서 이 논문이 주는 신호는 명확하다. 로봇 정책에 미래 예측을 넣고 싶지만 미래 영상 생성을 감당할 수 없는 환경이라면, 미래 영상 대신 엔드이펙터 키포인트 기반 모션을 명시적 미래 표현으로 쓰는 선택지가 있다. 특히 학습 파이프라인은 그대로 두고 추론에서만 비디오 생성을 제거하는 구조라, 이미 비디오 사전학습 모델(Wan2.2-5B)을 쓰는 팀이면 Video Transformer를 학습 시점 감독으로만 활용하고 Action-Motion 브랜치를 추가하는 형태로 접근할 수 있다. 추론 예산이 남는다면 후보를 여러 개 샘플링하고 검증기로 고르는 방식이 지연 증가 대비 성능 이득이 크다는 점도 확인해야 할 부분이다. 다만 모션 표현은 카메라 파라미터와 엔드이펙터 키포인트 정의에 의존하므로, 자기 로봇의 키포인트 투영과 그리퍼 기하를 어떻게 정의할지가 재현의 핵심 변수다.
저자들이 밝힌 한계는 분명하다. 구조화된 모션은 완전한 미래 영상 생성과 모든 면에서 등가가 아니다. LIBERO-Plus에서 MoWAM은 Initial과 Camera 이동에서 Fast-WAM을 앞서지만, 최고 밀집 미래 결과(Joint-WAM, IDM-WAM)보다 각각 5%p, 8%p 낮다. 즉 특정 이동 유형에서는 장면 외형 변화에 대한 정보가 여전히 필요할 수 있다. 또한 모션은 로봇의 미래 움직임만 담기 때문에, 학습 시점의 미래 영상 모델링이 빠지면 성능이 33.1%까지 무너진다는 절제 결과가 보여주듯 장면 진화 학습 자체를 모션이 대체하지는 못한다. 실기 평가도 과제 3종, 과제당 20회 시행 규모이며, 검증기는 성공 시연에서 만든 교란 음성 샘플에 의존한다.
관련 논문
- 미래 프레임 전체 대신 변화만 예측하는 양팔 조작용 월드-액션 모델 DeltaWAM로봇 조작용 월드-액션 모델이 미래 프레임을 통째로 예측하던 방식을 앵커와 희소 델타로 재구성하고, 스트리밍 델타 메모리로 추론 비용을 줄인 DeltaWAM을 정리한다. RoboTwin과 실세계 양팔 조작에서 성공률과 계산 효율을 함께 개선한 결과를 다룬다.
- 재계획 주기에 디노이징을 분산하는 로봇 월드액션모델 Rolling-WAM영상 예측과 행동 생성을 함께 디노이징하는 World Action Model의 지연을 줄이기 위해, 슬라이딩 윈도우로 디노이징을 여러 재계획 주기에 분산하는 Rolling-WAM을 제안한다. LIBERO 98.1%, RoboTwin 93.3% 성공률을 유지하면서 재계획 지연을 4.5배 단축했다.
- 관절 궤적 조건 자기회귀 확산 모델로 로봇 시뮬레이션을 스트리밍 생성하는 UranusUranus는 미래 관절 위치 궤적을 조건으로 다중 시점 로봇 영상을 자기회귀 확산으로 스트리밍 생성하는 데이터 기반 시뮬레이터다. 24 FPS 추론과 RoboTwin 정책 평가 상관계수 0.98을 보고하지만 접촉·물체 상태 변화는 한계로 남는다.