자동회귀 영상 사전학습이 로봇 월드액션 모델의 긴 문맥 활용을 가능하게 한다

Long-WAM: Scaling the Context of World-Action Models

arXiv2610.10528v1

Wei Huang2026-10-07

무엇인가

실시간 로봇 제어는 물체의 위치뿐 아니라 움직임과 작업 진행도를 추론하기 위해 충분한 시각적 이력을 필요로 한다. 그런데 이력을 많이 볼수록 정작 개선하려던 응답이 늦어진다. 이 논문이 던지는 질문은 두 가지다. 월드액션 모델(WAM)의 제어 성능은 시각 문맥 길이에 따라 어떻게 확장되는가, 그리고 그 이득을 실시간 제약 아래에서 어떻게 유지하는가. 저자들은 기존 WAM들이 인과적 캐시나 선택적 메모리로 이력에 '접근'하게 만들지만, 접근과 '이력으로부터 예측하도록 학습하는 것'은 다르다고 지적한다. DreamZero나 LingBot-VA가 양방향 사전학습 영상 생성기를 인과적 제어로 적응시키는 것과 달리, 이들은 먼저 자기회귀(AR) 영상 예측을 학습한 뒤 그 이력-미래 구조를 보존한 채 행동으로 적응시키는 경로를 택한다.

어떻게 동작하나

1단계는 LongLive2.0-Robot이라는 로봇 도메인 AR 영상 사전학습이다. LongLive-2.0의 16초 AR 체크포인트에서 이어서, RoVid-X·AgiBot World·EgoDex·EgoVerse·VITRA에서 약 1만 윈도우 환산 시간을 학습한다. 감독 신호가 영상뿐이라 여러 로봇 형태(embodiment)를 공유 행동 공간 없이 함께 쓸 수 있다. 최대 30초 길이의 로봇 영상 시퀀스를 시퀀스 병렬 AR 학습으로 GPU에 샤딩하고, 블록 인과 어텐션으로 각 노이즈 청크를 정답 프리픽스에서 병렬 감독하는 teacher-forcing 목적식을 쓴다. 조건 이미지는 손실 밖에 두고 깨끗하게 유지하며, SVI에서 온 오류 재활용(error recycling)을 유지한다. 목적식은 노이즈 수준 σ로 섞은 입력에 대해 비디오 속도 예측기가 '노이즈 빼기 데이터'를 맞히도록 하되, 복구 목표는 원본 잠재 z를 유지해 롤아웃 유사 오류를 교정하도록 가르친다.

무엇과 다른가

2단계는 인과-대-인과 월드액션 적응이다. 비디오 전문가와 행동 전문가를 비대칭 인터페이스로 연결하는데, 비디오 쿼리는 자기 자신과 이전 시각 블록만 읽고 행동 토큰은 절대 읽지 않는다. 반대로 행동 쿼리는 관측 이력, 부분적으로 노이즈가 제거된 미래, 그리고 노이즈 상태의 행동 청크 전체를 읽는다. 핵심은 이력-미래 순서가 행동 적응 단계에서 도입되는 게 아니라 영상 사전학습에서 이미 학습된다는 점이다. 추론 시 비디오 전문가는 K_v개의 미래 잠재 스텝을 노이즈 수준 σ*=0.9까지만 롤아웃하고, 그 계층별 키·값 캐시를 행동 전문가에게 넘긴다. 행동 전문가는 그 캐시에 조건화해 행동 청크를 디노이징한다. 저자들은 이 '예측 후 행동(predict-then-act)' 모드를 역동역학 모델링(IDM)이라 부른다. 학습은 두 패스로 진행되며 두 번째 패스에서 시각 캐시를 분리(detach)해 행동 손실이 행동 전문가와 고유수용성 어댑터만 갱신하게 한다. 추론에서는 비디오 4스텝이 깨끗한 영상이 아니라 σ*=0.9에서 멈추고, 미래 잠재는 픽셀로 디코딩되지 않는다.

어떻게 쓰나

배포 인프라는 비동기 실행과 엣지 가속을 공동 설계한다. 추론을 로봇 실행과 겹치되 블렌딩이나 프리픽스 가이던스 없이 순수 비동기로 전환하고, 스트리밍 인과 VAE가 트리거 이전에 들어오는 관측을 미리 인코딩한다. 비디오 전문가의 선형 계층과 KV 프리필에는 W4A4 NVFP4를 적용하지만 행동 연산과 KV 저장은 BF16으로 남긴다. 행동 양자화는 지연 이득이 제한적이고 제어 정밀도를 해칠 수 있기 때문이다. NVFP4에 CUDA Graph 재생과 PyTorch 컴파일을 결합해 커널 런치 오버헤드를 줄이고, 디노이징 불변 텍스트·상태 KV와 관측 비디오 KV, FP32 RoPE 테이블을 호출 내에서 재사용한다. 비디오와 행동 KV 버퍼에 대한 어텐션은 버퍼 연결 없이 온라인 소프트맥스로 정규화를 공유해 병합한다. 결과적으로 RTX 5090에서 관측 VAE 계산과 미래 영상 잠재 예측을 포함한 액션 청크당 107.4ms, DGX Spark 328.2ms, Jetson AGX Thor 378.7ms로 BF16 이저 실행 대비 각각 3.3배·4.1배·3.2배 빨라졌다. Fast-WAM의 244.1ms보다 2.3배 빠르면서 미래 영상까지 예측한다.

전제와 한계

시뮬레이션 결과는 문맥 스케일링의 효과를 정면으로 보여준다. RoboCasa GR-1 Tabletop에서 이력을 0.0초에서 19.2초로 늘리면 성공률이 63.3%에서 78.7%로 오른다. 반면 양방향 사전학습 초기화는 2.4초 61.7%, 9.6초 64.1%, 19.2초 61.6%로 순이득이 없다. 로봇 도메인 AR 모델의 양방향 대비 우위는 이력 없을 때 3.3점에서 19.2초에서 17.1점으로 커진다. LIBERO-Long에서는 2.4초 이력만으로 94.5%에서 99.5%로 오르고, 38.4초에서는 75.2%·74.2%로 떨어지는데 이 윈도우는 평균 학습 궤적 12.1초의 세 배이고 샘플링된 이력 프레임의 80.4%가 패딩이다. 저자들은 이를 내재적 기억 한계가 아니라 이력 커버리지 부족으로 해석한다. 벤치마크별로는 LIBERO에서 IDM 변형이 평균 99.5%(LIBERO-Long 99.5%)로 LingBot-VA를 1.0점, Fast-WAM을 4.3점 앞선다. RoboTwin 2.0은 평균 94.4%, Clean 94.7%, Randomized 94.2%로 ABot-M0.5를 0.3점, LingBot-VA 2.0을 0.8점 앞선다. DOMINO는 34.9% SR과 45.1 MS로 Fast-WAM보다 SR 15.0점, PUMA보다 MS 10.1점 높다. 디노이징 전략 비교에서는 미래 영상 예측 없음(w/o V) 94.5%, 비디오-행동 공동 디노이징(CoD) 97.8%, IDM 99.5%로 LIBERO-Long에서 격차가 가장 크다.

실기 배포도 인상적이다. Unitree G1에서 컨베이어 속도가 3.0에서 7.5cm/s로 올라갈 때 Fast-WAM은 75%에서 0%로, π0.5는 15%에서 0%로 무너지지만 Long-WAM은 100%·100%·95%·90%를 유지한다. 3cm/s로 움직이는 컵을 다른 컵에 쌓는 과제는 20회 중 19회 성공했고 두 베이스라인은 한 번도 성공하지 못했다. YAM에서는 평균 40초 이상 걸리는 과제에서 80%·80%·85%(평균 81.7%)를 기록했다. 비동기 실행에서도 IDM은 동기 대비 0.2%포인트만 잃는 반면 Fast-WAM은 15.4점, LingBot-VA는 45.5점을 잃는다. 계층 시스템 실험에서는 RoboCasa365에서 정책 체크포인트를 바꾸지 않고 GPT-6 Astra 플래너만 붙였을 때 Overall이 31.4%에서 54.4%로 오르고, 플래너 단독 25.2%, π0.5 결합 30.5%와 비교된다. 플래너 추가 이득도 Long-WAM이 23.0%포인트로 π0.5의 13.6%포인트보다 크다.

개발자 관점에서 이 논문의 실용적 메시지는 세 가지다. 첫째, 로봇 정책에 긴 시각 이력을 붙일 계획이라면 사전학습 방식부터 확인해야 한다. 인과적 마스크만 씌운 양방향 백본은 문맥을 늘려도 이득이 나지 않았고, AR 사전학습을 거친 백본만 문맥에 비례해 좋아졌다. 둘째, 미래 영상을 픽셀로 디코딩할 필요가 없다. σ*=0.9에서 멈춘 부분 디노이징 잠재를 캐시로 재사용하는 것만으로 LIBERO-Long에서 5점 차이가 났다. 셋째, 문맥은 공짜가 아니다. 이력을 8배로 늘리면 RTX 5090 지연이 107.4ms에서 341.0ms로 3.2배가 되므로, 비동기 실행·스트리밍 VAE·혼합정밀도 가속을 함께 설계해야 한다.

저자들이 밝힌 전제와 한계도 분명하다. 각 문맥 윈도우는 해당 학습 문맥 길이에서 평가된 별도 학습 모델을 쓰며, 에피소드 초반 이력이 없으면 첫 프레임을 반복한다. 38.4초에서의 성능 하락은 내재적 기억 한계가 아니라 학습 데이터의 이력 커버리지 부족이라는 가설이며 검증되지 않았다. 행동 쪽 양자화는 지연 이득이 제한적이고 제어 정밀도를 해칠 수 있어 의도적으로 BF16을 유지했다. 사전학습 비용도 약 30,720 GPU-시간(64×H100)이고 다운스트림 WAM 학습에 16×GB200을 쓴다는 점은 재현 부담으로 남는다.