재계획 주기에 디노이징을 분산하는 로봇 월드액션모델 Rolling-WAM

Rolling-WAM: World Action Models with Rolling Imagination

arXiv2609.30247v1

Yinghua Zhou2026-09-24조회 21

무엇인가

World Action Model(WAM)은 로봇 조작에서 행동 생성과 미래 영상 예측을 결합한다. 문제는 폐루프 제어가 매 재계획 주기마다 최신 관측으로 다시 계획해야 한다는 점이다. 표준 WAM의 결합 디노이징 샘플러는 매 주기마다 전체 예측 지평을 순수 노이즈에서 깨끗한 데이터까지 다시 처리하므로, 반복적인 모델 평가가 비싸지고 추론 지연이 행동 갱신을 늦춰 폐루프 반응성이 떨어진다. 테스트 시 미래 영상 생성을 아예 생략하는 방법도 있지만, 행동 생성을 안내할 명시적 시각 예측을 잃는다. 저자들의 지적은 더 근본적이다. 기존 청크 기반 샘플러는 실행되지 않고 버려질 뒷부분까지 매번 처음부터 완전히 디노이징한다는 것이다.

어떻게 동작하나

Rolling-WAM은 이 계산을 연속된 재계획 주기에 걸쳐 분산한다. 예측 윈도우를 시간적으로 정렬된 W개의 영상-행동 청크로 나누고, 미래로 갈수록 노이즈 수준이 높아지는 슬라이딩 윈도우를 유지한다. 롤링 모드에서 청크 j의 노이즈 수준은 σ_j(τ)=σ((j-1+τ)/W)로 정의되며, τ는 1에서 0으로 감소한다. 이 정의의 핵심은 σ_{j+1}(0)=σ_j(1)이라는 성질로, 첫 청크가 실행되어 윈도우에서 빠져나가면 남은 청크들이 이미 다음 위치의 시작 노이즈 수준에 놓여 있다는 뜻이다. 에피소드 시작 시에는 부분 디노이징된 예측이 없으므로 σ_j(τ)=σ(min{1, τ+(j-1)/W})로 전체 윈도우를 가우시안 노이즈에서 초기화하고, 가까운 청크부터 먼저 디노이징을 시작한다.

무엇과 다른가

각 청크는 총 N번의 디노이징 스텝을 거치지만, 그 계산이 여러 재계획 주기에 나뉜다. 초기화 모드에서는 스텝당 Δτ=-1/N로 N스텝이 필요하고, 이후 정상 상태 주기에서는 Δτ=-W/N로 N/W스텝만에 다음 실행 가능한 청크를 만든다. 각 스텝에서 모델은 윈도우 전체의 영상·행동 예측을 오일러 업데이트로 함께 갱신한다. 첫 청크가 깨끗해지면 로봇이 그 K개 행동을 실행하고, 윈도우는 한 칸 밀려 실행된 청크를 버리고 남은 예측을 유지한 채 가우시안 노이즈로 초기화된 새 청크를 뒤에 붙인다. 구조적으로는 사전학습된 비디오 Diffusion Transformer(Wan2.2-TI2V-5B)와 약 1B 파라미터의 경량 행동 Transformer를 Mixture-of-Transformers로 묶고, 마스크된 결합 어텐션으로 두 전문가를 연결한다. 어텐션 마스크상 모든 행동 청크는 윈도우 전체의 시각 특징을 참조하지만, 행동-행동 어텐션은 같은 청크 내부로 제한되고 비디오 토큰은 행동 토큰을 참조하지 않는다. 학습은 플로우 매칭으로 하며, 롤링 모드와 초기화 모드를 0.8/0.2 확률로 섞고 순수 노이즈로 고정된 초기화 청크는 활동 마스크로 손실에서 제외한다.

어떻게 쓰나

기본 설정은 청크당 N=10 디노이징 스텝, 윈도우 W=5, 청크당 K=16 행동이라 정상 상태 재계획 주기당 2스텝만 쓴다. LIBERO에서 평균 98.1% 성공률로, 공동 선두인 LingBot-VA와 Joint-WAM(각 98.5%)에 0.4%포인트 뒤지고 Motus(97.7%), Fast-WAM(97.6%)보다 앞선다. RoboTwin 2.0에서는 clean 93.5%, randomized 93.0%, 평균 93.3%로 LingBot-VA(92.2%), Fast-WAM(91.8%), Joint-WAM(90.6%)을 앞선다. 실물 Unitree G1 휴머노이드 세 과제에서는 평균 85.0%로 Joint-WAM(78.3%), Fast-WAM(75.0%)보다 높았고, 과제별로는 Doll Placement 85%, Plate Stacking 100%, Bead Pouring 70%였다.

전제와 한계

지연 시간은 단일 A100, RoboTwin 2.0 설정(384×320), 주기당 16행동 실행 기준으로 측정됐다. Rolling-WAM은 215ms로 Joint-WAM 978ms 대비 약 4.5배, Fast-WAM 548ms 대비 약 2.5배 빠르다. 비교군 VLA인 π0.5는 296ms, GR00T N1.7은 285ms로, Rolling-WAM은 미래 영상 생성을 유지하면서도 이들보다 주기당 시간이 짧다. 게다가 Rolling-WAM은 80행동 예측 윈도우를 유지하는 반면 베이스라인은 16행동만 예측한다. 이 수치는 torch.compile, TensorRT, 커스텀 CUDA 커널 없이 얻은 것이다. 윈도우 크기를 1~8로 바꾼 실험에서도 W=5일 때 322ms로 Fast-WAM 832ms, Joint-WAM 1529ms 대비 각각 2.58배, 4.75배 빨랐고 W=6~8에서는 지연 곡선이 평탄해졌다. 절제 실험에서는 윈도우가 클수록 좋은 것이 아니라 W=5가 78.2%로 W=3(77.3%), W=8(69.5%)보다 나았고, 청크 간 직접 행동 어텐션을 허용하면 RoboTwin 76.3%, LIBERO 97.9%로 오히려 떨어졌다.

실무 관점에서 이 논문은 미래 예측을 포기하지 않고도 실시간성을 확보하는 한 가지 설계 패턴을 제시한다. 미래 영상 디노이징을 통째로 제거하거나 캐시하는 대신, 실행되지 않을 뒷부분의 계산을 다음 주기로 이월하는 방식이다. 따라서 로봇 정책 서빙에서 재계획 주기 지연이 병목일 때, 그리고 미래 시각 예측이 행동 품질에 기여한다고 판단될 때 우선 검토할 만하다. 다만 윈도우 크기 W, 청크 크기 K, 총 스텝 N, 노이즈 스케줄 ρ=5 같은 값이 성능과 지연을 동시에 좌우하므로, 자신의 제어 주파수와 과제 동역학에 맞춰 재튜닝해야 한다. 또한 이 기법은 다른 WAM 효율화 기법과 직교적이라 조합할 수 있다고 저자들은 밝힌다.

저자들이 명시한 한계도 분명하다. 윈도우와 청크 크기 같은 설계 선택은 동역학과 제어 주파수가 다른 과제 전반에 걸쳐 더 탐구될 필요가 있다. 관측 피드백이 있음에도 유지된 예측이 빠른 장면 변화를 따라가지 못해 행동 생성을 잘못 인도할 수 있고, 특히 긴 윈도우에서 이 위험이 커진다. 향후 방향으로 적응적 윈도우 관리와 비동기 실행을 제안한다.

관련 논문