재계획 주기에 디노이징을 분산하는 로봇 월드액션모델 Rolling-WAM
Rolling-WAM: World Action Models with Rolling Imagination
무엇인가
World Action Model(WAM)은 로봇 조작에서 행동 생성과 미래 영상 예측을 결합한다. 문제는 폐루프 제어가 매 재계획 주기마다 최신 관측으로 다시 계획해야 한다는 점이다. 표준 WAM의 결합 디노이징 샘플러는 매 주기마다 전체 예측 지평을 순수 노이즈에서 깨끗한 데이터까지 다시 처리하므로, 반복적인 모델 평가가 비싸지고 추론 지연이 행동 갱신을 늦춰 폐루프 반응성이 떨어진다. 테스트 시 미래 영상 생성을 아예 생략하는 방법도 있지만, 행동 생성을 안내할 명시적 시각 예측을 잃는다. 저자들의 지적은 더 근본적이다. 기존 청크 기반 샘플러는 실행되지 않고 버려질 뒷부분까지 매번 처음부터 완전히 디노이징한다는 것이다.
어떻게 동작하나
Rolling-WAM은 이 계산을 연속된 재계획 주기에 걸쳐 분산한다. 예측 윈도우를 시간적으로 정렬된 W개의 영상-행동 청크로 나누고, 미래로 갈수록 노이즈 수준이 높아지는 슬라이딩 윈도우를 유지한다. 롤링 모드에서 청크 j의 노이즈 수준은 σ_j(τ)=σ((j-1+τ)/W)로 정의되며, τ는 1에서 0으로 감소한다. 이 정의의 핵심은 σ_{j+1}(0)=σ_j(1)이라는 성질로, 첫 청크가 실행되어 윈도우에서 빠져나가면 남은 청크들이 이미 다음 위치의 시작 노이즈 수준에 놓여 있다는 뜻이다. 에피소드 시작 시에는 부분 디노이징된 예측이 없으므로 σ_j(τ)=σ(min{1, τ+(j-1)/W})로 전체 윈도우를 가우시안 노이즈에서 초기화하고, 가까운 청크부터 먼저 디노이징을 시작한다.
무엇과 다른가
각 청크는 총 N번의 디노이징 스텝을 거치지만, 그 계산이 여러 재계획 주기에 나뉜다. 초기화 모드에서는 스텝당 Δτ=-1/N로 N스텝이 필요하고, 이후 정상 상태 주기에서는 Δτ=-W/N로 N/W스텝만에 다음 실행 가능한 청크를 만든다. 각 스텝에서 모델은 윈도우 전체의 영상·행동 예측을 오일러 업데이트로 함께 갱신한다. 첫 청크가 깨끗해지면 로봇이 그 K개 행동을 실행하고, 윈도우는 한 칸 밀려 실행된 청크를 버리고 남은 예측을 유지한 채 가우시안 노이즈로 초기화된 새 청크를 뒤에 붙인다. 구조적으로는 사전학습된 비디오 Diffusion Transformer(Wan2.2-TI2V-5B)와 약 1B 파라미터의 경량 행동 Transformer를 Mixture-of-Transformers로 묶고, 마스크된 결합 어텐션으로 두 전문가를 연결한다. 어텐션 마스크상 모든 행동 청크는 윈도우 전체의 시각 특징을 참조하지만, 행동-행동 어텐션은 같은 청크 내부로 제한되고 비디오 토큰은 행동 토큰을 참조하지 않는다. 학습은 플로우 매칭으로 하며, 롤링 모드와 초기화 모드를 0.8/0.2 확률로 섞고 순수 노이즈로 고정된 초기화 청크는 활동 마스크로 손실에서 제외한다.
어떻게 쓰나
기본 설정은 청크당 N=10 디노이징 스텝, 윈도우 W=5, 청크당 K=16 행동이라 정상 상태 재계획 주기당 2스텝만 쓴다. LIBERO에서 평균 98.1% 성공률로, 공동 선두인 LingBot-VA와 Joint-WAM(각 98.5%)에 0.4%포인트 뒤지고 Motus(97.7%), Fast-WAM(97.6%)보다 앞선다. RoboTwin 2.0에서는 clean 93.5%, randomized 93.0%, 평균 93.3%로 LingBot-VA(92.2%), Fast-WAM(91.8%), Joint-WAM(90.6%)을 앞선다. 실물 Unitree G1 휴머노이드 세 과제에서는 평균 85.0%로 Joint-WAM(78.3%), Fast-WAM(75.0%)보다 높았고, 과제별로는 Doll Placement 85%, Plate Stacking 100%, Bead Pouring 70%였다.
전제와 한계
지연 시간은 단일 A100, RoboTwin 2.0 설정(384×320), 주기당 16행동 실행 기준으로 측정됐다. Rolling-WAM은 215ms로 Joint-WAM 978ms 대비 약 4.5배, Fast-WAM 548ms 대비 약 2.5배 빠르다. 비교군 VLA인 π0.5는 296ms, GR00T N1.7은 285ms로, Rolling-WAM은 미래 영상 생성을 유지하면서도 이들보다 주기당 시간이 짧다. 게다가 Rolling-WAM은 80행동 예측 윈도우를 유지하는 반면 베이스라인은 16행동만 예측한다. 이 수치는 torch.compile, TensorRT, 커스텀 CUDA 커널 없이 얻은 것이다. 윈도우 크기를 1~8로 바꾼 실험에서도 W=5일 때 322ms로 Fast-WAM 832ms, Joint-WAM 1529ms 대비 각각 2.58배, 4.75배 빨랐고 W=6~8에서는 지연 곡선이 평탄해졌다. 절제 실험에서는 윈도우가 클수록 좋은 것이 아니라 W=5가 78.2%로 W=3(77.3%), W=8(69.5%)보다 나았고, 청크 간 직접 행동 어텐션을 허용하면 RoboTwin 76.3%, LIBERO 97.9%로 오히려 떨어졌다.
실무 관점에서 이 논문은 미래 예측을 포기하지 않고도 실시간성을 확보하는 한 가지 설계 패턴을 제시한다. 미래 영상 디노이징을 통째로 제거하거나 캐시하는 대신, 실행되지 않을 뒷부분의 계산을 다음 주기로 이월하는 방식이다. 따라서 로봇 정책 서빙에서 재계획 주기 지연이 병목일 때, 그리고 미래 시각 예측이 행동 품질에 기여한다고 판단될 때 우선 검토할 만하다. 다만 윈도우 크기 W, 청크 크기 K, 총 스텝 N, 노이즈 스케줄 ρ=5 같은 값이 성능과 지연을 동시에 좌우하므로, 자신의 제어 주파수와 과제 동역학에 맞춰 재튜닝해야 한다. 또한 이 기법은 다른 WAM 효율화 기법과 직교적이라 조합할 수 있다고 저자들은 밝힌다.
저자들이 명시한 한계도 분명하다. 윈도우와 청크 크기 같은 설계 선택은 동역학과 제어 주파수가 다른 과제 전반에 걸쳐 더 탐구될 필요가 있다. 관측 피드백이 있음에도 유지된 예측이 빠른 장면 변화를 따라가지 못해 행동 생성을 잘못 인도할 수 있고, 특히 긴 윈도우에서 이 위험이 커진다. 향후 방향으로 적응적 윈도우 관리와 비동기 실행을 제안한다.
관련 논문
- VLM을 로봇 파일럿으로 쓰는 시각 행동 워크스페이스, LIBERO-Pro 평균 75.6% 달성범용 VLM을 재학습 없이 로봇 파일럿으로 쓰는 다중 에이전트 하네스 WAA를 제안한다. 상호작용 중심 Contact view와 실행 전 행동 리허설, 뷰 내 보정을 갖춘 시각 행동 워크스페이스로 LIBERO-Pro 평균 75.6%를 달성하고 robosuite로 전이됐다.
- 미래 영상 대신 구조화된 로봇 모션으로 미래를 명시적으로 예측하는 효율적 World Action ModelMoWAM은 월드 액션 모델에서 추론 시 미래 영상을 직접 생성하는 대신 미래 모션을 명시적으로 예측해 계산 비용을 줄인다. 미래 동역학을 관측 특징에 암묵적으로만 담아 두는 방식의 분포 이동 취약성도 함께 겨냥한다.
- 장기 상상과 실시간 손 조작을 비동기 확산으로 분리한 LiMA장기 예측과 빠른 반응 제어를 분리한 비동기 이중 시스템 생성 프레임워크 LiMA를 제안한다. 느린 시스템이 의도를, 빠른 시스템이 고주기 동작을 맡아 추론 지연을 45.8% 줄이고 양팔 조작 6개 과제에서 70.8% 성공률을 기록했다.
- 예측을 행동으로 잇는 비동기 물리 세계 모델 InternW0상하이 AI 연구소가 공개한 InternW0는 비디오 예측과 로봇 제어를 비대칭 구조로 함께 학습하는 기반 물리 세계 모델이다. 7,200시간 데이터로 학습해 15단계 화학 합성과 힘 인식 조작 과제까지 평가한다.
- 관절 궤적 조건 자기회귀 확산 모델로 로봇 시뮬레이션을 스트리밍 생성하는 UranusUranus는 미래 관절 위치 궤적을 조건으로 다중 시점 로봇 영상을 자기회귀 확산으로 스트리밍 생성하는 데이터 기반 시뮬레이터다. 24 FPS 추론과 RoboTwin 정책 평가 상관계수 0.98을 보고하지만 접촉·물체 상태 변화는 한계로 남는다.