미래 프레임 전체 대신 변화만 예측하는 양팔 조작용 월드-액션 모델 DeltaWAM

DeltaWAM: Delta World Action Models for Bimanual Manipulation

HF Daily2609.28811

Han Yan, Zishang Xiang, Haokai Jiang2026-09-23조회 7

무엇인가

이 논문은 로봇 양팔 조작(bimanual manipulation)을 위한 월드-액션 모델(World-Action Model, WAM)의 계산 구조를 다시 설계한다. 기존 WAM은 사전학습된 비디오 생성 모델의 시각·운동 사전지식을 로봇 제어로 옮기기 위해 시각 동역학과 행동을 함께 모델링하는데, 학습 시 미래 프레임을 조밀하게(dense) 예측한다. 저자들은 여기서 두 가지 문제를 지적한다. 첫째, 인접한 조작 관측은 배경·작업공간 기하·대부분의 물체 내용이 거의 변하지 않아 중복이 크고, 행동과 무관한 조명·텍스처·배경 변화 같은 잉여 외관 요인에 월드 모델링 목적이 묶여 버린다. 둘째, Fast-WAM처럼 추론 시 미래 영상 생성을 제거해도 매 제어 주기마다 전체 관측을 무거운 비디오 Diffusion Transformer(DiT)에 통과시켜 레이어별 key-value(KV) 문맥을 만들어야 하며, 행동 디노이징 스텝 수를 줄이면 Action DiT는 가벼워지지만 이 고정 문맥 계산이 병목으로 남는다.

어떻게 동작하나

제안 방법 DeltaWAM은 월드-액션 모델링을 세 개의 토큰 스트림으로 분해한다. 참조 관측을 담는 조밀한 앵커(anchor) 스트림, 인접 관측 사이의 시각적 전이를 담는 희소 델타 스트림, 실행 가능한 제어 청크를 예측하는 행동 스트림이다. 델타 인코더는 두 관측 (o_t, o_t+1)을 하나의 토큰 d_t로 압축하며(논문에서 사용한 두 인코더 모두 N_Δ=1), 궤적은 앵커 하나와 델타 시퀀스로 표현된다. 앵커 네트워크는 사전학습 비디오 생성 백본(Wan2.2-TI2V-5B)에서 초기화하고, 델타 인코더는 동결한다. 학습은 델타와 행동에 각각 독립적인 노이즈와 플로우 타임을 샘플링하는 결합 플로우 매칭 목적으로 수행되며, 최종 손실은 두 항의 가중합이다. 구조는 표현과 계산 공유 방식에 따라 세 가지 변형을 비교한다. Anchor-Shared는 앵커와 델타를 공유 비주얼 백본으로 처리하고 별도 Action DiT가 레이어별 결합 어텐션으로 상호작용한다. Separated는 같은 앵커에 조건화된 독립 Delta DiT와 Action DiT를 쓴다. Action-Shared는 델타와 행동 토큰을 공통 백본에 매핑하되 모달리티별 입출력 헤드를 유지하고, 스트림 고유 구조를 보존하기 위해 Dual-Stream Residual Experts(DRE)를 도입한다. DRE는 공유 블록의 출력에 GELU를 낀 저차원 병목 투영을 스트림별로 더하는 형태다.

무엇과 다른가

Streaming Delta Memory(SDM)는 추론 효율을 위한 장치다. 완전한 관측의 캐시나 윈도우 대신, 참조 앵커와 시간순으로 정렬된 압축 델타 시퀀스로 상호작용 이력을 표현한다. 새 관측이 들어오면 직전 관측과의 전이만 인코딩해 비디오 전문가에 통과시키고, 그 레이어별 키와 값을 기존 메모리에 덧붙이며 과거 항목은 그대로 둔다. 학습 시에는 인과적 어텐션 마스크로 이 재귀적 갱신을 병렬화해, 각 델타가 앵커와 선행 전이만 보고 미래는 보지 못하도록 스트리밍 추론의 의존 구조를 보존한다. 히스토리 길이 h를 샘플링해 다양한 메모리 나이에 노출시키고, 배포 시에는 주기적 참조 갱신으로 앵커가 낡지 않게 하며, 비동기 SDM 업데이트로 행동 실행이 끝나기 전에 다음 관측을 받아 KV를 갱신해 지연을 줄인다(대신 시각적 신선도는 제한적으로 희생된다).

어떻게 쓰나

실험은 RoboTwin 2.0의 처음 10개 과제, 과제당 550개 시연으로 구성되며, 머리 카메라 1대와 손목 카메라 2대를 합친 384×320 해상도, 과제·설정당 100 에피소드로 평가한다. 기본 10 디노이징 스텝 기준으로 DeltaWAM(Anchor-Shared)은 Fast-WAM 대비 패널 (a)에서 깨끗한 설정 86.2%→86.4%, 시각 무작위화 79.0%→82.6%를 기록했고, SDM을 더하면 무작위화 평균이 86.6%로 오르는 대신 깨끗한 설정은 82.8%로 내려간다. 패널 (b)에서는 SDM 결합 시 76.4/72.6%가 88.0/81.2%로 크게 상승해, 두 패널 합산 평균은 Fast-WAM의 81.3/75.8% 대비 85.4/83.9%가 된다. 저자들은 델타 예측과 누적된 전이 문맥이 무작위 텍스처·조명·장면 외관에 대한 강건성을 높인다고 해석한다.

전제와 한계

효율 수치도 구체적이다. 학습 FLOPs는 Fast-WAM 대비 Anchor-Shared 17.78%, Separated 21.79%, Action-Shared 23.77% 감소한다. 샘플당 계산을 분해하면 VAE 인코딩이 85.48%, 비디오 전문가가 49.42% 줄지만, 델타 인코더가 샘플당 3.048 TFLOPs를 추가해 절감분의 일부를 상쇄한다. 단일 스텝 추론에서는 SDM이 시각/참조 KV 계산을 71.97% 줄이고 지연과 추론 FLOPs를 각각 36.57%, 31.55% 낮춘다(델타 인코더가 행동 청크당 0.457 TFLOPs를 더해 전체 절감을 제한한다). 절제 실험에서는 동결 앵커 백본만으로도 깨끗한/무작위화 성공률이 32.6/35.2%에서 59.0/52.6%로 오르고, LoRA 적응을 더하면 80.0/75.4%가 되며, 랭크를 8에서 64로 올리면 무작위화 성능이 70.8%→75.4%로 개선된다. LAM을 DeltaTok으로 교체하면 85.2/80.0%, 잔차 전문가를 마지막 6개 레이어에 두면 깨끗한 성능이 75.2%→80.0%가 된다. SDM은 무작위화 성능을 4.0%p 올리는 대신 깨끗한 성능을 3.6%p 낮춘다.

실세계 평가는 RealMan RM75-6F 두 대로 구성된 양팔 플랫폼에서 상단 카메라 1대와 각 팔의 손목 카메라로 세 시점을 관측하며, Tabletop Organization, Sugar Cube Placement, Bowl Stacking 세 과제에 과제당 100 에피소드를 수집한다. Fast-WAM과 DeltaWAM은 RoboCOIN의 325.7시간 RealMan RMC-AIDA-L 데이터로 50,000 스텝 사전학습 후 과제별 15,000 스텝 미세조정하고, π0.5는 공개 체크포인트에서 직접 미세조정한다. 과제당 20회 시행 결과 DeltaWAM이 60회 시행 전체에서 41.67%로 최고 성공률(π0.5 38.33%, Fast-WAM 35.00%)을, 정규화 진행도 72.14%로 최고값(π0.5 대비 +7.14%p, Fast-WAM 대비 +2.85%p)을 기록했다. 과제별로는 Bowl Stacking에서 두 지표 모두 앞서고 Sugar Cube Placement에서 진행도가 가장 높지만, Tabletop Organization에서는 π0.5가 가장 좋다.

개발자 관점에서 이 논문의 실용적 메시지는 두 가지다. 첫째, 비디오 사전학습 백본을 정책에 붙일 때 미래 프레임을 조밀하게 재구성하는 대신 변화만 표현하면 학습·추론 비용을 줄이면서 시각적 무작위화 강건성을 얻을 수 있다는 점이다. 둘째, 추론 지연이 중요한 few-step 제어에서는 매 주기 전체 관측을 무거운 비디오 전문가에 통과시키는 고정 비용이 지배적이므로, 앵커 문맥을 캐시하고 델타만 증분 갱신하는 SDM 같은 스트리밍 설계가 유효하다. 다만 구조 선택에 따라 결과가 갈린다. 세 변형 중 Anchor-Shared가 성능이 가장 좋고 Action-Shared가 학습 FLOPs 절감이 가장 크며, Separated는 델타 학습의 이점을 충분히 살리지 못했다. 또한 SDM은 무작위화 환경에서 이득이 크고 깨끗한 환경에서는 손해라는 트레이드오프가 있으므로, 배포 환경의 시각 변동성 수준을 먼저 판단해야 한다.

저자들이 명시한 한계는 델타 인코더의 계산 오버헤드다. 학습에서는 샘플당 3.048 TFLOPs, 추론에서는 행동 청크당 0.457 TFLOPs를 추가해 비디오 전문가 절감분의 일부를 상쇄하며, 이것이 현재의 제약이라고 밝힌다. 향후 연구로 더 경량한 델타 인코더를 탐색하겠다고 한다. 그 밖의 전제로, 앵커 백본은 LoRA(랭크 64, α=128)로만 적응되고 델타 인코더·비디오 VAE·텍스트 인코더는 동결되며, 비동기 SDM 업데이트는 지연을 줄이는 대신 제한된 시각적 staleness를 감수한다. 실세계 결과는 세 과제 60회 시행 규모이고 Tabletop Organization에서는 π0.5에 뒤진다는 점도 함께 봐야 한다.

관련 논문