UniWAM이 VLM 추론과 월드모델 동역학을 한 구조로 묶는다

UniWAM: Unified World-Action Model

HF Daily2610.02054

Jiayi Chen, Wenxuan Song, Jingbo Wang2026-10-01

무엇인가

로봇 파운데이션 모델은 두 갈래로 발전해 왔다. VLM 위에 액션 헤드를 얹은 VLA는 대규모 사전학습에서 얻은 의미 이해와 추론을 활용하지만, 액션만으로 감독하면 세계 동역학에 대한 접지가 약하다. 반대로 비디오 생성 모델을 백본으로 쓰는 World-Action Model(WAM)은 다음 프레임 예측을 통해 시공간 사전지식을 물려받지만, 분포 이동(OOD) 상황에서의 의미 이해와 복잡한 과제 추론이 제한적이다. UniWAM은 이 둘을 어떻게 결합할 것인가라는 질문에서 출발해, VLM 기반 물리 추론기(physical reasoner), VGM 기반 월드 생성기(world generator), 액션 예측기(action predictor)를 단일 아키텍처에 통합한다.

어떻게 동작하나

구조는 Mixture-of-Transformers(MoT)다. 세 전문가가 각자 정규화와, 비디오·액션의 경우 타임스텝 변조를 거친 뒤 공통 어텐션 공간으로 투영되고, 헤드별로 Q=[Q_v;Q_a;Q_u] 순서로 토큰 차원을 따라 연결해 joint attention을 수행한다. 출력은 모달리티별로 다시 분할돼 전문가별 투영·잔차·FFN을 통과한다. 이 반복적 상호작용 덕분에 액션 토큰이 의미적 맥락과 진화하는 시각 예측을 함께 참조할 수 있다. 모델이 학습하는 것은 언어 출력 y, 미래 관측 o_{t+1:t+h}, 액션 a_{t+1:t+h}의 결합분포다. 물리 추론기는 Qwen3-VL-2B-Instruct를, 월드 생성기는 Wan2.2-TI2V-5B 백본을 사용해 동결된 오토인코더 잠재 공간에서 미래 비주얼 플로우를 예측하며, 액션 예측기는 연속 플로우 필드를 예측한다.

무엇과 다른가

사전학습의 핵심 설계는 세 가지다. 첫째, 저수준 로봇 액션을 자연어로 표현하는 물리 언어 감독이다. 고정 좌표 규약과 구조화된 템플릿으로 엔드이펙터 움직임을 결정론적 문장으로 기술하고, VLM이 이를 자기회귀적으로 예측하도록 하며 손실은 답변 토큰에만 계산한다. 이렇게 하면 액션 감독이 VLM의 사전학습 입출력 분포와 정렬돼 언어 능력을 보존하면서 체화 지식을 습득할 수 있다. 둘째, 이질적 데이터에 대한 보완적 감독 배분이다. VQA 데이터는 VLM만 감독해 사전학습 지식을 유지시키고, 인간 자기중심(egocentric) 데이터는 VLM과 VGM을 감독하되 정밀도 낮은 액션 라벨은 쓰지 않으며, 로봇 데이터는 VLM·VGM·액션 예측기 모두를 감독한다. 셋째, 데이터 품질 관리다. 로봇 데이터에는 중앙값 필터와 Savitzky–Golay 스무딩 기반 급격 전이 탐지, 상태-액션 시계열 일관성(상호상관으로 지연 보정), 분위수 기반 이상치 제거, 순기구학 기반 관절-EEF 일관성 검사, 좌표계 정렬, 시각적 유효성 검사를 적용한다. 인간 데이터는 약 5,000시간(EgoDex, EgoVerse, VITRA) 규모로, EgoDex에는 VLM 기반 EgoANT 파이프라인을 붙여 0.5초 간격 프레임의 콘택트 시트로 조대 경계를 잡고 국소 윈도우에서 세분화한 뒤 여러 후보 설명을 LLM 선택기로 골라 원자적 조작 단위로 주석한다. 로봇 데이터는 약 4,363시간이다.

어떻게 쓰나

사후학습에서는 미래 시각 노이즈 증강과 히스토리 조건부 플로우 매칭을 도입한다. 전자는 조건 프레임은 깨끗하게 두고 미래 시각 잠재만 부분 교란해, 액션 전문가가 정밀한 미래 예측에 의존하지 않고 거친 시각 표현에서 제어 관련 의미를 뽑아내도록 만든다. 후자는 액션 히스토리를 고차원 잠재로 인코딩해 플로우 매칭 초기값으로 쓰는 것으로, 과거 운동 정보가 미래 궤적 생성을 안내하게 한다. 두 설계를 합쳐 디노이징 스텝 수를 크게 줄이면서 성능을 유지한다.

전제와 한계

실험 결과는 다음과 같다. LIBERO에서 평균 성공률 99.2%로 이전 최고 베이스라인 Xiaomi-Robotics-0를 0.5%p 앞선다. RoboTwin 2.0 Clean2Clean에서는 75.14%다. OOD 벤치마크 LIBERO-Plus에서 전체 92.6%로 나열된 방법 중 최고이며, 로봇 89.5%, 언어 92.2%, 조명 97.9%, 배경 97.6%에서도 최고 수치다. RoboTwin 2.0 Clean2Rand에서는 68.32%로, C2C 대비 하락폭이 6.82%p에 그친다(π0.5는 24.70%p, Spatial Forcing은 50.46%p). 실물 실험은 AgileX Piper 듀얼암(팔당 6-DoF, 손목 카메라와 서드퍼슨 카메라), 최대 18개 객체, 과제당 200개 시연, 8×H100에서 80K 스텝으로 Motus·π0.5와 비교했다. 지시 따르기 4개 과제 평균 성공률 67.5%, 지시 준수율(IFR) 82.5%로 π0.5를 각각 13.1%p, 21.9%p 앞선다. Diverse-Interaction에서는 성공률 40.0%에서 72.5%로, IFR은 50.0%에서 80.0%로 오른다. 6단계 마일스톤으로 채점하는 장기 과제(Task Progress 0~6)에서는 평균 5.0으로 π0.5의 4.8, Motus의 3.2를 앞선다.

스케일링과 절제 실험도 제시된다. 로봇 데이터 250·500·1k·2.5k·5k 시간으로 사전학습한 결과 평균 과제 완료율이 0.35에서 0.67로 단조 증가했고 포화 징후는 없었다. 인간 데이터는 1k 시간 미만에서는 오히려 성능을 떨어뜨리다가 1k 시간 이후부터 이득을 준다. 수렴 검증 손실은 L(D) ≈ 0.03205 − 0.00302 ln(D), R² ≈ 0.983의 로그선형 법칙을 따르며, 이 오프라인 추세가 실제 로봇 성능 향상과 같이 움직인다. 절제에서는 로봇 단독 사전학습이 평균 46.23%에서 67.53%로 오르고, 인간 데이터를 더하면 C2C 72.30%에서 75.12%, C2R 62.76%에서 67.56%, 평균 71.34%가 되며, 여기에 VQA를 더하면 C2C 75.14%, C2R 68.32%, 평균 71.73%로 가장 높다. VLM 학습 전략을 누적 절제하면 추론기 동결 해제가 42.61%에서 46.49%, 물리 언어 감독 추가가 51.74%, 사전학습 추가가 71.34%다. 액션 생성은 노이즈→액션(N2A)보다 액션→액션(A2A) 초기화가 평균 64.80%에서 69.73%로 우수하고, 미래 시각 증강을 더하면 71.34%가 된다.

개발자 관점에서 이 논문의 실용적 값은 세 가지다. 첫째, VLM을 로봇에 붙일 때 언어 능력을 잃지 않으려면 액션을 자연어로 표현해 감독하라는 레시피다. 둘째, VQA·인간·로봇 데이터를 서로 다른 전문가에 배분하는 감독 설계로, 데이터 소스별 기여도를 절제 수치로 확인할 수 있다. 셋째, 히스토리 조건부 플로우 매칭으로 디노이징 스텝을 줄이는 추론 효율 설계는 정책 서빙 비용에 직결된다. 다만 재현에는 Qwen3-VL-2B와 Wan2.2-TI2V-5B 두 백본, 약 4,363시간 로봇 데이터와 5,000시간 인간 데이터, 8×H100 80K 스텝급 자원이 필요하다는 점을 먼저 따져야 한다. 데이터 정제 파이프라인, 특히 상태-액션 지연 보정과 EEF 일관성 검사는 자체 데이터에 이식 가능한 부분이다.

한계와 전제는 다음과 같다. 제공된 본문에는 별도의 Limitations 절이 없고 저자들이 명시한 조건만 확인된다. 인간 자기중심 데이터는 1k 시간 미만 구간에서 오히려 해롭고, 로봇 데이터와의 시각·물리적 차이가 클 때는 전이되지 않는다. 인간 데이터에는 정밀도 낮은 액션 라벨을 감독 신호로 쓰지 않으며, 기하 일관성 검사는 관절 측정·로봇 모델·EEF 의미가 신뢰할 만할 때만 수행하고 메타데이터가 모호하면 건너뛴다. 스케일링 법칙은 5k 시간까지의 구간에서만 검증됐고 포화가 관측되지 않았을 뿐 상한이 확인된 것은 아니다. 결론부 역시 이질적 데이터 위의 통합 월드-액션 사전학습이 범용 로봇으로 가는 유망한 경로라고 표현하는 수준이며, 실물 평가는 AgileX Piper 단일 플랫폼과 과제당 200개 시연 규모에 머문다.