Magic-W0가 로봇 행동과 3D 세계 상태 변화를 함께 예측한다

Magic-W0: A Structured World-Action Foundation Model for Physical Intelligence

HF Daily2609.39870

Xuhua Chen, Zhenhan Yin, Yuan Zhang2026-10-03

무엇인가

기존 VLA 정책은 관측과 언어 지시로부터 행동을 생성하는 매핑을 학습하지만, 후보 행동이 현재 환경에 어떤 상태 변화를 일으킬지는 독립적인 예측 목표로 명시적으로 제약되지 않는다. 기존 세계-행동 모델(WAM)도 미래 관측 재구성이나 일반적인 잠재 상태 예측에 의존해, 제어에 직결되는 구조화된 세계 표현이 부족하다. 논문은 여기서 두 가지 질문을 세운다. 첫째, 의사결정을 위한 예측적 세계 표현을 어떤 구조로 조직할 것인가. 둘째, 행동 가설과 예측된 세계 전이가 하나의 정책 안에서 어떻게 상호 조건화하며 함께 진화할 것인가.

어떻게 동작하나

제안하는 핵심 표현은 Structured World Transition이다. 로봇 상호작용 중의 환경 진화를 Current State, Transition, Future State 세 단계로 나눈다. Current State는 현재 관측·언어 지시·고유수용 상태에서 뽑은 VLM 컨텍스트와 3D 스트림이 예측한 Current 3D Geometry로 구성된다. Transition은 행동이 유발한 3차원 변화를 나타내는 3D Motion이고, Future State는 전이 이후 과제와 관련된 장면 상태를 담는 Future Semantics다. 논문의 식 (1)은 이를 W = (C_t, Z_t / Z_{t→t+Δ} / Z_{t+Δ})로 적는다. 여기서 Δ는 행동 청크가 커버하는 구간의 끝과 미래 시점을 정렬하는 값이며, 데이터 소스별 행동 샘플링 배수에 따라 달라진다.

무엇과 다른가

감독 신호는 관측 가능한 출력을 재현하는 대신 잠재 특징으로 주어진다. 기하와 모션은 동결된 Track4World에서 나온다. 이 교사 모델은 현재-미래 프레임 쌍을 한 번의 순전파로 처리해, 동적 장면으로 학습된 DA3 백본에서 소스 프레임 기하 특징을, 3D 모션 헤드에서 시간 간 교차 모션 특징을 제공한다. 미래 의미 목표는 동결된 DINOv3를 미래 프레임에 적용한 패치 특징이다. 세 목표 모두 16×16×1024 공간 특징으로 표현되며, 교사는 학습 중에만 쓰이고 추론 시에는 내부 3D·의미 스트림이 표현을 생성한다. 모델 골격은 Qwen3.5-2B가 다중 뷰 시각 토큰과 언어 토큰, 투영된 고유수용 상태 토큰을 과제 컨텍스트로 인코딩하고, 행동 전문가는 flow matching으로 정규화된 행동 청크를 H개 토큰으로 생성한다. 네트워크는 24층이며 3개의 Gated DeltaNet 층마다 어텐션 층이 하나씩 놓이고, 4·8·…·24층에서 3D 스트림·의미 스트림·행동 스트림이 joint attention으로 정보를 교환한다. 각 스트림은 자기 query로 VLM·의미·3D·행동의 key/value를 이어 붙인 joint key/value에 어텐션하며(식 2), VLM은 전문가 스트림을 보지 않는다. 의미·3D 토큰이 행동 토큰을 참조해 action-conditioned world transition을, 행동 토큰이 두 세계 스트림을 참조해 world-informed action generation을 실현한다. 이질적 데이터를 묶기 위해 말단장치 자세·그리퍼 정보·관절 상태를 대응 차원에 매핑하는 34차원 통합 상태-행동 인터페이스도 구성했다.

어떻게 쓰나

사전학습은 자기중심적 인간 조작 데이터, UMI 데이터, 실제 로봇 궤적, 시뮬레이션 데이터를 아우른다. RoboDojo-Sim에서 Magic-W0는 비교 대상 WAM 가운데 가장 높은 평균 점수를 기록했는데, 원문 안에서 수치가 일치하지 않는다. 초록은 평균 Score 27.10을, 본문 결론은 36.75를 제시한다. 실제 로봇의 여러 과제에서는 제한된 다운스트림 데이터로 파인튜닝한 뒤 강한 성능을 보여 일반화와 빠른 적응을 뒷받침한다고 주장한다. 다만 베이스라인별 세부 점수와 과제별 표 수치는 제공된 원문 범위에 제시되지 않았다.

전제와 한계

저자들은 추론 시 개입 실험으로 내부 경로가 실제로 쓰이는지 검증한다. 첫째, 관측·언어·고유수용 상태·flow time을 고정하고 노이즈가 섞인 행동 청크만 같은 배치의 다른 샘플 것으로 바꾸는 action replacement를 수행했다. τ∈[0,0.2) 구간에서 정규화 응답 D_m은 Future Semantics 0.50, 3D Motion 0.37, Current 3D Geometry 0.26이었고, τ∈[0.8,1.0)에서는 각각 0.14, 0.11, 0.07로 줄었다. 행동 전문가의 velocity field 출력은 모든 노이즈 구간에서 0.93~0.99로 강하게 반응했다. 미래 의미 손실은 가장 낮은 노이즈 구간에서 73.5% 증가했고 가장 높은 구간에서는 8.0%로 줄었으며, 개입이 없을 때도 노이즈가 커지면 0.0741에서 0.0828로 상승했다. 둘째, 스트림 간 연결을 마스킹하는 실험에서 전체 모델의 평균 의미 손실 0.0785를 기준으로 3d→sem을 막으면 60.8% 증가해 개별 연결 중 가장 컸고, 반대 방향인 sem→3d는 2.6% 증가에 그쳐 약 23배 차이를 보였다. 모든 스트림 간 연결을 동시에 제거하면 95.3% 증가했는데, 개별 마스킹 증가분의 합 0.0755와 전체 제거 시 0.0748이 약 1.0% 차이에 불과하다. 저자들은 이를 근거로 미래 의미가 3D 스트림을 경유한 행동 정보에 의존한다고 해석하면서, 연결들이 공유 중간 표현에 영향을 줄 수 있으므로 이 수치를 엄격한 가산성으로 읽어서는 안 된다고 못 박는다.

실무 관점에서 이 논문의 쓸모는 표현 설계와 학습 목표 쪽에 있다. 행동 생성 헤드만 키우는 대신, 현재 기하·3차원 모션·미래 의미를 각각 다른 교사 모델의 잠재 특징으로 감독하고 이를 행동 전문가와 여러 층 깊이에서 맞물리게 하는 패턴은 다른 로봇 정책이나 embodied 모델에 그대로 옮겨 볼 수 있다. 도입을 검토한다면 세 가지를 확인해야 한다. 교사 모델(Track4World, DINOv3) 의존이 학습 파이프라인과 라이선스에 주는 부담, 34차원 인터페이스가 자체 로봇의 상태·행동 공간을 실제로 포괄하는지, 그리고 다층 상호작용이 추론 지연에 더하는 비용이다. 마지막 항목은 저자들도 명시적으로 남은 과제로 꼽는다.

저자가 밝힌 한계는 분명하다. 손가락 단위의 정교한 조작으로 프레임워크를 확장해 고차원 행동 공간과 미세 접촉 상호작용에서의 모델링·일반화를 살펴야 하고, 촉각과 힘 신호를 통합해 로봇-환경 접촉 상태와 상호작용 동역학을 더 온전히 표현해야 한다. 또한 다층 세계-행동 상호작용이 추가하는 계산 비용을 다뤄 최신 VLA 모델과의 추론 속도 격차를 좁히는 것이 남은 목표다.