예측을 행동으로 잇는 비동기 물리 세계 모델 InternW0

InternW0: A Foundational Physical World Model for Efficient Real-World Interactions

HF Daily2609.27656

Jisong Cai, Yao Mu, Ganlin Yang2026-09-23조회 10

무엇인가

로봇이 물리 세계에서 일하려면 다음 장면을 맞히는 것만으로는 부족하다. 예측은 환경이 계속 변하는 동안에도 행동으로 옮길 수 있어야 한다. 논문은 기존 세계 행동 모델(WAM)들이 이기종 로봇 몸체, 고유수용감각·힘·촉각 같은 추가 물리 모달리티, 그리고 비싼 영상 예측과 빠른 행동 생성을 동기적으로 갱신할 때 생기는 지연 문제를 충분히 다루지 못한다고 지적한다. 상하이 AI 연구소의 InternW 시리즈 첫 구현인 InternW0는 이 연결을 하나의 공유된 지각·동역학·행동 모델로 만들겠다고 주장하며 세 가지 요구사항을 내건다. 다양한 모달리티를 하나의 물리 표현으로 묶는 옴니모달 인터페이스, 감지·제어 주파수가 다른 신호를 함께 다루는 비동기 다중 주파수 처리, 그리고 부분 관측과 외부 교란 아래에서 국소 물리 상태를 추정하고 갱신하는 국소 환경 모델링이다.

어떻게 동작하나

구조의 뼈대는 mixture-of-transformers(MoT)다. 각 결합 레이어가 별도 파라미터와 토큰 스트림을 가진 모달리티별 블록으로 나뉘고, 영상 예측을 맡는 고용량 Video-DiT와 로봇 제어를 맡는 경량 Action-DiT가 관찰 조건부 영상 문맥 인터페이스로 연결된다. 두 전문가의 비대칭성이 핵심이다. Video-DiT는 언어와 시각 관측만으로 공유 예측 표현을 만들고 로봇 특화 행동 토큰이나 도메인 식별자를 소비하지 않는다. Action-DiT는 영상 문맥에 최신 관측, 고유수용감각, 언어 조건, 몸체별 인터페이스를 함께 읽는다. 영상 프레임은 동결된 Wan VAE로, 청크 단위 시각 관측은 동결된 DINOv3로 인코딩하고 언어 지시는 미리 계산한 텍스트 임베딩을 쓴다. 두 전문가 모두 연속 플로 매칭으로 학습한다. 깨끗한 목표 x0, 가우시안 노이즈 ε, 정규화된 플로 시간 τ에 대해 노이즈 입력은 xτ = (1-τ)x0 + τε, 목표 속도는 v* = ε - x0이며, 영상 어텐션에는 첫 프레임 인과 마스크를 적용해 관측된 첫 잠재 프레임이 미래 토큰을 보지 못하게 하고 첫 프레임은 영상 예측 손실에서 제외한다. 사전학습 목표는 L_pre = E[λv·L_video + λa·I_act·L_joint]로, 행동 라벨이 없는 자기중심 영상은 영상 감독에만 기여한다.

무엇과 다른가

실행 중 예측을 쓸모 있게 유지하는 장치가 비동기 이중 추론이다. Video-DiT는 느린 주기로 계획을 만들고, Action-DiT는 그 사이에 최신 관측으로 짧은 행동 청크를 계속 생성한다. 매 제어 갱신마다 전체 예측을 다시 계산하지 않기 위해 캐시한 영상 문맥의 레이어별 K/V를 청크 K/V 편집기로 적응시킨다. 청크에 정렬된 RGB 관측을 DINOv3로 인코딩하고 학습된 쿼리 인코더로 라우팅 쿼리 q를 만든 뒤, R = Attn(W^q·q_n, K, V)로 예측 표현에서 과제 관련 정보를 검색하고, D = Attn(K, R, R)로 그 정보를 원래 영상 토큰 위치로 되돌린다. 여기서 경량 투영이 잔차 보정 (ΔK, ΔV)을 예측하고 K̃ = K + σ(γ)ΔK, Ṽ = V + σ(γ)ΔV로 청크별 문맥을 만든다. 잔차 투영은 영 초기화되어 편집기가 항등 사상에서 출발해 점진적으로 관측 의존 보정을 학습한다. 원래 영상 문맥 자체는 바뀌지 않으므로 장기 예측 구조를 보존하면서 실행이 예상 미래에서 벗어날 때 국소 제어 문맥만 적응시킬 수 있다. 행동 감독이 있는 학습에서는 같은 VideoDiT 파라미터를 공유하되 노이즈와 플로 시간을 독립적으로 샘플링한 두 번째 영상 스트림(IDM 조건)을 유지하고, 이를 50% 확률로 깨끗하게 둔다. 이 조건 스트림의 K/V 특징을 그래디언트로부터 분리하지 않기 때문에 행동 플로 매칭 손실의 그래디언트가 K/V 편집기를 거쳐 공유 영상 전문가로 흘러 들어간다. 즉 예측 표현이 시각 재구성만이 아니라 행동 생성에 유용한지에 의해서도 학습된다. 이기종 몸체는 도메인별 소프트 프롬프트 P(d)를 모든 행동 청크 앞에 붙이고, 도메인별 입출력 투영과 차원별 유효성 마스크로 결측 채널을 유효한 0값과 구분해 처리한다.

어떻게 쓰나

접촉이 중요한 하위 과제에서는 사전학습된 행동 인터페이스를 힘·촉각 신호로 확장한다. 물리 타임스텝 i에서 예측 대상은 y_i = [a_i, f_i, h_i]로, 행동 표현과 힘/토크 신호, 촉각 표현을 함께 담는다. 각 청크에는 생성 이전에 사용 가능한 접촉 이력만 조건으로 주고, 미래 접촉 채널은 행동 채널과 함께 노이즈를 주고 공동으로 디노이즈한다. 행동 채널은 실행을 위해 디코딩되고 접촉 채널은 예측된 피드백을 나타낸다. 이 확장은 공유 영상 예측 백본을 건드리지 않고 행동 측 인터페이스만 늘린다.

전제와 한계

학습 데이터는 7개 데이터셋 약 7,200시간이다. 실로봇 데이터 AgibotWorld, Galaxea, RoboCOIN, MolmoAct, 시뮬레이션 데이터 InternData-A1, RoboDojo, 그리고 팀이 직접 수집한 275시간 실험실 자기중심 영상 EgoLab으로 구성된다. 단일팔·양팔·이동 조작을 포함하고, 행동과 상태는 37차원 통합 표현으로 매핑한다. 도메인은 데이터 출처·로봇 형태·부분집합 정체성으로 정의해 25개 학습 도메인과 24개 통계 그룹을 두며, 물리적 로봇 형태와 일대일로 대응하지 않는다. 데이터셋 기여도는 유효 앵커 수의 제곱근에 비례해 샘플링하고, 정지 궤적·머리나 허리 움직임 구간·짧은 그리퍼 펄스·결측이나 범위 초과 값을 유효성 마스크 또는 윈도 무효화로 처리한다. 학습 파이프라인은 데이터·실행·최적화 3계층으로 분리되며, 메타데이터와 페이로드를 분리해 샘플링 시 메타데이터만 재정렬하고 노드 공유 비디오 캐시로 중복 I/O를 줄인다. 실행은 Ray로 관리하고, FSDP2 샤딩은 각 MoT 결합 레이어와 전문가 스테이지를 독립 단위로 삼되 좁은 도메인별 인터페이스는 복제한다. 혼합 정밀도 학습은 FP32 마스터 파라미터와 옵티마이저 상태를 유지하고 계산은 BF16, 분산 그래디언트 축소는 FP32로 한다.

평가는 시뮬레이션 벤치마크와 실제 과학 과제를 아우른다. 실제 과제로는 15단계 금속-유기 골격체(MOF) 합성 워크플로와, 범용 정량 피펫팅을 위한 5단계 접촉·힘 인식 손재주 조작이 포함된다. 피펫팅은 20자유도 손이 다지 협응으로 피펫을 안정적으로 잡고 손 안에서 재배향해야 하는 과제로, InternW0는 5개 하위 과제 중 4개에서 최고 성공률을 기록하고 전체 진행률 65.3%로 가장 높았다. 특히 팁 부착, 액체 흡입, 액체 분주, 팁 배출 같은 접촉·힘 민감 하위 과제에서 우세했고, 픽업 재배향에서는 π0.5가 더 좋았다. 실패 사례 분석에 따르면 MOF 실험의 붓기 단계에서 InternW0는 메스실린더 입구를 깔때기 중앙에 유지한 반면 π0.5는 중심에서 벗어나 기울여 액체 일부가 플라스크 바깥으로 흘렀고 Fast-WAM은 깔때기에서 멀리 기울여 플랫폼에 직접 부었다. 피펫팅 팁 부착 단계에서는 InternW0가 접촉력을 받아 자세를 온라인으로 적응시켜 초기 정렬 오차를 극복한 반면, π0.5는 삽입 중 계속 아래로 힘을 가해 피펫을 놓쳤고 Fast-WAM은 삽입 지점에서 큰 위치 오차로 피펫 몸체를 변형시켰다. 효율은 RTX 5090D에서 임계 경로 행동 생성 지연 60.73ms, 모델 측 최대 정책 갱신률 16.47Hz로 측정됐으며 이는 Fast-WAM 대비 3.13배 빠르고 Motus보다 지연이 크게 줄어든 값이다. 이 지연에는 현재 관측 인코딩, 관찰 조건부 문맥 라우팅, 최신 예측 문맥을 쓰는 Action-DiT 디노이징이 포함되고, 비동기로 스케줄되는 영상 계획 생성은 임계 경로에서 제외된다. 시뮬레이션 벤치마크의 구체적 수치는 제공된 본문에 제시되지 않았고, 논문은 해당 부분에서 경쟁력 있는 성능을 보였다고만 서술한다.

개발자 관점에서 이 논문의 실질적 기여는 지연 예산 설계다. 무거운 미래 예측을 제어 임계 경로에서 빼고, 캐시한 K/V를 최신 관측으로 편집해 재사용하는 패턴은 로봇 정책뿐 아니라 실시간으로 무거운 생성 모델을 돌려야 하는 시스템에 그대로 옮길 수 있다. 또한 힘·촉각 이력을 조건으로 주고 미래 접촉 신호를 행동과 함께 예측하는 인터페이스는 비전만으로 판별하기 어려운 접촉 성공 여부를 다루는 방법을 제시한다. 도입을 검토한다면 세 가지를 확인해야 한다. 첫째, 자기 로봇의 제어 주파수와 Video-DiT 갱신 주기의 비율이 임계 경로 지연 60.73ms 안에 들어오는지다. 둘째, 37차원 통합 행동 표현과 도메인별 소프트 프롬프트 체계에 자기 몸체의 관절·센서 구성이 매핑되는지, 결측 채널 유효성 마스크를 제대로 채울 수 있는지다. 셋째, 접촉 인식 후처리 학습에 필요한 힘·촉각 라벨을 확보할 수 있는지다. 참고로 사전학습 단계는 힘·촉각 주석을 요구하지 않지만, 접촉이 중요한 과제에서 성능을 내려면 후처리 단계의 접촉 데이터가 필요하다.

저자들이 밝힌 전제와 한계는 분명하다. 이기종 사전학습은 힘·촉각 주석을 요구하지 않는 대신, 접촉 역학이 중요한 하위 과제에서는 별도 접촉 인식 후처리 학습이 필요하다. 또한 시각 관측만으로는 조작 성공을 좌우하는 접촉 조건을 완전히 해석하지 못할 수 있다고 인정한다. 사전학습 코퍼스에서는 손재주 손 로봇 데이터와 형식 변환이 불완전한 데이터셋 복사본을 제외했다. 향후 과제로는 개입(intervention) 이해, 깊이·3D 기하·오디오 등 추가 모달리티, 계층적 표현과 메모리로 여러 시간 규모를 잇는 예측, 로봇·기기·실험실 간 전이, 실제 환경에서의 지속적 폐루프 개선을 제시한다. 특히 부분 관측, 누적 오차, 개입 의존 동역학을 다루려면 불확실성 보정 예측과 지속적 상태 수정이 필요하다고 본다. 마지막으로 약 4B 파라미터, 궁극적으로 1B 미만의 경량 세계 모델을 목표로 증류·양자화·압축된 잠재 표현·효율적 행동 헤드·하드웨어 인식 추론이 중요하다고 밝힌다. 이는 현재 모델이 아직 임베디드 기기에 바로 올릴 크기가 아니라는 전제를 내포한다.

관련 논문