관절 궤적 조건 자기회귀 확산 모델로 로봇 시뮬레이션을 스트리밍 생성하는 Uranus

Uranus: Building the Next-Generation Simulation Infrastructure for Embodied AI

HF Daily2609.24815

Wenkang Qin, Yukun Zhou, Noah Shen2026-09-23조회 8

무엇인가

로봇 학습에는 데이터 생성, 정책 학습, 통제된 평가, 안전한 반복 실험이 모두 필요하지만 실제 세계 상호작용은 비용이 크고 재현이 어렵다. Isaac Sim이나 MuJoCo 같은 전통 시뮬레이터는 반복 가능한 상호작용을 제공하지만 3D 자산과 환경, 물리 모델을 사람이 직접 만들어야 하고 sim-to-real 격차도 남는다. 데이터 기반 비디오 월드 모델은 자산과 물리 규칙을 수동으로 지정하는 대신 로봇 상호작용 데이터에서 미래 관측을 직접 예측하지만, 기존 시스템들은 소수의 로봇·과제·장면에 묶여 있어 범용 시뮬레이터로 확장하기 어렵고, 오프라인 비디오 생성에서 물려받은 긴 프레임 청크 단위 추론 때문에 action-to-observation 지연이 커 세밀한 폐루프 상호작용에 부적합하다. Uranus는 이 문제를 관절 궤적 조건 자기회귀 확산 모델로 풀겠다고 주장한다.

어떻게 동작하나

구조는 두 단계다. 바깥쪽은 잠재 프레임 인덱스 t에 대한 인과적 자기회귀 롤아웃이고, 안쪽은 각 잠재 프레임을 만드는 flow-matching 확산 과정이다. 인과적 VAE에서 잠재 프레임 하나는 선두 RGB 프레임 하나에 대응하고, 이후 RGB 프레임 4개마다 잠재 프레임 하나가 추가된다(F_lat = 1 + floor((F_rgb-1)/4)). 모델은 초기 다중 시점 관측, 보정된 카메라 시점, MJCF/URDF 로봇 형상 기술, 그리고 qpos로 표현된 미래 관절 구성 4개를 받아 다음 동기화된 다중 시점 관측을 예측하고, 그 결과를 다시 문맥으로 되먹인다. 한 번의 자기회귀 스텝이 잠재 프레임 하나를 만들고 이것이 카메라마다 연속된 RGB 4프레임으로 디코딩되며, 4개의 qpos 샘플은 이 4개 RGB 타임스탬프에 1대1로 정렬된다. 학습 시에는 영상과 동기화된 기록 관절 상태를 쓰고, 추론 시에는 상위 정책이나 컨트롤러가 네 개의 미래 구성을 미리 공급해야 한다. 즉 여기서 말하는 action-conditioned는 토크나 속도를 적분해 로봇 운동을 복원하는 것이 아니라, 지정된 운동학 궤적의 시각적 결과를 예측한다는 뜻이다.

무엇과 다른가

조건 신호는 네 갈래다. 하나 이상의 깨끗한 참조 RGB 프레임은 영속적 참조 앵커 블록으로 토큰 시퀀스 앞에 붙고 타임스텝 임베딩 0을 가지며 절대 노이즈가 주입되지 않는다. 로봇 관절 상태는 RGB 타임스탬프마다 순운동학을 돌려 3D 관절·말단장치 위치를 얻고 카메라 파라미터로 투영해 2D 스켈레톤 맵 4장으로 렌더링하는데, 말단장치 마커의 반지름은 그리퍼 개구를, 색은 말단장치와 카메라 사이 상대 포즈의 구면조화함수 값을 나타낸다. 이 이미지 공간 표현은 운동학 기술·관절 구성·카메라 보정만 있으면 되므로 관절 수, 링크 길이, 그리퍼 형태, 이동 베이스 기하 같은 형상별 세부가 신경망에 들어가기 전에 흡수된다. 카메라 외부·내부 파라미터는 픽셀마다 6D Plücker 광선(모멘트와 방향)으로 인코딩되어 학습된 카메라 ID 없이 가변 시점을 지원하고, 언어 설명은 동결된 T5 인코더를 거쳐 표준 교차 어텐션으로 들어간다. 어텐션은 전체 다중 시점 토큰에 완전 어텐션을 걸지 않고 두 모드로 인수분해한다. 공간 어텐션은 한 잠재 프레임 안의 동기화된 카메라 뷰들을 상호작용 그룹으로 묶어 뷰 간 양방향 어텐션을 허용하고, 시간 어텐션은 카메라 한 대의 잠재 프레임 시퀀스를 그룹으로 묶어 참조 앵커와 과거 잠재 프레임만 보이도록 마스킹한다. 두 모드는 DiT 블록 두 개마다 교대하며, 완전 어텐션 O((N_c·F·H_p·W_p)^2) 대비 공간 블록은 F배, 시간 블록은 N_c배 비용을 줄인다.

어떻게 쓰나

학습은 양방향 비디오 모델을 먼저 만들고 인과 학생으로 증류하는 대신, 처음부터 teacher forcing 목적의 인과 생성기로 사전학습한다. 깨끗한 히스토리 잠재 프레임과 노이즈가 섞인 타깃 잠재 프레임을 분리하고, 참조 앵커 블록은 확산 타임스텝 0의 전역 접근 가능한 싱크로 유지하며, 잠재 프레임 단위 RoPE를 적용한다. 노이즈 타깃 토큰·깨끗한 히스토리 토큰·참조 토큰이 긴 다중 시점 시퀀스에 공존하므로 HSDP, 시퀀스 병렬화, 고해상도 다중 프레임 입력을 타일로 쪼개 GPU에 분산 인코딩하는 tiled VAE를 결합한다. 추론에서는 히스토리 토큰을 담는 KV 캐시와 증분 잠재-투-비디오 변환을 위한 스트리밍 VAE 디코딩, CUDA 그래프 실행, 그리고 내부 확산 과정을 여러 번의 디노이징에서 4스텝으로 줄이는 확산 스텝 증류를 사용해 추론 최적화 후 24 FPS를 달성한다고 보고한다.

전제와 한계

학습 데이터는 AgiBot World Beta, AgiBot World 2026, DROID, RoboChallenge Table30 v1·v2를 중심으로 단일 팔·양팔·휴머노이드 플랫폼을 아우른다. 저자들은 RoboCOIN, RoboMIND, RoboMIND 2.0의 공개 버전이 카메라 파라미터를 제공하지 않아 기하 인식 학습 구성에 필요한 정보가 빠져 있다고 명시한다. 평가는 WorldOlympiad 벤치마크의 장기 상호작용, GE-Sim 2.0과의 통제 비교, 실제 실행과의 일치도, 정책과의 폐루프 상호작용, 미학습 장면·궤적·과제·카메라 운동·로봇 형상으로의 일반화를 포함한다. 개루프 일치도 평가는 다양성 기반 샘플링으로 학습 분할 100개, 테스트 분할 50개를 골라 사람 평가자 5명이 각각 판정했고, 학습 분할에서는 높은 일치도를, 테스트 분할에서는 뚜렷한 일반화 격차를 보였다. 폐루프 평가는 RoboTwin에서 정책 9개를 put_bottles_dustbin, hanging_mug, lift_pot, move_can_pot, place_object_basket 5개 과제에 대해 과제당 15 에피소드씩 돌리고, Uranus를 공식 RoboTwin 데이터의 깨끗한 부분집합과 정책 롤아웃으로 만든 실패 궤적 7,891개로 미세조정한 뒤 비교했다. 집계 성공률의 피어슨 상관계수 0.98, 평균 최대 순위 위반(MMRV) 0.01을 기록했고 정책 A와 G 사이에 사소한 순위 역전이 하나 있었다. 과제 일반화는 Table30의 과제 범주 20%를 떼어낸 6개 미학습 과제에서, 형상 일반화는 학습 데이터에 전혀 없는 G2 로봇(AgiBotWorld2026)에서 평가했는데, 두 경우 모두 거친 로봇 팔 궤적과 시점 변화는 따라갔지만 물체 상호작용과 상태 변화는 신뢰할 수 없었다.

개발자 입장에서 이 논문의 실용적 가치는 모델 하나가 아니라 데이터·학습·추론·서빙으로 이어지는 통합 스택을 공개한다는 점이다. 추론 코드, SDK 코드, 데모 데이터, 1.3B SFT 가중치와 증류 가중치가 모두 공개돼 있어, 정책 학습 전에 값싼 롤아웃을 대량으로 뽑거나 정책 순위를 미리 가늠하는 용도로 시험해볼 수 있다. 다만 도입 전에 확인해야 할 전제가 분명하다. 이 모델은 토크·속도를 적분하는 물리 엔진이 아니라 미래 관절 위치 궤적을 입력으로 받는 인터페이스이므로, 상위 정책이나 컨트롤러가 네 스텝 앞의 qpos를 공급하도록 파이프라인을 맞춰야 한다. 또한 정책 평가 대리 지표로서의 상관계수 0.98은 특정 5개 과제·9개 정책 조합에서 얻은 값이므로, 자신의 과제 분포에서 순위 보존이 유지되는지는 별도로 검증해야 한다.

저자들이 밝힌 한계는 다섯 가지다. 첫째, 물리 상호작용 충실도로, 강체·접촉·과제 상태 제약을 명시적으로 강제하지 않아 그럴듯한 로봇 운동을 만들면서도 잘못된 파지나 접촉, 물체 상태 변화를 낼 수 있다. 둘째, 장기 오차 누적으로, 인과 학습과 영속적 참조 관측이 열화를 늦추지만 제거하지는 못하며 기하·외관·카메라 포즈·노출 오차가 되먹임을 따라 쌓인다. 셋째, 불균등한 일반화로, 과제·형상·시점·상호작용 패턴의 분포 이동이 커지면 성능이 떨어지고 시뮬레이터 신뢰도가 학습 데이터의 다양성과 커버리지에 의존한다. 넷째, 평가 범위의 한계로 재현 가능한 베이스라인과 공유 데이터셋, 표준 시뮬레이터 벤치마크가 부족해 더 광범위한 폐루프 연구가 필요하다. 다섯째, 계산 비용으로 증류와 시스템 최적화로 실시간 생성을 가능케 했어도 고해상도 다중 시점 모델의 학습과 배포에는 여전히 상당한 컴퓨팅·서빙 자원이 든다. 여기에 더해 저자들은 teacher forcing 학습의 히스토리 분포와 추론 시 KV 윈도에 쌓이는 생성 히스토리 사이의 불일치(exposure bias), 액션 전문가 모듈을 붙인 스트리밍 정책, 깊이 추정·객체 검출·VQA 같은 이해 지향 보조 목표, 시뮬레이터 고유 속성을 반영한 벤치마크, 단일 궤적이 아니라 그럴듯한 결과의 분포를 맞추는 분포 수준 물리 일관성, 그리고 언어 모델 인프라를 재사용할 수 없는 대화형 비디오 전용 인프라를 미해결 질문으로 남긴다.

관련 논문