Rho는 로봇별 중간학습으로 VLA 과제 적응 데이터를 절반으로 줄인다

Rho: A Foundation for Efficiently Adaptable VLA Models

arXiv2609.38164v1

Rho Team2026-09-29조회 3

무엇인가

이 논문은 범용 로봇 조작 모델, 즉 VLA(vision-language-action)와 월드-액션 모델이 실제 환경에서 여전히 낮은 제로샷 성공률을 보인다는 문제에서 출발한다. 사전학습 모델과 실전에서 동작하는 모델 사이에는 적응(adaptation)이라는 비싼 단계가 있고, 기존 사전학습은 여러 로봇과 과제를 넓지만 얕게 섞어 노출할 뿐 특정 로봇의 센싱, 기구학, 행동 공간, 데이터 규약을 가르치지 않는다. 그래서 사전학습 모델에 새로운 과제를 직접 가르치면 로봇 제어를 익히는 비용까지 과제 적응에 얹혀 데이터 소모가 커진다. Rho의 핵심 전제는 새 과제를 빠르게 배우려면 과제 적응 이전에 대상 로봇의 비전·언어·제어를 먼저 숙달해야 한다는 것이고, 이를 위해 로봇 임베디먼트 적응과 과제 적응을 훈련 단계에서 분리한다.

어떻게 동작하나

모델은 크게 세 부분이다. 백본은 마이크로소프트 Phi 계열에서 파생한 Phi-Phy로, 46.8억 파라미터의 causal 언어 디코더와 SigLIP 2 NaFlex 비전 인코더, 그리고 시각 특징을 언어 임베딩 공간으로 사상하는 2층 크로스모달 프로젝터로 구성된 mid-fusion 구조다. NaFlex 인코더는 이미지 종횡비를 보존하고 패치 예산 안에서 이미지 크기에 따라 시각 토큰 수를 바꾸며, Rho 사전학습에서는 카메라 뷰를 256×256으로 패딩 리사이즈해 시각 토큰 예산을 예측 가능하게 만든다. 여기에 로봇 관련 VQA·그라운딩 데이터(MGrounding, RefSpatial, XVR, RoboPoint의 객체·공간 참조 부분집합, 그리고 재가공된 다중 이미지 그라운딩·OCR·계수 데이터와 합성 차이 찾기 VQA)를 더해 물리적 지각을 강화한다. 최종 SFT 데이터 1억 건 중 약 600만 건이 이 세 범주이고, 일반 캡션·지각·객체 존재·UI 그라운딩 데이터가 3천만 건 추가된다.

무엇과 다른가

행동 생성은 flow-matching 액션 전문가가 맡는다. 정답 행동 청크 a, 노이즈 ε, 시간 t에 대해 x_t = tε + (1-t)a를 만들고 속도 ε-a를 평균제곱 오차로 예측하도록 학습하며, 추론 시 t=1의 노이즈에서 t=0의 행동 청크로 기본 10회 오일러 스텝으로 적분한다. 전문가는 12개 블록, 2048차원 행동 표현, 128차원 어텐션 헤드 16개, grouped-query 어텐션으로 총 5억 4200만 파라미터이며, 타임스텝 조건화는 블록마다 별도 모듈을 두는 대신 기본 변조 맵을 공유하고 블록별로 0으로 초기화된 작은 오프셋만 학습하는 adaLN-single 방식을 쓴다. 상태와 행동은 최대 32차원의 연속 벡터로 표현해 관절 공간·엔드이펙터 공간, 델타·절대 목표, 단일·다중 팔을 같은 인터페이스로 받는다. 사전학습에서는 이기종 데이터를 청크 시작 시점의 엔드이펙터 자세 기준 델타(3차원 이동 + 6D 회전 + 절대 그리퍼)로 표준화해 팔당 10차원을 쓰고, 약 1초 길이의 청크를 최대 50스텝으로 패딩한 뒤 데이터셋·행동 차원·청크 위치별로 1·99 백분위를 -1과 1에 대응시켜 정규화하고 범위 밖 값은 [-1.5, 1.5]로 자른다.

어떻게 쓰나

훈련은 정규화된 점진적 적응(regularized progressive adaptation)이라는 레시피를 따른다. 먼저 Rho-Tomyum이라 부르는 다중 임베디먼트·다중 과제 혼합으로 사전학습하는데, 공개 데이터셋과 자체 물리 로봇 및 UMI 스타일 시연, UR AI Trainer용 Isaac Sim 시뮬레이션 궤적을 포함하고 OXE 컬렉션은 Fractal, Taco Play, DROID, Stanford Hydra, Furniture Bench, Austin Sailor, BC-Z를 제외한 부분집합만 쓴다. 매 업데이트는 0.9 확률로 로봇 배치, 0.1 확률로 RoboPoint/RefSpatial 비전-언어 배치를 뽑고, 비전-언어 교차엔트로피 손실에는 0.02를 곱해 백본이 언어 이해를 잃지 않도록 정규화한다. 학습은 AdamW bfloat16, 사전학습된 비전-언어 모듈 1e-6과 새로 초기화한 행동 모듈 1e-4의 분리 학습률, 1000 업데이트 워밍업 후 마지막 45,000 업데이트에서 10배 코사인 감쇠, 48개 NVIDIA B200 GPU, 로봇 전역 배치 3072로 수행한다. 이어서 임베디먼트 중간학습은 대상 플랫폼의 넓은 다중 과제 데이터로 2 에폭 학습하는 단계로, YAM Box는 약 300시간·65개 과제군(실험실 146시간, 일상 환경 143시간), UR AI Trainer는 약 260시간·28개 과제군에 36시간 분량의 시뮬레이션 궤적 5개 과제를 더하고, FR3 Duo는 약 280시간·19개 과제군을 쓴다. 저자들은 이 단계의 목표가 특정 과제 숙달이 아니라 로봇의 카메라·제어 규약에 익숙해지는 것이라며, 중간학습 데이터의 과제당 평균 시간이 15시간 이하(예: UR AI Trainer 263/28≈9시간)임을 강조한다.

전제와 한계

배포 이후 적응을 위해 각 VLA의 flow 모듈에는 선택적 내부 잠재 정책이 들어간다. 이 모듈은 현재 관측을 flow의 초기 조건으로 사상해 무작위 가우시안 샘플링을 대체하며, 행동 생성기는 동결한 채로 둔다. 시뮬레이션에서는 스크립트 개입, 실제 로봇에서는 사람 개입으로 얻은 교정만으로 이 가벼운 모듈을 학습시키며, 15개 교정 에피소드만으로 오프라인 파인튜닝 분포의 경계에 있는 상황을 처리할 수 있다고 보고한다. 전체 VLA를 온라인 갱신하는 방식보다 계산 부담이 작고 사전학습 능력 훼손 위험도 낮다는 것이 저자들의 설명이다.

실험은 RoboTwin, LIBERO, RoboEval 시뮬레이션 환경과 YAM Box, UR AI Trainer, FR3 Duo 실제 양팔 로봇에서 수행되며, 기존 오픈웨이트 VLA 베이스라인과 비교한다. 저자들이 내세우는 핵심 수치는 두 가지다. 임베디먼트 중간학습이 주어진 성공률 임계값에 도달하는 데 필요한 과제 파인튜닝 데이터 양을 절반으로 줄이고, 뒤집어 말하면 동일한 소량 데이터셋으로 파인튜닝했을 때 과제 성공률을 20% 이상 끌어올린다는 것이다. 또한 중간학습의 이득이 특정 파인튜닝 데이터 양에 국한되지 않고 넓은 데이터 구간에서 유지된다고 주장하며, 보고서에서 평가한 과제·임베디먼트·베이스라인 전반에서 가장 강한 종합 성능을 냈다고 밝힌다. 다만 개별 표의 정확한 성공률 수치는 제시된 본문 범위에서는 확인되지 않는다.

개발자 입장에서 이 논문의 실용적 가치는 공개 범위에 있다. Rho-base 파운데이션과 YAM Box, UR AI Trainer, FR3 Duo용 임베디먼트 중간학습 체크포인트를 Hugging Face에 올리고, 하위 과제 파인튜닝과 잠재 공간 온라인 적응 코드를 GitHub에 공개했으며, YAM Box에서 수집한 BusyBox 데이터셋도 함께 배포한다. 즉 범용 다중 임베디먼트 체크포인트에서 시작할지, 이미 대상 플랫폼의 센싱·제어 규약을 학습한 체크포인트에서 시작할지 선택할 수 있다. 자체 로봇에 적용하려면 32차원 상태·행동 인터페이스와 청크 시작 기준 EEF 델타 표현, 최대 3개 RGB 카메라 뷰, 256×256 패딩 리사이즈, 청크 위치별 백분위 정규화 같은 데이터 규약을 먼저 맞춰야 한다.

저자들이 명시한 한계도 분명하다. 평가는 유한한 시뮬레이션 벤치마크, 로봇 임베디먼트, 조작 과제 집합에 국한되며 하드웨어·환경·과제 분포 전반의 보편적 일반화를 입증하지 않는다. 임베디먼트 중간학습의 이득은 임베디먼트별 데이터의 다양성과 품질에 의존할 수 있고, '최강 성능' 주장도 보고서에 기재된 베이스라인·학습 예산·평가 프로토콜 범위 안에서만 유효하다. 또한 자연어 지시를 얼마나 잘 따르고 표현 변화에 얼마나 민감한지(언어 조종성)는 체계적으로 평가하지 않았고, 프런티어 생성 모델을 상위 제어기로 두는 에이전틱 시스템에서의 성능, 촉각 센싱 같은 미활용 피드백 양식의 통합은 향후 과제로 남긴다. 온라인 적응에 대해서는 대표성 있는 시연 확보, 사람 감독, 플랫폼별 안전장치와 작업 공간 제약, 배포 전 평가 게이트가 필요하다고 당부한다.