휴머노이드 전신 로코-매니퓰레이션을 언어모델 어휘 안의 이산 행동 토큰으로 통합한 Holo-M
Humanoid Loco-Manipulation With Discrete VLA Model
무엇인가
휴머노이드 로봇은 하나의 전신 형태로 걷기와 조작을 모두 수행할 수 있다는 점에서 인간 환경을 다루는 가장 범용적인 embodiment다. 이를 실현하려면 열린 언어 지시 아래에서 이동과 조작을 결합하는 로코-매니퓰레이션 정책이 필요하고, VLA(Vision-Language-Action) 모델이 그 주류 레시피로 자리 잡았다. 논문이 지적하는 핵심 설계 선택은 행동을 언어모델에 어떤 형태로 표현하느냐다. 행동을 텍스트와 같은 어휘의 이산 토큰으로 다루는 흐름은 지금까지 로봇 팔에 거의 한정되어 있었다. 팔의 행동 공간은 관절 각 몇 개나 말단 자세+그리퍼 수준으로 저차원이라 단일 토크나이저와 자기회귀 또는 이산 확산 디코딩으로 충분했기 때문이다. 반면 기존 휴머노이드 VLA는 VLM 백본에 flow-matching이나 확산 action expert를 붙이는 연속 행동 생성에 의존해 왔다. 이 격차는 우연이 아니다. 다리·몸통·팔·손을 아우르는 전신 행동 공간은 자유도가 훨씬 많고 스케일과 시간 척도가 이질적이라, 팔용 해법을 그대로 확장하면 토큰화(평평한 어휘가 너무 거칠거나 너무 커짐), 학습(어떤 단일 데이터셋도 휴머노이드의 모든 자유도를 커버하지 못함), 실시간 추론(훨씬 긴 토큰 시퀀스에 대한 자기회귀 디코딩이 전신 제어에 너무 느림)이라는 세 가지 문제가 겹친다.
어떻게 동작하나
Holo-M은 이 문제를 전신 부위별 토큰화 공간으로 푼다. 하나의 단일 토크나이저 대신 행동 공간을 네 그룹으로 분해한다. EEF(양손 손목 위치, 6D 손목 회전, 카메라 좌표계의 손끝 위치), body(하드웨어별 고정 순서의 관절 공간 목표), hand(같은 방식의 손 관절 목표), kinematics(베이스 속도, 높이, 요레이트 명령)이며 각 그룹 차원은 (48, 29, 14, 5), 합쳐서 96차원이다. 하나의 행동 청크는 30Hz에서 T=30 스텝이고 그룹 순서는 EEF → body → hand → kinematics로 고정된다. 이 분해 덕분에 텔레오퍼레이션 휴머노이드 로그, 자기중심적 인간 영상, 시뮬레이션처럼 서로 다른 데이터 소스가 자신이 커버하는 부위만 지도할 수 있다. 각 그룹을 고정 길이 토큰열로 바꾸는 것이 FAST-RVQ다. FAST를 따라 각 행동 차원의 시간축에 DCT를 적용하되, 저주파 계수 N=2개만 남기고 나머지 시간 영역 잔차를 RVQ로 인코딩한다. RVQ 각 단계는 신경망 토크나이저 학습 없이 k-means로 적합한 코드북을 쓰고 그룹당 Q=4 스테이지를 둔다. 그래서 그룹 g의 토큰 길이는 L_g = 2·D_g + 4가 되고, 네 그룹은 각각 (100, 62, 32, 14), 총 208개 행동 토큰이 된다. 그룹 경계를 표시하는 구조 토큰은 이 수에 포함되지 않는다. 이 설정에서 FAST-RVQ는 실험에 쓰인 결합 데이터셋의 검증 행동 청크에 대해 재구성 오차 0.0068을 달성했다. 학습 시 어떤 샘플에 없는 그룹은 인위적 패딩으로 채우지 않고 손실에서 제외한다.
무엇과 다른가
백본은 Qwen3-VL-2B이고, 조건화 문맥은 image → task → setup → state의 고정 순서를 따른다. setup 필드는 embodiment와 데이터 소스를 식별하며(예: "G1 humanoid robot from Humanoid Everyday", "Human egocentric data from EgoDex"), state 필드는 선택된 로봇 관절 각도를 [-π, π]로 클리핑한 뒤 π로 정규화하고 256개 상태 빈 토큰 중 하나로 균일 양자화한다. 상태 토큰은 조건 정보일 뿐 208개 행동 시퀀스에는 들어가지 않는다. 모델은 Qwen3-VL 어휘에 상태 빈 토큰, 행동 토큰, 구조 토큰을 추가해 p(y_t | c_t)를 그룹 순서와 그룹 내 순서에 대한 곱으로 모델링하도록 학습된다. 저자들이 강조하는 구조적 이점은, 연속 action expert를 쓰는 모델이 사전학습 VLM의 의미 표현을 훼손하지 않으려고 action expert를 그래디언트로부터 절연해야 하는 반면, 행동과 언어 토큰이 같은 어휘 위에서 같은 시퀀스 모델로 생성되는 Holo-M에는 절연할 경계 자체가 없다는 점이다.
어떻게 쓰나
실시간성은 그룹 단위 이산 확산 디코딩으로 해결한다. 자기회귀 디코딩은 행동 토큰 하나마다 모델 평가가 한 번씩 필요해 청크당 208회의 순차 평가가 발생한다. 대신 DiffusionVL에 기반한 그룹 마스크 확산 목적함수로 파인튜닝해, 각 그룹 안에서는 토큰들이 양방향으로 상호작용하며 병렬로 복원되고 그룹 사이 의존성은 인과적으로 유지된다. 추론 시에는 네 그룹을 정해진 순서로 순차 디코딩하되 그룹 내부는 병렬로 생성한다. 현재 그룹의 모든 위치를 [MASK]로 초기화하고, 매 반복마다 모델이 마스크된 위치를 예측해 확률 기반 신뢰도를 부여한 뒤 신뢰도가 높은 위치부터 de-mask한다. 그룹이 완성되면 그 토큰은 다음 그룹을 디코딩할 인과 문맥에 추가되고, 조건 프리픽스와 완료된 그룹은 반복 사이에 캐시된다. 그룹당 8회 de-masking을 쓰면 네 그룹 디코딩에 32회의 순차 스텝만 필요해, 토큰별 자기회귀의 208스텝 대비 순차 디코딩 깊이가 6.5배 줄어든다. 학습은 네 단계다. Stage I에서 EgoDex와 Humanoid Everyday를 함께 자기회귀 사전학습하고(각 샘플은 가용한 그룹만 손실에 기여), Stage II에서 SIMPLE 휴머노이드 학습셋으로 embodiment를 정렬하며, Stage III에서 그룹 마스크 확산 목적함수로 파인튜닝해 일반 정책을 만들고, Stage IV에서 개별 태스크 시연으로 특화 정책을 만든다. 비전 인코더는 동결하고 언어 백본만 최적화하며, 별도 행동 모델이나 태스크별 행동 헤드는 도입하지 않는다.
전제와 한계
실험은 전신 로코-매니퓰레이션용 SIMPLE 벤치마크에서 수행했다. 강체 물체 조작, 비파지 상호작용, 관절 물체 조작, 양팔 협응, 이동형 로코-매니퓰레이션을 아우르는 6개 태스크를, 도메인 랜덤화 수준 Level 0/1/2 각각에서 방법·태스크·레벨 조합마다 10회 롤아웃으로 평가한다. 일반 정책 설정에서 Holo-M은 180회 중 143회 성공, 자기회귀 디코딩만 쓰는 절제 모델 Holo-M AR은 138회로, Ψ0의 114/180과 나머지 베이스라인(모두 80/180 미만)을 크게 앞섰다. Holo-M AR 단독으로도 모든 베이스라인을 이긴다는 점에서 이득의 상당 부분은 토크나이저와 공동 학습 레시피에서 나온다고 저자들은 해석한다. 그룹 이산 확산 디코딩은 자기회귀 변형보다 집계 성공률이 약간 더 높으면서(143 대 138) 추론 지연을 크게 줄였다. 전문가 설정에서는 태스크별로 파인튜닝한 Holo-M이 163/180으로 최고 성공률을 기록해 가장 강한 베이스라인 Ψ0(154/180)를 앞섰고, 격차는 가장 긴 행동 지평을 가진 Mobile P&P에서 가장 컸다. 테이블 사이를 이동하며 물체를 운반·배치해야 하는 이 태스크에서 Holo-M 전문가는 30회 중 25회(레벨별 8/9/8) 성공해 Ψ0의 18/30(7/5/6) 대비 약 40% 상대 개선을 냈다. 데이터 스케일링 절제에서는 사전학습을 건너뛰고 SIMPLE에 바로 포스트트레이닝한 경우 53/180, Humanoid Everyday만 사전학습한 경우 119/180, EgoDex를 더한 전체 레시피가 138/180으로, 사전학습 데이터만으로 성공률이 2.6배 증가했다. 즉 로봇 데이터로 전신 그라운딩을 확립한 뒤 자기중심적 인간 데이터를 더하면 폐루프 견고성이 좋아진다는 것이 저자들의 설명이다.
실제 로봇 배포도 보고된다. 하드웨어는 Unitree G1-comp(competition edition)에 Dex3 손 두 개와 상단 장착 RealSense 카메라를 붙인 구성으로, 카메라를 640×360, 30Hz로 입력받고 상체 31개 관절 각도(손 14, 팔 14, 허리 roll/pitch/yaw)를 각각 256개 상태 토큰으로 양자화하며, 하체 관절·베이스 속도·높이·IMU는 입력으로 쓰지 않는다. 출력은 1초 분량의 행동이고 RTX 5090 한 장에서 WebSocket으로 실행된다. Ψ0의 실로봇 스택(클라이언트, 관측/행동 프로토콜, 전신 컨트롤러)을 그대로 재사용하고 정책 서버만 교체해, 성능 차이가 정책과 청크 스케줄링에서만 기인하도록 했다. 제어 루프는 고정 스케줄로, 모델이 새 청크를 추론하는 동안 로봇은 이전 청크를 계속 실행한다. 관측은 15틱(500ms)마다 고정 주기로 캡처되고, 이후 청크는 hold 구간에 해당하는 선행 예측 스텝을 버리고 hold 직후 스텝부터 나머지 15스텝을 이어받는다. hold는 2·4·8 de-masking 스텝에 대해 각각 233ms, 333ms, 500ms였고, 추론이 hold를 넘기면 로봇은 이전 자세로 복귀한다. Tabletop Grasp과 Move Pick 두 태스크에 대해 배포 장면에서 수집한 100 에피소드 텔레오퍼레이션 데이터로 일반 정책에서 특화시킨 체크포인트를 썼고, 태스크당 10회 롤아웃으로 실로봇 성공률을 측정했다.
저자들이 밝힌 전제와 한계는 명확하다. 이 작업은 Holo-M v1이며, 학습과 평가 모두 decoupled WBC(하체는 강화학습, 상체는 IK 구동) 위에서 이루어졌다. 향후 버전에서는 토크나이저의 detokenization을 HoloMotion이나 SONIC 같은 다른 컨트롤러로 재매핑하되 토큰화, 모달리티 간 어텐션, de-masking 디코딩 방식은 그대로 유지할 계획이다. 또한 행동 토큰이 언어와 같은 어휘에 있으므로, 서브태스크 분해나 실패 복구 같은 명시적 추론 토큰을 행동 토큰 사이에 끼워 넣는 방식으로 장기 지평 언어 지정 로코-매니퓰레이션 능력을 백본 추론 능력 향상에 직접 연동시킬 수 있다는 것이 저자들이 제시하는 확장 방향이다. 아울러 부위별 통합 토크나이저는 여기서 쓴 것보다 더 이질적인 데이터 소스를 흡수하도록 설계되었으므로, 텔레오퍼레이션 로봇 데이터보다 훨씬 풍부한 자기중심적 인간 영상으로 학습을 확장하는 것이 자연스러운 다음 단계라고 밝힌다.