인간 모션 데이터로 휴머노이드 보행을 자연스럽고 조종 가능하게 학습한다
HuMBLE: Human Motion-Driven Behavior Learning for Embodied Locomotion
무엇인가
휴머노이드 보행 제어에는 오래된 상충 관계가 있다. 명령 추종과 외란 복원에 최적화된 컨트롤러는 기계적인 걸음걸이를 만들고, 반대로 인간 모션 데이터에 강하게 묶인 컨트롤러는 데이터에 없거나 희박하게 등장하는 속도·방향 조합 명령에서 반응성을 잃는다. 이 논문은 배포 가능한 컨트롤러가 동시에 만족해야 할 세 조건을 명시한다. 첫째, 속도와 방향 전환 전반에서 인간 보행의 스타일 품질과 자연스러운 보행 전환을 보존할 것. 둘째, 넓은 범위의 사용자 지정 속도 명령에 정확하고 안정적으로 반응할 것. 셋째, 온보드 배포가 가능하도록 충분히 낮은 지연과 modest한 메모리·연산 요구를 만족할 것. HuMBLE은 이 세 조건을 두 단계 학습으로 분리해 해결한다.
어떻게 동작하나
1단계는 teacher-student 증류다. 먼저 다양한 속도·방향·보행 모드(작은 스텝, 일반 보행, 전력 질주, 옆걸음, 회전)를 담은 자체 큐레이션 모션캡처 데이터셋으로, 전신 레퍼런스에 조건화된 teacher 정책을 RL로 학습한다. 이 teacher는 motion-mimic 프레임워크로 레퍼런스 모션을 추종하면서 동역학적으로 실현 가능한 동작을 만든다. 이어서 DAgger 변형인 teacher-student 증류로, proprioception과 SE(2) 평면 토르소 속도 명령만 관측하는 경량 prior 정책을 만든다. 학습 목표는 롤아웃에서 마주친 각 상태에 대해 teacher가 취했을 행동을 레이블로 삼아, prior 정책의 행동과 teacher 레이블 간 차이를 최소화하는 감독학습이다. 즉 전신 레퍼런스라는 특권 정보 없이 부분 관측만으로 전신 협응 동작을 재구성하도록 강제하는 셈이다.
무엇과 다른가
2단계는 multi-task RL 파인튜닝이다. prior 정책은 데이터 분포 안에서는 충실하지만, 조이스틱으로는 가능하지만 인간 보행에는 드문 명령(예: 빠른 회전을 동반한 대각선 옆걸음)에서 취약하다. 이를 임의 명령 추종 보상으로 그냥 파인튜닝하면 스타일 붕괴가 일어난다. 그래서 병렬 환경을 두 그룹으로 나눈다. E_ref 그룹은 짧은 에피소드의 레퍼런스 가이드 모방 태스크로, 1단계에서 얻은 스타일 일관성을 유지하는 정규화 역할을 한다(부분 관측 상황에서 오차가 누적돼 레퍼런스에서 멀어지는 것을 막기 위해 의도적으로 에피소드를 짧게 잡는다). E_goal 그룹은 긴 에피소드의 goal-conditioned 태스크로, r_cmd + r_reg + r_survival 구조의 보상으로 무작위 샘플링된 속도 명령을 추종하며 운용 범위를 데이터 분포 밖으로 넓힌다. 여기에 GC-RSI(Goal-Conditioned Reference-State Initialization)를 도입한다. 명령별로 레퍼런스 상태를 binning한 룩업 테이블을 미리 만들어 두고, 주어진 명령에 해당하는 bin에서 프레임을 뽑아 시간 윈도우 안의 후보 상태를 소량 섭동해 초기 상태로 쓴다. 이는 파인튜닝이 학습된 prior의 지지집합 근처에서 시작하도록 앵커링하고, 큰 크기 명령에서 초기 자세 불일치로 에피소드가 조기 종료되는 것을 막는다. 학습 안정화를 위해 PPO의 critic을 teacher 학습 단계의 V_teacher로 초기화하고, 레퍼런스 가이드 태스크에서 5000 iteration 동안 정책을 고정한 채 critic만 워밍스타트한 뒤 본 학습에 들어간다. 태스크 구분용 이진 지시자 o_sup은 critic에만 제공되어 dual value function을 학습하게 하고, 두 태스크의 advantage는 각각 정규화한다. 정책 entropy 계수와 학습률은 1단계보다 낮춘다.
어떻게 쓰나
실험은 Isaac Lab에서 학습하고 MuJoCo 파이프라인으로 반응성·명령 커버리지·강건성을 교차 검증했으며, Boston Dynamics Atlas R1, Atlas D1, Unitree G1 세 플랫폼에 배포했다. 정성적으로 HuMBLE 정책은 Boston Dynamics 기본 MPC(족보 계획 + MPC 추종) 대비 동기화된 팔 스윙, 지지기 무릎 신전, 토르소 자세를 조절하는 힙 운동, heel-strike에 가까운 접지 전환, 지지발의 heel-to-toe rolling을 보였고, MPC는 팔이 몸통에 거의 고정된 뻣뻣한 동작을 보였다. 인간 모션 prior 없이 학습한 Tabula Rasa RL 정책과 비교해서는 상하체 시공간 협응, knee-locking, 접지 시 heel-to-toe rolling이 뚜렷했고 걸음이 더 조용했다. Atlas D1은 인간과 다른 발 형태에도 불구하고 heel-to-toe rolling이 유지됐다. 명령 속도가 낮을 때는 평평하게 끄는 걸음에서, 속도가 올라가면 heel-strike와 toe-off가 뚜렷한 패턴으로 자연스럽게 전환된다.
전제와 한계
정량 평가는 Unitree G1 시뮬레이션에서 레퍼런스 데이터셋의 8개 정규 모션(전진 3속도, 후진 3속도, 제자리 회전, 옆걸음)에 대해 수행했다. 레퍼런스에 주석된 SE(2) 속도 명령을 배포 정책에 입력하고 나온 궤적을, 시간 오프셋이 오차를 부풀리지 않도록 DTW로 정렬한 뒤 비교했다. DTW가 유발한 평균 시간 변위는 68.7ms였다. 배포 정책의 DTW 정렬 MAE는 토르소 선속도 0.058 m/s, 토르소 각속도 0.127 rad/s, 관절 위치 0.055 rad였고, 전신 레퍼런스를 직접 보는 teacher 정책은 각각 0.048 m/s, 0.055 rad/s, 0.033 rad였다. 즉 배포 정책의 추종 오차는 teacher 대비 각 성분에서 20.83%, 130.31%, 67.58% 컸다. 저자들은 이 격차가 부분 관측과 명령 조건부 파인튜닝에서 비롯된 예상된 결과라고 설명한다. 다만 레퍼런스 궤적의 표준편차(선속도 0.390 m/s, 각속도 0.491 rad/s, 관절 0.300 rad)와 비교하면 배포 정책 오차는 각각 0.149σ, 0.257σ, 0.184σ 수준으로, 전신 레퍼런스 입력 없이도 재타게팅된 모션 분포에 가깝게 머문다. 빠른 전진 보행에서 어깨·팔꿈치(팔 스윙), 힙 롤(측방 균형), 무릎(지지 다리 신전), 발목 피치(발 배치와 heel-to-toe rolling) 관절 궤적을 보면, 배포 정책이 proprioception과 SE(2) 명령만 받고도 teacher와 레퍼런스의 위상·진폭 추세를 따라간다.
개발자 관점에서 이 논문의 실용적 핵심은 스타일 획득과 명령 공간 확장을 분리한 파이프라인이다. 런타임에 레퍼런스 모션, 잠재 모션 샘플링, 생성 모델 추론이 필요 없고, proprioception과 SE(2) 속도 명령을 단일 경량 MLP로 매핑해 관절 레벨 행동을 낸다. 즉 지연·연산 제약이 빡빡한 온보드 제어에 바로 얹을 수 있는 형태다. 계층적 제어 스택의 로코모션 레이어로 통합하거나 조이스틱 직접 조종에 쓰는 시나리오를 검증했고, 실내외 환경 모두에서 동작했다. 다만 재현하거나 채택하려면 1단계 teacher 학습에 필요한 전신 레퍼런스 조건부 RL과 모션 재타게팅 파이프라인, 2단계의 GC-RSI 룩업 테이블 구축 비용을 함께 고려해야 한다.
저자들이 밝힌 한계와 전제도 분명하다. G1을 비정형 야외 환경에 배포하면 온보드 상태 추정기의 선속도 추정에 노이즈와 드리프트가 커질 수 있어, 선속도 관측을 아예 제외한 정책 변형을 별도로 학습했다. 이 변형은 안정적으로 동작하지만 목표 명령에 대한 속도 추종 정밀도가 떨어진다. 조이스틱 배포 시에는 입력의 변화율을 제한했는데, 사용자 주행감은 부드러워지지만 정책 반응성은 일부 희생된다. 레퍼런스 가이드 태스크의 에피소드를 짧게 잡은 것도 부분 관측으로 인한 장기 누적 드리프트를 피하기 위한 타협이다. 또한 비교 기준으로 쓴 Tabula Rasa RL 정책은 전역 최적 제어 설계가 아닐 수 있으며, 대안적 RL 구성에 따라 성능이 달라질 수 있다는 점을 명시한다. 마지막으로 teacher-student 증류만 사용하면 명령 커버리지가 레퍼런스 데이터셋 지지집합에 갇혀 배포 시 OOD 명령에서 실패할 수 있다는 것이 2단계 설계의 전제다.