스탠퍼드 HomeBody, Unitree G1에 계층형 VLM 제어 구조를 제안
스탠퍼드대 The Movement Lab과 캘리포니아공과대학(Caltech) 연구진이 휴머노이드 로봇 제어를 계층으로 나눈 프로젝트 HomeBody를 공개했다. Unitree G1에 비전언어모델(VLM)을 연결해, 로봇이 낯선 주방을 스스로 탐색한 뒤 사람의 지시에 따라 물건 찾기, 약 가져오기, 쓰레기 버리기, 서랍 열기를 연속으로 수행한다. 원문은 제목에서 모델을 GPT-6로, 본문에서는 GPT Astra로 적고 있다.
핵심은 VLM을 G1의 관절 제어기에 직접 붙이지 않았다는 점이다. Astra는 판단을 마치면 구조화된 tool call로 스킬 하나를 고르고, 그 스킬이 실제로 요구하는 파라미터를 함께 넘긴다. Pick은 현재 이미지에서 0~1000으로 정규화된 2차원 점과 왼손·오른손 지정을 받고, Navigate는 지도 좌표계의 목표점과 방향점을 받는다. Place는 몸통 좌표계의 3차원 해제 위치, 사용할 손, 해제 거리를 쓴다. 서랍 조작은 시각 정렬, 손잡이 걸기, 뒤로 걷기를 하나의 스킬로 묶었다. VLM은 말단 궤적을 연속값으로 뱉지 않고 의미 공간에서 대상만 지정하며, 기하 제약으로의 변환은 스킬 인터페이스가 맡는다.
공간 기억은 별도 계층이다. 탐색 단계에서 시스템은 카메라 관측, D435i 스테레오 데이터, LiDAR와 SLAM 정보, 관절 자세, Astra가 선택한 웨이포인트를 함께 저장한다. 이후 Astra가 Real2Sim 과정에 참여해 이 관측을 Isaac Sim의 디지털 환경으로 정리한다. 실행 시에는 Super Odometry로 G1의 실제 SLAM 지도상 상태를 구하고, ICP(Iterative Closest Point)로 SLAM 점군을 Isaac Sim 재구성 환경에 정합한다. 정합이 끝나면 실제 지도와 디지털 환경이 같은 공간 관계를 공유하고, 탐색 중 저장한 ego 키프레임도 그 좌표계에 묶인다. 기억은 두 층으로 나뉜다. 어떤 키프레임에 무엇이 보였는지를 담는 의미 기억과, 그 사진을 찍을 때 로봇이 어디 있었는지를 담는 계측 기하 정보다. 이미지 좌표를 지도 좌표로 바꾸는 일을 VLM 컨텍스트에 과거 사진을 밀어 넣는 방식으로 처리하지 않겠다는 설계다.
Pick 스킬의 입력은 단순하지만 뒤쪽 파이프라인은 길다. 2차원 점으로 분할 모듈을 프롬프트해 목표를 배경에서 분리하고, Fast-FoundationStereo가 D435i 스테레오 영상으로 깊이를 계산한다. 카메라 캘리브레이션 관계로 마스크 안의 픽셀을 3차원으로 투영한 뒤 해석적 방법으로 파지 자세를 생성한다. 계획 단계에서는 spline 레퍼런스를 만들고 minimum-jerk 타이밍으로 속도와 가속도 변화를 부드럽게 묶으며, 궤적을 따라가며 역기구학을 풀고 swept motion 전체의 충돌 간격을 검사한다. 접근 중에는 SAM 2.1과 SAMURAI의 memory selection으로 목표 상태를 유지하고 visual servoing으로 방향을 계속 보정한다. 제어 주기는 층마다 다르다. 팔과 손 명령은 250Hz, AMO는 5개 제어 틱마다 갱신되어 50Hz, Astra의 원격 추론은 초 단위다. 서랍을 열 때는 손이 손잡이를 잡은 채 로봇이 뒤로 걸어야 하는데, 여기서 쓰이는 AMO는 Sim2Real 강화학습과 궤적 최적화를 결합한 전신 제어 프레임워크로, 통상 분포를 벗어난 상지 목표가 들어와도 하지와 몸통을 조정해 작업 공간을 넓히도록 학습됐다.
최근 로봇 학습의 주류는 시각과 언어 입력에서 행동을 직접 뽑는 VLA다. HomeBody는 반대 방향을 택했다. 중간층을 명시적 인터페이스로 분리하면 파지는 해석적 방법으로, 내비게이션은 전통적 플래너로, 새 스킬은 강화학습 정책으로 각각 구현할 수 있다. 입출력이 같은 프로토콜을 따르기만 하면 상위 VLM은 하위가 어떤 제어 방법을 쓰는지 알 필요가 없다. 능력 확장의 병목이 정책 전체 재학습에서 인터페이스가 필요한 상태를 표현할 수 있는지의 문제로 옮겨간다는 뜻이다.
개발자 입장에서 참고할 지점은 세 가지다. 스킬 API를 어떤 명령 공간으로 정의할지, 과거 관측을 어떤 공간 상태로 표현할지, 그리고 고주파 제어와 초 단위 추론 사이의 경계를 어디에 그을지다. 이 구조에서는 모델 추론 지연이 신체 제어를 흔들지 않고 스킬 전환 지점에서만 멈춤을 만든다. 로봇 소프트웨어가 고수준 의사결정, 외부 상태 저장소, 표준화된 스킬 호출, 고주파 안정화 계층으로 나뉘는 형태에 가까워진다.
한계도 분명하다. Real2Sim은 배포 준비와 API 비용을 늘리고, Astra의 원격 추론은 스킬 사이에 멈춤을 만든다. 로컬 인지와 계획은 현재 RTX 4090 노트북 한 대에서 돌아가며, 더 무거운 비전 모델은 연산 요구를 계속 밀어 올린다. 장시간 작업은 팔 작업 공간, 손 서보 발열, 하드웨어 내구성에 묶인다. 더 근본적인 제약은 스킬 커버리지다. Astra는 Pick, Place, Navigate, Open Drawer의 순서를 바꿀 수 있지만 구현된 적 없는 접촉 동역학을 언어 추론만으로 만들어내지는 못한다. 스킬 라이브러리에 책상 닦기가 없으면 그 명령으로 안정적인 닦기 제어를 얻을 수 없고, 유연물체 제어기가 없으면 상위 계획이 하위 능력의 공백을 메우지 못한다.