범용 VLM 하나로 로봇 조작을 제로샷으로 수행하는 MotorMind
MotorMind: Scaffolding General Vision Language Models for Zero-Shot Robot Manipulation
무엇인가
이 논문은 로봇 조작에서 제로샷 일반화가 왜 어려운지를 문제로 잡는다. 비전-언어-행동(VLA) 모델은 분포 내 성능은 강하지만 물체 외형, 공간 배치, 과제 의미, 환경 구조가 바뀌면 성능이 무너지고, 새로운 환경에 적응하려면 추가 로봇 행동 데이터나 정책 적응이 필요하다. 또 VLA는 로봇 전용 데이터셋으로 학습돼서 빠르게 발전하는 범용 VLM의 지능을 직접 가져오지 못한다. 다른 갈래인 에이전트 로보틱스는 범용 VLM을 상위 추론에만 쓰고 인식·그라운딩·행동 생성·모션 플래닝을 외부 모듈에 맡기는데, 학습된 행동 전문가, SAM3 같은 분할 모델, 스킬 라이브러리, 모션 플래너, 반복 실행 모듈이 계속 붙어 복잡도와 비용이 커진다. 저자들의 질문은 이렇다. 외부 모델이나 코딩 에이전트 없이, 범용 VLM 자체가 사람 원격조작자처럼 관측에서 직접 추론하고 행동을 내고 실행 피드백에 적응할 수 있는가.
어떻게 동작하나
먼저 저자들은 VLM이 조작 중에 반복해서 답해야 하는 세 가지 국소 결정을 진단한다. 다음에 무엇을 할지 고르는 행동 선택, 이전 행동이 진전을 만들었는지 판단하는 진행 평가, 현재 부분목표가 충족됐는지 판단하는 완료 판정이다. 240문항(능력별 80문항) 진단 벤치마크에서 행동 선택이 모든 모델에서 가장 부정확했고 정확도는 18.75%에서 60.00% 사이였다. Qwen3.8-Flash-Next 기준 행동 선택 36.25%, 진행 평가 55.00%, 완료 판정 65.00%였다. GPT-6 Astra는 세 능력 모두 최고 정확도를 냈지만 질의당 8.724초가 걸려 Qwen3.8-Flash-Next의 0.276초와 큰 차이를 보였다. 저자들은 이 정확도-지연 트레이드오프와 불완전한 판정을 근거로, 짧게 제안하고 실행 결과를 보고 수정할 수 있는 피드백 기반 제어 인터페이스를 설계해야 한다고 결론짓는다.
무엇과 다른가
MotorMind의 구조는 하나의 동결된 범용 VLM에 다섯 개 역할을 부여한다. Planner는 자연어 지시를 부분목표 시퀀스로 분해하고, 각 부분목표는 의도된 상태 변화, 대상 설명, 성공 기준을 담는다. Executor는 현재 이미지, 로봇 상태 측정값, 최근 사이클 이력을 받아 짧은 행동 배치를 제안한다. Monitor는 실행 중인 부분목표를 감시하며 잘못된 대상, 떨어진 물체, 장면 변화 같은 이벤트를 경보로 보고한다. Verifier는 시도가 끝날 때 관측과 로봇 상태 증거로 성공 기준을 평가하고, Memory는 실행 증거와 평가 결과를 압축해 다음 계획과 검증에 넘긴다. 물리 실행은 결정적 Controller가 맡는다.
어떻게 쓰나
행동 표현은 관절 명령이 아니라 로봇 베이스 좌표계의 파라미터화된 중간 수준 동작이다. 핵심 프리미티브는 move, rotate, gripper 세 가지로, 이동은 방향 또는 축과 거리를, 회전은 방향 또는 축과 각도를, 그리퍼는 열기/닫기와 선택적 폭을 지정한다. 한 사이클의 제안은 행동 배치 A_t=(a_{t,1},…,a_{t,K_t}), 각 a_{t,k}=(τ_{t,k}, η_{t,k}) 형태로, τ는 행동 타입, η는 파라미터다. VLM이 행동과 크기를 고르고 Controller가 이를 실제 운동으로 변환하며, 다음 제안은 갱신된 관측과 측정된 피드백을 받는다. 스케줄링은 비동기다. 실행 루프 자체는 순차적이지만 Monitor는 백그라운드 스레드에서 주기적으로 관측을 확인하고, STOP 경보가 뜨면 Controller가 다음 행동 경계에서 대기 중 명령을 버린다. 예컨대 잘못된 물체를 집은 것을 감지하면 큐에 있던 배치 동작을 막을 수 있다. 메모리 요약도 백그라운드에서 생성돼 다음 부분목표가 생성을 기다리지 않는다.
전제와 한계
실험은 LIBERO-PRO의 Goal, Spatial, Object 스위트에서 이뤄졌다. MotorMind는 과제별 정책 학습 없이 베이스 스위트 평균 66.7%, Semantic·Object·Position·Task 교란 조건에서 53.8% 성공률을 기록했고, 이는 비교한 기존 제로샷 방법의 최대 13.3%와 19.2%를 크게 앞선다. Spatial 베이스 75.0%, Task 교란 58.3%다. 240개 교란 에피소드에서 과제 파인튜닝된 OpenVLA-OFT가 51.2%인 것과 비교해 2.6%포인트 차이로 맞먹는다. 효율 지표로 TimeScore=60s/T̄(성공률 66.7%, 평균 223.4초면 17.91 pp/min)를 함께 보고한다. 실행 중 변화에 적응하는 실험에서는 Dynamic Reasoning 70%, Scene Shift 90%, Dynamic Manipulation 80%, Prompt Shift 60%로, 각 그룹 최강 베이스라인의 30%, 70%, 40%, 60%를 웃돌았다. 실제 xArm6 로봇에서는 Direct Perception 98%와 Human Perturbation 92%를 합쳐 95%를 냈고, Semantic Understanding 네 과제는 80%, 100%, 100%, 60%였다. 백본을 GPT-6 Sol로 바꾸면 Spatial 70→80%, Object 80→100%, Goal 50→70%로 평균 83.3%까지 오르지만 Spatial 월타임이 199.0초에서 370.4초로 늘어난다. 절제 실험에서는 재계획 제거 시 66.7→36.7%, Verifier 제거 시 60.0%, Planner 제거 시 0.0%로 떨어졌다.
개발자 관점에서 이 논문의 요점은 로봇 정책을 처음부터 학습하는 대신, 이미 접근 가능한 범용 VLM을 중간 수준 행동 표현과 비동기 실행 하네스로 감싸는 것만으로 상당한 제로샷 조작이 가능하다는 주장이다. 실제로 적용을 검토한다면 세 가지를 먼저 확인해야 한다. 첫째, 행동 프리미티브(move/rotate/gripper)와 베이스 좌표계 파라미터가 대상 로봇의 Controller로 얼마나 깔끔하게 매핑되는지다. 둘째, 백본 선택의 정확도-지연 트레이드오프로, 논문은 Qwen3.8-Flash-Next를 실용적 균형점으로, GPT-6 Sol을 더 강하지만 느린 선택지로 제시한다. 셋째, Monitor의 STOP 경보와 Verifier의 성공 판정이 실제로 오류를 얼마나 줄이는지인데, 절제 실험상 Planner와 재계획의 기여가 압도적이고 Verifier는 6.7%포인트 수준이다.
저자들이 밝힌 한계와 전제도 분명하다. 진단 벤치마크는 국소적 시각 결정을 평가한 것이지 완전한 과제의 폐루프 제어를 평가한 것이 아니며, 관찰된 오류의 원인이 특정 제어 추상화 때문이라고 단정하지 않는다. 남은 실패는 시각 그라운딩 오류가 가장 큰 비중을 차지하고, 조기 완료 선언이 특히 Task·Object 교란에서 주요 실패 원인이다. 즉 성능 상한은 백본 VLM의 시각 이해와 자기 검증 능력에 묶여 있고, 논문 스스로 이 병목이 더 강한 미래 VLM에서 완화될 것으로 전망한다. 또한 실로봇 평가는 테이블탑 배치 과제에 한정되며, 과제별 시연이나 파인튜닝을 쓰지 않았다는 전제 위에서 보고된 수치다.