VLM을 로봇 파일럿으로 쓰는 시각 행동 워크스페이스, LIBERO-Pro 평균 75.6% 달성
World Action Agent: Harnessing VLMs for Robot Manipulation via World Action Rehearsal
무엇인가
이 논문이 푸는 문제는 범용 VLM의 지식과 공간 추론을 로봇 조작에 어떻게 직접 쓸 것인가다. 기존 계열은 VLM을 간접적으로만 활용한다. HAMSTER나 ReKep은 VLM이 중간 경로나 관계 제약을 예측하게 하고 하위 정책·옵티마이저가 이를 운동으로 바꾸며, Code as Policies(CaP)와 CaP-X는 언어모델이 인식·제어 API를 프로그램으로 조합하고 실행 피드백으로 수정하게 한다. Show-Harness나 VIA 같은 시각 인터페이스는 VLM이 행동을 직접 고르게 하지만, 장면을 보여줄 뿐 행동할 세계를 주지는 않는다. 저자들이 지목하는 결손은 세 가지다. 관측이 그리퍼·물체·목표 사이의 국소 관계 중심이 아니고, 행동은 발행되는 즉시 효력이 생겨 결과를 보기 전에 시험할 수 없으며, 지각과 행동이 다른 공간에 있어 이미지에서 본 오프셋을 좌표로 다시 써야 한다.
어떻게 동작하나
WAA의 답은 VLM 자체가 아니라 VLM이 보는 것과 결정이 효력을 발휘하는 방식을 바꾸는 것이다. 핵심은 하나의 캘리브레이션된 Canvas로 구성된 시각 행동 워크스페이스이며, 여기에는 전역 뷰와 두 개의 Contact view가 들어간다. Contact view는 장면 포인트클라우드, 로봇 기하, 강조된 상호작용 영역이 주어졌을 때 가시성과 조밀한 프레이밍을 최대화하고, 같은 방향을 중복 전달하는 시점과 시점 점프에 벌점을 주는 목적함수(식 2)로 자동 선택된다. 두 Contact view의 수평 투영은 직교하도록 제약되어, 정렬 오차를 두 독립 방향에서 읽을 수 있다. 이 목적함수는 로봇 베이스 좌표계의 포인트클라우드만 요구하므로 시뮬레이터 렌더링, 캘리브레이션된 RGB-D 융합, VGGT 같은 피드포워드 모델의 RGB 복원 어느 쪽이든 쓸 수 있다.
무엇과 다른가
에이전트가 쓰는 도구는 효과에 따라 세 부류다. query 도구는 공간 정보나 스킬 안내를 얻고, proposal 도구는 실행 계획 제안을 만들고 수정하며 시각 프리뷰와 계획 피드백을 돌려주고, execution 도구가 로봇을 움직인다. query와 proposal은 물리 세계를 바꾸지 않으므로 에이전트는 실행 전에 행동을 반복 검사·수정할 수 있다. 행동 리허설에서는 에이전트가 Canvas에서 목표를 지정하면 하네스가 역기구학을 풀고 cuRobo로 운동을 계획한 뒤 목표 자세를 반투명 로봇으로 모든 뷰에 오버레이하고 실행 가능성을 보고한다. 더 세밀한 조정이 필요하면 메인 에이전트가 공간 의도를 Imagination Agent에 위임하고, 이 에이전트는 별도 컨텍스트에서 물리 장면을 그대로 둔 채 제안을 반복 편집·재계획해 수정된 제안만 돌려준다. 실행 가능한 계획이 있는 제안만 실제 운동이 된다. 뷰 내 보정은 오차가 관찰된 바로 그 뷰에서 수정을 표현하게 한다. Contact view에서 기준점(그리퍼 또는 든 물체의 보이는 점)에서 원하는 위치로 드래그하면, 뷰 캘리브레이션이 이를 유계 엔드이펙터 변위로 변환한다.
어떻게 쓰나
절차 지식은 같은 워크스페이스를 통해 두 경로로 얻는다. 비모수 경로에서는 스킬 라이브러리를 진화시킨다. 각 스킬은 적용 조건, 절차, 참조 이미지가 붙은 핵심 상태, 관찰 가능한 결과 확인으로 구성되며, 고정 좌표나 고정 변위 대신 그리퍼·물체·목표가 만족해야 할 관계와 필요한 접촉·여유, 실패 회복 방법을 규정한다. 실행 중 메인 에이전트는 이름과 설명으로 스킬을 고르고 해석을 Skill Agent에 위임하는데, 참조 이미지는 Skill Agent 컨텍스트에 남겨 과거 이미지가 현재 장면으로 오인되지 않게 하고 메인 컨텍스트를 간결하게 유지한다. 라이브러리는 GPT-5.5가 하네스 API로 작성한 텍스트 전용 시드 스킬에서 출발해, LIBERO-90 원본 태스크당 전문가 궤적 하나로 보강된다. Learner가 영상을 상태 변화 지점에서 분할해 하네스 행동 관점의 지식 후보를 근거 프레임과 함께 추출하고(기존 스킬 텍스트를 읽지 않아 새 증거가 기존 결론에 끌려가지 않는다), Editor가 기존 절차·참조 이미지와 비교해 추가·수정·폐기·보류를 결정하며, Reviewer가 근거와 대조해 구체적 문제를 되돌려준다. 시연은 성공 행동만 보여주므로, 사람이 에이전트와 같은 다중 뷰 Canvas와 같은 도구로 로봇을 조작하는 Canvas-GUI를 두고, 실패 직전의 에이전트 시도와 같은 상태에서의 사람 교정을 대비해 어떤 관계(접촉 위치, 정렬 방향, 놓는 시점)가 결과 차이를 만들었는지 회복 지침으로 증류한다. 모수 경로에서는 하네스에서 기록한 상호작용 트레이스로 더 작은 VLM을 식 3의 최대우도 목적함수로 파인튜닝한다. 학습 예시는 실행 전 Canvas, 태스크 지시, 제어 컨텍스트, 사용 가능한 스킬 안내와 실제 실행된 도구 호출을 짝지은 것이며, 교사의 추론이나 시뮬레이터 특권 상태는 포함하지 않는다. 파인튜닝은 메인 정책만 갱신하고 워크스페이스와 하위 에이전트는 그대로 두므로, 모델은 인터페이스를 대체하는 법이 아니라 사용하는 법을 배운다.
전제와 한계
실험은 LIBERO-Pro와 robosuite에서 이뤄졌다. LIBERO-Pro는 Object, Goal, Spatial 각각에 초기 위치 교체(Pos.)와 태스크 교란(Task)을 적용한 6개 split을 쓰고, split당 10개 태스크, split당 60 에피소드(태스크당 6회)를 평가한다. 백본은 Gemini 3.7 Flash이며, 스킬 라이브러리는 LIBERO-90에서만 학습해 평가 전에 동결한다. 진화된 스킬을 쓴 WAA는 평균 75.6%로 최고 성능을 냈고, 스킬 없이도 28.9%, 텍스트 전용 시드 스킬로 43.3%였다. Spatial split 성공률은 스킬 없이 13.3%와 6.7%에서 진화된 스킬로 80.0%와 73.3%까지 올랐다. 비교 대상 중 ASPIRE는 평균 72.0%로 Object 두 split과 Goal Pos.에서 가장 강했고, 같은 백본에 스킬 없이 돌린 Show-Harness는 평균 6.7%로 Spatial 에피소드를 전부 실패했으며, π0.5는 12.8%였다. Spatial split에서 CaP-Agent0와 RATs는 12.0~31.0%, ASPIRE는 51.0%와 60.0%에 그쳤다. 효율도 차이가 나서 WAA는 에피소드당 평균 31회 모델 호출과 150초를 쓴 반면 Show-Harness는 120회 호출과 874초를 썼다.
전이와 일반성도 보고된다. robosuite에서 스킬 없이도 lifting과 stacking은 모든 시행을 성공했고 restacking은 60.0%였으며, 동결된 LIBERO 스킬을 쓰면 restacking이 100.0%로 올라간다(CaP-Agent0에 RATs 스킬을 붙인 조합은 평균 63.3%). 포인트클라우드 출처를 시뮬레이터에서 RGB-D 융합이나 VGGT 복원으로 바꿔도 평균 성공률은 71.1%와 68.9%로 각각 4.5포인트, 6.7포인트만 떨어지고 두 Spatial split에서는 여전히 모든 베이스라인을 앞선다. 스토브 활성화 태스크에서는 스토브 전용 절차 없이 LIBERO-90 시연 하나로 스킬을 얻어 LIBERO-Pro 스토브 태스크 10회 실행을 모두 성공했는데, Reviewer가 노브 움직임을 성공으로 간주한 초안을 거부하고 명시적 활성화 신호를 요구하도록 만든 결과다. 파일럿 증류에서는 6개 split에 걸친 112개 성공 에피소드의 1,774개 메인 에이전트 도구 호출로 Qwen3.5-9B를 LoRA(rank 8, 10 에폭, 학습률 5×10⁻⁵)로 파인튜닝해, 인도메인 성공률 0.0%→55.0%, 아웃오브도메인 1.7%→43.3%를 얻었다.
개발자 관점에서 이 논문의 실무적 의미는 VLA를 파인튜닝하지 않고도 범용 VLM을 로봇 제어 루프의 의사결정자로 쓸 수 있다는 구체적 패턴이다. 도입을 검토한다면 먼저 하네스가 요구하는 전제를 확인해야 한다. 로봇 베이스 좌표계의 포인트클라우드, 투영 캘리브레이션이 유지되는 다중 뷰, 역기구학과 cuRobo 같은 운동 계획기, 그리고 이미지 공간 드래그를 유계 변위로 바꾸는 보정 경로다. 다음으로 스킬을 고정 좌표가 아니라 관계 지침으로 작성해야 이식성이 생긴다는 점, 그리고 하네스에서 기록되는 상호작용 트레이스와 Canvas-GUI의 사람 교정이 별도 라벨링 없이 그대로 소형 모델 학습 데이터가 된다는 점이 설계상 중요하다. 비용 측면에서는 에피소드당 수십 회의 모델 호출이 발생한다는 것을 전제로 삼아야 한다.
저자들이 밝힌 한계는 두 가지다. 첫째, WAA는 VLM의 공간 이해를 끌어내지만 성능 상한은 백본에 묶인다. Gemini 3.7 Flash가 일부 태스크에서 다중 뷰 정보를 불완전하게 통합해 WAA가 덜 안정적으로 동작하며, 저자들은 이 한계가 하네스 인터페이스가 아니라 백본의 지각에 있다고 본다. 따라서 다중 뷰 이해가更强的 VLM이 나오면 WAA가 직접 이득을 본다. 둘째, 비용과 속도다. WAA는 code-as-policy 계열보다 루프를 더 자주 닫고 모든 결정을 새 관측에 근거시키며, Flash급 백본을 써서 프런티어 독점 모델로 구동하는 방식보다는 저렴하지만 에피소드 하나에 여전히 수십 회의 모델 호출이 필요하다. 저자들은 소형 VLM이 하네스를 조종하도록 학습시키는 것을 비용과 지연을 줄이는 유망한 경로로 제시한다.
관련 논문
- 재계획 주기에 디노이징을 분산하는 로봇 월드액션모델 Rolling-WAM영상 예측과 행동 생성을 함께 디노이징하는 World Action Model의 지연을 줄이기 위해, 슬라이딩 윈도우로 디노이징을 여러 재계획 주기에 분산하는 Rolling-WAM을 제안한다. LIBERO 98.1%, RoboTwin 93.3% 성공률을 유지하면서 재계획 지연을 4.5배 단축했다.
- 행동을 구분하는 세계 모델 AD-WM은 반사실적 MPC를 위한 것이다.잠재 세계 모델이 사실적 전이 예측만 잘하면 반사실적 행동 비교가 무너진다는 문제를 지적하고, 잔차 잠재 예측과 예측기 수준의 행동 복원 정규화를 결합한 AD-WM을 제안한다. OGBench-Cube 하드 스타트 성공률을 3.7%에서 52.0%로 올리고, Franka 실로봇 픽앤플레이스도 42.2%에서 71.1%로 개선했다.
- 단일 시연에서 로봇 조작 프로그램을 생성·검증·개선하는 코딩 에이전트, RAPIDRAPID는 단일 시각 시연에서 로봇 조작 프로그램을 자동 생성·검증·개선하는 코딩 에이전트 프레임워크다. 객체 중심 관계형 표현으로 시연 장면을 넘어 물체 자세·형상·재질·환경 변화에 일반화하는 전략을 만들고, MuJoCo 시뮬레이션과 실제 Franka 암에서 검증했다.
- 하나의 어휘로 이해·행동·미래 예측을 묶은 8B 물리 파운데이션 모델 PhysBrain 1.5PhysBrain 1.5는 물리 환경 이해, 행동 생성, 미래 상태 예측을 하나의 학습 틀로 묶는 모델이다. 일반 시각언어모델에서 출발해 언어 응답과 엔드이펙터 움직임, 시각 목표를 이산 시퀀스로 인코딩하고 자기회귀 다음 토큰 예측으로 공동 최적화한다.