월드모델이 상상한 실패로 로봇 스킬 전문가를 골라 가르친다
RoboCoach: World Models as Active Coaches for Compositional Robot Skills
무엇인가
장기(long-horizon) 로봇 조작은 차 만들기, 상 차리기처럼 재사용 가능한 스킬의 연쇄로 이뤄진다. 각 스킬은 다음 스킬이 실행될 상태를 바꾸기 때문에 국소적인 실행 오류가 전파되어 전체 작업을 실패로 몰고 간다. 문제는 개선 비용이다. 가능한 모든 스킬 조합의 롱테일을 end-to-end 시연으로 덮는 것은 비싸고 확장이 어렵다. 물리 로봇에서는 궤적 하나하나가 데이터 수집 노력, 하드웨어 시간, 환경 리셋, 안전 감독을 소모한다. 이 논문이 던지는 질문은 구체적이다. 궤적 하나가 비쌀 때, 다음 시연은 어느 스킬을 겨냥해야 하고 그 감독은 어느 정책 구성요소에 들어가야 하는가.
어떻게 동작하나
RoboCoach의 설계 원칙은 공유 예측과 선택적 적응의 분리다. 실행은 공유 VLA 백본 π_base 위에 스킬별 LoRA 어댑터 Δ를 얹은 전문가 라이브러리로 구성한다(수식 1). picking, placing, pressing 같은 원자적 스킬마다 전문가가 하나씩 대응하고, 같은 전문가가 여러 과제의 서브태스크를 맡을 수 있다. 그래서 코칭의 기본 단위는 서브태스크-전문가 쌍 (g, e)가 된다. 긴 작업의 실패를 미완료 서브태스크로 국소화하고, 그 서브태스크에 대응하는 재사용 전문가를 감독의 목적지로 삼는 구조다.
무엇과 다른가
코칭은 Route–Imagine–Diagnose–Improve(RIDI) 루프로 돌아간다. Route 단계에서 라우터는 과제 지시, 현재 시각 관측, 스킬 어휘, 완료된 서브태스크 프리픽스를 입력받아 다음 서브태스크 g_k를 정하고 매핑 함수로 해당 전문가 e_k를 호출한다(수식 2). Imagine 단계에서 그 전문가는 공유 행동조건부 월드모델 CoachWorld 안에서 폐루프로 굴러간다. 전문가가 델타 엔드이펙터 공간의 행동을 예측하면 경량 어댑터가 이를 미래 엔드이펙터 궤적으로 바꾸고, CoachWorld는 카메라별 내부·외부 파라미터와 함께 다음 비디오 청크를 생성한다(수식 3). 생성된 청크는 다음 정책·판정 질의 전에 확정되어 다시 관측으로 들어가므로 폐루프가 유지된다. 이종 로봇을 하나의 예측 모델로 다루기 위해 행동은 엔드이펙터 위치 3차원, 6D 회전, 그리퍼 상태, 암 슬롯 존재 여부로 표현하고, 캘리브레이션으로 이를 영상 평면에 투영하며 PRoPE로 카메라 기하를 시각 self-attention에 반영한다. CoachWorld는 시연, 정책 실패, 플레이 데이터 등 비전문가 궤적까지 포함해 conditional flow matching 손실(수식 4)로 학습한다.
어떻게 쓰나
Diagnose 단계에서는 진행 판정기(progress judge)가 관측 윈도, 지시, 서브태스크를 받아 완료 확률 p를 0과 1 사이로 추정한다. 서브태스크-embodiment 쌍마다 완료 임계값과 시간 제한을 코칭 전에 캘리브레이션해 고정해 두고, 임계값을 넘으면 라우터로 제어를 돌려보내고 넘지 못하면 시간 제한까지 실행한다. 시간 제한에 걸리면 그 시점의 서브태스크-전문가 쌍을 첫 타임아웃으로 기록한다. 각 초기 상태 시행은 월드모델 시드 3개로 돌리고, 최소 2개 시드가 타임아웃 쌍까지 포함해 결과에 동의할 때만 채택한다. Improve 단계는 이 기록을 과제별로 균등 가중한 first-timeout 질량 점수(수식 6)로 집계해 상위 M=2개 쌍을 고르고, 각 쌍에 대해 B/M개의 서브태스크 시연을 요청한다. 새 시연은 기존 데이터의 소량 replay와 섞어 해당 전문가의 LoRA만 파인튜닝하며, 백본과 선택되지 않은 어댑터는 건드리지 않는다. 갱신된 라이브러리가 다음 라운드의 스코어카드를 만든다.
전제와 한계
평가는 LIBERO-Long 10개 과제, RoboTwin 2.0 5개 과제, 그리고 Franka Research 3와 AgileX dual-Piper 실로봇에서 이뤄졌다. 공유 백본은 LIBERO와 Franka에 π0.5, RoboTwin과 AgileX에 MolmoAct2를 쓴다. 시뮬레이션은 과제당 50회, 실로봇은 20회 시행한다. 먼저 월드모델 자체를 검증한다. DROID와 자체 수집 데이터에서 각각 180개 클립을 뽑아 전체 에피소드 예측을 평가했을 때, 혼합 도메인 CoachWorld가 DROID-180에서 LPIPS 0.0996, FVD 51.71, 궤적 지표 3종, 지시 따르기 0.880으로 최고를 기록했고 Lab Franka-180에서도 LPIPS 0.1712로 가장 좋았다. 정책 수준 사실성은 22개 과제-정책 체크포인트 쌍에서 상상 성공률과 실제 배포 성공률의 Pearson 상관 r=0.820, Spearman ρ=0.840으로 나타났다. 진행 판정기로는 여러 후보 중 RoboMeter를 채택했는데, 전환 경계 오차 0.414초, [email protected] 82.73%, 결과 F1 88.21%를 냈고, CoachWorld가 생성한 관측에서도 단계 순위 상관 ρ=0.638, 결과 F1 83.84%를 유지했다.
고정 예산 코칭 실험에서 라운드당 시뮬레이션 100개, 실로봇 플랫폼당 50개의 서브태스크 시연을 추가한다. 실로봇에서 Franka는 13.3%에서 75.0%로, AgileX는 40.0%에서 83.8%로 올랐다(플랫폼당 누적 150개 시연). 같은 예산에서 모든 과제에 균일하게 시연을 모아 공유 어댑터를 갱신한 Single VLA + Uniform은 각각 30.0%와 47.5%에 그쳤다. 정규화 Budget AUC는 Franka 53.1 대 18.9, AgileX 72.7 대 46.3이다. 시뮬레이션에서도 RoboCoach가 LIBERO 71.2%, RoboTwin 68.0%로 비교한 네 조건 중 최고 최종 성공률을 냈다. 데이터 획득과 갱신 위치를 분리한 비교가 핵심이다. RoboCoach가 고른 것과 같은 표적 시연을 공유 어댑터에 넣으면 LIBERO +0.8%p, RoboTwin −4.8%p에 그치지만, 대응하는 스킬 전문가에 넣으면 +3.4%p, +13.2%p가 더해진다. 모듈형 시스템 안에서 월드모델 표적 선택은 무작위 선택보다 LIBERO 2.8%p, RoboTwin 12.8%p 앞선다.
학습과 코칭에서 제외한 네 개의 장기 경로로 재조합 일반화도 확인했다. 경로당 실로봇 20회 시행에서 AgileX의 상차리기+차 만들기 연속 경로는 13/20(65%), Franka의 초록 버튼 누르기+램프 줄 당기기 조합은 3/20(15%), AgileX의 신발 놓기 순서를 뒤집은 경로는 5/20(25%), Franka의 버튼 순서를 뒤집은 경로는 7/20(35%)이었다. 네 경로 평균은 35.0%로, Single VLA + Uniform은 네 경우 모두 0%였다.
실무 관점에서 이 논문이 주는 신호는 두 가지다. 첫째, 월드모델을 데이터 증강기가 아니라 감독 배분기로 쓰는 패턴이다. 값싼 상상 롤아웃으로 실패 지점을 먼저 찾고, 비싼 실제 시연은 그 지점에만 투입한다. 둘째, 모듈형 정책에서 '어디를 가르칠지'와 '어디를 갱신할지'를 반드시 짝지어야 한다는 실험적 근거다. 같은 시연이라도 공유 어댑터에 넣으면 이득이 사라지거나 마이너스가 될 수 있다. 도입을 검토한다면 자신의 과제에서 상상 성공률과 실제 성공률의 상관이 유지되는지, 진행 판정기의 전환 오차가 라우팅을 망가뜨리지 않는지부터 확인해야 한다. 저자들이 밝힌 한계도 분명하다. 조작 대상이 가려지거나 접촉·충돌이 카메라 시야 밖에서 일어나면 그 영역의 물리 모델링과 예측이 어려워진다. 시드 합의로 확률적 변동에 대한 민감도는 줄였지만 월드모델의 체계적 편향을 배제하지는 못한다. 전문가 라이브러리는 스킬 의미론에 따라 사람이 미리 정의하며, 그 구조를 스스로 학습하고 인간 시연 의존을 줄이는 일은 열린 문제로 남는다.