RoboPrompt는 스케치와 점 하나로 로봇 정책을 조종한다
RoboPrompt: Intuitive Robot Policy Steering with Sparse Human Input
무엇인가
이 논문이 푸는 문제는 모방학습으로 학습한 엔드투엔드 로봇 정책이 데이터 다양성 부족 때문에 실제 환경 제로샷 배포에서 자주 실패한다는 것이다. 저자들은 이 악순환을 사람이 개입하는 배포 루프로 풀려 하지만, 기존 방식에는 걸림돌이 있다고 지적한다. 텔레오퍼레이션 기반 공유 자율성은 전용 하드웨어와 조작자 훈련을 요구하고, 언어 프롬프트는 작업 목표는 말할 수 있어도 미세한 공간·동작 수준 지시에는 약하다. 그래서 저자들이 요구하는 것은 물리적·인지적 부담이 거의 없는 직관적 조종 인터페이스다. 카메라 화면 위에 2D 스케치를 그리거나, 목표점을 찍거나, 거친 방향 지시를 주는 것만으로 정책 행동을 유도하고 그 궤적을 교정 데이터로 재활용하자는 구상이다.
어떻게 동작하나
1단계는 사람 의도를 행동 초안(action draft)으로 번역하는 모듈이다. 0.77B 파라미터 VLA인 Evo-1을 백본으로 쓰고, 실험에 쓰는 것과 같은 로봇 플랫폼에서 수집한 500개 플레이 데이터 궤적으로 학습한다. 프롬프트는 세 종류다. 점 프롬프트는 액션 호라이즌 H 이후 도달해야 할 TCP 위치를 이미지 평면에 투영한 값이고, 궤적 프롬프트는 그 구간의 미래 TCP 투영 시퀀스를 선으로 이은 것이다. 전역 행동 프롬프트는 같은 구간의 XYZ 액션을 누적해 [-1,1]^3으로 정규화한 거친 카테시안 변위를 텍스트로 바꾼 것이다. 중요한 점은 이 라벨을 VLM으로 만들지 않는다는 것이다. 의미 모호성·가림·정밀 동작 추론에서 VLM이 불안정하다고 보고, 실제로 수행된 미래 동작을 사후(hindsight)에 되짚어 라벨을 생성한다. 시각 프롬프트는 카메라 관측 위에 렌더링한 이미지와 배경 없는 프롬프트 전용 이미지 두 장을 입력으로 넣어 조종 신호가 장면 외형에 묻히지 않게 했다. 손실은 행동 손실에 점·궤적 픽셀 손실과 전역 변위 MSE를 합한 보조 손실을 더한 형태이며, 사람 프롬프트가 부정확하다는 전제로 위치·스케일 랜덤 교란을 준다.
무엇과 다른가
2단계는 초안을 베이스 정책의 사전분포로 다듬는 단계다. 핵심은 Progressive Biased Denoising(PBD)이다. 재계획 청크 인덱스 m에 대해 디노이징 스텝을 k^m = min(k0 + mΔk, N)으로 증가시키고 γ^m = k^m/N을 조종 강도로 쓴다. 기본형은 초안 a_I를 (1-γ)a_I + γε로 오염시킨 뒤 베이스 정책의 디노이징으로 되돌린다. γ=0이면 초안 그대로, γ=1이면 사람 개입 없는 베이스 정책 출력이 된다. γ를 청크마다 단조 증가시키면 하나의 스케치가 여러 청크에 걸쳐 영향을 주면서 첫 청크는 사람 의도를 강하게 따르고 이후 청크는 정책 사전분포로 부드럽게 넘어간다. 다만 저자들의 디노이징 동역학 실험에 따르면 디노이징 스텝당 행동 변화는 균일하지 않아서, 적은 스텝만으로도 큰 보정이 일어난다. 그래서 순수 가우시안 노이즈를 바로 섞는 대신 Noise-Augmented Flow Reversal Steering(NA-FRS)을 도입한다. 먼저 베이스 정책의 디노이징 동역학을 초안에서 목표 레벨까지 역방향으로 적분해 역노이즈 ε_rev를 얻고, 이를 순수 노이즈와 ε_mix = sqrt(1-ρ²)ε_rev + ρε로 섞는다. ρ가 랜덤 노이즈 비율을 조절하며, 결과적으로 디노이징 레벨에 대해 거의 선형에 가까운 부드러운 행동 전환이 나온다고 보고한다.
어떻게 쓰나
조종된 롤아웃을 정책 개선에 쓰기 위해 Time-weighted Optimal Transport(TOT) 필터를 제안한다. 성공한 롤아웃이라도 진동, 그리퍼 반복 동작, 불필요하게 긴 경로가 섞이면 비슷한 관측에 일관성 없는 행동이 짝지어져 마르코프적 모방학습 정책을 오히려 망친다는 것이다. TOT는 정책 임베딩 사이의 코사인 기반 스텝별 비용을 정의하고, 롤아웃을 가장 가까운 전문가 궤적에 최적수송으로 정합시킨 거리에 실행 길이 초과 페널티 λ·max(0, T_r/T̄_E - 1)를 더해 점수를 매긴다. 임계값 이하만 남겨 오프라인 데이터와 50대 50으로 섞어 다음 DAgger 라운드를 돌린다.
전제와 한계
실험은 Flexiv Rizon4와 Robotiq 2F-85 그리퍼, Sigma.7 텔레오퍼레이션으로 과제당 100개 시연을 모아 베이스 정책을 학습하는 구성이다. Diffusion Policy, π0.5, FastWAM 세 정책을 세 가지 과제 목표가 섞인 데이터로 학습시켜 다봉 분포를 만든 뒤 추론 시점에 RoboPrompt로 목표를 지정했다. 조종이 없을 때 정책마다 선호 목표가 달랐고, 조종을 걸면 세 정책 모두 비조종 베이스라인보다 성공률이 올라갔으며 프롬프트 정렬도 세 정책 모두 95% 이상이었다. DAgger 실험에서는 π0.5로 Insert Bread, Hang Cup, Push Ball 세 과제를 돌렸고(Push Ball은 5개 경로당 20개 시연, 추론 시 미학습 레이아웃), 2~3라운드 반복 후 세 과제 평균 성공률이 15.5% 올랐다. Insert Bread에서는 세 정책 평균 21.3% 향상, 사람 개입 횟수는 각각 2.86에서 1.60으로 44.0% 감소, 2.60에서 0.47로 81.9% 감소했다. 사용성 실험에서는 사전 경험이 없는 지원자 6명에게 5분 소개만 하고 π0.5 Round-0 정책으로 빵 삽입 과제를 5회씩 수행하게 했는데, 초보 사용자의 과제 진행도가 숙련 사용자와 비슷했고 비조종 베이스라인은 크게 웃돌았다. 롤아웃 품질 실험에서는 성공 궤적 20개를 무작위로 고른 경우보다 TOT로 거른 경우가 3개 과제 모두 진행도가 높았고, 무작위 데이터는 동작 떨림을 늘렸다.
개발자 관점에서 이 방법이 쓸모 있는 조건은 분명하다. 베이스 정책이 확산 또는 플로우 매칭 기반이라 반복 디노이징 구조와 노이즈 공간에 접근할 수 있어야 하고, 정책 아키텍처 변경이나 조종용 파인튜닝 없이 개입 인터페이스만 얹고 싶을 때 적합하다. 다만 공짜는 아니다. 1단계 조종 모델은 자체 플랫폼에서 모은 500개 수준의 플레이 데이터와 사후 라벨 생성 파이프라인을 요구하므로, 데이터 수집 비용이 남는다. 또 조종 대상이 엔드이펙터 포즈로 한정된다는 점, 그리고 조종된 롤아웃을 그대로 학습에 넣으면 오히려 정책이 나빠질 수 있어 TOT 같은 필터링이 사실상 필수라는 점을 확인해야 한다.
저자들이 밝힌 한계는 두 가지다. 첫째, 이 조종 방식은 엔드이펙터 포즈를 유도하는 데는 효과적이지만 다지 손가락 같은 손재주 있는 엔드이펙터 제어는 아직 지원하지 않는다. 둘째, 1단계 조종 모듈 자체는 특정 로봇 형태나 환경에 묶여 있지 않지만, 더 넓은 과제에서 제로샷 조종이 가능하려면 더 크고 다양한 데이터셋으로 학습하는 후속 연구가 필요하다고 말한다. 여기에 더해 프롬프트 라벨을 VLM으로 생성하는 방식은 의미 모호성·가림·정밀 동작 추론 상황에서 신뢰할 수 없다는 전제도 논문이 직접 밝히고 있다.