단일 시연에서 로봇 조작 프로그램을 생성·검증·개선하는 코딩 에이전트, RAPID

RAPID: Robot Agentic Programming from Demonstrations

arXiv2609.30249v1

Yuyao Liu2026-09-24조회 29

무엇인가

로봇 조작을 코드로 푸는 연구는 최근 코딩 에이전트의 성공에 힘입어 늘고 있다. 이 논문이 지적하는 핵심은 코딩 에이전트의 진짜 강점이 한 번에 코드를 뽑아내는 것이 아니라 생성, 실행, 검증, 수정의 반복 루프, 즉 에이전틱 코딩 루프에 있다는 점이다. 그런데 이 루프를 로봇 조작에 그대로 가져오려면 세 가지 재료가 필요하다. 의도한 결과를 정의하는 검증 가능한 태스크 명세, 프로그램 수준 추론과 저수준 실행을 잇는 조작 프리미티브, 그리고 후보 프로그램을 실행하고 평가할 상호작용 환경이다. 기존 로봇 코딩 에이전트 시스템들은 이 셋을 정답 보상과 성공 신호, 사람이 만든 프리미티브, 리셋 가능한 환경으로 미리 제공받는다고 가정한다. RAPID는 그 가정을 없애고, 시각적 인간 시연 하나와 언어 설명만으로 세 재료를 스스로 추론한다.

어떻게 동작하나

RAPID의 핵심 표현은 객체 중심 관계형 프로그램이다. 시연의 특정 궤적을 그대로 재생하는 대신 시연된 전략의 불변 구조를 담는다. 프리미티브는 고정 궤적도 블랙박스 정책도 아니라 국소 궤적 최적화 프로그램 P_i = (G_i, C_i, Ψ_i, ρ_i, J_i)로 표현된다. G_i는 의도한 효과에 대한 의미적이고 객체 중심적인 기술이고, C_i는 관계형 인터페이스로 의미 역할 r_i, 역할 간 관계 Γ_i, 효과 파라미터 q_i를 선언한다. 예를 들어 flip 프리미티브의 역할은 대상 물체, 지지 평면, 고정물, 매니퓰레이터이고 효과 파라미터는 요청된 회전 각도다. Ψ_i는 실행 가능한 성공 조건, ρ_i는 실행 시점에 장면 의존 기하를 계산하는 기하 해석기, J_i는 최적화 비용이다. 비용은 최종 상태가 의도한 효과에서 얼마나 벗어났는지를 재는 최종 비용과 접촉이 많은 상호작용을 유도하는 진행 비용의 합이며 진행 비용에는 가중치 λ_i가 붙는다. 이 최적화는 접촉이 많은 시뮬레이션을 미분하지 않아도 되는 gradient-free 샘플링 기반 최적화기인 cross-entropy method(CEM)로 푼다. 그 결과 프리미티브는 물체의 자세, 크기, 기하, 물리 속성, 요청 효과에 맞춰 동작을 스스로 적응시킨다.

무엇과 다른가

전략 Π는 이 프리미티브들을 제약으로 조합한 재사용 가능한 태스크 수준 프로그램이다. 전체 목표 G_Π와 최종 성공 조건 Ψ_Π, 그리고 K개 단계의 튜플로 구성된다. 각 단계에서 역할 맵 m_k는 장면 객체를 프리미티브의 역할 선언에 채워 넣는 바인딩 b_k를 만들고, 연결 제약 c_k는 이전 단계 실행 후의 환경 상태 s_{k-1}를 이용해 다음 프리미티브의 효과 인자 g_k를 그때그때 계산한다. 논문이 드는 예에서 press move 단계는 앞선 flip 단계가 만든 상태를 받아 갈색 장애물과 흰색 고정물 사이의 관계로 목표 위치를 구하고, 고정물 축을 따라 이동할 변위를 정한다. 즉 고정된 월드 좌표 오프셋이 아니라 실행 중 관측된 상태에서 기하 의존적 하위 목표를 계산한다. 새 장면에 배포할 때는 노출된 의미 역할에 장면 객체를 할당하는 가벼운 의미 바인딩만 하면 되고 전략과 프리미티브 자체는 고정되며, 이 바인딩은 장면당 수 초가 걸린다.

어떻게 쓰나

이 프로그램들을 만들고 검증하는 절차는 다음과 같다. 먼저 시연의 첫 RGB-D 프레임에서 상호작용 시뮬레이션 환경을 재구성한다. VLM이 장면의 물체를 식별하고 의미 라벨과 물리 속성을 추정하고, SAM 3로 분할 마스크를 얻고, RGB-D 프레임과 마스크를 SAM 3D에 넣어 완전한 메시를 복원하고, FoundationPose로 각 메시를 RGB-D 프레임에 정합한 뒤 MuJoCo에서 로봇 모델과 함께 조립한다. 다음으로 태스크 무관 변형 샘플러가 물체 외형, 크기, 자세와 질량, 마찰, 탄성 같은 물리 파라미터를 무작위화해 장면 변형을 만들고, 코딩 에이전트가 각 프리미티브나 전략에 대해 선언된 역할과 관계, 태스크 의미, 물리적 실현 가능성을 보존하는 변형만 통과시키는 필터를 작성한다. 프리미티브 구성 단계에서 RAPID는 시연을 순서 있는 상호작용 구간으로 나누고 구간별 설명을 붙인다. 이미 라이브러리에 있는 행동이면 그대로 가져오고, 아니면 의미 목표와 성공 조건을 추론한 뒤 관계형 인터페이스, 기하 해석기, 최적화 비용을 생성한다. 생성된 프리미티브는 시연 효과-환경 쌍과 실현 가능한 변형들로 이루어진 검증 집합에서 성공 조건이 모두 만족될 때까지 수정된다. 이후 전략을 조립하고 검증된 프리미티브는 고정한 채 조합만 수정하며, 전체 성공 조건이 검증 집합 전체에서 만족될 때까지 반복한다.

전제와 한계

실험은 접촉이 많은 nonprehensile 조작 8개 과제에서 수행했다. 물체가 처음에는 평행 그리퍼로 잡히지 않아 밀기, 뒤집기, 피벗, 넘어뜨리기 같은 프리미티브를 순서대로 써야 하는 과제들이다. MuJoCo에 Franka Research 3 팔과 순응형 작업공간 제어기를 올린 벤치마크를 만들고, 과제마다 시연 장면과 물체 자세, 외형, 크기, 형상, 재질이 다른 50개의 새 테스트 장면을 구성했으며 방해 물체도 넣었다. 평가는 RAPID에 숨겨진 비공개 성공 기준으로 하고 실험마다 3회 반복해 평균과 표준편차를 보고한다. 베이스라인은 에이전틱 루프, 객체 중심 관계형 표현, 장면 변형 합성의 세 축을 조합해 CaP, CaP+OReP, CaP-Agent0, CaP-Agent0+SV, RAPID w/o SV, RAPID 여섯 가지를 비교하며, 코딩 에이전트로는 Codex(GPT-5.6 Sol, high reasoning effort)를 쓴다. 결과적으로 순수 CaP는 각 테스트 장면에 맞춘 프로그램을 생성할 수 있음에도 성능이 낮았고, 관계형 표현만 붙인 CaP+OReP도 개선되지 않았다. CaP-Agent0는 프로그램 구성 중 정답 성공 신호와 환경 상태, 시각 관측을 담은 롤아웃 피드백을 받고 평가 시점에 각 테스트 장면에서 롤아웃 후 프로그램을 수정할 수 있는, RAPID보다 유리한 조건에서도 크게 뒤졌다. 장면 변형 생성을 제거한 절제 실험에서는 과제 1, 2를 제외하고 성능이 크게 떨어지고 성공률 표준편차가 커졌으며, 반대로 CaP-Agent0에 장면 변형 생성을 붙여도 성능은 개선되지 않았다. 과제당 프로그램 구성에는 수십 분이 걸리지만 이는 과제당 한 번이고, 50개 새 장면에서는 전략과 프리미티브가 고정된 채 의미 역할 바인딩만 수 초 걸린다. 원문 본문에는 표 II와 III의 구체적 성공률 수치가 제시되지 않아 퍼센트 값을 옮기지 않았다. LIBERO-Pro에서는 6개 태스크 설정 중 5개에서 최고 성공률을 냈고 LIBERO-Goal (Pos.)에서는 ASPIRE에 이어 2위였다. 이 실험에서 RAPID는 시연 없이 태스크 설명과 디버그 장면 하나만 받았고, CaP 베이스라인들은 파지, 놓기, 운반 같은 프리미티브를 미리 제공받았으며 ASPIRE는 과제당 15개 디버그 장면을 썼다. 실제 Franka Research 3 팔과 평행 그리퍼, Intel RealSense L515로 8개 nonprehensile 과제를 과제당 10개 테스트 장면에서 평가해 시뮬레이션에서 최적화한 접촉 위주 동작이 실제 로봇으로 옮겨졌음을 보였다.

실무 관점에서 이 논문이 주는 신호는 세 가지다. 첫째, 로봇 조작에서 코딩 에이전트의 병목은 코드 생성 능력이 아니라 검증 환경이다. 같은 에이전트에 정답 신호와 평가 시점 수정 권한을 더 준 CaP-Agent0가 RAPID에 뒤졌다는 결과는 시뮬레이션 재구성과 성공 조건 자동 추론이 실제 성능을 가른다는 뜻이다. 둘째, 프로그램을 월드 좌표 오프셋과 고정 타이밍으로 쓰면 장면이 바뀌는 순간 무너진다. 역할과 관계, 효과 파라미터로 표현하고 기하는 실행 시점에 해석하는 방식이 일반화에 유리하다. 셋째, 시뮬레이션에서 최적화한 접촉 위주 궤적이 순응형 제어기와 함께 실제 팔로 옮겨질 수 있다는 점은 sim-to-real 파이프라인을 설계할 때 참고할 만하다. 다만 과제당 수십 분의 구성 비용이 발생하므로 반복 실행이 많은 고정 작업군에 적합하고, 일회성 작업에는 비용 대비 효율을 따져야 한다.

저자들이 밝힌 전제와 한계도 분명하다. RAPID는 준정적 강체 조작을 대상으로 하며 시연 하나와 언어 설명, 그리고 시뮬레이션 재구성 품질에 의존한다. 실제 로봇 실험에서 real-to-sim과 sim-to-real 격차를 관리할 수 있었던 것은 VLM의 물리 파라미터 추정과 SAM 3D의 3D 복원 능력 덕분이라고 저자들은 설명한다. LIBERO-Goal (Pos.)에서 ASPIRE에 뒤진 이유로는 디버그 장면 하나에서 발견한 관절 물체 조작 프리미티브, 예컨대 서랍 열기가 공간 변이에 덜 강건한 반면 ASPIRE는 interpolate segment 모션 프리미티브를 제공받는다는 점을 든다. 향후 계획으로는 손가락이 많은 손 조작을 위한 강화학습 등 다른 프리미티브 학습 도구를 통합하고, 변형 가능한 물체를 다루는 시뮬레이션 엔진을 포함해 코딩 에이전트와 로봇 파운데이션 모델, 시뮬레이터의 발전을 그대로 흡수해 규모를 키우는 것을 제시한다.

관련 논문