작업 영상 하나로 시뮬레이션 장면과 로봇 정책을 함께 만드는 Agentic RSR
Agentic RSR: Real-to-Sim-to-Real through Scene Reconstruction and Execution-Grounded Robot Policies
무엇인가
실제 로봇 정책을 실기 시행착오로 개발하고 평가하는 일은 비용이 크고 확장이 어렵다. 시뮬레이션이 대안이지만, 캡처한 작업공간으로 정책을 되돌려 쓰려면 두 가지 조건이 필요하다. 시뮬레이션 장면이 과제에 관련된 상호작용을 보존해야 하고, 그 안에서 개발한 정책이 실제 로봇이 볼 수 있는 관측 위에서 동작해야 한다. 그런데 기존 연구들은 장면 재구성과 정책 개발을 따로 다뤄 왔다. 이 논문은 영상으로 재구성한 장면, 실행 기반 프로그램 정책, 시뮬레이션과 하드웨어에 공통으로 쓰이는 태스크 수준 인터페이스를 하나의 조작 과제로 묶을 수 있는지를 묻는다.
어떻게 동작하나
장면 재구성은 로봇 기준 미터 스케일 정합에서 시작한다. 작업공간 RGB 영상에서 32개 프레임을 뽑고 그중 4개를 고정 참조 뷰로 삼는다. VGGT-Ω가 각 프레임의 카메라 내부 파라미터, 월드-투-카메라 외부 파라미터, 깊이를 추정하고 SAM3가 로봇 마스크를 만든다. 마스크된 깊이를 역투영해 재구성 좌표계의 로봇 포인트 클라우드를 얻은 뒤, 미터 스케일이 알려진 URDF 표면과 다중 스케일 Sim(3) 정합을 수행하고 국소 포즈와 스케일을 정제한다. 로봇 베이스 좌표계에서 재구성 좌표계로 가는 유사변환과 그 스케일(재구성 단위/미터)을 구하면, 역변환으로 장면과 카메라 포즈를 미터 단위 로봇 베이스 좌표계로 옮기고 추정 깊이를 스케일로 나눠 미터로 환산한다. 후보 정합은 투영 마스크 일치도, 양방향 포인트 클라우드 적합도, 커버리지, 깊이 일관성으로 순위가 매겨진다.
무엇과 다른가
이 위에 피드백 기반 에이전트 정제가 붙는다. Codex 에이전트를 파이썬 SDK로 호출해, 계획 세션이 과제 설명과 실제 참조 이미지 4장을 받아 과제 물체·배경 요소·공간 관계 계획을 세우고, 별도의 정제 세션이 그 계획과 초기 Blender 장면, 고정된 참조 카메라 상태, 실제 이미지, 현재 장면의 RGB 프리뷰를 받아 기하·배치·재질·조명을 반복 편집한다. 로봇과 4개 참조 카메라는 실행 프로그램이 고정해 에이전트가 건드릴 수 없다. 매 라운드 에이전트는 후보를 렌더링해 확인한 뒤 Blender 파이썬 편집 스크립트를 제출하고, 외부 러너가 이를 적용해 고정 자산을 검사하고 별도 후보 버전으로 저장한 다음 4개 참조 뷰에서 렌더링·평가한다. 평가기는 뷰별 미터 깊이 오차, Lab 색차, 유효 렌더 깊이 커버리지를 기록하고, 4개 뷰 평균 깊이 오차 0.15m 미만과 평균 Lab 색차 15 미만, 그리고 모든 뷰에서 깊이 오차 0.20m 미만·색차 30 미만·커버리지 0.50 이상을 동시에 요구한다. 수용 여부는 에이전트의 자기평가가 아니라 프로그램 평가기가 결정한다. 다만 참조 깊이 자체가 앞선 영상 재구성에서 나온 값이므로, 이 지표는 독립적으로 측정한 정답 대비 기하 오차가 아니라 그 미터 기준과의 일관성을 잰다는 점을 저자들은 명시한다.
어떻게 쓰나
시각 검사를 통과한 후보는 별도 Codex 세션이 메시를 시각 전용 요소, 정적 지지·충돌 형상, 이동·관절 물체로 분류하고, exporter가 알려진 로봇 모델과 결합해 MuJoCo 장면을 만든다. 저자들은 이 분류가 실제 물체 물성의 측정값이 아니라 검토 가능한 물리 가설이라고 못 박는다. 또 다른 물리 검사 세션이 안착, 단순 파지, 관절 운동 프로브를 돌려 충돌 형상·물체 포즈·물리 파라미터를 바꾼 후보를 시험하고, 형상이나 포즈가 바뀌면 고정 참조 뷰 회귀 검사도 다시 돌린다. 정책 개발은 세 번의 패스로 진행된다. 첫 패스에서는 정답 물체 포즈를 임시로 노출해 과제 분해와 행동 로직을 세우게 하고, 둘째 패스에서는 그 특권을 제거해 실제 로봇용 시각 관측 인터페이스만으로 물체 상태를 추정하게 하며, 셋째 패스는 같은 시각 인터페이스를 유지한 채 초기 물체 위치, 카메라 포즈와 캘리브레이션, 행동 실행에 제한된 변동을 넣는다. 인터페이스는 엔드이펙터 상태, 추정 손목 카메라 포즈, 그리퍼 상태, 손목·3인칭 이미지, 손목 RGB-D와 SAM3로 얻은 물체 위치 추정을 제공하고, 내장된 픽앤플레이스 동작이나 성공 오라클은 없다. 한 번의 프로그램 실행 안에서 관측과 행동을 여러 번 교차할 수 있고, 실패하거나 제어를 넘기면 러너가 행동 결과·오류·최근 관측을 같은 에이전트 대화로 되돌려 계속 진행하거나 리셋 후 재시도하거나 정책을 수정하게 한다.
전제와 한계
실기 이전에는 정책과 함께 경험 메모리를 넘긴다. 정책은 검증된 과제 단계와 관측-행동 로직을 담고, 경험 메모리는 효과가 있었던 행동, 실패 원인, 지각상의 어려움, 시도하거나 피해야 할 행동을 요약한다. 이 메모리는 정답 물체 포즈나 시뮬레이터 내부 정보를 제공하지 않으며, 새 에이전트 대화는 실제 관측에서 물체를 다시 찾고 과제 상태를 판단해야 한다. 로봇 쪽에서는 좌표계와 카메라 캘리브레이션을 자동 점검하고, 로봇과 과제별 행동 한계 및 안전 작업공간을 강제해 위반하는 행동은 실행하지 않는다. 실기 정책 지침은 특히 중요한 행동 전후에 한 프로그램 호출 안에서 더 자주 관측하도록 요구한다.
실험은 두 로봇(Piper, Franka)에 걸친 18개 실세계 조작 장면과 과제에서 이뤄졌다. 장면 재구성에서 정제는 평균 4뷰 Depth MAE를 0.9036m에서 0.1057m로, 평균 Lab ΔE76을 24.84에서 11.04로 낮췄고 평균 전체 프레임 그레이스케일 SSIM은 0.6990이었다. 모든 장면이 6라운드 안에 평균 Depth MAE 0.15m 미만에 도달했고, 평균 최초 도달 라운드는 2.0, 최종 선택 라운드는 4.3이었다. 42개 측정 물체에 대해 장면 균등 평균 대칭 Chamfer 거리는 0.0303m, F1@1cm는 0.3655, 가시 바운딩박스 중심 오차는 0.0869m였다. 같은 18개 영상에 Re³Sim, RL-GSBridge, RoboSimGS, SimFoundry를 적용한 비교에서 Agentic RSR이 깊이·색 오차가 가장 낮고 SSIM과 물체 기하 점수가 가장 좋았으며, 일부 항목의 누락은 방법의 한계가 아니라 깊이나 인스턴스 기하를 직접 내놓지 않는 출력 형식 비호환이라고 설명한다. 정책 평가에서 Code as Policies는 시뮬레이션 성공률 50.0%, 실기 과제 균등 성공 25.6%로 서술적 변환비 51.1%였고, Instruct2Act는 18개 중 시뮬레이션 7개·실기 5개 성공으로 38.9%, 27.8%, 71.4%였다. Agentic RSR은 시뮬레이션에서 10/18을 완료했고 그중 8개가 실기에서도 성공해 55.6%, 44.4%, 짝지은 전이율 80.0%를 기록했다. 절제 실험에서는 정제 에이전트를 GPT-5.6 Sol로 바꾸면 시각 검사 통과가 10/18로 줄고 Depth MAE가 0.2119m, Lab ΔE76이 13.31로 나빠졌으며, 스칼라 지표 피드백을 빼면 6/18만 통과하고 Depth MAE가 0.3746m로, 초기 캘리브레이션을 빼면 3/18만 통과하고 Depth MAE가 0.2583m로 올라갔다.
개발자 관점에서 이 논문의 쓸모는 개별 부품보다 배선 방식에 있다. 장면 재구성, 정책 생성, 실기 실행이 같은 태스크 수준 관측·행동 인터페이스를 공유하고, 정책 버전은 평가 중 고정하되 실행 피드백으로 재시도·수정을 허용하며, 실기에서는 좌표계·캘리브레이션·행동 한계를 별도 안전 계층이 게이트한다는 구조는 사내 로봇 파이프라인을 설계할 때 그대로 참고할 만하다. 다만 도입 전에 확인할 것은 세 가지다. 첫째, 재구성 품질 지표가 독립 실측이 아니라 영상 재구성 결과와의 일관성이라는 점, 둘째, 메시 물리 분류가 측정이 아닌 가설이고 MuJoCo 프로브로만 검증된다는 점, 셋째, 성능 수치가 폐쇄형 모델 서비스인 GPT-6 Astra에 묶여 있다는 점이다.
저자들이 밝힌 한계도 이 지점과 맞물린다. GPT-6 Astra를 탐색적으로 쓰면서 기기와 호출 인터페이스에 따라, 또 같은 기기에서도 시각에 따라 에이전트 행동이 눈에 띄게 달라지는 것을 관찰했지만, 통제된 동일 입력 프로토콜로 측정한 것이 아니라 원인은 불명이라고 적는다. 이런 변동성은 폐쇄형 모델 서비스에 의존할 때 재현을 어렵게 만들며, 저자들은 명확한 모델 버전 관리와 안정적인 호출 인터페이스를 요구한다. 또한 프로그램 제어와 에이전트 기반 수정은 실행 속도와 적응성 사이에서 상충하며, 모델 호출 지연과 이산적 체크포인트 때문에 빠르게 변하는 접촉에 대응하는 능력은 π0 같은 고주파 시각운동 정책에 비해 제한적이다. 향후 고수준 프로그램 추론과 더 빠른 저수준 폐루프 제어를 결합하는 방향을 제안한다.