Real2Gym이 시연 영상에서 로봇 학습용 시뮬레이션 환경을 만든다
Real2Gym: Building Gyms from Videos, Bringing Skills to Robots
무엇인가
로봇이 스스로를 개선하려면 실행 실패를 진단하고 정책을 고쳐 다시 시도하는 반복이 필요하지만, 이를 실제 하드웨어에서 돌리는 비용은 매우 크다. 동작과 장면 리셋에 시간이 들고, 실패한 시도는 매니퓰레이터나 주변 환경을 망가뜨릴 수 있으며, 계속된 시행은 감독 인력과 하드웨어 마모를 요구한다. 물리 셋업이 한정적이라 병렬 탐색도 어렵고 실패 후 초기 상태를 안정적으로 복원하기도 힘들다. 시뮬레이션이 대안이지만 Real2Sim2Real 전이의 성패는 대상 장면의 작업 관련 기하, 물체 관절 구조, 물리 상호작용을 얼마나 충실히 재현하느냐에 달려 있다. 기존 RialTo 같은 파이프라인은 장면 스캔, 메시 수리, 관절 모델링, 물리 파라미터화를 사람이 이어 붙이는 무거운 작업을 요구했고, GPT-6 Astra 같은 멀티모달 모델의 Blender 장면 합성도 객체 치수, 상대 공간 배치, 카메라 외부 파라미터가 부정확해 파지 간극과 접촉 기하를 왜곡한다. 이 논문은 그 기하·물리 충실도 격차를 메우는 통합 프레임워크 Real2Gym을 제안한다.
어떻게 동작하나
입력은 사람 또는 로봇의 시연 영상과 로봇 URDF다. Real2Sim 단계는 먼저 편집 가능한 3D 장면을 복원한다. 단일 뷰 입력은 MoGe-3로, 여러 뷰가 있으면 π³의 Pi3X 구현으로 기하를 초기화하고, 캘리브레이션된 카메라 파라미터와 미터 기준 단서로 전역 스케일과 공유 좌표계를 강하게 제약한다. 에이전트는 의미 추론과 SAM2 세그멘테이션을 결합해 조작 대상, 지지 표면, 두드러진 배경 개체를 식별하고 뷰 간에 동일 정체성을 유지한다. 각 인스턴스는 통합 장면 좌표계 안의 완전한 메시로 표현되며, 점군이 주는 깊이·방향·스케일 단서에 더해 가려진 표면은 RGB 실루엣과 가시 구조, 최대 10장의 희소 다시점 프레임으로 완성한다. 로봇은 URDF 또는 MJCF로 임포트해 베이스 포즈, 초기 관절 구성, 카메라 마운트를 관측에 맞춘 뒤, 반복 재투영 검사로 객체 기하·포즈·카메라 파라미터를 함께 정제하면서 물리적 지지 관계와 로봇 기구학을 강제한다.
무엇과 다른가
다음은 시연된 상호작용을 복원하고 물리적으로 검증하는 단계다. 접촉, 파지, 지지, 포함 관계의 위상 변화에 연결된 키프레임으로 상호작용을 복원하고, 기록된 관절·그리퍼 상태가 있으면 그대로 쓰며 사람 시연은 관측된 손-물체 상호작용을 목표 로봇으로 리타게팅한다. 각 이벤트 키프레임에서 에이전트는 주요 불일치, 카메라 정렬, 상대 물체 배치, 접촉·관통, 외형 충실도라는 다섯 진단 축으로 자기 점검과 수정을 반복하고, 이상이 감지되면 인접 프레임을 시간적으로 검사해 국소 수정 후 재검증한다. 시각 정렬이 끝나면 관절 로봇 모델, 충돌 기하, 용기 내부 공간, 물리 재질, 액추에이터를 갖춘 MuJoCo 장면으로 인스턴스화한다. 물리 실행은 접근 궤적과 접촉 방향을 먼저 조정하고, 이어 그리퍼 닫힘, 파지 유지, 지지 안정성, 물체 해제를 검증하는 순서로 점진적으로 캘리브레이션된다. 최종 모델은 초기 상태부터 끝까지 실행해 물리 일관성과 작업 완료를 확인하고, 네이티브 물리 궤적을 다시 Blender로 임포트해 Real RGB, Blender RGB, MuJoCo RGB 렌더링을 프레임 단위로 비교한다.
어떻게 쓰나
검증된 시드 환경은 작업 조건부 증강으로 확장된다. 객체 기하, 포즈, 지지 높이, 재질, 방해물, 배경, 조명을 체계적으로 변형하되, 각 요인을 먼저 개별적으로 교란해 작업 가능성에 미치는 영향을 평가한다. 기하 변경은 시각 모델, 충돌 메시, 지지 표면, 로봇 장착 제약에 일관되게 전파되고, 해당 조작 단계는 갱신된 파지 영역과 목표 포즈, 공간 여유에 맞춰 적응한다. 모든 후보 환경은 네이티브 물리 실행을 거쳐 작업 완료, 접촉 동역학, 지지 안정성, Blender-MuJoCo 크로스 렌더러 일관성을 검증받고, 실패한 후보는 장면이나 행동 정제로 되돌려지고 통과한 후보만 환경 풀에 추가된다. 이 폐루프 검증이 환경 다양성을 늘리면서도 물리적 실현 가능성을 보장한다.
전제와 한계
스킬 축적은 조작 서브태스크 수준의 폐루프로 이뤄진다. 정책은 과제 지시 g, 현재 관찰 o_k, 에피소드 내 이력 H_k, 명시적으로 선택된 스킬 K_e를 받아 실행 가능한 파이썬 프로그램 c_k를 생성하며, 이 프로그램에는 진입 조건, 중간 검사, 관찰 가능한 완료 조건이 들어간다. 프로그램은 SAM3 객체 세그멘테이션과 GraspNet 파지 제안을 호출하는 지각 API, 좌표 변환과 목표 포즈 오프셋 같은 단순 수치 계산, goto_pose(), open_gripper(), close_gripper() 같은 로봇 제어 명령을 조합하고, 갱신된 관찰에 대한 조건 검사로 진행 상황을 확인한다. 응답 하나가 물체 접근, 그리퍼 닫기, 파지 유지 테스트를 함께 조율할 수 있어 모델 상호작용 횟수가 줄어든다. 에피소드가 끝나면 별도 추출 과정이 관찰, 생성 코드, 실행 피드백, 최종 결과를 분석해 각 코드 라운드에 긍정·부정·불명의 국소 효과를 부여하고, 실행 기록이 뒷받침될 때 실패한 시도와 이후 수정을 비교한다. 결과 스킬은 적용 조건, 작업 절차, 효과 검사, 물체 상대 운동 규칙, 복구 지침을 담는다. 운동 규칙은 행위 주체, 물체 앵커, 상대 위치나 자세, 정지 조건을 명시하고, 실행 시 현재 관찰에서 추정한 물체 포즈로 인스턴스화되므로 물체 배치가 바뀌어도 같은 스킬이 적응한다. 새 교훈은 근거를 유지한 채 기존 라이브러리에 병합되고 모순되는 지침은 수정되며, 이 모든 과정에서 기반 모델 가중치 θ는 고정된다.
실험은 DROID에서 12장면, EgoDex에서 12장면을 골라 총 24개의 MuJoCo 환경을 구축하고, 각 데이터셋이 쉬움·중간·어려움 장면을 4개씩 기여한다. 비교 대상은 GPT-6 Astra(medium 추론)와 GPT-5.6 Sol(xhigh 추론)이며, 정책 베이스라인은 Direct Mode로 주어진 지시와 실시간 다시점 관찰, URDF, 지각·팔 제어 API만으로 행동을 직접 고른다. Real2Sim 재구성에서 Real2Gym은 DROID와 EgoDex의 네 지표 모두에서 두 베이스라인을 앞섰고, DROID에서 시점 정렬은 GPT-6 Astra보다 40.83점 향상됐으며 EgoDex에서 시뮬레이션 성공 점수는 85.76으로 같은 베이스라인 대비 상대 51.5% 개선됐다. 에이전트 정책은 스킬 축적 전에도 평균 성공률 79.2%로 GPT-6 Astra보다 토큰을 67.3% 적게 썼고, 스킬을 쓰면 평균 성공률 87.5% 대 70.8%로 앞서면서 정책 실행 토큰을 약 74.9% 줄였다. 결정 입자도 차이가 핵심인데, 베이스라인은 개별 행동을 하나씩 결정하는 반면 제안 에이전트는 완전한 조작 단계에 대한 코드를 생성해 응답당 여러 행동과 검증을 묶는다. 구현에는 Blender 4.5.3 LTS, MuJoCo 3.3.7, SAM3 0.1.0, Contact-GraspNet이 쓰였고, 과제당 50회 모델 결정과 코드 실행당 600 제어 스텝이 예산으로 주어졌다.
실제 로봇 실험은 7자유도 Franka Emika Research 3에 Robotiq 2F-85 그리퍼와 손목 장착 eye-in-hand 및 고정 외부 시점의 Intel RealSense RGB-D 카메라 두 대를 붙여 수행됐다. Pick Block into Plate는 100%(3/3) 대 베이스라인 33%(1/3)였는데, 베이스라인은 블록 폭이 그리퍼 수평 간격을 약간 넘는데도 공간 방향 인식이 없어 수평 파지를 시도하다 걸린 반면 제안 에이전트는 위에서 아래로 파지했다. Hang the Mug는 양쪽 모두 100%(3/3)였지만 총 실행 시간이 1,302.7초 대 1,522.7초로 제안 쪽이 빨랐고, 이는 고정 길이 행동 청크 대신 단계 수준 코드를 생성한 덕분이다. Place Cup in Microwave and Close Door는 100%(3/3) 대 33%(1/3)였으며, 베이스라인은 컵을 문턱에 부정확하게 놓거나 후퇴 중 문틀 충돌로 관절 안전 정지가 걸렸다. Place Plate on Shelf는 제로샷에서 양쪽 모두 0%였는데, 파지 시 깊이 제어, 곡면 접시 가장자리에 맞춘 접근 자세, 좁은 선반 프레임에 끼워 넣는 높은 손재주가 동시에 요구되기 때문이다. 이를 복구하기 위해 사람이 과제를 수행하는 비보정 3인칭 영상을 Real2Sim으로 디지털 트윈으로 재구성하고 에이전트가 시뮬레이션 안에서 탐색했으며, 처음 두 시도는 실패했지만 세 번째 진화 반복에서 안정적인 스킬을 얻어 시뮬레이션 성공률 100%를 달성했고, 진화된 스킬 라이브러리를 Franka에 배포해 실제 성공률 100%를 기록했다.
개발자 관점에서 이 논문의 실용적 요점은 시뮬레이션 환경을 손으로 모델링하는 대신 영상에서 자동 생성하고, 그 환경에서 얻은 지식을 모델 가중치 갱신 없이 코드와 규칙 형태의 스킬 라이브러리로 축적해 실제 로봇에 그대로 옮긴다는 점이다. 스킬이 물체 앵커 기준 상대 운동 규칙으로 표현되므로 물체 위치가 바뀌어도 재사용되고, 실패 기록이 복구 지침으로 남는다. 도입을 검토한다면 재구성 장면이 네이티브 물리 실행을 통과했는지, 카메라 정렬과 스케일이 시연과 맞는지, 스킬이 특정 그리퍼 형태에 얼마나 의존하는지, 그리고 단계 수준 코드 생성이 요구하는 토큰·결정 예산이 자신의 작업에 맞는지를 확인해야 한다.
저자들이 밝힌 한계는 세 가지다. 첫째, 3D 재구성 충실도에서 손목 장착 카메라와 고정 카메라 사이의 다시점 정합 오류가 잡음이 있는 Pi3X 점군에 고스팅이나 층상 표면을 만들 수 있고 원본 영상과의 기하·텍스처 잔차가 남는다. 둘째, 제어 입자도에서 거친 단계 수준 코드 생성은 상호작용 효율을 높이지만 제약이 심한 조작에 필요한 국소적 세밀 반응성이 부족하며, 단계 수준과 세밀 행동 수준 제어를 적응적으로 전환하는 방안이 향후 과제다. 셋째, 구현체 범위에서 실제 실험은 평행 조 그리퍼를 단 Franka 팔에 국한되어 있어, 손가락이 많은 손과 다양한 휴머노이드 플랫폼으로 확장해야 일반성을 제대로 평가할 수 있다.