인간 손 시연을 리셋으로 써서 로봇 강화학습 탐험을 뚫는다

X-Reset: Scaling Object-Centric Reinforcement Learning via Cross-Embodiment Resets

arXiv2609.35715v1

Prithwish Dan2026-09-28조회 3

무엇인가

시뮬레이션 강화학습으로 다관절 로봇 손을 학습시킬 때 가장 큰 병목은 탐험이다. 물체에 다가가고, 쥐고, 목표 자세로 다시 돌리는 행동을 태스크 비종속 보상만으로 처음부터 발견하기는 어렵다. 기존 연구는 고품질 로봇 시연, 태스크별 보상 셰이핑, 또는 행동 양식을 좁히는 방식으로 이 부담을 우회했다. X-Reset은 방향을 바꿔, 값비싼 로봇 시연 대신 사람의 손-물체 시연을 탐험의 씨앗으로 쓴다.

어떻게 동작하나

핵심 발상은 사람 손-물체 상태를 모방 대상이나 추종 레퍼런스가 아니라 리셋 분포로 쓰는 것이다. 사람 시연은 MANO 손 키포인트 21개와 물체의 SE(3) 자세로 표현되고, 목표 자세는 시연의 마지막 물체 자세로 정의된다. 물체는 표면에서 64개 키포인트를 샘플링해 기하를 표현한다. 먼저 PyRoki 기반 최적화 운동학 리타게팅으로 사람 손 자세를 로봇 손 관절각으로 옮기고, cuRobo로 충돌을 고려한 역기구학을 풀어 손 자세를 고정한 채 손목을 따라가는 팔 관절각을 구한다. 이렇게 만든 로봇 손-물체 쌍 데이터셋에서 관절 한계를 벗어나거나 시뮬레이션에 스폰했을 때 불안정한 상태(예: 손-물체 관통)를 오프라인으로 걸러낸다. 학습 중에는 확률 1-p로 기본 리셋 분포에서, 확률 p로 해당 시연의 잔존 프레임에 대한 균등 분포에서 리셋을 샘플링한다. 기본 설정은 p=0.9다.

무엇과 다른가

보상은 모든 물체와 로봇에 공통인 객체 중심 함수다. 근접 보상, 재정렬 보상, 성공 보너스, 부드러운 행동 보상, 안전 페널티의 합으로 구성되고, 재정렬 항은 현재 물체 키포인트와 목표 키포인트 사이 대응점 L2 거리 평균에 비례한다. 정책은 로봇 고유수용감각, 현재 물체 키포인트, 목표 키포인트, 상호작용 이력을 담는 LSTM 상태만 입력받는다. 즉 사람 동작을 매 스텝 추종하도록 요구하지 않는다. 학습은 PPO로 하고, 특권 정보를 보는 비대칭 크리틱과 도메인 랜덤화를 함께 쓴다.

어떻게 쓰나

실험은 세 가지 embodiment에서 이뤄졌다. 6-DoF UR7e 팔에 장착한 22-DoF Sharpa 손, 7-DoF KUKA iiwa 14 팔에 장착한 같은 손, UR7e 팔의 1-DoF Robotiq 2F-85 평행 그리퍼다. DexYCB의 물체 20개를 물체당 오른손 시연 20개로 학습하고 IsaacSim에서 시뮬레이션하며, 조건마다 시드 3개를 돌린다. 성공 지표는 키포인트 거리 2cm 이내 도달 여부다. 베이스라인은 운동학 리타게팅을 개루프로 재생한 것(평균 4.9%), 객체 전용 보상만 쓴 것(전체 11.0%, 쉬운 물체 15.0%), 손 유도 셰이핑을 더한 손-물체 보상(42.1%)이다. 여기에 X-Reset을 붙이면 객체 전용 보상은 11.0%에서 66.6%로, 손-물체 보상은 42.1%에서 59.6%로 오른다. 출발점이 낮았던 객체 전용 보상 쪽이 최종 성능은 더 높았는데, 저자들은 사람 시연에 가깝게 붙잡아 두는 편향 없이 자유롭게 탐험하게 하는 쪽이 embodiment별 전략을 더 잘 찾는다고 해석한다.

전제와 한계

확장성과 일반화도 측정했다. UR7e+Sharpa 정책을 DexYCB 물체 1~20개로 학습하고, EBench의 고정된 12개 물체에 제로샷으로 평가한다(물체당 400회 시행). 학습 물체가 늘수록 전이가 좋아져 쉬운 물체는 64.8%에서 89.6%로, 큰 그릇과 얇은 포크가 포함된 어려운 물체는 16.8%에서 43.5%로 상승한다. 같은 10k 에폭 예산에서 DexYCB 5k 사전학습 후 EBench 5k 파인튜닝은 평균 85.9%를 기록해, EBench 10k를 처음부터 학습한 39.1%를 크게 앞선다. 리셋 확률 p를 바꾼 절제 실험에서는 p=0일 때 평균 에피소드 리턴 8.28에 그친 반면, p를 올린 조건들은 55.45~61.09를 기록해 특정 값에 의존하지 않음을 보였다. 손 자세에 노이즈를 주입해도 리턴은 51.46~56.07로 깨끗한 입력의 58.53에 근접했고, 고노이즈 조건에서는 리셋 기각률이 6.82%에서 16.71%로 2.45배 올랐다. 실기체 전이는 SAM 3D로 물체 메시를 복원하고 FoundationPose로 자세를 추적해 수행했으며, 학습에 포함된 머스터드와 포함되지 않은 프링글스·해머에서 동작이 전이됐다.

개발자 관점에서 이 논문의 실용적 포인트는 사람 데이터를 어떻게 쓰느냐다. 리타게팅된 사람 동작을 그대로 따라 하게 하면 embodiment 불일치와 실제 접촉 역학 때문에 안정적 파지가 잘 안 되지만, 같은 데이터를 리셋 상태로만 주입하면 정책은 객체 상태와 목표만 보고 행동을 학습하면서 성공 신호에 훨씬 빨리 도달한다. 사람 손 추정이 부정확해도 노이즈가 리셋 분포에만 들어가고 모방 타깃 자체를 오염시키지 않는다는 점도 실무에서 중요하다. 다만 리셋 생성에 역기구학·충돌 검사·불안정 상태 필터링 파이프라인이 필요하고, 리셋 확률과 필터 기준이 성능을 좌우하므로 자기 로봇과 물체 셋에서 재검증해야 한다.

저자들이 밝힌 한계는 명확하다. 정책이 물체 자세를 직접 입력받기 때문에 자세 추적 노이즈를 그대로 물려받고, 실제 관찰된 주 실패 모드도 물체 자세 추정 오류였다. 해결책으로 시각 또는 시각-촉각 정책 증류를 제안한다. 또한 대규모 1인칭 데이터셋으로의 확장은 아직 하지 못했으며, 이를 위해서는 강체뿐 아니라 관절 물체와 변형 물체의 손-물체 상태를 영상에서 추출하는 real-to-sim 파이프라인이 필요하다고 적고 있다.