GNR이 흐름 정합으로 사람 손 동작을 로봇 궤적으로 바꾼다
Generative Neural Retargeting for Human-to-Robot Dexterous Manipulation
무엇인가
사람이 손으로 물체를 다루는 시연은 로봇 조작 정책 학습에 쓸 수 있는 확장성 높은 데이터원이지만, 사람 손과 로봇 손의 체형 차이(embodiment gap) 때문에 사람 동작을 로봇에 그대로 실행할 수 없다. 역기구학(IK) 기반 리타게팅은 빠르지만 동역학과 접촉을 무시해 실행 불가능한 궤적을 만든다. 강화학습은 보상 설계 부담과 불안정한 학습 비용이 크고, 샘플링 기반 모델예측제어(MPC)는 정책 학습은 피하지만 궤적마다 독립적으로 최적화하므로 하나를 풀어도 다음 궤적이 쉬워지지 않는다. 데이터셋과 과제 난도가 커질수록 샘플 비용이 급격히 늘어나는 것이 확장 병목이다.
어떻게 동작하나
저자들의 가설은 동역학적으로 실행 가능한 궤적들이 시연들 사이에 공유되는 저차원 매니폴드 근처에 모여 있다는 것이다. 그래서 매 시연마다 새 최적화 문제를 푸는 대신, 사람 동작을 조건으로 그 매니폴드에서 샘플링하는 문제로 리타게팅을 재정식화한다. 제안 방법 GNR(Generative Neural Retargeting)은 조건부 흐름 정합(flow matching) 모델로, IK 참조 제어에 대한 잔차를 예측한다. 조건은 참조 상태 시퀀스와 물체 형상·포즈 인코딩이다. 학습은 가우시안 노이즈와 흐름 시간을 뽑아 두 분포를 잇는 보간점을 만들고, 속도장이 잔차에서 노이즈를 뺀 방향을 맞히도록 하는 흐름 정합 손실로 이뤄진다. 추론에서는 노이즈에서 상미분방정식을 끝까지 적분해 잔차를 얻고 참조 제어에 더한다. 백본은 IK 참조와 형상 조건을 FiLM으로 주입하는 시간축 U-Net이고, 형상 조건은 1,024개 점에 대한 Point Transformer V3 인코더로 뽑는다. 절대 제어가 아니라 잔차를 예측하는 설계가 더 나은 성능을 낸다고 부록에서 밝힌다.
무엇과 다른가
배포는 두 갈래다. 개루프 모드에서는 조건마다 잠재변수를 S개 뽑아 S개 후보 궤적을 디코딩하고 시뮬레이션에서 재생해 성공 여부를 확인하는 pass@S 방식의 테스트타임 스케일링을 한다. 폐루프가 필요한 경우 GNR이 만든 궤적을 MPC의 초기값으로 넣어 다듬게 한다. 이 리타게팅을 real-to-sim 데이터 엔진에 넣어 SuperDex 시뮬레이터에서 Tesollo DG-5F 손(및 Franka FR3 팔)으로 대규모 데이터를 만든다. 데이터 확장은 두 단계다. 발견 단계에서는 명목 조건과 물체 위치·자세·시작 시각·스케일·마찰에 대한 16개 단축 섭동 아래에서 실행 가능한 해를 찾고, 추적 오차·관통·파지·접촉력 네 가지 판정을 모두 통과한 궤적만 남긴다. 확장 단계에서는 마찰 재샘플링, 메시 부피와 LLM이 추정한 밀도로 계산한 질량, SAM3D 기반 메시 재생성·변형·스트레칭 등으로 기하와 물성을 바꿔가며 같은 판정을 통과하는 궤적을 추가한다.
어떻게 쓰나
다양성 축 실험은 자아중심(egocentric) HOT3D 데이터셋의 780개 소스 모션(33개 물체, 평균 약 2초)에서 시작해 36만 개 증강 시연을 만든다. DIAL-MPC는 이 중 9만5천 개(26.43%)에서만 성공했고 39만 CPU 코어아워(512코어로 31.7일)를 썼다. GNR은 MPC 성공 궤적의 약 30%인 2만8천 개(33개 물체 중 23개)로 학습해, 물체·파지·기하 변형이 학습 분포 밖인 1,000개 테스트 시연에서 평가됐다. 손끝 IK는 성공률 18.3%에 그쳤고, MPPI·DIAL-MPC·iCEM·CMA-ES는 3,000 샘플로 27.2~34.7%였다. 개루프 GNR은 128 샘플에서 52.2%, 256 샘플에서 56.2%로 앞섰고, 궤적당 CPU 비용은 DIAL-MPC 대비 7.6배 줄었다. MPC 성공 시연에서는 S=1일 때 평균 46.2%에서 S=256일 때 93.2%로 올랐고, MPC가 3,000 샘플로 실패한 시연의 31.9~58.4%를 풀었다. 36만 개 전체에 S=256(MPC 샘플 예산의 8.5%)을 적용해 MPC 실패 26.4만 개 중 127,136개(48.01%)를 풀었고, 결과적으로 3.3천 개 기하에 걸친 22.3만 개 실행 가능 궤적 데이터셋을 만들었다. 실전 배치 비용 추정에서도 GNR은 21.5만 궤적을 14.87만 코어아워로 생성해 DIAL-MPC 대비 2.62배 절감했다.
전제와 한계
난이도 축에서는 15대 OptiTrack 카메라와 착용형 외골격으로 정밀 모션캡처를 해서 두 과제를 다룬다. ShapeFilter는 1.96mm 공차의 십자 부품 삽입으로 605개 사람 시연에서 3,037개로 증강했고, NIST 산업 조립 과제는 수평 오차 1mm 이하, 8mm 이상 나사 조임, 축 오차 0.003rad 이하를 요구하며 358개 시연을 쓴다. ShapeFilter에서 IK는 3.7%에 불과했지만 개루프 GNR은 S=1에서 52.4%, S=64에서 97.4%, S=256에서 99.3%로 올랐다. S=64에서 MPC가 3,000 샘플로 낸 92.9%를 CPU 비용 1.6%만 써서 넘어섰고, GNR+MPC는 98.4~99.3%를 기록했다. NIST에서는 개루프 GNR이 S=256에서 4.7%에 그쳐(IK는 0%) 폐루프 피드백이 필요함을 보였고, GNR 초기화를 쓰면 MPC가 3,440 샘플 대신 2,296 샘플로 92.2%에 도달해 33.3%를 줄였다. 시드 데이터 크기 실험에서는 ShapeFilter에서 학습 시연 50개만으로도 S=1 성공률 11.5%가 테스트타임 스케일링으로 S=256에서 99.5%까지 올랐다. 데이터셋 전체 생성 비용은 ShapeFilter 3,037개에서 765.6 코어아워(94.8%) 대 MPC 8,541.0 코어아워(93.7%)로 11.2배, NIST 358개에서 44,516.7 코어아워(92.1%) 대 79,135.6 코어아워(92.2%)로 1.8배 절감이다.
실무적으로 이 논문이 주는 신호는 두 가지다. 첫째, 물리 기반 리타게팅처럼 비볼록·불연속 최적화를 궤적마다 반복해야 하는 문제에서 소량의 최적화 결과를 시드로 삼아 조건부 생성 모델로 잔차를 학습시키고, 추론 시 샘플 수를 늘려 성공률을 확보하는 패턴은 다른 로봇 데이터 파이프라인에도 이식 가능하다. 둘째, 성공 판정을 추적 오차 하나가 아니라 관통·파지·접촉력까지 묶은 게이트로 정의한 점은 시뮬레이션 데이터 품질 관리에 바로 참고할 만하다. 다만 GNR은 IK 참조와 물체 형상·포즈 조건에 의존하므로, 자체 파이프라인에 적용하려면 참조 궤적 품질과 형상 인코더 입력(포인트 클라우드 1,024점)을 먼저 맞춰야 하고, 접촉이 많은 장기 과제에서는 개루프만으로는 부족하다는 점을 전제로 삼아야 한다.
저자들이 밝힌 한계와 전제는 다음과 같다. GNR은 MPC가 만든 시드 데이터셋에 의존하며, 시드 생성 자체가 비싸다(2만8천 시드에 약 10.8만 회 MPC 시도, 11.61만 코어아워). NIST처럼 접촉이 많고 수평선이 긴 과제에서는 개루프 GNR 성공률이 4.7%에 머물러 MPC 초기화 용도로만 쓸 수 있다. 또한 GNR이 MPC보다 높은 성공률을 내긴 하지만 MPC가 실패한 시연의 절반 정도는 여전히 풀지 못한다. 정책 학습 결과는 시뮬레이션 안에서의 행동 복제 성공까지이며, 실제 로봇으로의 sim-to-real 전이는 향후 과제로 남겨져 있다. 원문에는 실제 하드웨어 실험 수치가 제시되지 않았다.