비디오 확산 모델로 손 자세와 접촉력을 함께 추정해 로봇 학습에 쓴다

RLHND: Video Foundation Models as Physically Grounded Hand Trackers for Robot Learning

HF Daily2610.09455

Seungjun Moon, Subin Jeon, Sangwoo Kim2026-10-07

무엇인가

사람의 1인칭 영상으로 로봇 정책을 학습하려는 시도가 늘고 있지만, 기존 손 추적기는 잘라낸 프레임 단위로 자세를 회귀하기 때문에 손의 움직임이나 물체 상호작용에 대한 사전지식이 거의 없다. 그 결과 깊이 축을 따라 심한 떨림이 생기고, 원근 투영의 스케일-깊이 모호성 때문에 같은 손의 크기가 프레임마다 크게 요동친다. 로봇 학습에서는 작은 추정 오차가 전혀 다른 동작이나 실행 불가능한 동작으로 이어질 수 있어 이런 시간적 불일치가 치명적이다. 여기에 사람 영상에는 접촉이나 힘 같은 물리 정보가 없어서, 물체를 실제로 쥐었는지 그 위에 떠 있는지조차 구분하기 어렵다는 두 번째 간극이 있다. RLHND는 이 두 문제를 단안 1인칭 영상 하나로 동시에 메우려는 모델이다.

어떻게 동작하나

골격은 사전학습된 Cosmos 3 Nano 비디오 확산 백본이다. 비디오 토크나이저인 Wan2.2 VAE가 클립을 깨끗한 잠재 z로 인코딩하고, patch embedding과 생성 경로를 LoRA로 미세조정해 결정론적 시공간 특징 격자 F를 얻는다. 선행 연구가 노이즈 레벨을 0으로 두고 깨끗한 영상을 디노이징 인터페이스에 직접 넣은 것과 달리, RLHND는 사전학습 때 깨끗한 문맥 프레임을 받도록 설계된 Cosmos 3의 컨디셔닝 인터페이스를 사용하고 프롬프트는 비워 둔다. 이렇게 해서 미세조정이 백본의 사전학습 인터페이스와 어긋나지 않게 맞춘다.

무엇과 다른가

자세 추정은 포즈 전문가 스트림이 맡는다. 두 손 토큰은 캐시된 MANO 모양 파라미터 β_cache에 학습 가능한 쿼리와 영 초기화 MLP를 더해 만든다. 영상에서 손이 충분히 보이는 첫 클립에서 β를 한 번 추정해 영상 전체에 재사용하고, 그 이전 클립들은 β가 확보된 뒤 다시 디코딩한다. 학습 중에는 확률 0.5로 정답 β를 주입하고 그 샘플의 shape-head 손실은 끈다. 또 MANO의 45 자유도 대신 해부학적 축(twist, spread, bend)으로 분해해 PIP와 DIP 관절의 twist·spread를 0으로 묶고 29 자유도만 회귀한다. 엄지는 안장 관절이라 제약하지 않는다. 기존 45 자유도 라벨은 감쇠 가우스-뉴턴으로 feasible set에 사영해 29 자유도 라벨을 만든다. 출력 헤드는 자세·모양·깊이·존재를 디코딩하고, 카메라 공간 병진은 ACE-Ego-Hand의 광선 기반 mixed-PnP 솔버로 복원한다.

어떻게 쓰나

촉각은 별도 전문가 스트림이 예측하며, 포즈 스트림을 얼려둔 채 학습해 촉각 지도가 자세를 흔들지 않게 분리한다. 778개 정점마다 어텐션을 거는 대신 MANO 운동 트리의 16개 관절에 뼈 토큰을 붙이고, 출력 단계에서 고정된 LBS 가중치 행렬로 특징을 정점으로 펼친다. 정점별 특징에 학습된 정점 임베딩을 더한 뒤 두 개의 작은 MLP가 접촉 로짓과 힘 분포 로짓을 읽고, 손 단위 총 힘은 softplus로 뽑아 정점별로 softmax 분배한다. 1단계에서는 자세 손실(회전·β·3D·2D·병진·존재·시간·광선)만으로 포즈 스트림을 학습하고, 2단계에서 포즈를 고정한 뒤 가중 BCE와 총 힘 L1, 분포 크로스엔트로피로 촉각 스트림을 학습한다.

전제와 한계

실험은 1단계를 1인칭·3인칭 손 영상 데이터 혼합으로, 2단계를 힘 라벨이 있는 장갑·압력판 기록과 손-물체 메시에서 유도한 접촉 전용 라벨로 학습한다. 자세는 학습에서 제외한 HOT3D와 ARCTIC 1인칭 분할, 그리고 모든 방법에 제로샷인 EgoDex에서 평가했고, 촉각은 HOPE의 OpenTouch·PressureVisionDB 테스트 분할과 HOT3D·DexYCB·ARCTIC의 접촉 라벨로 평가했다. 저자들은 세 자세 벤치마크 전부에서 베이스라인을 앞서고, HaMeR·WiLoR·HaWoR·HaPTIC이 쓰는 외부 손 검출기보다 높은 F Acc를 얻었다고 보고한다. 접촉은 네 데이터셋 모두에서 F1과 AUROC 최고, 힘은 경쟁력 있는 수준이며, HACO는 접촉을 과다 예측하고 HOPE는 접촉 영역이 조각나고 압력을 과소 추정한다고 지적한다. 다섯 종류의 로봇 손으로 DexPilot 리타게팅했을 때 평균 Q-err가 가장 낮고 명령 궤적도 매끄러운 편이며, Dexterous Point Policy에 RLHND 키포인트를 넣으면 특히 복잡한 양손 작업에서 성능이 오른다. 절제 실험에서는 Cosmos 3 Nano를 Wan2.2로 바꾼 변형이 모든 지표를 떨어뜨려 인코더가 가장 큰 요인임을 확인했고, 해부학적 자세 표현이나 모양 캐싱을 제거해도 ARCTIC MPJPE가 나빠졌다. 정답 β를 넣으면 관절 수준 지표는 그대로지만 Q-err이 좋아져, 고정된 손 모양이 리타게팅을 안정화할 수 있음을 시사한다. 촉각 쪽에서는 고정 LBS 가중치를 학습 가능한 778×16 행렬로 바꾸거나 접촉 전용 데이터를 빼면 접촉 성능이 크게 떨어진다. 다만 본문에 옮겨진 텍스트에는 표의 구체적 수치가 제시되지 않아, 여기서는 순위와 방향성 위주로 정리했다.

실무 관점에서 이 논문이 주는 것은 두 가지다. 하나는 사람 시연 영상을 로봇 동작 공간으로 옮길 때 필요한 3D 손 라벨을, 프레임별 크롭이 아니라 클립 전체를 보고 뽑아내는 방식으로 안정화하는 설계다. 다른 하나는 별도 장비 없이 접촉과 힘 라벨을 자동 생성해, 수작업 주석 없이 정책 학습에 힘 정보를 넣는 경로다. 사람 영상 데이터셋을 로봇 정책 학습에 재활용하려는 팀이라면, 손 모양을 영상 단위로 고정하는 선택과 포즈·촉각 스트림을 분리하는 학습 순서를 우선 참고할 만하다. 코드와 사전학습 가중치는 공개 예정이라고 밝혔다.

저자들이 명시한 전제와 한계도 분명하다. 접촉과 힘은 측정값이 아니라 추론값이므로, 리타게팅된 명령을 실제 로봇에 배포할 때는 관절 토크나 전류 제한, 사람의 감독을 함께 두라고 권고한다. 공개 데이터셋의 다양성이 제한적이어서 피험자, 손 크기, 피부 톤에 따라 평가셋이 담지 못하는 성능 편차가 생길 수 있다는 점도 인정한다. 새로운 사람 데이터는 수집하지 않았고 원본 영상도 공개하지 않으며, 일반 영상에서 손 활동을 복원할 수 있는 만큼 감시 목적의 사용은 지양해야 한다고 밝힌다.