비전이 놓치는 접촉을 예측 세계 상태로 끌어들인 손재주 조작용 시각-촉각 세계-행동 모델

DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation

arXiv2609.24976v1

Haoran Yuan2026-09-21조회 2

무엇인가

로봇 손으로 물체를 다루는 일은 카메라에 보이는 장면만으로는 풀리지 않는다. 접촉이 일어났는지, 미끄러지는지, 쥐는 힘이 안정적인지는 시야에서 가려지거나 부분적으로만 관측된다. 최근 세계-행동 모델(World-Action Model, WAM)은 영상 세계 모델링과 행동 생성을 결합해 주목받았지만 대부분 비전 중심이라 이런 접촉 역학을 직접 모델링하지 못한다. 기존 시각-촉각 세계 모델 연구도 평행 그리퍼나 단순한 엔드이펙터에 머물러 있어, 손가락마다 분산된 촉각을 다루는 손재주 조작으로 확장하는 방법은 정리되지 않았다. 이 논문은 촉각을 정책의 보조 입력으로 쓰는 대신, 모델이 예측하는 세계 상태의 일부로 취급하자는 제안을 내놓는다.

어떻게 동작하나

제안 시스템 DexTacWAM의 첫 단계는 손끝마다 촉각을 독립적으로 인코딩하는 것이다. 촉각 VAE를 처음부터 학습하는 대신, 사전학습된 비전 VAE를 손가락별 촉각 특징 추출기로 재사용한다. 촉각 맵은 단일 채널이라 1×1 흑백-투-RGB 어댑터로 3채널로 맞춘 뒤 동결된 VAE 인코더에 통과시킨다(z = E_VAE(φ(o))). 이렇게 하면 접촉 영역, 변형 패턴, 압력 변화 같은 공간 구조를 이미지 스타일 잠재로 옮길 수 있고, 영상 확산 세계 모델과 잠재 공간이 호환된다. 다음으로 손가락-자세 인지 촉각 압축기가 열 개 손끝 스트림을 손당 하나의 잠재로 묶는다. 각 손가락 잠재에 학습 가능한 손가락 정체성 임베딩을 더하고, 손 자세 q_t를 인코딩해 집계 쿼리에 주입한다. 각 시공간 셀에서 손 쿼리 하나와 손가락 토큰 다섯 개에 self-attention pooling을 적용해 5:1로 압축하며, 시간축으로는 분할 시공간 어텐션으로 미끄러짐, 재파지, 핸드오버 같은 접촉 이벤트의 진화를 모델링한다. 출력 잠재의 시간축은 시각 잠재 시퀀스와 정렬된다.

무엇과 다른가

세계 모델 쪽에서는 좌우 손 촉각 잠재를 시각 잠재의 뷰 축에 덧붙인다. 확산 트랜스포머(DiT)는 뷰 개수가 V = V_v + V_τ로 늘어난 채 그대로 쓰이고, 크로스-뷰 self-attention이 시각 토큰과 촉각 토큰을 함께 디노이징한다. 학습 목표는 모달리티 분리 디노이징으로, 시각 파티션과 촉각 파티션 각각에 플로 매칭 손실을 건다. 즉 L_wm = λ_v E[||v_θ(s_σ,σ)[:V_v] − (ε − z^v)||²] + λ_τ E[||v_θ(s_σ,σ)[V_v:] − (ε − ẑ^τ)||²] 형태다. 행동 생성은 이 세계 모델 위에 별도의 액션 전문가가 얹힌다. 시각 잠재는 조밀하고 전역적이며 촉각 잠재는 희소하고 접촉에 민감해 분포와 스케일이 크게 다른데, 이를 그냥 이어 붙이면 K/V 분포가 어긋나 최적화가 불안정해진다. 그래서 어텐션 모듈은 공유하되 K/V 시퀀스를 시각과 촉각으로 나눠 각각 RMSNorm한 뒤 다시 이어 붙이는 모달리티별 K/V 정규화를 쓴다. 행동 타깃은 손가락별 힘(10개 손가락 × 6차원 = 60차원), 청크 시작 시점 대비 엔드이펙터 포즈로 표현한 팔 동작, 손 타깃, 고유수용 상태 예측을 하나의 벡터로 묶고 단일 플로 매칭 MSE로 학습한다. 학습은 세 단계다. 1단계에서 동결된 비전 VAE를 두고 흑백-투-RGB 투영과 촉각 압축기만 약 4시간 분량의 diverse-488 코퍼스(488 에피소드, 0~463 학습, 464~487 홀드아웃)로 적응시킨다. 2단계에서는 촉각 모듈을 동결하고 사전학습된 비디오 모델을 과제당 약 100개 시연으로 크로스모달 세계 모델링에 파인튜닝하며, 촉각 중간학습은 하지 않는다. 3단계에서 같은 시연으로 새 액션 전문가를 학습한다.

어떻게 쓰나

실험은 22자유도 양손 플랫폼과 손가락 표면의 조밀한 접촉을 관측하는 Sharpa 촉각 센서에서 이뤄졌다. 과제는 가림 상황의 큐브 배치, 양손 큐브 핸드오버, 장시간 접촉이 필요한 양손 닦기, 집게를 통한 방울토마토 옮기기, 겹친 그릇 분리, 병뚜껑 돌려 열기까지 여섯 가지다. 베이스라인은 촉각 없는 범용 정책 π0.5, 손끝 힘과 토크를 쓰는 ACT/CVAE 정책 ViTacFormer, 손끝 6차원 렌치를 확산 정책에 직접 주입하는 Reactive Diffusion Policy(RDP), 비전 전용 WAM인 Genie Envisioner다. 과제당 20회 실제 로봇 시행에서 DexTacWAM은 여섯 과제 모두 최고 점수를 냈고 평균 70.6 대 최강 베이스라인 RDP의 38.0을 기록했다. 격차가 가장 큰 것은 집게 과제로 60 대 10이었는데, 카메라 기반 베이스라인은 모두 10 이하였다. 이진 채점 네 과제를 합친 80회 시행에서 성공률은 55/80(68.8%) 대 RDP 24/80(30.0%)였고, 95% Wilson 신뢰구간은 각각 [57.9, 77.8]과 [21.1, 40.8], Fisher 정확검정 p = 1.59×10⁻⁶이었다. 학습에 없던 초록·보라·노란 그릇 조합에서는 13/20, 본 적 없는 2단·4단 적층 높이에서는 12/20으로 성공해 외형과 적층 기하 변화에 대한 강건성도 보고했다.

전제와 한계

절제 실험은 이득의 출처를 분명히 한다. 촉각 세계 모델링을 제거하고 액션 전문가가 인코딩된 촉각 특징에 직접 조건화하도록 바꾸되 촉각 인코더, 관측, 액션 전문가 구조, 행동 공간, 학습 데이터를 그대로 두면 네 과제 평균이 74.7에서 26.6으로 떨어진다. 즉 같은 촉각 특징을 주더라도 접촉 진화를 예측 세계 상태의 일부로 모델링하는지가 관건이다. 모달리티별 K/V RMS 정규화를 빼면 액션 전문가가 아예 수렴하지 않아 오픈루프 예측이 정답 행동을 따라가지 못했다. 촉각 압축기 구성요소는 홀드아웃 24개 에피소드의 접촉 리콜로 평가했는데, self-attention pooling이 Recall@9를 0.492에서 0.575로 올리고, 자세 주입을 더하면 0.645, 시간적 정제를 더하면 0.710, 둘을 결합하면 0.725가 되면서 융합 전 대비 리텐션이 62.9%에서 89.4%로 올랐다. 손가락 정체성 임베딩을 빼면 Recall@9가 0.671로 떨어져, 토큰이 순서 없는 접촉 묶음이 되면 안 된다는 점이 확인된다. 촉각 예측 품질은 코사인 유사도 0.967, NMSE 0.063, 접촉 정밀도/재현율/F1 0.749/0.725/0.737이었고, 마지막 프레임을 복사하는 베이스라인의 오차 대비 0.561배에 그쳐 단순 반복이 아니라 접촉 진화를 예측함을 보였다. 촉각을 익히면서도 시각 예측 품질은 유지되어, PSNR 변화의 95% 신뢰구간이 Cube Handover에서 [−0.16, +0.28] dB, Two-Hand Wipe에서 [−0.49, +0.36] dB로 손실을 0.5 dB 이내로 묶는다. 효율 측면에서는 열 손끝 스트림을 손당 하나로 압축해 DiT가 보는 뷰를 11개(머리 + 손끝 10)에서 3개(머리 + 손 2)로 줄이고, 뷰 토큰을 3168에서 864로(3.67배), 청크당 지연을 363.0 ms에서 281.6 ms로(1.29배) 낮췄다. 이는 1.8초짜리 행동 청크 실행 시간 안에 들어오는 수치다. 같은 학습 설정에서 반복 시간은 3.87에서 1.71 s/iter로 2.26배 빨라졌다.

실무 관점에서 이 논문이 주는 신호는 세 가지다. 첫째, 촉각을 정책 입력으로 넣는 것만으로는 부족하고 접촉 상태를 예측 대상으로 삼아야 성능이 나온다는 점이다. 같은 손끝 렌치를 받는 RDP가 평균 38.0에 그친 반면 접촉 진화를 세계 상태로 모델링한 쪽은 70.6을 냈다. 둘째, 촉각 데이터가 부족한 상황에서 비전 사전학습을 재활용하는 경로가 제시된다. 비전 VAE를 동결한 채 약 4시간의 상호작용으로 촉각 인코더를 적응시키고 과제당 약 100개 시연만으로 파인튜닝해 촉각 예측 능력을 얻으면서 시각 예측 품질은 0.5 dB 이내로 지킨다. 셋째, 다지 촉각을 그대로 넣으면 토큰과 지연이 커지므로 손가락 정체성과 자세를 보존하는 압축 설계가 실배포에서 중요하다. 다만 이 수치들은 특정 하드웨어와 과제 프로토콜에서 나온 것이므로, 다른 센서 원리나 자기 로봇에 적용하려면 접촉 리콜 리텐션과 지연을 먼저 재측정하는 편이 안전하다.

저자들이 밝힌 한계는 두 가지다. 첫째, 평가가 비전 기반 촉각 센싱을 쓰는 Sharpa 손에 국한되어 있어 정전용량식, 압저항식, 압전식, 자기식 등 다른 센싱 원리로의 전이는 검증되지 않았다. 둘째, 세계 모델과 액션 전문가 모두 과제별 성공 시연만으로 학습되어 명목 실행은 강하지만 실패 복구나 자기 수정에 대한 지도 신호가 거의 없다. 향후 과제로 더 넓은 센서와 신체에 대한 사전학습, 그리고 교란, 개입, 강화학습을 통해 수집한 실패 및 복구 데이터 활용이 제안된다.