힘 센서 없이 그리퍼 변형 영상으로 접촉 힘을 추정해 조작한다
Robot Learning with Visual Predicted Force
무엇인가
접촉이 많은 조작에서는 힘을 제어하는 것이 중요하다. 힘이 너무 세면 물체가 파손되고, 너무 약하면 미끄러져 과제가 실패한다. 기존 로봇은 손목 장착 힘/토크 센서, FPCB 촉각 센서, GelSight 같은 광학 촉각 센서로 이 정보를 얻지만, ATI나 Bota의 6축 힘/토크 센서는 로봇별 마운트와 통합 비용을 제외하고도 대당 수천 달러에 달하고, FPCB 센서는 맞춤 제작·배선·캘리브레이션이 필요하며, 광학 촉각 센서는 내장 카메라와 조명, 반복 접촉에 마모되는 연성 표면을 요구한다. 이 논문은 그 하드웨어를 배치 시점에서 없앨 수 있는지 묻는다. 답은 3D 프린팅 TPU로 만든 Fin Ray 컴플라이언트 그리퍼의 눈에 보이는 변형이다.
어떻게 동작하나
방법은 세 단계로 구성된다. 1단계는 시각 힘 추정기 학습이다. 기준 힘 센서 위에 19개의 3D 프린팅 접촉 셸을 올리고, 그리퍼가 누르는 힘을 센서로 전달하면서 손목 카메라로 Fin Ray 손가락의 변형을 동시에 기록한다. 기준 센서는 Mitsumi MMS101 저항식 힘 센서와 ATI 6축 힘/토크 센서 두 가지를 쓴다. 다양한 접촉 위치와 세기로 117 에피소드, 총 47.5분을 수집했고, 영상은 30Hz, 힘은 약 20Hz로 기록해 타임스탬프로 정렬한 뒤 축방향 힘 Fz만 학습에 사용한다. 입력 처리에서는 SAM2로 그리퍼를 분할해 배경을 제거하고 256×256으로 리사이즈한 뒤 그레이스케일로 바꿔 Sobel 에지 크기를 계산한다. 분할 경계가 만드는 인공 에지를 줄이려고 마스크를 1픽셀 침식해 에지 이미지에 적용한다. 이렇게 만든 단일 채널 에지 이미지를 특징 차원 (32,64,128,256)과 512채널 병목을 가진 인코더 전용 U-Net에 넣고, 부호 있는 축방향 힘과 Fz 측정값의 평균제곱오차를 최소화하도록 학습한다. 배치 시에는 예측값의 크기만 쓴다.
무엇과 다른가
2단계에서는 과제별 시연을 로봇 팔로 수집하고, 얼려둔 시각 힘 추정기로 각 시연 타임스텝에 힘 추정값을 붙인다. 이렇게 만든 힘 증강 시연에서 과제별 목표 힘 하나를 고른다. 3단계는 행동-힘 제안 정책이다. 확률적 정책이 현재 관측으로부터 엔드이펙터 행동과 그에 대응하는 힘 값을 동시에 생성하도록 학습하는데, 행동은 시연 행동으로, 힘은 시각 힘 라벨로 각각 지도한다. 저자들은 이 정책이 행동 조건부 힘 추정기가 아니라고 강조한다. 시각 힘 추정기는 그리퍼 변형만 보고 힘을 예측하지만, 정책은 관측에서 행동과 힘을 함께 생성한다. 추론 시에는 같은 관측에서 K=32개의 행동-힘 후보를 독립적으로 샘플링하고, 생성된 힘 성분이 과제 목표 힘에 가장 가까운 후보의 행동만 로봇에 보낸다. 힘 값은 후보 선택에만 쓰이고 제어 명령으로 전달되지 않는다. 이 절차를 매 타임스텝 반복한다.
어떻게 쓰나
힘 추정 성능은 별도 평가 데이터로 확인한다. 학습과 베이스라인 캘리브레이션에서 모두 제외한 3개 에피소드, 442프레임을 Nextech DFS-XM 힘 게이지와 Micro-SBeam 로드셀로 측정한 기준값과 비교했다. 베이스라인은 그리퍼 모터 전류로 힘을 추정하는 선형 모델로, 10개의 별도 캘리브레이션 기록으로 계수를 적합했다. 시각 추정기의 평균절대오차는 0.91N, 전류 베이스라인은 4.20N이었다. 전류 베이스라인은 기준 측정값이 0에 가까울 때도 상당한 힘을 보고하고 하중 구간에서 과대추정하는 반면, 시각 추정값은 저힘 구간과 접촉 중 변화를 더 충실히 따라갔다. 다만 높은 힘 구간에서는 시각 추정값에도 변동이 남는다.
전제와 한계
조작 실험은 네 가지 힘 민감 과제에서 수행했다. 내용물이 없는 탄산캔 잡기, 베리 따기, 손 안에서 금속판을 세우는 재배향, 플러그 삽입이다. 과제마다 ARX 로봇 팔로 40개의 시연을 모았고, Diffusion Policy 구조의 확률적 정책을 학습했다. 손목에는 RealSense D405, 측면에는 D435를 달았고 RTX 5090 한 장에서 학습·실행했다. 비교는 같은 정책 체크포인트에서 샘플 선택 방식만 바꾼다. 단일 샘플 추론은 행동-힘 샘플 하나를 뽑아 힘 성분을 무시하고 실행하고, 제안 방법은 K=32개를 뽑아 목표 힘에 가장 가까운 것을 실행한다. 과제별 15회 시행에서 성공률은 캔 잡기 46.7%에서 86.7%, 베리 따기 0%에서 73.3%, 재배향 6.7%에서 46.7%, 플러그 삽입 26.7%에서 73.3%로 모두 올랐다. 베리 따기가 가장 크게 개선됐고 재배향은 46.7%로 가장 어려운 과제로 남았다. 정성적으로 단일 샘플 추론에서는 캔이 찌그러지고 베리가 으스러졌으며, 재배향 실패와 그리퍼 안에서 플러그가 미끄러지는 사례가 나타났다. 힘 탐색 예시에서는 정책이 생성한 32개 후보의 예측 힘이 4.45~6.36N, 평균 5.36N, 표준편차 0.69N이었고 목표 힘에 가장 가까운 4.45N 후보가 선택됐다.
개발자 관점에서 이 방법의 실질적 이점은 배치 시 힘·촉각 센서가 필요 없다는 점이다. 값싼 3D 프린팅 그리퍼와 RGB 카메라만으로 접촉 힘에 대한 신호를 얻고, 정책 재학습이나 제어 인터페이스 변경 없이 추론 단계의 후보 선택만 바꿔 성공률을 올린다. 다만 도입 전에 확인할 것이 있다. 시각 힘 추정기는 기준 힘 센서로 수집한 캘리브레이션 데이터에 의존하므로 그리퍼 형상·재질·카메라 위치가 바뀌면 다시 학습해야 한다. 또 과제마다 목표 힘을 시연에서 골라 넣어야 하고, 그리퍼 변형이 잘 보이도록 손목 카메라 시야를 확보해야 한다. 정책이 생성 정책이므로 K개 샘플을 뽑는 추론 비용이 단일 샘플보다 크다는 점도 감안해야 한다.
저자들이 밝힌 한계는 세 가지다. 첫째, 과제별 목표 힘이 필요하고 이는 성공 시연에서 얻는다. 물체 특성과 접촉 상태, 과제 단계에 따라 목표 힘을 자동으로 추론·적응하는 것은 향후 과제로 남는다. 둘째, 현재는 수직 파지력 Fz만 추정하며 접선 방향 힘이나 토크는 복원하지 못한다. 전체 접촉 렌치로 확장하려면 다축 변형 단서가 풍부한 연성 그리퍼가 필요하다. 셋째, 행동 선택이 정책이 생성한 힘 예측에만 의존하고 온라인 시각 힘 피드백이 없어서 예측 오차나 예상치 못한 접촉 외란을 실행 중에 교정하기 어렵다. 저자들은 결론에서 로봇의 컴플라이언트 구조 자체가 시각적으로 관측 가능한 센싱 매체가 될 수 있다는 관점을 제시하며, 물리적 상호작용 신호를 로봇 변형의 시각 관측에서 직접 복원하는 저비용 조작 시스템을 기대한다.