SpatialHarness가 가상 시점으로 로봇 정밀 조작 성공률을 높인다

SpatialHarness: Test-Time Spatial Scaffolding for Fine Robotic Manipulation

arXiv2610.12457v1

Jiayu Wang2026-10-08

무엇인가

이 논문이 푸는 문제는 정밀 로봇 조작에서 최신 멀티모달 파운데이션 모델이 왜 자주 실패하는가다. GPT-6 Astra 같은 모델은 별도 정책 학습 없이 시각 관측과 언어 지시만으로 로봇 행동을 생성하고 실행 피드백으로 교정할 수 있지만, 삽입·쌓기·좁은 구조 위 배치 같은 과제에서는 성능이 제한된다. 저자들은 실패 원인이 정책 능력 부족이 아니라 공간 관측성(spatial observability) 부족이라고 주장한다. 플러그가 소켓과 정렬됐는지, 홀이 페그 위 중앙에 놓였는지 같은 과제 결정적 공간 관계는 실제 배포의 고정 카메라 구성으로는 잘 드러나지 않으며, 특히 접촉 근처에서는 그리퍼와 조작 대상이 가장 중요한 기하 정보를 가린다. 그래서 정책을 재학습하거나 물리 센서 구성을 바꾸지 않고 테스트 시점에 공간 관측성을 높일 수 있는가라는 질문을 던진다.

어떻게 동작하나

제안 방법인 SpatialHarness는 테스트 시점에 동작하는 embodied harness다. 실세계 실행과 동기화된 온라인 시뮬레이션 장면을 유지하고, 과제에 결정적인 공간 관계를 식별한 뒤, 그것을 드러내는 보조 가상 뷰를 렌더링해 동결된(frozen) 멀티모달 정책에 넘긴다. 정책은 매 결정 스텝마다 과제 지시문, 실제 관측, 로봇 상태와 함께 이 공간 컨텍스트를 받는다. 공간 컨텍스트는 보조 가상 뷰와 구조화된 공간 정보로 구성되며, 여기에는 객체 6-DoF 자세와 렌더링 신뢰도 추정이 포함된다. 물리 시뮬레이션과 이미지 렌더링은 MuJoCo로 수행한다.

무엇과 다른가

핵심 구성 요소는 상호작용 인식 장면 동기화다. 초기화 단계에서 모델이 각 물체의 여러 이미지와 치수 주석으로 CAD 모델을 만들고, 실제 카메라 외부 파라미터를 이용해 후보 자세에서 렌더링한 윤곽·깊이를 SAM 3 세그멘테이션 마스크 및 관측 깊이와 비교하는 시각 보정으로 초기 후보 자세 집합을 만든다. 이어 모델이 물체 속성과 장면 참조로부터 공간 관계 제약을 추론하고 이를 제약 프로그램으로 생성해 실행하는데, 하네스는 제약 검사 후 유계 자세 보정을 적용하거나 후보를 기각하고, 제약과 시각 검증을 모두 통과한 자세만 채택한다. 실행 중에는 매 행동 후 물체-그리퍼 상호작용 모드를 static, held, transition 세 가지로 구분해 갱신한다. static은 고정 물체의 자세를 유지하거나 새 관측으로 시각 보정하고, held는 측정된 관절·그리퍼 운동을 물리 엔진에 넣어 파지된 물체 자세를 예측한 뒤 중심축 오프셋과 특징 방향 같은 물체-그리퍼 기하 제약 및 시각 검증을 거치고 실패하면 손목 카메라 기반 보정으로 대체한다. transition은 파지·해제 전환에서 가설 리플레이를 쓴다. 접촉 전 체크포인트의 전체 시뮬레이션 상태를 저장하고 물체 자세 주변에 국소 교란을 준 여러 가설을 만든 뒤, 동일한 실측 로봇 운동을 각 가설에서 리플레이한다. 이후 모델이 손목 카메라 관측과 로봇 운동으로 상호작용 일관성 제약을 만들어 제약 프로그램으로 각 후보의 파지·해제 결과가 실제와 맞는지 불리언으로 검사해 걸러내고, 남은 후보들은 손목 카메라 시점에서 리플레이 시퀀스를 렌더링해 물체 마스크 윤곽 차이가 가장 작은 것을 골라 그 전체 시뮬레이션 상태를 채택한다. 이렇게 하면 물체 자세뿐 아니라 리플레이가 만들어낸 동적 상태까지 보존된다.

어떻게 쓰나

가상 시점은 실행 전에 과제 지향적으로 선택한다. 모델이 과제 지시문에서 성공 기준을 뽑아 완료 시 물체가 만족해야 할 공간 제약을 도출하고, 그 제약이 물체 전체의 상대 위치·방향에 관한 것이면 전역 뷰 두 개를, 국소 구조끼리의 결합 방식에 관한 것이면 국소 뷰 하나와 전역 뷰 하나를 고른다. 국소 뷰의 시점과 프레이밍은 관련 구조의 형상·위치·방향에서 결정하고, 전역 뷰는 로봇과 과제 관련 물체를 담는다. 하네스가 후보 뷰를 렌더링하면 모델이 관련 부위가 동시에 보이는지, 과제 결정적 관계를 명확히 판단할 수 있는지, 현재 실제 관측에서 구분하기 어려운 정보를 드러내는지를 검사하고, 부적합하면 카메라 위치·방향·프레이밍을 조금씩 조정해 다시 렌더링한다. 필요하면 물체 이동을 시뮬레이션해 뷰의 적합성을 확인한다. 실행 중에는 시점이 고정되고, 갱신되는 온라인 장면에서 보조 렌더링만 계속한다.

전제와 한계

실험은 Franka Research 3 팔과 Intel RealSense RGB-D 카메라 두 대(손목 장착 1대, 고정 3인칭 1대)로 수행했다. 두 방법 모두 Robocurve의 Inspect Robots 제어 프레임워크와 GPT-6 Astra(low reasoning effort)를 조작 모델로 쓴다. 베이스라인은 과제 지시문, 실제 카메라 두 대의 RGB 이미지, 측정된 로봇 상태, 실행 피드백을 받고, SpatialHarness는 여기에 가상 RGB 뷰 두 개와 물체 자세를 추가한다. 가상 시점은 실행 전에 GPT-6 Astra(xhigh reasoning effort)가 선택한다. 행동은 병진 증분, 회전 벡터 증분, 그리퍼 명령으로 이루어진 7차원 벡터이고, 한 번의 호출에서 행동 청크와 그 길이 H∈{10,20,30}을 함께 생성한다. 과제는 블록 쌓기, 플러그 삽입, 타워 오브 하노이, 서랍 열고 블록 넣기 네 가지이며 과제당 15회 시행했다.

결과는 네 과제 모두에서 성공률이 올랐고 평균 성공률은 18.33%에서 83.33%로 65.00%포인트 상승했다. 타워 오브 하노이는 0%에서 100%(15/15), 서랍 과제는 0%에서 66.67%(10/15)가 됐다. 플러그 삽입은 26.67%에서 66.67%로 40.00%포인트, 블록 쌓기는 46.67%에서 100%로 올랐다. 정책 질의 횟수는 블록 쌓기에서 약 30%, 타워 오브 하노이에서 약 21%, 플러그 삽입에서 약 7% 줄었고 서랍 과제는 베이스라인과 비슷한 수준이었다. 질의가 줄거나 비슷한데 성공률이 오르는 것은 보조 가상 렌더링이 공간 관측성 부족에서 오는 비효율적 시도와 반복 조정을 줄인다는 해석으로 이어진다.

개발자 관점에서 이 논문의 의미는 정책 자체를 건드리지 않고 관측 인터페이스만 바꿔 성능을 끌어올린다는 점이다. 실무에서는 시뮬레이션-실제 동기화 정확도, 특히 파지·해제 전환 구간의 신뢰성, CAD 자산 생성 품질, 카메라 캘리브레이션 정확도, 그리고 가상 시점이 실제로 기존 관측에 없던 정보를 주는지를 확인해야 한다. 또한 가상 뷰가 늘어난 만큼 추론 입력과 지연시간이 어떻게 변하는지도 배포 전에 점검할 항목이다.

저자들이 밝힌 한계는 세 가지다. 현재 연구는 강체와 관절 물체만 다루고, 기하 변화가 장면 표현과 동기화에 추가 난제를 만드는 변형 물체 조작은 다루지 않는다. 상호작용 인식 장면 동기화는 시간 오버헤드를 발생시키며, 특히 가설 리플레이·상호작용 일관성 필터링·윤곽 매칭이 필요한 파지·해제 전환에서 시스템 응답성을 제한한다. 마지막으로 SpatialHarness는 공간 추론과 행동 생성에 강력한 멀티모달 파운데이션 모델에 의존하고 있어, 더 작은 모델에서의 효과는 검증되지 않았다.