점 집합 하나로 강체·관절·변형 물체 조작을 예측하는 월드 모델 PointCast

PointCast: One World Model for Rigid, Articulated, and Deformable Object Manipulation

arXiv2609.28393v1

Hantao Ye2026-09-23조회 9

무엇인가

이 논문은 로봇이 상자를 밀고 천을 끌고 캐비닛을 여는 상황을 같은 질문으로 본다. 엔드이펙터를 이렇게 움직이면 다음에 무엇이 일어나는가. 월드 모델은 이 질문에 답하는 모델이고, 조작에서는 외형보다 3D 기하가 자연스러운 상태가 된다. 기존 연구는 크게 세 갈래인데, 물리 구조를 네트워크에 심는 모델은 한 영역에서는 정확하지만 그 영역에 묶이고 새 물체마다 재질 파라미터를 다시 식별해야 한다. 픽셀 공간 월드 모델은 규모로 넓이를 얻지만 움직임과 외형이 얽히고 플래너가 쓰는 기하 상태보다 생성 비용이 크다. 점 운동 월드 모델은 상태를 기하로 유지하지만 가장 가까운 연구들도 얼린 이미지 인코더의 외형 특징이나 모든 입자에 재질 라벨을 붙인다. 이 논문이 남은 빈틈으로 지목하는 것은 점이 어디 있는지 외에는 물체에 대해 아무것도 주지 않고도 강체, 관절, 변형 물체를 하나의 레시피로 다루는 월드 모델이다.

어떻게 동작하나

PointCast의 상태는 물체와 엔드이펙터 표면 위의 지속적인 3D 점 집합이다. 메쉬가 없고 위상 가정도 없다. 상호작용마다 물체 점 K=128개를 최원점 샘플링으로 한 번 고르고, 각 행 i는 모든 프레임에서 물체의 같은 위치에 남는다. 대응은 시뮬레이터가 주거나 실제 데이터에서는 점 추적기가 준다. 엔드이펙터 점은 M=16개이며 양팔 에피소드에서는 두 그리퍼에 나뉜다. 입력 C_t는 현재 기하 x_t, 한 스텝 변위 Δx_t = x_t - x_{t-1}, 그리고 컨트롤러가 이미 정한 다음 F=5 프레임의 액터 궤적 a_{t:t+F}를 모은 것이다. 목표는 관측된 미래가 pθ 아래에서 가능한 한 높은 확률을 갖도록 θ를 맞추는 것, 즉 max θ E[log pθ(x_{t+1:t+F} | C_t)]이다. 위치는 월드 프레임으로 표현하고 첫 프레임 물체 바운딩 박스 대각선으로 상호작용마다 스케일한다.

무엇과 다른가

백본은 점별 토큰 위의 확산 트랜스포머다. 각 물체 점은 노이즈가 섞인 미래 윈도, 관측 위치, 한 스텝 변위를 융합한 토큰 하나를 만들고, 그 토큰이 그 점의 F개 미래 위치를 디코딩한다. F개 프레임을 한꺼번에 디노이즈하므로 시간 축 인과 마스크가 필요 없다. 흐름 시간은 토큰이 아니라 adaptive layer normalization을 통해 모든 블록을 변조한다. 자기 주의에서는 3D RoPE가 관측 위치로 쿼리와 키를 회전시켜 두 점 사이 오프셋에 주의가 의존하게 한다. 토큰 상호작용에는 세 가지 선택이 있다. 자기 주의가 블록마다 kNN 마스크된 국소 형태(k=16 이웃)와 전역 형태를 번갈아 쓴다. 점에 속하지 않고 국소 자기 주의에서 제외되며 출력에서 버려지는 학습 가능한 레지스터 토큰 n=8개를 더한다. 각 액터 점은 윈도 첫 프레임의 위치와 운동을 담은 교차 주의 토큰이 되고, 이후 각 프레임은 엔드이펙터 평균 변위를 담은 토큰 하나를 추가한다. 그래서 윈도 안의 손가락 운동과 엔드이펙터 회전은 관측되지 않는다. 물체 점은 엔드이펙터의 어느 부분이 가까운지 해결하고 접촉을 기하 자체에서 읽는다.

어떻게 쓰나

학습은 흐름 매칭으로 한다. z_τ를 가우시안 노이즈 z_0와 깨끗한 윈도 z_1 사이의 선형 보간으로 두고, τ는 노이즈 쪽으로 치우친 로짓 정규 분포에서 뽑는다. 네트워크 fθ는 세 항으로 깨끗한 윈도를 회귀한다. L = L_flow + λv L_vel + λa L_dist이고 모든 영역에서 λv=0.1, λa=0.01이다. L_flow는 예측 윈도의 제곱 오차를 점과 프레임에 대해 평균한 것이고, L_vel은 예측이 함축하는 속도를 실제 경로 속도 z_1 - z_0에 맞춘다. 선형 경로에서 L_vel은 L_flow를 (1-τ)^-2로 재가중한 형태이며 깨끗한 끝을 더 중시한다. L_dist는 거리 보존 사전항으로, 각 점을 첫 프레임에서 정한 여섯 최근접 이웃과의 초기 거리에 붙든다. N(i)는 점 i의 여섯 최근접 이웃, d_ij는 휴지 길이, w_ij = e^{-γ d_ij^2}는 가중치이고 모두 첫 프레임에서 읽는다. 이 항은 F개 예측 프레임에 대해 합산되며 이웃을 고르는 방식만 빼고 모든 영역에서 동일하다. 캐비닛에서는 이웃을 같은 부품 위의 점에서만 고르고, 이것이 부품 라벨이 손실에 들어가는 유일한 곳이다. 추론에서는 표준 정규분포에서 z_0를 뽑고 τ=0에서 1까지 S개 오일러 스텝으로 흐름을 적분하는데, 배포 시에는 S=1로 두어 한 스텝이 예측된 깨끗한 윈도 x̂_1을 바로 돌려준다. 롤아웃은 윈도를 앞으로 밀면서 F개 예측 프레임을 히스토리에 붙이고 컨트롤러에서 다음 액터 궤적 구간을 읽는다.

전제와 한계

실험은 시뮬레이션과 실제 데이터로 나뉜다. 시뮬레이션 데이터는 Newton 시뮬레이터에서 나오며 엔드이펙터가 강체 YCB 물체를 밀고, 천을 집어 들어 올리고, 로프를 밀고 집고, 회전 및 직동 관절이 있는 캐비닛 손잡이를 잡는다. 물체 기하, 재질 파라미터, 명령 운동은 에피소드마다 무작위다. 실제 데이터는 PGND 벤치마크의 6개 범주, 다중 시점 RGB-D 원격조작 로봇 상호작용이며 자체 분할과 지표를 쓴다. 실제 데이터의 물체 점은 벤치마크가 공개한 CoTracker3 추적에서 온다. 시뮬레이션 훈련 풀은 강체 112k, 천 10.2k, 로프 10.2k, 캐비닛 5.0k 상호작용이고 15%를 검증으로 남긴다. 시뮬레이션은 물체별로 분할해 모든 평가 물체가 훈련에서 보이지 않는다. 훈련 윈도는 F=5 미래 프레임이며 강체와 캐비닛은 연속 프레임, 천과 로프는 네 번째 프레임마다 쓴다. 평가는 지상 진실 엔드이펙터 궤적을 따라 롤아웃하고 예측 제어점에서 선형 블렌드 스키닝으로 조밀한 점 구름을 운반한 뒤, 모든 상호작용의 모든 프레임에 대한 평균 롤아웃 오차(mm)를 잰다. 캐비닛은 구동 관절만 점수화한다. 상호작용 길이는 강체 86프레임 15Hz, 천 114, 로프 34~75, 캐비닛 40프레임이다. 실제 데이터는 벤치마크 자체 프로토콜로 3초 지평의 평균 변위 오차를 잰다. AdaptiGraph는 실제 데이터에서 점수화되지 않는데, 공개된 평가가 엔드이펙터가 움직이는 동안만 진행되고 원격조작 캡처는 멈추기 때문이다. 베이스라인은 AdaptiGraph, PGND, 용량을 맞춘 PTv3, 가장 가까운 ParticleFormer다. PTv3, ParticleFormer, PointCast는 영역이나 범주마다 처음부터 같은 코사인 감쇠 스케줄로 학습하고 체크포인트 하나씩을 검증 슬라이스에서 골라 한 번만 점수화한다. 200 에폭, 800스텝, 배치 64, 영역별 같은 예산으로 A100 또는 H100 한 장에서 약 7시간이다. 결과는 시뮬레이션 표 I에서 PointCast가 네 영역 중 세 영역 최고, 강체에서는 두 번째다. 천에서 ParticleFormer를 16.6%, 로프에서 32.6% 앞선다. 캐비닛 구동 관절에서는 PTv3를 6.84 대 10.34로 앞선다. 강체는 유일한 패배로 ParticleFormer에 16.9% 뒤진다. PTv3는 같은 예산과 용량(19.5M 대 19.8M)에서 모든 영역을 잃어 이득이 백본이 아니라 아키텍처에 있음을 보인다. 실제 데이터 인도메인에서는 표 II의 6개 범주 중 4개에서 최저 평균 오차, 나머지 2개에서 두 번째이며, PGND를 6개 모두에서 개선한 유일한 방법이다. 제로샷 전이에서는 시뮬레이션 체크포인트를 실제 데이터 없이 네 캡처에 적용해 Push-T와 Franka에서 네 방법 중 최고, 로프와 천에서는 ParticleFormer가 앞선다. 같은 천과 로프 체크포인트는 PGND 에피소드에서 92.45mm와 134.33mm를 기록했고, 프레임마다 엔드이펙터가 거의 움직이지 않는 데이터라 재스트라이딩으로 65.25mm와 51.87mm까지 회복하지만 인도메인 행보다 천 2.0배, 로프 3.3배 격차가 남는다.

절제 실험은 점별 감독과 거리 사전항이 관절을 결정한다고 주장한다. ParticleFormer의 집합 수준 목적함수는 각 점이 어디로 갔는지가 아니라 점들이 이루는 모양을 점수화한다. 이 교체는 캐비닛 구동 관절을 79% 나쁘게 만들지만 모든 캐비닛 점 오차는 9.66에서 6.51로 개선된다. 모양 맞춤은 정적인 몸체로 만족되고 움직이는 부품을 포기한다. 점별 손실은 강체 영역을 희생해 움직이는 부품을 얻는다. 천은 3.5% 나빠지고 로프는 2.2% 좋아진다. 강체는 이 교체가 가장 도움이 되는 영역으로 14.5% 좋아져 우리 백본이 ParticleFormer의 강체 수치에 도달한다(20.86 대 20.88). 어느 손실에서도 모델은 천, 로프, 캐비닛에서 ParticleFormer를 이긴다. 거리 사전항을 제거하면 캐비닛 관절이 18% 나빠지고 천은 3.1%, 로프는 2.1% 좋아지며 강체는 1.7% 움직인다. 캐비닛에만 있는 설정인 부품 라벨로 이웃을 고르는 것은 구동 관절에서 15.6% 가치가 있다. 국소와 전역을 번갈아 쓰는 패턴과 전체 윈도 토큰도 필요하다. 단일 패턴 두 팔은 강체에서 번갈아 쓰기보다 각각 4.9%와 8.8% 나쁘고 천, 로프, 캐비닛 관절은 어느 방향으로든 7% 미만 바뀐다. 비디오 레시피는 모든 점에 프레임마다 토큰 하나를 주고 시간 로타리 임베딩으로 블록 인과 주의를 하며, 모든 영역에서 더 나쁘고 강체 33%에서 로프 3.5배까지 나쁘며 파라미터가 21% 더 많다. 네트워크 평가 한 번이면 충분하고 영역별 체크포인트 하나는 충분하지 않다. 노이즈 추출은 열 개 평가 풀 모두에서 모델 자체 오차의 2~17%만 출력을 움직인다. 25스텝은 천에서 1% 미만 이득, 로프에서는 이득이 없고 강체는 5%, 캐비닛 관절은 16% 나쁘게 만든다. 같은 네트워크를 같은 점별 손실로 직접 회귀하면 모든 영역에서 5.1% 이내에 들어, 이득이 상태와 감독에 있음을 보인다. 흐름 매칭은 한 오일러 스텝 비용이 같고 생성 목적함수 학습을 유지하므로 남는다. 네 영역을 하나의 체크포인트로 네 배 예산에서 학습하면 강체와 천은 3.3% 이내지만 로프는 15% 나쁘고 캐비닛 관절은 3.8배 나쁘다. 배포 시 예측 윈도 하나는 RTX 4090 한 장, 배치 크기 1에서 모델 연산 16.2ms이고 25스텝은 384.8ms로 23.8배다. 자유 롤아웃은 15Hz 관측 속도에서 실시간보다 18~77배 빠르다.

계획에서는 윈도마다 네트워크 평가 한 번이 가능하다는 점이 얼린 PointCast를 샘플링 기반 MPC에 쓸 만큼 싸게 만든다. 재계획 스텝마다 플래너는 제안 평균 주변의 등방성 가우시안에서 N개 후보 행동 시퀀스를 뽑고, 하나의 공유 노이즈 추출에서 모델을 한 스텝씩 굴린다. 예측 점은 점 집합 목표에 대해 점수화되고, MPPI 규칙이 AdaptiGraph 온도에서 최저 비용 후보 쪽으로 평균을 당기며 순차 과제는 최선 후보에 재적합한다. 플래너는 최선 후보를 한 윈도 실행한 뒤 재계획한다. 후보 수는 밀기, 캐비닛, 끌기 과제에서 각각 N=32, 16, 8이다. 포즈 밀기에서는 엔드이펙터가 한 윈도 안에 더 나은 접촉면으로 재배치될 수 없어 세 윈도 앞을 보고, 순차 과제는 두 윈도, 끌기는 한 윈도를 본다. 네 과제 모두 보지 못한 물체 기하를 쓰고 목표는 점 집합 구성이다. SE(2) 포즈 밀기는 T블록을 10~20cm 떨어진 평면 목표로 명령 요 20~60도에서 보낸다. 순차 관절 조작은 캐비닛 관절 두 개를 샘플된 순서로 명령하고, 첫째를 열고 놓은 뒤 첫째가 남긴 상태에서 둘째를 작동시키며 손잡이 사이 이동은 모든 모델에 스크립트된다. 천 끌기와 로프 끌기는 스크립트된 파지에서 시작해 물체를 이동 목표로 옮긴다. 결과적으로 PointCast는 표 V에서 네 과제 모두 계획하며 각 과제에서 모든 베이스라인과 경쟁하거나 능가한다. 포즈 밀기와 두 끌기에서 PTv3와 AdaptiGraph를, 포즈 밀기와 천 끌기에서 PGND를, 로프 끌기에서 ParticleFormer를 앞선다. 남은 차이는 실행 간 변동 범위 안이다. PointCast는 첫 명령 관절에서 최저 오차이고 둘째에서는 PGND와 동률이며 재부착 후 곡선이 가장 낮게 정착한다. PGND는 표 I에서 가장 약한 자유 롤아웃 예측기 중 하나지만 플래너가 매 윈도 재계획하면 회복하고, 다만 놓은 뒤 첫 관절을 2.25cm까지 표류시킨다. 같은 플래너와 실제 데이터 없는 시뮬레이션 강체 체크포인트로 Franka Emika Panda에서 인쇄된 T블록을 포즈 목표로 민다. 그 점은 융합된 깊이 구름에 SE(2)로 맞춘 인쇄 형상이다.

개발자 관점에서 이 논문의 핵심은 메쉬, 외형 특징, 재질 라벨, 재질 파라미터 없이 점 집합과 점별 궤적 감독만으로 강체, 관절, 변형 물체의 조작 동역학을 예측하고, 한 번의 오일러 스텝으로 전체 윈도를 뽑아 샘플링 기반 MPC에 넣을 수 있다는 주장이다. 시뮬레이터에서 무작위화해 학습한 체크포인트가 실제 로봇 데이터의 자체 모델을 6개 범주 모두에서 개선하고, 제로샷으로도 일부 캡처에서 최고가 된다는 점은 시뮬레이션-실제 전이를 노리는 팀에 참고가 된다. 다만 실제 적용 전에 확인할 전제가 있다. 물체 점의 시간적 대응은 시뮬레이터나 실제 데이터의 점 추적기에 의존하고, 액터 템플릿은 그리퍼 열림 거리를 담지 않으며 윈도 안 손가락 운동과 엔드이펙터 회전은 관측되지 않는다. 캐비닛에서는 거리 사전항의 이웃을 같은 부품에서 고르는 부품 라벨이 손실에 들어간다. 저자들이 밝힌 한계는 PointCast가 한 번에 한 윈도만 예측하고, 자기 예측을 다시 입력하는 롤아웃이 지평선에서 오차를 누적한다는 것이다. 포즈 밀기는 이미 세 윈도 앞을 계획하지만 더 멀리는 롤아웃이 얼마나 버티는지의 문제로 남는다. 비디오 모델도 같은 한계를 self-forcing과 diffusion forcing으로 다루며, 점 집합도 같은 처리를 받을 수 있는 상태라고 저자들은 말한다.

관련 논문