확산 궤적 모델의 불확실성을 실시간 제어에 바로 쓰게 만드는 SCOPE

Control-Ready Uncertainty for Trajectory Diffusion

arXiv2610.12431v1

Zhiwei Xue2026-10-08

무엇인가

확산 모델은 조작과 보행 같은 로봇 과제에서 정책으로도, 세계 모델로도 쓰인다. 특히 주변 보행자나 차량, 협업자의 미래 궤적을 예측하는 데 유용하다. 그런데 상호작용 로봇에서는 정확한 예측만으로 충분하지 않다. 미래 행동 자체가 확률적이어서 생기는 aleatoric 불확실성, 즉 그럴듯한 미래들 사이의 퍼짐을 알아야 로봇이 지나갈지 양보할지, 안전 마진을 얼마나 둘지 정할 수 있다. 문제는 확산 모델이 불확실성을 생성 분포 안에 암묵적으로만 담고 있어서, 이를 명시적으로 꺼내려면 역확산 체인을 수백 번 돌리는 Monte Carlo 샘플링이 필요하다는 점이다. GPU 배칭을 써도 폐루프 제어 주기에는 너무 느리고, 샘플 수를 줄이면 추정 품질이 떨어진다. 논문은 여기서 Monte Carlo 없이 제어에 바로 쓸 수 있는 불확실성을 빠르게 얻을 수 없느냐를 질문으로 삼는다.

어떻게 동작하나

제안 방법 SCOPE(Score-Curvature for Online Precision Estimation)는 확산 궤적 모델에 제어용 불확실성을 붙이는 경량 모듈이다. 핵심 관찰은 학습된 score 모델이 학습된 궤적 밀도의 국소 기하를 담고 있다는 것이다. 예측 궤적 주변에서 우도가 얼마나 빨리 떨어지는지가 불확실성을 결정한다. Laplace 근사에 따르면 이 국소 기하는 로그 밀도의 곡률, 즉 음의 헤시안으로 표현되고 이것이 정밀도 행렬이 된다. 곡률이 날카로우면 좁고 정밀한 튜브가, 평평하면 넓은 그럴듯한 미래 영역이 나온다. 다만 전체 곡률 행렬을 제어 시점에 만들고 질의하는 것은 비현실적이라, SCOPE는 학습 시점에 score-curvature 정보를 증류해 구조적 정밀도 헤드를 학습한다.

무엇과 다른가

구조와 학습 절차가 이 논문의 실질적인 기여다. 정밀도는 A_φ(y) + R_φ(y)R_φ(y)^T 로 매개화되는데, A_φ = L_φL_φ^T 는 블록 하부 밴드 콜레스키 인자(대역폭 b)이고 R_φ는 장거리 상관을 담는 저랭크 보정(r ≪ dT)이다. 궤적의 정밀도 행렬이 근사적으로 블록 밴드 형태인 이유는 인접 타임스텝은 동역학으로 강하게 결합되고 먼 타임스텝은 중간 상태가 주어지면 조건부 독립에 가깝기 때문이다. 교사 정밀도는 절대 명시적으로 만들지 않는다. 대신 임의의 프로브 벡터 u에 대한 헤시안-벡터 곱을 자동미분으로 계산하고, Hutchinson 항등식에 따라 등방성 프로브를 Q개 뽑아 프로베니우스 노름 차이를 확률적으로 최적화한다. 이 손실은 예측 정밀도에 프로브를 곱한 항과 score의 야코비안에 프로브를 곱한 항의 제곱 노름으로 구성되며, 2차 계산을 전부 학습 시점으로 옮긴다. 추론 시에는 확산 1회와 헤드 1회 순전파로 앵커와 구조적 정밀도를 얻고, 밴드 콜레스키 솔브와 Woodbury 업데이트로 타임스텝별 주변 공분산을 복원한다. 마지막으로 홀드아웃 셋에서 궤적 단위 NLL을 최소화하는 지평별 스케일 인자를 최적화하는 사후 캘리브레이션을 적용한다.

어떻게 쓰나

백본과 제어 인터페이스도 짚어둘 만하다. SCOPE는 표준 확산 모델의 단일 궤적에도, 여러 샘플에도, 멀티모달 백본의 명시적 모드에도 붙일 수 있지만 논문은 마지막을 택한다. 이산 잠재 멀티모달 확산 백본이 Trajectron++ 스타일 혼합으로 K개의 명목 궤적 가설과 모드 확률을 내놓으면, SCOPE가 각 가설에 구조적 정밀도를 씌워 가우시안 튜브 혼합을 만든다. 모드 확률은 서로 다른 미래 사이의 전역적 모호성을, 역정밀도는 한 모드 안의 국소 퍼짐을 나타낸다. 이 표현은 두 용도로 쓰인다. 세계 모델로 쓸 때는 다른 에이전트의 미래 점유 분포가 되어 MPPI의 chance-cost, 즉 충돌 확률 계산에 들어가고, 정책 사전으로 쓸 때는 로봇 자신의 계획 주변 유연성을 나타내 MPPI 탐색 공분산을 튜브 공분산에 비례하도록 적응적으로 조절한다. 넓은 공분산은 유연한 구간에서 탐색을 확장하고, 좁은 공분산은 정밀한 구간에서 탐색을 수축시킨다.

전제와 한계

첫 번째 실험 축은 불확실성 품질과 추론 속도다. ORCA 시뮬레이션 Y자 복도에서 보행자 궤적 예측을 평가하며 보행자 수는 3, 6, 9, 12명으로 늘린다. 주 지표는 NLL이다. 비교 대상은 등속 칼만 필터 LKF와, 확산 샘플 64개, 128개, 256개를 뽑아 GMM을 피팅하는 MID-Ensemble이다. 정밀도 구조 절제는 타임스텝 독립 대각, 블록 밴드만, 저랭크 추가(캘리브레이션 없음), 완전 캘리브레이션 모델로 나뉜다. 결과적으로 SCOPE는 모든 군중 밀도에서 가장 강한 앙상블 베이스라인과 동등하거나 더 나은 NLL을 냈고, 밴드 구조가 대각 구조보다 낫고 저랭크 항과 캘리브레이션이 궤적 단위 NLL을 추가로 개선한다. 정밀도 헤드와 캘리브레이션은 A5000에서 1ms 미만이 걸린다. MID-Ensemble은 GPU 완전 배칭에서도 샘플 예산에 따라 비용이 커져 최대 7배 느리다.

두 번째와 세 번째 축은 하류 제어 성능이다. Maze2D에서는 무작위로 생성된 비볼록 미로를 쓰고 학습과 테스트 미로 구성을 다르게 한다. 베이스라인은 고정 등방 가우시안으로 섭동하는 Vanilla MPPI, 로그노멀 섭동을 쓰는 Log-MPPI, 확산 명목 궤적으로 워밍스타트하지만 고정 탐색 공분산을 쓰는 Diff-MPPI다. Diff-MPPI에 SCOPE를 붙인 방법이 모든 롤아웃 예산에서 최고 성공률과 최단 평균 경로 길이를 기록했다. Vanilla와 Log-MPPI는 오목 구간에서 롤아웃을 낭비하고 지역 최솟값에 갇히며, Diff-MPPI는 고정 제안 공분산 때문에 너무 작으면 탈출을 못 하고 너무 크면 벽 근처에서 충돌하는 단일 스케일 트레이드오프에 걸린다. SCOPE는 튜브 불확실성을 유연성 인지 분산으로 써서 열린 공간에서 확장하고 좁은 통로에서 수축한다. Y자 복도 보행자 내비게이션에서는 예측 없음, LKF, MID-Ensemble과 비교하고 단일모달, SCOPE 없는 멀티모달, 캘리브레이션 생략을 절제한다. SCOPE가 모든 밀도에서 최고 또는 공동 최고 성공률을 냈고 특히 보행자 9명과 12명에서 두드러졌다. 예측이 전혀 없으면 순수 반응적이고 등속 예측만 넣어도 성공률이 크게 오르며, 확산 예측은 추가로 도움이 되지만 단일모달은 한 미래에 커밋하고 멀티모달은 보정된 타임스텝별 불확실성이 없어 보수성을 조절하지 못한다. MID-Ensemble은 무차별 샘플링으로 불확실성을 추정하지만 계산량 때문에 제어 주파수가 제한되고 성공률이 모든 밀도에서 SCOPE보다 낮다. 내비게이션 시간과 경로 길이는 강한 베이스라인과 비슷한 수준이며, 캘리브레이션을 빼면 밀집 군중에서 성공률이 일관되게 떨어진다.

실로봇 검증은 7자유도 Franka Emika 팔의 테이블탑 픽앤플레이스다. 선반 안쪽으로 들어가 토마토를 집어 위 선반에 놓아야 하는 제약된 비볼록 작업공간이고, 박스 장애물은 시행마다 무작위로 재배치된다. 확산 모델은 여유 공간이 다른 두 접근 모드, 즉 유연한 정면 접근과 더 좁은 측면 접근을 제공한다. Static 조건은 정책 측 튜브 기반 MPPI에 500 롤아웃과 정지 장애물을 쓰고, Dynamic 조건은 사람이 근처 물체를 집으러 뻗는 상황을 추가한다. 조건당 30 시행이며 지표는 성공률, 충돌률, 120초 내 충돌 없이 실패한 타임아웃률이다. Diffuser는 개루프로 자주 충돌했고, Vanilla MPPI는 짧은 지평 때문에 선반 층 사이에 갇혔으며, Diff-MPPI는 유연성 인지 없이 좁은 측면 접근을 골라 지역 최솟값에 빠졌다. SCOPE는 튜브로 더 유연한 모드를 고르고 선택한 경로를 따라 탐색을 적응시켜 최고 성공률과 최저 충돌률을 냈다. Dynamic에서 예측이 없으면 사람이 이미 가까워진 뒤에야 반응해 회피가 늦거나 선반 쪽으로 과보정한다. 매 제어 주기마다 새 예측을 줄 수 있는 최대 앙상블인 MID-Ens-64도 SCOPE보다 성공률이 낮았고, 샘플을 128개로 늘리면 예측 갱신이 느려져 사람 움직임에 대한 반응이 지연됐다. 다만 성공률, 충돌률, 타임아웃률의 구체적 수치는 원문에 제시되지 않았다.

개발자 관점에서 이 논문이 쓸모 있는 지점은 명확하다. 확산 정책이나 확산 예측기를 이미 쓰고 있고 MPPI 같은 샘플링 제어기를 폐루프로 돌리는 팀이라면, 앙상블 샘플링 대신 1ms 미만의 불확실성 추정을 얻어 제어 주기를 지킬 수 있다. 도입 전에 확인할 것은 세 가지다. 백본이 모드를 제대로 분리하는지, 캘리브레이션이 홀드아웃 셋에서 실제로 됐는지, 튜브 질의 비용이 목표 제어 주기에 들어오는지다. 저자들이 밝힌 한계도 분명하다. SCOPE는 신뢰할 수 있는 확산 백본을 전제하는데, 불확실성을 학습된 score에서 증류하기 때문이다. 학습 데이터의 커버리지가 제한적이거나 확산 모델이 모드를 분리하지 못하면 예측 튜브가 잘못 캘리브레이션될 수 있다. 또한 현재 실험은 상대적으로 저차원인 상태와 기하 입력만 사용했고, 이미지나 포인트 클라우드 같은 원시 시각 관측으로 확장하는 것이 향후 과제로 남아 있다.