CTP는 한 번의 순전파로 다봉 궤적 후보를 고른다
Conditional Trajectory Peaks: Single-Pass Multimodal Policies over Action Chunks
무엇인가
로봇 조작 시연은 본질적으로 다봉적이다. 비슷한 관측이라도 장애물 회피 경로, 접촉 위치, 미는 순서, 하위 과제 순서가 달라질 수 있다. 제곱오차 기반 행동 복제는 조건부 평균으로 쏠려 모드 사이의 저확률·실행 불가 영역을 지나가고, Diffusion Policy나 BESO, 플로우 매칭 계열은 분포 표현력은 좋지만 재계획 주기마다 여러 번의 네트워크 평가가 필요해 고주기 폐루프 제어에서 지연과 연산이 커진다. 논문은 여기서 "재계획 한 스텝당 한 번의 순전파로 궤적 수준의 다봉 행동을 생성할 수 있는가"를 핵심 질문으로 세운다. 후보를 병렬로 여러 개 뽑는 기존 다중 가설 정책은 순열 대칭 때문에 학습 초기에 후보들이 같은 고밀도 영역으로 몰리는 모드 붕괴를 겪고, 후보 다양성만으로는 청크 간 모드 뒤섞임(cross-chunk mode stitching)을 막지 못한다는 것이 저자들의 진단이다.
어떻게 동작하나
CTP는 완전한 액션 청크 위에 궤적 수준 조건부 혼합분포를 정의한다. 공유 백본이 관측 이력을 인코딩해 문맥 표현 z_t를 만들고, 궤적 파라미터 헤드가 한 번의 순전파로 K개 피크 각각에 대해 계수 C_t,k, 확률 로짓 ℓ_t,k, 스케일 s_t,k를 예측한다. 고정 기저 B를 곱해 궤적 중심 μ_t,k = B·C_t,k를 얻고, π_t = softmax(ℓ)로 확률 질량을, σ_t,k = σ_min + (σ_max−σ_min)·sigmoid(s_t,k)로 스케일을 만든다. 여기서 이산 변수 Z가 전체 지평을 하나의 성분으로 설명하므로 모드 정체성은 개별 스텝이 아니라 완전한 액션 청크에 속한다. 저자들은 π_t,k가 실행 성공 확률이 아니고 σ_t,k가 물리적 경로 폭이 아니라고 명시한다. 기저는 저주파 저랭크(R<H) 또는 시간영역 직접 예측(R=H, B=I)을 모두 지원하며 어느 쪽이든 재계획 주기당 NFE=1을 유지한다.
무엇과 다른가
DAPS(Distribution-Aware Peak Specialization)는 모드 붕괴를 학습 단계에서 다룬다. 가우시안 에너지 E_nk로 혼합 음의 로그우도 L_mix를 계산하고, 그로부터 궤적 수준 사후 책임 r_nk = softmax_k(log π_nk − E_nk)를 얻는다. 이는 거리만 보는 하드 winner-takes-all과 달리 적합 오차·확률 질량·스케일을 함께 고려해 후보 역할을 데이터에 맞게 배분한다. 여기에 정규화 궤적 거리 d_n,ij = ||μ_ni − μ_nj||²_F / (HD)를 이용한 피크 간 중첩 제약 L_ov = (1/N)Σ_n Σ_{i<j} π_ni π_nj exp[−d_n,ij / (2(σ_ni²+σ_nj²))]를 더한다. 확률 곱 인자가 질량이 큰 쌍에 분리 압력을 집중시키고, 스케일 항이 분포 폭 대비 중첩을 평가한다. 결과적으로 데이터가 뒷받침하는 고확률 중복 피크는 밀어내되, 지지되지 않는 중복 후보는 확률 질량을 줄여 자연히 기여를 낮출 수 있다. 클러스터링이나 사전 정의된 모드 할당이 필요 없다는 점이 강조된다.
어떻게 쓰나
ETBT(Evidence-Gated Trajectory Belief Transport)는 재계획 주기 사이의 행동 정체성을 유지한다. 후보 집합의 인덱스가 순열 대칭이라 인덱스로 대응을 알 수 없으므로, 과거 후보 i의 미실행 접미사와 현재 후보 j의 접두사 사이 기하학적 대응 비용 C_t(i,j)를 계산하고, 이를 견고한 궤적 스케일로 정규화한 유사도 커널 G_t(i,j) = exp(−C_t(i,j)/(s_t τ))를 순열 등변적으로 정규화해 전이 확률 T_t(j|i)를 만든다. 이전 행동 신념 b_{t−1}을 전파해 c_t(j) = Σ_i b_{t−1}(i)T_t(j|i)를 얻고, 이를 ρ로 섞어 역사적 사전 b̄_t로 만든 뒤 현재 정책 증거 q_t(j) = π_t(j)^β와 융합해 b_t(j)를 계산한다. 핵심은 역사가 하드 제약이 아니라 소프트 사전이라는 점이다. 현재 정책이 지지하는 후보의 증거가 역사적 연속 후보보다 충분히 강하거나(q_t(j_q)/(q_t(j_c)+ε) ≥ γ), 대응 자체가 불신뢰(max_j c_t(j) < η)하면 역사 제약을 해제하고 현재 정책 증거로 되돌아간다. 선택된 청크의 처음 E개 행동만 실행한 뒤 다시 계획하며, 후보 생성에 추가 샘플링이나 반복 디노이징이 필요 없다.
전제와 한계
실험은 Push-T, D3IL, LIBERO, 실세계 양팔 과제로 구성된다. Push-T에서 CTP는 커버리지 점수 0.9140으로 비교 대상 중 최고였고, IMLE Policy 0.8874와 Diffusion Policy-C 0.8790을 앞섰으며 IMLE 대비 0.0266, 궤적 수준 MDN 대비 0.1177 높았다. K=4 모델의 파라미터가 74.041M로 Diffusion Policy의 65.783M보다 큰데도, 같은 RTX 5070에서 평균 호출 지연이 0.9507ms, P95가 0.9745ms로 NFE=100인 Diffusion Policy의 902.8522ms/904.8401ms보다 압도적으로 짧았다. D3IL에서는 Avoiding 100.0%, Aligning 79.72%, Sorting-2 84.44%를 기록했고, Avoiding의 100.0%는 기존 최고 보고치 95.0%를 넘는다. Aligning에서 K를 1에서 4로 늘리면 성공률이 69.17%에서 79.72%로 10.56%포인트 올랐고 층화 95% 신뢰구간은 [0.28, 21.11]%포인트였다. LIBERO에서는 Spatial 98.0%, Object 100.0%, Goal 98.0%, Long 93.0%로 평균 97.25%를 냈으며, 이는 Motus 97.70%, Fast-WAM 97.60%, LingBot-VA 98.45%, 로컬 재평가 π0.5 96.75%와 비교된다. 정책 호출 지연은 218.24ms에서 75.80ms로 2.88배 빨라졌고 65.27% 감소했으며 P95도 219.64ms에서 76.15ms로 줄었다. 두 정책 모두 50스텝을 예측하고 10스텝을 실행하므로 재계획 빈도 차이 때문이 아니라고 저자들은 밝힌다.
구성 요소별 절제 실험은 기여를 분리한다. 단일 피크 기준선 77.34%에서 K=4 다봉 표현이 80.30%(+2.96%포인트), DAPS 추가가 85.67%(+5.37%포인트), ETBT 추가가 91.40%(+5.73%포인트)로 단계적으로 올랐다. 실세계에서는 두 접시 중 하나에 놓는 과제로 다봉 보존을 직접 시험했는데, 모드별 150개씩 총 300개 시연을 수집했고 50회 시행에서 왼쪽 31회(62%), 오른쪽 19회(38%)를 선택해 50회 전부 성공했다. 목표 사이의 평균 궤적으로 수렴한 시행은 없었다. 병 세우기에서는 π0.5와 CTP 모두 95%, 펜 꽂기에서는 각각 85%와 83%로 비슷했고, RTX 4090에서 호출당 추론 지연은 218.24ms에서 75.80ms로 2.88배 줄었다.
실무 관점에서 CTP는 고주기 폐루프 제어에서 다봉 행동을 유지하면서 추론 예산을 줄여야 할 때 후보가 된다. 다만 도입 전에 확인할 것이 있다. ETBT의 대응 비용은 과제별 매핑 Φ와 정규화 방식(행별 정규화 또는 주변 제약을 둔 Sinkhorn)에 의존하므로 자기 과제에 맞는 궤적 표현을 정의해야 한다. 기저 B 선택도 벤치마크별로 달라지고, π는 실행 성공 확률이 아니라 현재 관측 하의 모드 확률 질량이며 σ는 물리적 경로 폭이 아니라는 점을 디코딩·임계값 설계에 반영해야 한다. 저자들이 명시한 전제도 분명하다. Push-T·D3IL·LIBERO의 타 모델 수치는 학습·평가 프로토콜이 완전히 일치하지 않아 성능 참조용이며, LIBERO의 발표된 기준선 성공률도 원 논문에서 가져온 것이라 프로토콜 정합성이 없다. 실세계 지연 수치는 동일 로컬 하드웨어에서 저자들이 직접 측정한 값이다. 논문 본문에는 별도의 한계 절이 없고, 결론에서도 위 프로토콜 불일치 이상의 실패 조건이나 확장성 한계는 수치와 함께 제시되지 않았다.