로봇 정책의 비동기 재계획에서 노이즈 초기화를 실행 궤적에 정렬한다
Execution-Aligned Progressive Noise for Consistent Asynchronous Replanning in Generative Robot Policies
무엇인가
생성형 로봇 정책은 한 번 호출에 미래 행동 시퀀스(Action Chunk)를 통째로 예측하고, 추론이 끝나기 전에 현재 청크를 계속 실행하는 비동기 실행을 쓴다. 문제는 대부분의 정책이 매 추론을 독립적인 가우시안 노이즈에서 시작한다는 점이다. 다중모드 조건부 분포에서 서로 다른 초기 노이즈는 시간적으로 겹치는 두 추론을 각각 확률은 높지만 서로 다른 국소 모드로 밀어넣을 수 있다. 커밋된 프리픽스가 연속이어도 자유 생성되는 서픽스가 이전 추론의 행동 모드에서 서서히 벗어나고, 장기 조작에서는 운동 방향·말단장치 상태·접촉 관계의 불일치가 청크마다 누적된다. 저자들은 π0.5 정책의 연속 행동 윈도우를 Flow inversion으로 되돌려, 같은 에피소드 안의 소스 잠재변수가 시간적 거리에 따라 감소하는 상관을 가지며 그 상관 피크가 고정된 토큰 인덱스가 아니라 실제 실행 변위(j−h=D)를 따라 이동한다는 것을 16개 홀드아웃 에피소드, D=1…9에서 확인한다.
어떻게 동작하나
EAPN은 이 관찰을 근거로 행동 출력을 직접 제약하는 대신 확률적 상태의 연속성을 모델링한다. 두 층위다. 첫째, 정책 호출 사이를 넘어 지속되는 공유 AR(1) 과정 G_t = ρG_{t−1} + √(1−ρ²)ε로 실행 정렬된 인터청크 상관을 만든다. 둘째, 각 청크 내부의 행동 시간축을 따라 별도의 사설 AR(1) 과정 U_{k,h}를 재귀 생성해 인트라청크 시간 상관을 넣는다. 소스 토큰은 z_{k,h} = √γ·G_{T_k+h} + √(1−γ)·U_{k,h}로 두 과정을 섞는다. ρ는 시간 상관 감쇠를, γ는 공유 이력과 윈도우 고유 혁신의 비중을 조절한다. 두 AR(1) 모두 표준 가우시안 정상 주변분포를 가지므로 단일 토큰 주변분포는 N(0,I)로 유지되지만, 전체 H×D_a 소스의 결합 공분산은 Cov(z_{k+1,h}, z_{k,j}) = γρ^{|Δ_k + h − j|}I로 바뀐다. 즉 가장 강한 의존성이 같은 인덱스가 아니라 실행 정렬 위치 j ≈ h + Δ_k에서 나타난다.
무엇과 다른가
상관된 노이즈만으로는 정책이 어느 과거 확률 상태가 현재 윈도우에 대응하는지 알 수 없다. EAPN은 이전 소스 Z_{k−1}을 실제 실행 변위 Δ_{k−1}만큼 시프트해 정렬하고, 실행 후에도 시간적 대응이 남는 토큰만 옮기며 대응이 없는 위치는 유효성 마스크 m_k로 표시한다. 컨디셔너 C_φ가 정렬된 이력, 변위, 현재 추론 지연/커밋 프리픽스 길이 D_k, 마스크를 받아 c_k^hist를 만들고, 정책은 v_θ(o_k, X_{k,t}, τ_{k,t}, c_k^hist)로 이를 명시적 조건으로 받는다. 토큰별 flow time τ는 고정 프리픽스와 생성 서픽스를 구분한다. 학습 시에는 지연 D와 변위 Δ를 평가 지원 범위에서 샘플링하고, 실행 기하가 맞는 인접 소스 쌍을 공유 과정 G로 생성한다. 에피소드 시작이나 이력이 유효하지 않은 경우를 대비해 전체 이력을 확률 p_h로 버리고 현재 소스를 독립 재샘플링하며 마스크를 0으로 만든다. Flow Matching 손실은 커밋된 h ≤ D 구간을 제외한 생성 서픽스에만 적용된다. 배포 시 에피소드 리셋은 버퍼를 비우고 이력을 끄며, 첫 추론이 새 공유/사설 윈도우를 샘플링한 뒤에는 실제로 소비된 행동 수만큼 공유 궤적을 전진시킨다. D_k는 커밋 프리픽스를, Δ_k는 확률 상태 전진·정렬을 제어하는 별개 변수다.
어떻게 쓰나
D3IL의 Avoiding 과제에서 DDPM-ACT를 쓰면 성공률이 73.13%에서 78.96%로 5.83%p 오르고, 모드 전환율(MSR)은 3.969%에서 3.167%로, 전환 위치의 국소 불연속(Switch Gap)은 0.001913에서 0.001672로 줄었다. 단일 행동으로 붕괴시키지 않고 다중모드 능력을 유지한 채 모드 연속성을 안정화한 결과다. Kinetix에서는 예측 지평 H=8, 커밋/추론 프리픽스 D∈{0,1,2,3,4}에서 12개 과제 평균 성공률 88.59%를 기록했고, 실행 지평 K나 지연 D가 커질수록 성능은 떨어지지만 EAPN의 하락이 더 완만하다. Kinetix mjc_swimmer 절제 실험에서는 ttRTC 46.60에서 인터청크 노이즈만 추가하면 76.89, 인트라청크까지 넣으면 78.85, 전체 EAPN이 79.26으로, 인터청크 상관이 이득의 대부분을 만들고 인트라청크 상관이 보완한다.
전제와 한계
LIBERO에서는 π0.5를 베이스로 두 개의 지연 체제를 따로 학습해 평가한다. 저지연(D=1~4, K=5)에서 평균 성공률 96.4~97.0%를 유지하며 D=4에서 VLASH를 4.9%p 앞선다. 고지연(D=5,10,15, K=25)에서는 ttRTC가 이미 VLASH를 크게 앞서는데, EAPN은 D=10에서 83.0%, D=15에서 75.0%로 ttRTC를 각각 2.7%p, 2.0%p 개선한다. 두 그룹은 각자의 프로토콜 안에서만 비교되며 단일 모델의 연속 지연 스윕으로 해석되지 않는다. 실기에서는 물체 정리(Object Storage) 90.0%(Naive Async 대비 +25.0%p, VLASH 대비 +5.0%p), 양팔 천 접기(Cloth Folding) 96.7%를 달성했다. 천 접기에서 베이스라인은 반복 보정으로 56초가 걸린 반면 EAPN은 33초에 끝냈고, 속도·가속도 프로파일은 ttRTC와 비슷하면서 RTC·VLASH에서 보이던 큰 변동을 피했다.
실무 관점에서 EAPN은 정책 네트워크나 액션 청킹 실행 로직을 바꾸지 않고 소스 노이즈의 결합 구조와 이력 조건만 손대는 방법이라는 점이 핵심이다. VLA나 월드-액션 모델처럼 추론 지연이 크고 청크가 겹쳐 실행되는 파이프라인에서, 커밋 프리픽스 제약(RTC 계열)만으로는 잡히지 않는 자유 생성 서픽스의 모드 드리프트를 겨냥한다. 다만 EAPN은 학습이 필요하다. 단일 토큰 주변분포는 가우시안으로 유지되지만 전체 소스의 결합 공분산이 바뀌므로, 훈련 없이 기존 샘플러에 끼워 넣는 분포 보존 기법으로 취급하면 안 된다. 또한 실행 변위 Δ_k를 실제 버퍼 소비량에서 얻어야 하므로, 비동기 런타임이 소비한 행동 수를 정확히 노출하는지 확인해야 한다.
저자들이 명시한 전제와 한계는 다음과 같다. 첫째, EAPN은 훈련 없는 분포 보존 샘플러가 아니라 구조화된 결합 소스에 적응하도록 학습되어야 한다. 둘째, 에피소드 시작이나 이력이 유효하지 않은 상황을 전제로 이력을 확률 p_h로 버리는 훈련 절차를 둔다. 셋째, D_k(커밋 프리픽스)와 Δ_k(확률 상태 전진)는 고정 실행 주기에서는 같아질 수 있지만 EAPN이 그 등식을 요구하지는 않는다. 넷째, LIBERO의 저지연·고지연 결과는 서로 다른 프로토콜로 훈련된 두 모델의 비교이지 하나의 모델에 대한 연속 지연 스윕이 아니다. 논문은 별도의 한계 절이나 실패 사례 분석을 두지 않았고, 실기 평가도 물체 정리와 천 접기 두 과제에 한정된다.