Flow Matching 디노이징 궤적 기하로 VLA 액션 호라이즌을 적응 선택하는 GeoAAC
GeoAAC: Geometry-Based Adaptive Action Chunking from Denoising Trajectories in VLA Policies
무엇인가
이 논문은 Vision-Language-Action 정책에서 널리 쓰이는 액션 청킹의 고정 액션 호라이즌 문제를 다룬다. 액션 청킹은 한 번에 여러 미래 액션을 예측해 운동 연속성을 높이지만, 몇 개의 예측 액션을 실행한 뒤 다시 관찰하고 재계획할지를 정하는 호라이즌은 연속성과 폐루프 반응성 사이의 트레이드오프를 만든다. 짧은 호라이즌은 피드백과 교정이 잦지만 추론 부담이 크고, 긴 호라이즌은 연속성은 좋지만 개루프 실행이 길어진다. 저자들은 같은 조작 과제 안에서도 단계마다 필요한 연속성, 제어 정밀도, 폐루프 피드백 수준이 달라 고정 호라이즌이 어떤 단계에는 맞고 다른 단계에는 해가 될 수 있다고 주장한다. 기존 적응형 방법은 호라이즌 예측기를 추가 학습하거나, 여러 확률적 액션 예측의 출력 불일치로 불확실성을 추정해 호라이즌을 고르지만, 로봇 액션 분포가 다봉형이면 출력 차이가 실제 불신뢰가 아니라 유효한 여러 모드의 다양성일 수 있다는 한계를 지적한다.
어떻게 동작하나
GeoAAC의 핵심 주장은 Flow Matching 기반 VLA 정책의 디노이징 궤적 기하가 현재 액션 예측의 신뢰도를 나타내는 과정 수준 신호를 제공한다는 것이다. Flow Matching 액션 헤드는 관측 o가 주어졌을 때 d x_tau / d tau = v_theta(x_tau, tau | o)를 적분해 액션 청크 A=(a_1,...,a_H)를 생성하며, 수치 적분 과정에서 여러 중간 속도 예측 v^(t)가 나온다. 논문은 각 후보 호라이즌 k에 대응하는 액션 프리픽스 A_1:k에 대해 중간 속도 예측을 v_1:k^(t)로 제한하고, 연속된 속도 예측의 차이를 흐름 시간 간격으로 나눈 값의 L2 노름 b_k^(t)를 국소 기하 변화량으로 정의한다. 이 변화량을 디노이징 단계와 프리픽스에 걸쳐 집계한 U_k가 참조 예측 불확실도 R_k와 양의 상관을 보인다고 실험적으로 제시한다. 이때 참조 불확실도는 GR00T N1.5로 LIBERO 네 스위트에서 200개 관측을 모으고, 각 관측마다 H=16으로 32개의 확률적 액션 청크를 생성해 얻은 leave-one-out 프리픽스 분산이다.
무엇과 다른가
방법은 크게 세 단계다. 먼저 국소 기하 변화량 b_k^(t)를 모든 디노이징 단계와 액션 프리픽스에 대해 계산한다. 다만 저자들은 디노이징 후반으로 갈수록 국소 기하 변화량 자체는 커지지만 참조 불확실도와의 상관은 중간 단계 이후 떨어진다는 관찰을 보고, 단계별 신뢰도가 균일하지 않다고 본다. 그래서 정규화된 생성 진행도 s_t=t/T와 전이 중간점 s_bar_t를 이용해 w_t = s_bar_t(1-s_bar_t)^2 / (T-1)^(-1) Σ_j s_bar_j(1-s_bar_j)^2 라는 시간 가중치를 둔다. 이 가중치는 중간 디노이징 단계를 강조하고 후반부 변화량을 더 강하게 억제한다. 이렇게 보정한 U~_k = T Σ_t w_t b_k^(t) / (Σ_t ||vec(v_1:k^(t))||_2 + ε)를 모든 k에 대해 모아 호라이즌별 기하 프로파일 U~=(U~_1,...,U~_H)를 만든다.
어떻게 쓰나
다음으로 이 프로파일에서 실행 경계를 고른다. 절대 임계값은 관측, 과제, 생성된 액션 청크마다 스케일이 달라 보정하기 어렵기 때문에 상대적 기하 성장을 사용한다. 인접 프리픽스 사이 상대 성장 r_k = (U~_k - U~_{k-1})/(|U~_{k-1}|+ε)를 구하고, 양의 성장만 e_k=max(r_k,0)로 남긴다. 음의 성장은 조기 실행 경계의 증거로 보지 않고, 앞서 쌓인 증거를 상쇄하지 못하게 한다. 이어 누적 분포 F_k = Σ_{i=2}^k e_i / Σ_{j=2}^H e_j, F_1=0을 만들고, F_k가 0.5에 도달하는 중앙값을 실행 경계로 삼는다. F_k<0.5<F_{k+1}이면 k_hat_50 = k + (0.5-F_k)/(F_{k+1}-F_k)로 선형 보간하고 반올림해 k_50을 얻는다. 양의 기하 성장이 전혀 없으면 조기 절단 증거가 없다고 보고 k_50=H로 둔다. 마지막으로 예측 운동 크기 M(A)가 작을 때 지나치게 짧은 호라이즌을 피하는 운동 인지 하한을 적용한다. q=min(M(A)/α,1), k_motion=floor(k_min+(1-q)(H-k_min)+0.5)로 두고 최종 호라이즌을 k*=max(k_50,k_motion)으로 정한다. 정책은 처음 k*개 예측 액션을 실행한 뒤 새 관측을 받아 재계획한다. 추가 학습 없이 단일 Flow Matching 생성만으로 호라이즌을 정한다는 점이 이 방법의 특징이다.
전제와 한계
실험은 두 Flow Matching 기반 VLA 정책인 GR00T N1.5와 π0.5로 수행됐다. GR00T N1.5는 예측 호라이즌 H=16, LIBERO에서 8 디노이징 스텝, RoboCasa365에서 4 스텝을 사용했고, π0.5는 H=10, LIBERO-Pro에서 10 디노이징 스텝을 사용했다. 벤치마크는 LIBERO, LIBERO-Pro, RoboCasa365이며, 비교 대상은 고정 호라이즌과 두 적응형 기준인 다중 샘플링 기반 MS, 자기어텐션 기반 SA다. LIBERO에서 GR00T N1.5를 쓴 GeoAAC는 평균 성공률 95.5%로 최고 고정 호라이즌인 fixed-8의 94.7%, MS의 94.6%, SA의 93.8%를 앞섰고, Object와 Long 스위트에서 각각 99.0%, 89.2%를 기록했다. π0.5에서는 평균 98.0%로 fixed-5의 97.1%, MS의 97.2%보다 높았고, Long 스위트는 fixed-5의 93.2%에서 96.4%로 올랐다.
LIBERO-Pro에서는 위치 섭동 Shift-0.2, Shift-0.3, Shift-0.4 조건을 평가했고, GeoAAC가 평균 36.2%로 고정 호라이즌 기준보다 5.3%포인트 높았으며 SA와 MS도 앞섰다. Shift-0.2와 Shift-0.3에서 각각 58.5%, 37.6%를 기록했고 더 강한 Shift-0.4에서도 경쟁력을 유지했다. RoboCasa365에서 GR00T N1.5를 쓴 GeoAAC는 평균 75.1%로 최고 고정 호라이즌 기준보다 8.7%포인트, MS보다 4.0%포인트, SA보다 6.2%포인트 높았고 18개 과제 중 9개에서 최고 성능을 내거나 동률을 기록했다. 또한 LIBERO에서 선택된 호라이즌은 국소 운동 패턴에 따라 달라졌다. 정밀 자세 제어와 잦은 폐루프 교정이 필요한 Align과 Place/release는 평균 7.94와 7.77로 짧았고, 연속 이동, 접촉 제약 운동, 회전 조작에 해당하는 Transport, Push/pull, Turn은 각각 9.56, 9.19, 10.52로 길었다. Reach는 8.30으로 fixed-8에 가까웠다.
실세계 실험은 두 개의 PiperX 로봇 팔과 세 대의 Intel RealSense D435i 카메라로 구성된 양팔 조작 플랫폼에서 이뤄졌다. 기본 정책은 Qwen3-VL-2B-Instruct 비전언어 백본과 Flow Matching 액션 전문가를 결합한 흐름 기반 VLA 정책이며, 추론 시 H=50 액션 청크를 예측하고 로봇은 50Hz로 제어된다. 과제는 Alcohol Lamp Extinguishing, Rubber Tube Disconnection, Test-Tube Uncapping 세 가지이고, 과제당 50개의 원격조작 시연으로 총 150개 궤적을 학습에 사용했다. Fixed-50과 GeoAAC는 같은 정책 체크포인트를 쓰고 호라이즌만 다르게 하며, 각 방법은 과제당 30회, 총 180회 시행으로 평가됐다. GeoAAC는 평균 성공률을 53.3%에서 74.4%로 21.1%포인트 높였고, Rubber Tube Disconnection에서는 Fixed-50의 76.7% 대비 100.0%를 기록했다. 정성적으로는 Test-Tube Uncapping에서 Fixed-50이 빈 그립이나 잘못된 대상 그립에 취약한 반면 GeoAAC는 그립과 뚜껑 열기 단계에서 더 자주 관측을 갱신했고, Rubber Tube Disconnection에서는 접근 시 그리퍼와 손목 자세를 조정해 초기 로봇 구성 변화에 덜 민감하게 만들었다.
개발자 관점에서 GeoAAC는 Flow Matching 기반 VLA 정책을 이미 쓰고 있고 디노이징 중간 속도 예측에 접근할 수 있을 때, 추가 데이터나 재학습 없이 추론 시 호라이즌을 적응적으로 줄이거나 늘리는 선택지가 된다. 적용하려면 각 디노이징 스텝의 속도 예측을 액션 프리픽스별로 잘라 기하 변화량을 계산하고, 시간 가중치와 누적 성장 중앙값, 운동 인지 하한을 구현해야 한다. 논문은 α와 k_min을 과제 전반에 고정한다고 밝히지만 실제 로봇과 액션 스케일이 다르면 이 값과 M(A) 정의를 확인해야 한다. 또한 고정 호라이즌, MS, SA와 같은 기준과 비교해 정밀 단계 실패율, 추론 빈도, 전체 지연을 함께 측정하는 것이 좋다. 원문은 별도의 한계 절을 두지 않지만, 결론에서 현재 접근이 Flow Matching 액션 생성 과정 내부의 기하 정보에 초점을 맞춘다고 밝히고, 향후에는 로봇 실행 중 언제 어떤 과제 관련 정보를 얻고 통합할지 더 유연한 폐루프 상호작용으로 확장할 필요가 있다고 적는다. 따라서 이 방법은 Flow Matching 기반 정책에 한정된 전제를 가지며, 프리픽스 기하와 예측 불확실도의 상관에 기반해 호라이즌을 정한다는 점을 염두에 둬야 한다.