CARE가 VLA 가속이 깨뜨리는 과제를 통계적으로 인증한다
CARE: Certifying Acceleration for Vision-Language-Action Inference
무엇인가
VLA(비전-언어-행동) 모델은 매 제어 스텝마다 추론해야 해서 실행이 느리다. 기존 가속 연구는 액션 청킹, 시각 토큰 프루닝, 특징 캐싱, 플로우 적분 스텝 축소 같은 기법을 쓰면서 지연 시간과 평균 과제 성공률로 평가해 왔다. 이 논문은 그 두 지표가 가속이 무엇을 망가뜨리는지 감춘다고 지적한다. 가속이 버린 정보 때문에 원래 정책이라면 풀었을 과제가 실패해도, 두 정책이 공통으로 실패한 과제는 가속 정책의 몫으로 계산되고 가속이 새로 푼 과제는 그 실패를 상쇄한다. 그래서 평균 성공률이 비슷한 두 정책이 실제로는 전혀 다르게 행동할 수 있다. 저자들은 동일한 과제·초기 장면·시드에서 참조 정책과 가속 정책을 각각 완주시키는 짝지은 롤아웃을 정의하고, 참조는 성공했는데 가속은 실패한 사건을 '가속 유발 실패(AIF)'로 부른다. 행동이 한 번 달라지면 이후 상태와 관측이 모두 발산하므로 이 위험은 에피소드 단위로만 측정할 수 있고, 주변 성공률이나 스텝별 신뢰도·행동 커버리지로는 복원되지 않는다는 것을 부록 A.5에서 보인다.
어떻게 동작하나
형식화는 이렇다. 평가 단위 U는 과제 인덱스, 초기 장면, 실행 시드의 묶음이고, 손실은 L_λ(U) = Y_0(U)(1 − Y_λ(U))로 참조 성공을 가속 실패로 뒤집었을 때만 1이 된다. 배포 위험 R(λ)는 과제별 기대 손실을 동일 가중으로 평균한 값이며, 참조 자신은 R(λ_0)=0이다. 목표는 위험 예산 α와 오류 확률 δ가 주어졌을 때 Pr(R(λ̂) ≥ α) ≤ δ를 만족하면서 가능한 한 빠른 구성을 고르는 것이다. 함께 보고하는 지표가 보존율 Ret(λ) = Pr(Y_λ=1 | Y_0=1) = 1 − R(λ)/Pr(Y_0=1)로, 참조가 푼 에피소드 중 가속이 살려내는 비율이다. 참조가 자주 실패하는 환경에서는 두 기준이 갈라질 수 있어서, 보존율을 요구사항으로 둘 때는 보존율 예산을 직접 인증하는 경로도 부록 A.6에 둔다.
무엇과 다른가
방법은 '인증 후 선택'이다. 후보 λ_j마다 '위험이 α 이상'이라는 귀무가설을 Learn-then-Test 틀로 검정하고, 개별 오류 예산을 합이 δ 이하가 되도록 나눠(예: δ/M) 패밀리 단위 오류율을 통제한다. 여러 후보를 동시에 보면 우연히 안전하지 않은 후보를 통과시킬 확률이 커지기 때문이다. 고정 표본에서는 Hoeffding–Bentkus p-값을 쓴다. 여기에 두 가지 효율 장치를 얹는다. 첫째, 과제별 위험이 크게 다른 점을 감안해 보정 단위를 과제마다 m개씩 묶은 라운드(B=mT)로 나누고 라운드 경계에서만 증거를 본다. 검정 통계량은 안전한 위험 q<α와 경계 위험 α를 비교하는 우도비를 q 격자 Q⊂[0,α)에 대해 평균한 e-프로세스이며, 귀무가설 아래에서 비음의 슈퍼마틴게일이 되므로 빌의 부등식에 의해 어느 시점에 멈춰도 유효하다. E_j(n_k) ≥ 1/δ_j가 되는 순간 인증하고, 남은 손실이 0이어도 인증에 도달할 수 없으면 즉시 후보를 버린다. 둘째, 후보를 별도 프로파일링 셋에서 측정한 지연 시간 순으로 빠른 것부터 평가하고 첫 인증 후보에서 멈춘다. 또 후보가 성공한 단위에서는 참조 결과와 무관하게 손실이 0이므로, 참조 정책은 후보가 실패한 단위에서만 실행하고 그 결과를 후보 간 공유 캐시에 저장한다. 이렇게 하면 참조 실행 횟수가 단위당 최대 한 번으로 묶이면서도 손실값과 인증 결정은 전수 짝지은 평가와 정확히 같아진다.
어떻게 쓰나
실험은 OpenVLA-OFT를 네 개 LIBERO 스위트(Goal, Spatial, Object, Long)에 올려 진행한다. 각 스위트 10개 과제, 참조는 1스텝 재계획(H1)이고, 후보군은 액션 호라이즌 8로 고정한 8개 구성(순수 실행, FastV-25/50/75, VLA-Cache, VLA-Pruner, SpecPrune, VLA-ADP)이다. 스위트당 500개 매칭 장면, 총 2,000개 초기 장면과 18,000개 롤아웃을 쓰고, 인증에는 스위트당 250개 과제 균형 에피소드, 나머지 250개는 테스트셋으로 둔다. 위험 예산 α=5.0%, 오류 확률 δ=5.0%에서 CARE는 네 스위트 모두에서 가속 정책을 인증했고, 참조 대비 9.02~10.81배 속도 향상을 얻으면서 패밀리 보정된 95% 하한 기준으로 참조가 푼 에피소드의 85.8~95.7%를 보존한다고 보장한다.
전제와 한계
베이스라인 비교는 500개 짝지은 에피소드를 경험적 모집단으로 두고 10,000번 재표집해 이뤄진다. 위험 예산을 2.0%로 좁히면 지연 시간만 보고 가장 빠른 후보를 고르는 방식은 75.0%의 시행에서 예산을 초과했고, α=2.5%에서 평균 성공률 매칭은 25.0%가 초과했으며 검증 데이터 튜닝과 비짝지음 검정도 자주 위반했다. CARE는 증거가 부족하면 H1로 안전하게 폴백해 모든 시행에서 예산 안에 머문다. 표준 예산 α=5.0%에서 고정 표본 CARE는 8.88배 속도 향상에 폴백률 11.7%로 위험 통제 선택기 중 가장 빨랐고, Pareto Testing은 6.16배·42.2%, 비용 순서 LTT는 6.35배·45.5%, 안전 정책 개선은 5.30배·60.5% 폴백이었다. 순차 CARE는 7.32배·26.9% 폴백을 유지하면서 평가 비용을 2,250개에서 592개 롤아웃으로 줄인다. 후보군을 액션 호라이즌 4종 × 추론 모드 6종의 24개 구성으로 넓힌 실험에서도 CARE만 네 스위트 모두 인증에 성공했고(전수 HB와 순차 exact는 Long에서, 플러그인 e-프로세스는 Spatial과 Long에서 H1을 유지, 순차 HB는 Object만 인증), 롤아웃을 25,000개 대신 5,263개(78.9% 감소)로 줄이며 H1 실행도 1,000회에서 113회로 낮춘다.
아키텍처 일반화도 확인한다. π0.5에서는 기본 10스텝 추론을 참조로 두고 2·4·6 스텝 후보를 평가해 Spatial과 Object에서 2스텝(플로우 연산 5배 감소), Goal에서 4스텝(2.5배 감소)을 선택했고, Long에서는 세 후보를 조기 종료하고 참조를 유지하며 1,000개 대신 464개 롤아웃을 썼다. 네 스위트 합계로 후보 롤아웃 1,250개, 참조 롤아웃 26개만 써서 전수 평가보다 68.1% 적다. Crafter에서는 Qwen3.5-9B와 Llama-3.1-8B 에이전트의 collect_wood 스케줄을 모든 시드에서 인증하며 연산을 25.1~30.6% 줄였고, collect_drink는 세 시드 중 두 개에서 더 작은 폭으로 인증했다. 절제 분석에서는 국소 수준 가속 효과가 에피소드 단위 AIF를 예측하지 못함을 보인다(Object에서 국소 4.3% 대 에피소드 1.0%, Long에서 9.5% 대 2.7%). 10개 후보 시뮬레이션에서 패밀리 보정 없는 선택은 46.0%의 시행에서 예산 초과 정책을 배포한 반면 보정을 넣으면 0.15% 이하로 떨어지고, 과제별 순차 수집은 고위험 과제를 보기 전에 초과 정책을 인증할 수 있지만 과제 균형 라운드로빈은 모든 이질적 위험 프로파일에서 예산 안에 머문다. 효율 절제에서는 순차 최속 우선 평가가 후보 롤아웃을 8,000개에서 1,950개로, 실패 유발 참조 평가가 H1 롤아웃을 1,000개에서 47개로 줄여, 총 평가가 9,000개에서 1,997개(77.8% 감소), 벽시계 시간이 38.6시간에서 7.0시간(81.9% 감소)으로 준다.
개발자 입장에서 이 논문이 주는 실무적 시사점은 명확하다. 가속 기법을 고르는 기준을 '평균 성공률이 얼마나 떨어지지 않는가'에서 '참조가 풀던 에피소드 중 몇 퍼센트를 보존하는가'로 바꾸고, 그 보존율에 위험 예산과 신뢰 수준을 명시하라는 것이다. 절차 자체는 모델·가속 기법에 독립적이어서, 후보를 블랙박스 정책으로 취급하고 종료 결과와 측정된 연산량만 있으면 액션 청킹, 토큰 프루닝, 캐싱, 플로우 스텝 축소, 그리고 이들의 조합에 같은 인증 파이프라인을 적용할 수 있다. 다만 인증은 배포 전에 오프라인으로 한 번 돌리는 단계이고, 보정용 짝지은 롤아웃을 폐루프로 돌려야 하므로 참조 정책 실행 비용이 그대로 발생한다는 점을 예산에 넣어야 한다. 실패 유발 참조 실행과 캐시 공유가 이 비용을 크게 깎아주지만, 후보가 실패한 단위에서는 참조를 반드시 돌려야 한다.
저자가 밝힌 전제와 한계도 분명하다. 첫째, 보장은 보정셋이 배포 분포를 대표한다는 가정 위에서 성립하는 유한 표본 PAC 스타일 보장이며, 보정 단위는 독립적으로 추출되어 보정셋과 테스트셋으로 분리된다. 둘째, 증거가 부족하면 참조 정책을 유지하므로 속도 향상이 전혀 없을 수 있고, 실제로 Long 스위트의 24개 후보 실험이나 π0.5의 Long에서 그런 폴백이 일어난다. 셋째, AIF 위험과 보존율은 참조가 신뢰할 만할 때는 일치하지만 참조가 자주 실패하는 환경에서는 갈라질 수 있어 어느 쪽을 요구사항으로 삼을지 사용자가 정해야 한다. 넷째, 위험은 과제 동일 가중 혼합으로 정의되므로 배포 환경의 과제 분포가 이 가중과 다르면 보장의 의미도 달라진다. 원문에 제시된 범위 안에서, 이 방법은 가속을 속도-정확도 트레이드오프로만 다루지 않고 가속이 새로 만드는 실패를 명시적으로 통제하며 선택할 수 있음을 보여준다.