DiVeR는 VLA 검증기 학습을 결정적 상태에 집중시켜 성공률을 높인다

DiVeR: Decision-Critical Verifier Learning for VLA Test-Time Scaling

HF Daily2610.04933

Seongheon Park, Heecheol Kim, Shulin Tian2026-10-04

무엇인가

로봇 조작 정책을 학습하려면 시연 데이터를 대규모로 모아야 하고, 그 비용이 성능 향상의 병목이 된다. 이 논문이 다루는 것은 정책 자체를 다시 학습하지 않고 추론 시점의 계산만 늘려 성공률을 올리는 방법이다. 사전학습된 VLA 정책을 확률적 생성기로 보고, 각 결정 스텝에서 N개의 행동 청크 후보를 샘플링한 뒤 검증기가 가장 성공 가능성이 높은 후보를 고르는 Best-of-N 구조다. 문제는 기존의 분류기 기반 검증기들이 궤적 단위의 성공·실패 라벨만으로 학습하면서 궤적에 등장하는 모든 상태를 똑같이 취급한다는 점이다. 저자들은 자유공간 이동이나 파지 후 운반처럼 후보 행동들이 서로 비슷한 일상 상태가 궤적의 대부분을 차지하고, 파지 직전이나 배치 직전처럼 후보가 크게 갈라지는 결정 임계 상태는 드물게 국소적으로 나타난다고 관찰한다. 이 불균일성을 무시하면 정작 중요한 소수 상태의 감독 신호가 희석된다는 것이 논문의 출발점이다.

어떻게 동작하나

검증기는 궤적 수준의 성공·실패 결과로부터 학습하는 경량 판별기로 정식화된다. 성공 궤적과 실패 궤적이 유도하는 상태-행동 방문 분포를 각각 ρ+와 ρ-라 하면, 두 분포를 구분하는 이진 교차엔트로피 학습의 모집단 최적해는 ρ+/(ρ++ρ-)이고 그 로짓은 log(ρ+/ρ-)가 된다. 저자들은 이 비율을 성공-방문 비율 R(s,a)이라 부르고, 판별기의 로짓을 그대로 검증기 점수로 쓴다. 실제 구현에서는 원시 상태-행동 대신 VLA 정책의 action expert가 내놓는 내부 은닉 표현 z를 입력으로 삼아 f(z)를 학습한다.

무엇과 다른가

DiVeR의 핵심은 결정 임계도를 행동 표현의 분산으로 추정하는 것이다. 각 상태에서 동결된 정책으로 K개의 후보 행동 청크를 샘플링하고 action expert의 은닉 표현을 뽑은 뒤, 좌표별 분산의 평균 u_t = (1/d)·Tr(Cov)를 계산한다. 후보들이 서로 비슷하면 u_t가 작고, 갈라지면 커진다. 이 값을 궤적 내에서 표준화한 뒤 지수 가중 w_t = exp(β·ũ_t)로 양수 가중치를 만든다. 최종 학습 목표는 이 가중치를 곱한 가중 이진 교차엔트로피다. 중요한 점은 가중치가 궤적 결과 y_t를 직접 쓰지 않고, 동결된 정책 아래 후보 간 불일치만으로 계산된다는 것이다. 스텝 단위 주석이나 추가 환경 상호작용이 필요 없다.

어떻게 쓰나

실험은 LIBERO-Long(장기 조작 10개 과제, 과제당 50 에피소드)과 RoboCasa(원자적 조작 18개 과제, 과제당 50 에피소드), 그리고 Franka Research 3 실기에서 수행됐다. 시뮬레이션은 과제당 30 에피소드로 학습하고 20 에피소드로 평가했으며, 실기는 과제당 사람 텔레오퍼레이션 시연 40개로 π0.5를 LoRA 파인튜닝하고 과제당 24 에피소드로 평가했다. 기준 모델은 π0와 π0.5이고, 비교 대상은 검증기 없는 KDPE·MG-Select와 학습 기반 TACO·SVM이다. LIBERO-Long에서 π0, N=32일 때 N=1 대비 +5.8%p, 최고 베이스라인 대비 +2.8%p를 기록했다. RoboCasa N=16에서는 π0 기준 +5.9%p, π0.5 기준 +11.6%p를 N=1 대비 올렸다. 실기에서는 평균 성공률 71.9%로, 균일 가중 검증기의 65.6%와 단일 샘플 정책의 58.3%를 각각 +6.3%p, +13.6%p 앞섰다. 초록은 단일 샘플 추론 대비 최대 +13.6%p, 최강 베이스라인 대비 +3.4%p 향상을 주장한다.

전제와 한계

구성 요소 분석은 RoboCasa N=16에서 이뤄졌다. 후보를 무작위로 고르면 N=1 대비 이득이 미미했고, action expert 표현에 균일 가중으로 검증기를 학습하면 π0와 π0.5에서 각각 +2.7%p, +7.5%p가 올랐다. 여기에 결정 임계도 가중을 더하면 +3.2%p, +4.1%p가 추가된다. 입력 특징을 비교하면 원시 행동보다 action expert 표현이 일관되게 낫고, 이미지 특징을 더 얹어도 추가 이득이 없었다. VLM 기반 검증기인 RoboMeter와 비교하면 성공률은 +4.6%p 높으면서 검증 지연은 0.743초에서 0.001초로 줄어 700배 이상 빠르다. 검증기 구조는 약 66K 파라미터로 맞춘 조건에서 MLP가 LSTM과 단일 계층 트랜스포머를 모두 앞섰다. 학습에 쓰지 않은 과제 범주로의 전이도 확인됐다.

실무 관점에서 이 논문이 주는 시사점은 검증기 학습 비용을 늘리지 않고도 추론 시점 선택 품질을 올릴 수 있다는 것이다. 이미 성공·실패 라벨이 붙은 오프라인 궤적과, 내부 action 표현을 노출하는 VLA 정책만 있으면 검증기 쪽에 가중치 항 하나를 추가하는 것으로 적용할 수 있다. 추론 오버헤드가 1밀리초 수준이라 실시간 제어 루프에 부담이 적고, VLM 판정기를 별도로 띄우던 구성보다 지연과 배포 부담이 크게 준다. 다만 가중 온도 β와 후보 샘플 수 K, 그리고 테스트 시점의 N을 함께 튜닝해야 하며, 검증기는 벤치마크 내 여러 과제가 하나의 검증기를 공유하는 멀티태스크 설정으로 학습된다는 점을 전제로 삼아야 한다.

논문 본문에는 별도의 한계 절이 없다. 다만 방법이 성립하기 위한 전제는 분명하다. 정책이 다중 후보를 샘플링할 수 있고 내부 action 표현을 노출해야 하며, 성공·실패 라벨이 붙은 오프라인 궤적이 필요하다. 결정 임계도 u_t는 rollout 기반 오라클 임계도와 상관한다는 것만 부록 C.1에서 확인된 근사 프록시이지 정답이 아니다. 실기 실험은 4개 과제, 과제당 24 에피소드 규모로 작고, 제로샷 전이 분석에서도 항행 과제는 행동 특성이 질적으로 달라 제외됐다. 검증기는 각 벤치마크 안에서 과제 간 공유되지만, 학습에 쓰지 않은 완전히 새로운 환경으로의 전이는 검증되지 않았다.