FastOPD가 대형 VLA를 2스텝 경량 학생 정책으로 증류한다
FastOPD: On-Policy Distillation for Lightweight VLA Deployment
무엇인가
VLA 파운데이션 모델은 조작 성능과 일반화를 위해 백본을 계속 키워왔고, 최근에는 2B 파라미터를 넘거나 3B~6B 규모의 교사 모델이 등장했다. 문제는 이 규모가 실제 로봇 배포에서 감당하기 어려운 계산 비용을 만든다는 점이다. 기존 대응은 두 갈래였다. SmolVLA처럼 4억5천만 파라미터급 소형 정책을 처음부터 설계하거나, flow 기반 정책의 반복 디노이징 스텝을 줄이는 것이다. 그러나 few-step 정책은 학습 불안정과 품질 저하를 동반하고, on-policy distillation(OPD)을 flow 정책에 그대로 적용하면 학생의 디노이징 궤적 전체에서 교사를 반복 평가해야 해 훈련 비용이 급증한다.
어떻게 동작하나
FastOPD는 학생을 flow map u_θ(x,s,t)로 파라미터화하고 두 개의 손실을 결합한다. 첫째는 on-policy flow map distillation(OPFD)으로, 노이즈에서 flow map을 한 번 점프시켜 도달한 단일 on-policy 상태에서만 교사 속도와 학생 속도를 정합한다. 논문의 Proposition 1은 단일 상태 전이 매칭의 reverse KL이 가중 속도 회귀와 같아진다는 것을 보여, 궤적 전체를 훑지 않고도 밀도 있는 감독을 얻을 수 있게 한다. 둘째는 자기일관성(self-consistency) 손실로, 중간점 m=(s+t)/2를 경유한 두 번의 짧은 전이와 s에서 t로의 직접 전이가 일치하도록 대각선 속도 감독을 유한 구간 숏컷 전이로 전파한다. 목표값은 stop-gradient로 고정되며, 두 항은 L_FastOPD = L_SC + λ·L_OPFD로 합쳐진다.
무엇과 다른가
이론적 근거도 제시된다. Proposition 2는 FastOPD 손실이 학생 flow map과 교사가 유도하는 이상적 숏컷 u_φ 사이의 거리를 상한으로 묶는다는 것을 보이고, Theorem 1은 동일 샘플링 스케줄에서 학생 분포와 교사 유도 few-step 분포의 2-Wasserstein 거리가 손실의 제곱근으로 제한되어 손실이 0으로 가면 분포가 일치한다는 것을 보인다. 즉 명시적인 숏컷 교사를 구성하지 않고도 학생이 교사의 few-step 분포를 회복하며, 같은 자기일관성 정식화가 임의 스텝 flow map을 자연스럽게 유도해 추론 스텝을 줄일 수 있다.
어떻게 쓰나
LIBERO 실험에서는 π0.5를 교사로, SmolVLA를 학생으로 사용했다. 2 스텝만으로 교사 성능의 84%를 유지하면서 추론 지연을 78.1% 줄였고, 2 스텝에서 81.8%의 최고 평균 성공률을 기록했다. 단일 스텝만으로도 10 스텝 SmolVLA 기준선보다 성공률이 높으면서 지연을 193ms에서 50ms로 낮췄다. CTM, DMD, iMF 같은 대표적 few-step 증류 베이스라인보다 모든 디노이징 스텝 수에서 평균 성공률이 앞섰다.
전제와 한계
RoboTwin 2.0에서는 LingBot-VLA를 교사로 써서 단일 스텝 성공률을 기본 학생 35.3%에서 51.2%로 15.9%포인트 끌어올렸고, 교사보다 10.0배 빠른 지연을 달성했다. 다만 4스텝과 10스텝에서는 기본 학생보다 약간 낮은 성능을 보여, 이득이 기본 학생이 무너지는 few-step 영역에 집중된다는 점을 저자들이 명시했다. World Action Model 확장 실험에서는 6B 파라미터 Fast-WAM을 동일한 451M SmolVLA 학생으로 증류해 단일 스텝 50.5%(기본 대비 15.2%포인트 향상), 2 스텝 56.3%를 얻었다.
실제 로봇 실험은 양팔 YAM 로봇의 오른팔로 공을 접시에 올리는 pnp-plate 과제에서 수행했다. MolmoAct2를 14,000회 학습해 교사로 쓰고, SmolVLA 학생을 10,000회 flow matching으로 워밍업한 뒤 FastOPD로 증류했다. 4 스텝에서 50% 성공률로 같은 스텝 수의 기본 SmolVLA 42%를 8%포인트 앞섰고, 10 스텝 기본 학생(44%)보다 정확하면서 실행 시간을 19.32초에서 17.38초로 줄였다.
절제 실험은 훈련 비용 절감을 수치로 보여준다. 표준 OPD가 1,000회 반복당 9.51시간 걸리는 반면 FastOPD는 1.43시간으로 5.7배 빠르다. FastOPD는 10시간 만에 단일 스텝 성공률 78.2%에 도달하지만, 기존 OPD는 비슷한 79.1%에 이르기까지 약 57시간이 필요하다. 손실 구성별로는 자기일관성만 쓰면 18% 미만으로 붕괴하고 OPFD만 쓰면 비대각 flow 역학을 잡지 못하며, 둘을 결합해야 2 스텝에서 81.8%가 나온다. OPFD 가중치 λ는 0.01에서 성능이 무너지고 0.1~0.5 구간에서 안정적이며, 행동 실행 스텝 K는 교사와 학생 모두 10에서 최적이었다.
실무 관점에서 FastOPD는 소비자급 GPU나 로봇 온보드 하드웨어에 VLA를 올려야 할 때 검토할 만한 선택지다. 비전-언어 백본은 동결하고 액션 전문가와 투영층, 추가 시간 투영층만 미세조정하므로 학습 자원 요구도 크지 않다. 다만 도입 전에 확인할 점이 있다. 이득은 1~2 스텝 영역에 집중되므로 4스텝 이상을 쓸 계획이라면 기본 학생 대비 이점이 사라질 수 있고, λ를 충분히 크게 잡지 않으면 자기일관성 항이 발산한다. 또한 이론적 보장은 교사 속도장의 Lipschitz 연속성과 밀도비 κ, 롤아웃 비 κ_roll 같은 가정 위에 서 있으며, 실험은 LIBERO·RoboTwin 2.0과 단일 실로봇 과제로 제한된다.