VLA 정책의 지름길 의존을 데이터 교란으로 줄이는 PerturBot
PerturBot: Breaking Shortcut Priors in Vision-Language-Action Models with Perturbative Training
무엇인가
이 논문은 VLA(vision-language-action) 정책이 복잡한 조작 과제를 성공시키면서도, 실제 결정을 좌우해야 할 증거를 무시하는 현상을 다룬다. 저자들은 이를 모달리티 지름길(modality shortcut)이라 부른다. 손목 카메라 근처에 있는 물체가 지시된 목표물을 밀어내고, 동사가 바뀌어도 익숙한 명사가 학습 때 짝지어진 동작을 유발하며, 아무것도 쥐지 않은 그리퍼가 그대로 들어올리는 식이다. 핵심 주장은 이것이 단순한 입력 부족이 아니라 성공 시연의 규칙성에서 생긴다는 것이다. 시연 데이터에서는 목표물이 손목 시야를 지배하고, 물체 이름마다 조작이 하나씩 짝지어지고, 그리퍼 닫힘 뒤에는 항상 들어올림이 따른다. 행동 복제는 시연된 행동과의 일치만 보상할 뿐 그 예측에 어떤 증거를 썼는지 보지 않으므로, 같은 종류의 시연을 아무리 늘려도 이 상관관계는 그대로 남는다. 저자들은 상호정보량 분해로 이를 형식화해, 공선성(목표물이 손목 시야를 채우는 경우)과 퇴화(결정이 애초에 변하지 않는 경우) 두 가지로 설명한다.
어떻게 동작하나
해법은 추론을 전혀 바꾸지 않고 학습 데이터만 바꾸는 세 가지 개입이다. 첫째 V는 과제 보존 손목 시야 교란으로, 파지 경로를 벗어난 위치에 그럴듯한 방해 물체를 삽입한다. 목표물을 가리거나 접촉 기하를 바꾸지 않아 기록된 행동 라벨이 그대로 유효하다. 둘째 C는 결정 관련 캡션 보강으로, 비전-언어 모델이 각 녹화를 파지·들기·이동·내려놓기 같은 원자 기술로 나누고 행동하는 손, 열림/닫힘, 조작, 물체 속성, 위치, 초기 상태, 파지점을 서술하게 한다. 예컨대 'pick up the mug'의 파지가 '왼손이 트레이 왼쪽의 세워진 파란 머그를 몸통으로 닫고 잡는다'로 바뀐다. 셋째 R은 캡션 기반 궤적 확장으로, 무작위 움직임과 실패 실행 궤적을 구간으로 나눠 실제로 하는 행동에 맞게 재라벨링해 보조 데이터로 섞는다. 세 구성 모두 백본 자체의 행동 손실(π0.5의 flow matching)로 학습하며, 보조 데이터 비율 ρ로 혼합한다. V·C·R 각각을 끄는 소거 실험이 가능하다.
무엇과 다른가
평가를 위해 GroundFscore도 제안한다. 과제 성공률은 지름길을 읽는 정책과 증거를 읽는 정책을 구분하지 못한다. GroundFscore는 각 입력에 대해 행동이 변하지 않아야 하는 null 편집과, 알려진 양만큼 행동이 변해야 하는 causal 편집을 짝지어, 불필요하게 움직인 정도(R)와 요구된 변화를 실제로 반영한 정도(S)를 재고 그 조화평균(F-score)을 취한다. 입력을 무시하는 정책은 R이 0이지만 S도 0이라 점수가 0이 된다. 롤아웃 없이 순전파만으로 계산되므로 체크포인트마다 산출할 수 있다.
어떻게 쓰나
실험은 π0.5 백본으로 실제 로봇 General PnP 50개 레이아웃(100개 물체·3개 컨테이너에서 6물체 3컨테이너를 무작위 배치, 평가 레이아웃은 학습에 없음)과 RoboTwin 2.0의 50개 양팔 과제에서 수행했다. V·C·R 여덟 조합 전부를 비교했는데, V는 GF_V를 0.28에서 0.51로 올리고 salience capture 실패율을 68%에서 36%로 낮췄으며, C는 GF_L을 0.24에서 0.47로, R은 GF_A를 0.19에서 0.44로 올리고 motor inertia 실패율을 82%에서 44%로 줄였다. 효과는 중첩되어 전체 방법은 베이스라인 성공률을 84%로 두 배로 올렸고, 구성 하나를 빼면 16~20점이 손실됐다. 노이즈·드롭아웃·데이터 2배·카메라 제거 같은 통제 조건은 베이스라인 대비 6점 이내에 머물렀다. 카메라 제거는 salience capture를 가장 낮췄지만 성공률 16점을 잃고 GF_V가 0.16으로 떨어졌다.
전제와 한계
RoboTwin 2.0에서는 Clean2Random 설정의 무작위 장면에서 12.2점을 얻어 깨끗한 장면의 2.7점보다 컸고, V를 제거하면 두 설정에서 각각 8.4점, 2.6점이 손실됐다. 데이터 스케일링 절에서는 Perturbot이 배증마다 성공률 16.2점을 얻어 파인튜닝의 6.0점을 앞섰고, 1/4배 데이터로 파인튜닝 2배와 맞먹었다. 더 중요한 차이는 종류다. 파인튜닝은 1/4배에서 2배로 가는 동안 성공률 18점을 얻었지만 GF 평균은 0.04밖에 움직이지 않고 실패율도 높게 유지됐다. Perturbot은 성공률 48점과 GF 0.30이 함께 올랐고, 성공률과 GF의 스피어만 상관은 0.93(파인튜닝 0.41)이었다. 통제 실험에서도 Perturbot은 방해 물체를 20%만 선택(파인튜닝 68%)하면서 지시된 물체는 90% 선택했고, 빈 파지 후 들어올림은 24%(파인튜닝 82%)였다. GroundFscore는 온라인 실패율과 ρ=0.72로 상관해 과제 성공률보다 0.41 우수했고, 95% 클러스터 부트스트랩 구간은 [0.12, 0.68]이었다.
개발자 관점에서 이 논문의 실용적 요점은 두 가지다. 첫째, 로봇 정책 파인튜닝에서 성공률 상승만 보고 데이터를 늘리는 전략은 지름길을 강화할 수 있다. 같은 분포의 시연을 추가하는 대신, 과제를 보존하는 시야 교란·결정 관련 캡션·실패/무작위 구간 재라벨링으로 '무엇을 스케일하는지'를 바꿔야 한다는 것이 이들의 주장이다. 둘째, 롤아웃 없이 순전파 짝지은 편집만으로 정책이 증거를 쓰는지 진단할 수 있다는 점은 체크포인트 선택과 회귀 테스트에 바로 쓸 수 있는 아이디어다. 다만 GroundFscore는 진단 지표이지 과제 수행 능력의 보증서가 아니며, 저자들도 온라인 실패와의 연관성을 별도 절에서 검증했다고 밝힌다.
한계도 분명하다. Perturbot은 기록된 행동에 맞춘 상세 캡션과 재라벨링된 구간, 그리고 시연 외에 무작위·실패 궤적을 필요로 한다. 재라벨링은 한 번도 기록되지 않은 행동을 만들어내지 못한다. 예컨대 빈 파지 후 다시 여는 복구 동작은 데이터에 없으면 학습될 수 없다. 저자들은 실제 로봇 롤아웃이 이런 궤적의 좋은 공급원이라고 덧붙인다. 성공 궤적은 서로 비슷하지만 실패는 저마다 다르게 어긋난다는 것이다.