VLA 로봇의 지시문 표현 민감도를 재작성 규칙으로 줄인다

Rephrase Before You Act: Characterizing and Mitigating Language Sensitivity in Vision-Language-Action Models

arXiv2610.10526v1

Mikey Watts2026-10-07조회 1

무엇인가

이 논문이 다루는 문제는 비전-언어-행동 모델(VLA)이 지시문의 표현 방식에 지나치게 민감하다는 것이다. VLA는 자신이 기반한 비전-언어 모델(VLM)의 언어 강건성을 물려받지 못한다. 논문이 든 예에서 π0.5는 LIBERO 조리대 과제에서 "switch on the stove"에는 100% 성공하지만 "switch on the hot plate"에는 2%만 성공한다. 재표현 증강(rephrase augmentation)으로 파인튜닝한 π0 체크포인트조차 최대 61점의 성공률 변동을 보인다. 저자들은 이런 민감도가 과제마다 제각각인 잡음이 아니라 체계적이어서 명시적 규칙으로 표현될 수 있다고 본다.

어떻게 동작하나

방법은 세 단계다. 첫째, 증거 수집 단계에서 증거 과제(sealed 세트 밖의 시뮬레이션 가능한 Bridge 과제 8개와, BridgeData V2의 언어 주석 전문가 시연 228개 과제 풀에서 남은 208개 비시뮬레이션 과제)에 대해 VLM이 자연스러운 재표현 7개와 적대적 재표현 2개를 생성하고, 오라클 탐색에서 측정한 모든 표현도 포함한다. 이렇게 모은 증거 D는 228개 과제에서 뽑은 5,453개의 (과제, 표현, 점수) 쌍이다. 시뮬레이션 가능 과제는 18개 레이아웃×2회 반복으로 36번 롤아웃해 성공률로 점수를 매기고, 비시뮬레이션 과제는 16개 전문가 궤적 각각 4프레임, 표현당 64회 측정한 그리퍼 오차를 대리 점수로 쓴다. 이 대리 점수는 15개 과제 변형, 434개 (과제, 표현) 쌍에서 롤아웃 성공률과 과제 내 피어슨 r=0.54로 상관한다.

무엇과 다른가

둘째, 규칙 증류 단계에서 Claude가 점수화된 표현들을 10~20개의 자연어 규칙으로 정제한다. 예컨대 "일반 명사를 형제 명사로 바꾸지 말 것: 'plate'를 'dish'로 쓰지 말 것", "'coke'는 'coke'로 유지하고 'cola', 'soda', 맨 'can'으로 쓰지 말 것" 같은 규칙이다. 증류는 세 개의 렌즈 증류기, 적대적 비평가, 합성기로 구성된 다중 에이전트 패널이 한 번 돌아가며, 확률적이므로 규칙집 유형별로 3회 증류해 평균낸다. 규칙집 유형은 증거 범위에 따라 in-finetune, out-of-finetune, both로 나뉘고 총 9개 규칙집이 저장소에 공개되어 있다.

어떻게 쓰나

셋째, 배포 시점에 재작성기(applier)가 규칙집과 장면 이미지로부터 만들어진 추론 트레이스, 그리고 들어온 지시문을 받아 에피소드 시작 전에 지시문을 딱 한 번 고쳐 쓴다. 재작성기는 Claude, Gemini, 오픈웨이트 Qwen3.5-9B 중 하나이며 이미지 자체는 받지 않는다. 지시문당 모델 호출은 2회로, 트레이스 생성에 약 2.5초, 규칙 적용에 Claude 약 10초, Gemini 약 17초, 로컬 Qwen 1~2초가 걸린다. 재작성 결과는 모든 레이아웃과 반복에 재사용되고, VLA 가중치는 전혀 건드리지 않는다.

전제와 한계

민감도 특성화 실험에서는 단일 편집 변동을 이항비례 z 검정(p<0.05)으로 검정했고, π0.5는 추가로 18점 이상 격차를 요구했다. π0.5의 후보 쌍 426개 중 우연만으로 약 21개의 유의 변동이 기대되며, 저자들은 장면 모호성 때문일 수 있는 8개 세트를 수동으로 제거했다. π0는 표현당 72회(24개 레이아웃×3회), π0.5는 50개 레이아웃에서 1회 평가했다. 결과적으로 in-finetune 쌍의 44%가 18점 이상의 유의 변동을 보인 반면 out-of-finetune 쌍은 5%에 그쳤다. plate를 dish로 바꾸면 π0는 19점, π0.5는 56점 손해이고, "hot plate"는 출발 명사로 2%, 목적지 명사로 0% 성공한다. 색 형용사는 모델에 따라 비대칭적이어서 Bridge에서는 어휘 밖 명사에 색을 더하면 성공률이 오르고(black keyboard +42) 어휘 안 명사에는 떨어진다(yellow plate −22). LIBERO에서는 색 추가가 항상 성공률을 낮춘다(black bowl −20). Pepsi를 pepsi로 바꾸면 44점이 오르는데, 이는 단어가 아니라 토큰 수준의 민감성을 시사한다.

오라클 표현 탐색은 VLM이 3라운드에 걸쳐 과제당 16개 재표현을 생성하고 롤아웃으로 점수를 매겨 다음 라운드에 반영하는 방식이다. π0는 레이아웃 0~17에서 n=36으로 측정해 선택하고, 선택된 표현을 24개 레이아웃 전체에서 레이아웃당 12회 재측정했다. 선택에 쓰지 않은 레이아웃 18~23만으로 n=72로 재면 같은 헤드룸이 나와 선택 편향이 아님을 확인했다. 이 탐색에서 표현만 바꿔도 in-distribution과 out-of-distribution 사이의 21점 격차가 거의 닫혔다.

본 평가는 재표현 증강된 π0를 12개 sealed Bridge 과제, 24개 고정 레이아웃에서 네 가지 표현 집합(적대적 72개, VLM 생성 자연어 186개, 사람 생성 자연어 363개, 정규 지시문 12개)으로 수행했다. 사람 표현은 저자 지인 37명(11~85세)이 8세 아이, 성인, 로봇에게 요청하는 방식으로 수집해 392개(고유 363개)가 남았다. 베이스라인은 무재작성, 단일 일반 규칙만 쓰는 no-rules 재작성기, 그리고 매 스텝 40개 후보(8개 재표현×5개 행동)를 대조 학습 검증기로 고르는 CoVer다. 통계는 base instruction을 짝지은 단위로 하고 양측 부호반전 순열검정(20,000회 재표본, n≤12면 정확 열거)을 썼다. 무재작성 베이스라인의 통합 성공률은 적대적 24.5%, 사람 자연어 23.0%, VLM 자연어 26.0%였다. out-of-finetune 규칙집이 일관되게 가장 좋았고(정규 지시문 집합만 예외이나 검정력 부족), Claude 재작성기 기준으로 무재작성 대비 적대적·자연어 집합에서 16~27% 상대 개선, no-rules 재작성기 대비 적대적 26%, 사람 자연어 11%, VLM 자연어 4.7% 개선을 보였다. 규칙집 유형별 3회 증류 간 통합 성공률 변동은 0.7~5.1점, 중앙값 범위 3.0이었다.

π0.5와 LIBERO로의 재현 실험은 사전 등록한 sealed 20개 과제(10개 in-finetune, 10개 out-of-finetune), 과제당 VLM 자연어 재표현 10개, 비sealed 단일 편집 쌍만을 증거로, Gemini 재작성기, n=200 base, 50개 레이아웃으로 진행됐다. 독립적으로 증류한 규칙집 3개가 in-finetune 성공률을 평균 93.6%에서 97.8%로 올렸고(p≤0.005), out-of-finetune 성공률은 변화가 없었다(p>0.4). no-rules 재작성기는 in-finetune에서 아무 이득이 없고 out-of-finetune에서 1.6점 올랐다(p=0.006). 개별 수리 효과로는 hot plate, hotplate, burner를 stove로 바꾸면 200개 테스트 표현 중 약 9개에서 45점이 올랐고, dish를 plate로 바꾸면 24점, onto→on과 into→in은 약 50개 표현에서 2.5점, grab이나 lift를 pick up으로 바꾸면 약 15개 표현에서 2.4점이 올랐다. 모든 과제에서 성립해야 한다는 제약을 걸면 규칙집이 거의 바뀌지 않고 이득도 없었다.

개발자 관점에서 이 방법의 실무적 가치는 정책 재학습이나 스텝별 검증 없이, 지시문당 한 번의 추가 모델 호출만으로 기존 VLA 위에 얹을 수 있다는 점이다. 다만 이득이 out-of-distribution 과제에 집중되고, in-finetune 과제에서는 규칙집이 오히려 약했다는 점을 확인해야 한다. 또한 재작성기가 장면 이미지를 직접 보지 않고 별도 추론 트레이스에 의존하므로, 트레이스 품질이 결과를 좌우할 수 있다. 도입 시에는 자신의 과제 집합에서 단일 단어 편집 변동을 먼저 측정해 민감도가 실제로 존재하는지 확인하고, 규칙집을 여러 번 증류해 분산을 보는 것이 좋다.

저자들이 밝힌 한계는 다음과 같다. 더 많은 과제에서 규칙집을 증류하면 이득이 커질 수 있으나, 표현 문제를 강화학습으로 정식화하려면 훨씬 많은 시뮬레이션 가능 과제가 필요하다. in-finetune 규칙집이 부진했던 것은 대리 점수가 약했기 때문일 수 있는데, 증거를 전부 롤아웃으로 점수화한 LIBERO 규칙집은 그렇지 않았다. 평가는 VLA 두 개와 시뮬레이션에서만 이루어졌으므로 실제 로봇이 다음 단계다. 무엇보다 언어 민감도를 여러 모델에 걸쳐 체계적으로 측정하고 그 원인을 귀속시키는 것이 이 연구 방향에서 가장 가치 있는 결과라고 저자들은 말한다.