VLA가 로봇 실행 오차를 배포 중 스스로 보상하도록 적응시킨다

Taming VLAs under Robot Execution Errors: Self-Compensation and Stress Testing

HF Daily2609.37334

Sohyun Lee, Yoonjae Baek, Jaesang Won2026-09-29

무엇인가

이 논문이 다루는 문제는 VLA(시각-언어-행동) 정책이 명령한 동작과 로봇이 실제로 실행한 동작이 어긋날 때 무너진다는 것이다. 이런 실행 오차는 마모, 무거운 페이로드, 온도 변화 같은 로봇의 기계적 특성과 운용 조건에서 발생하며, 로봇마다 그리고 같은 로봇에서도 상황마다 달라진다. 기존 VLA 견고성 연구는 시점·조명 변화, 방해 물체, 바꿔 말한 지시문 같은 입력 교란에 집중했고, 최근에는 정책 출력 명령에 인위적 노이즈를 주입하는 방식으로 행동 교란을 다뤘다. 저자들은 이 둘이 다르다고 지적한다. 실제 실행 오차는 로봇의 현재 상태와 최근 동작 이력에 의존하고, 관절 단위에서 발생해 말단장치 운동에 관절마다 다르게 기여하는데, 합성 교란은 이런 의존성과 관절별 기여를 모델링하지 않는다는 것이다.

어떻게 동작하나

제안 방법인 자기보상 VLA(self-compensating VLA)는 배포 시점 적응 기법이다. 정책이 출력하는 것은 델타 포즈로 이루어진 액션 청크이고, 각 실행 스텝에서 고유수용감각으로 측정한 실제 말단장치 자세 변화 Δx에서 명령한 델타 포즈 a_policy를 빼서 잔차 η = Δx − a_policy를 구한다. 회전 변위는 SO(3) 로그 맵으로 계산하고, 명령을 물리 단위로 바꿀 때 쓰는 스케일 팩터로 나눠 명령과 같은 스케일로 맞춘다. 이 잔차는 명령과 고유수용감각 측정만으로 얻어지므로 태스크 보상이나 라벨 없이 자기지도 신호로 쓸 수 있다. 다음으로 각 실행 명령에서 관측된 잔차를 빼서 보상된 의사 타깃 a_target = a_policy − η를 만든다. 잔차는 실행이 끝난 뒤에만 관측되므로 이 타깃으로 현재 청크를 고칠 수는 없고, 이후 청크를 위한 정책 업데이트에만 쓴다. 구체적으로는 각 베이스 정책의 액션 expert에 rank-4 LoRA를 붙이고 사전학습 가중치는 동결한 채 LoRA 파라미터만 온라인으로 갱신한다. 베이스 정책이 flow-matching 모델이므로 타깃 액션 청크가 정의하는 타깃 속도로 예측 속도를 회귀하는 flow-matching 목적함수를 쓰고, LoRA 파라미터가 초기값에서 벗어나는 것을 억제하는 앵커 항을 가중치 10⁻⁴로 더한다. Adam, 학습률 10⁻⁶으로 최적화하며 실행된 액션 청크에서 만든 타깃 청크를 온라인 버퍼에 쌓아 기댓값을 계산한다. 로봇의 저수준 컨트롤러는 건드리지 않고 정책이 내보내는 명령만 적응시킨다는 점이 핵심이다.

무엇과 다른가

저자들은 실행 오차 견고성을 실물 로봇 군집으로 평가하는 것이 비현실적이라는 문제를 시뮬레이션 벤치마크 RoboStress로 우회한다. 여기서는 로봇 동역학 문헌의 관절 단위 모델 네 가지를 쓴다. 속도에 비선형으로 의존하고 저속에서 커지는 Stribeck 마찰(Coulomb-Stribeck + 점성항), 링크 질량 추정 불일치와 미지 페이로드에서 남는 중력보상 오차, 마모로 넓어진 기어 유격이 방향 전환 시 데드밴드를 만드는 백래시(Tao-Kokotović 모델, 이력 의존), 부하에 따라 링크가 처지는 동적 컴플라이언스(스프링-매스-댐퍼 2차 동역학, 이력 의존)다. 마찰과 중력보상 오차는 관절 토크에 더하고, 백래시와 컴플라이언스는 시뮬레이터 적분 단계에 들어가는 관절 위치에 더한다. 이 효과들을 조합해 Heavy Payload, Thermal Drift-Stribeck, Thermal Drift-Backlash, Aged Transmission, Aged Joint-Uniform, Aged Joint-Shoulder, Aged Joint-Elbow의 일곱 배포 시나리오를 구성하고, 관절별 심각도 계수로 각 성분의 세기를 조절한다.

어떻게 쓰나

실험은 LIBERO의 네 태스크 스위트(각 10개 태스크)에서 태스크당 20 에피소드로 일곱 시나리오를 평가했다. 베이스 정책은 π0와 π0.5이고, 비교 대상은 학습 시점에 견고성을 심는 두 방법, 즉 말단장치 명령에 가우시안 노이즈(σ~U[0,0.05])를 주는 도메인 랜덤화와 ℓ∞ ε=0.03 PGD로 적대적 학습하는 RobustVLA다. 결과적으로 자기보상 VLA는 두 백본 모두에서 일곱 시나리오 전부에서 베이스 정책, DR, RobustVLA를 앞섰다. 평균 성공률은 π0.5에서 49.1%에서 56.6%로, π0에서 41.7%에서 44.2%로 올랐다. 반면 DR과 RobustVLA는 일관된 이득을 내지 못했고 π0에서는 평균이 베이스 정책보다 낮았다. 노이즈 성분별로 보면 Stribeck 36.8→37.8, Backlash 68.0→72.1, Compliance 74.1→74.2, Gravity 21.1→22.0으로 평균 50.0%에서 51.5%가 됐고, 컴플라이언스에서 이득이 가장 작았는데 그 조건에서 베이스 정책이 이미 가장 높은 성공률을 보였기 때문이다.

전제와 한계

방법의 구성 요소를 분리한 실험도 있다. 잔차를 0으로 두고 온라인 업데이트만 유지한 변형은 40.8%로 베이스 정책과 제안 방법 모두보다 낮았고, 정책을 고정한 채 이전 청크의 평균 잔차를 다음 청크 명령에서 빼는 직접 잔차 보정은 23.6%에 그쳤다. 제안 방법은 44.2%, 베이스는 41.7%다. 즉 잔차가 보정 신호를 제공하고, 정책 적응이 고정된 청크 수준 보정을 넘어 관측 조건에 반응하는 보상을 만들어낸다는 것이 저자들의 해석이다. 실물 실험은 사용 이력이 다른 AgileX Piper 암 두 대(신품 Robot A, 1년 사용 Robot B)에서 태스크당 25 에피소드로 볼 픽앤플레이스 3개와 서랍 열기 1개를 평가했다. 신품 암조차 명령-실행 불일치가 있었고 정규화 잔차 평균이 32.9%로, 구형 암의 35.0%와 비슷한 수준이었다. 자기보상 VLA는 두 팔 모두에서 π0와 π0.5 양쪽으로 모든 태스크에서 베이스 정책과 RobustVLA를 앞섰고, 두 팔 각각에서 평균 성공률을 30%포인트 이상 끌어올렸다. 외부 명령 보정과의 결합 실험에서는 Robot A의 Task 1, π0.5 기준으로 베이스 48%, 외란 관측기(DOB) 단독 56%, 제안 방법 단독 84%, DOB+제안 방법 80%를 기록해, 외부 보정이 있는 상황에서도 정책 적응이 추가 이득을 준다는 것을 보였다. 파인튜닝 시연에 없던 객체 변형(나무색·자두색·연한 파란색 그릇 등)으로 평가한 Task 1에서는 π0.5 기준 64% 성공으로 베이스 16%, RobustVLA 36%를 크게 앞섰다. 시뮬레이션 Heavy Payload 모델을 실제 1kg 페이로드 실행과 맞춰본 비교에서는 조정된 RoboStress 모델이 가우시안 노이즈 기준보다 실제 편차 프로파일에 대한 DTW 거리가 낮았다.

개발자 관점에서 이 방법의 실용적 매력은 요구 사항이 적다는 데 있다. 태스크 보상도, 라벨도, 오차 원인에 대한 지식도, 로봇 동역학 모델도 필요 없고, 고유수용감각으로 측정한 명령-실행 잔차만 있으면 된다. 기존 저수준 컨트롤러를 교체하지 않고 정책이 내보내는 명령 계층만 LoRA로 온라인 갱신하므로, 이미 돌아가는 VLA 스택 위에 얹는 형태로 배포할 수 있다. 실제 로봇을 오래 쓰면서 마모가 진행되거나 페이로드가 자주 바뀌는 현장, 또는 같은 모델을 상태가 다른 여러 대의 암에 올려야 하는 상황이 주요 적용 지점이다. 다만 보상 신호의 품질이 전적으로 고유수용감각 측정에 달려 있으므로, 관절 상태 추정의 정확도와 지연을 먼저 확인해야 한다. 또한 온라인으로 파라미터를 갱신하는 만큼 앵커 가중치와 학습률 같은 하이퍼파라미터가 적응 속도와 안정성을 좌우한다는 점도 염두에 둬야 한다.

저자들이 명시한 한계는 다음과 같다. 향후 과제로 외부 센서의 모션 추정을 통합해 고유수용감각 의존을 줄이는 것을 든다. 윤리 성명에서는 보고된 성공률 향상이 안전 보장이 아니며, 인간 환경 배포에는 추가 안전 평가와 적절한 보호 조치가 필요하다고 밝힌다. 실제 평가는 사용 이력이 다른 Piper 암 두 대에 한정됐고, RoboStress는 시뮬레이션 벤치마크로서 실제 페이로드 실행과의 정합성은 DTW 거리 비교로 일부만 검증됐다.