VLA 안전 정렬을 Lagrangian 페널티 대신 Hamilton-Jacobi 도달가능성으로 다시 짠 ShieldVLA

ShieldVLA: Feasibility-Aware Safety Alignment for Vision-Language-Action Models

HF Daily2609.13231

Manan Tayal, Akshay Nambi2026-09-02조회 5

무엇인가

이 논문이 다루는 문제는 명확하다. Vision-Language-Action(VLA) 모델은 로봇 조작과 내비게이션에서 강한 일반화를 보이지만, 기존 파인튜닝 방식은 안전 보장을 거의 제공하지 못한다. 가정용 조작, 산업 조립, 내비게이션 같은 안전 필수 영역에서는 단 한 번의 충돌, 위험 구역 진입, 힘 한계 위반이 되돌릴 수 없는 실패를 만든다. 그런데 기존 방법은 대부분 Constrained MDP 위에서 Lagrangian 최적화를 써서 기대 누적 비용에 부드러운 페널티를 줄 뿐이고, 궤적 단위의 실행가능성 신호가 없어 잔여 제약 위반이 남거나 반대로 지나치게 보수적인 행동으로 편향된다. 여기에 시각 도메인에서는 단계별 안전 라벨이 촘촘하게 존재하지 않는다는 감독 문제가 겹친다. 저자들이 던지는 질문은 이것이다. 높은 과제 성능을 유지하면서 안전 제약을 실제로 강제하려면 VLA를 어떻게 파인튜닝할 것인가.

어떻게 동작하나

제안 방법의 뼈대는 제어이론의 Hamilton-Jacobi(HJ) 도달가능성이다. 먼저 안전 마진 ℓ(s)를 두는데, ℓ(s) ≥ 0이면 안전 상태, ℓ(s) < 0이면 제약 위반이다. 통상적 CMDP 비용은 c(s) = max{-ℓ(s), 0}로 정의된다. HJ 도달가능성은 안전 집합을 안전 가치함수 V^s(s) = max_π min_{t≥0} γ^t ℓ(s_t)로 특징짓는다. V^s(s) ≥ 0이면 어떤 정책이 마진을 계속 음이 아니게 유지할 수 있다는 인증이고, V^s(s) < 0이면 모든 정책이 결국 제약을 위반한다는 뜻이다. 이에 대응하는 안전 벨만 연산자는 Q^s(s,a) = (1-γ)ℓ(s) + γ min{ ℓ(s), E_{s'~P(·|s,a)}[max_{a'} Q^s(s',a')] }이며, 이 연산자는 무한노름에서 γ-수축이라 유일한 고정점을 가진다. ShieldVLA는 이 고정점을 모델 없이, 시각 관측 o에 대한 Q^s_φ(o,a)로 시간차 학습으로 추정한다. 실제 타깃은 y_s = (1-γ)ℓ(o) + γ d̄ min{ ℓ(o), Q̄_φ̄^s(o',a') }이고, d̄ = 1 - done이라 종단 상태는 즉시 마진만 반환하고 부트스트랩하지 않는다. 비평가는 독립 모듈로, 비전 인코더(가능하면 VLA 인코더로 초기화)와 행동 임베딩을 결합한 MLP 헤드로 구성되며 정책 그래디언트는 행동 입력 쪽으로만 흐른다. 롤아웃은 공유 리플레이 버퍼에 쌓이고, PPO 반복마다 K번의 off-policy 그래디언트 스텝으로 비평가를 정책과 동시에 학습한다. 동결된 BC 워밍업 대신 동시 학습을 택한 이유는 파인튜닝 중 정책이 이동해도 비평가가 롤아웃 분포에 계속 보정되게 하기 위해서다.

무엇과 다른가

학습 목적함수의 핵심은 실행가능성 게이트다. 학습된 비평가는 관측-행동 공간을 실행가능 영역(Q^s_φ > δ)과 실행불가능 영역(Q^s_φ ≤ δ)으로 나누고, δ는 노이즈 버퍼 역할을 한다. 정책 평균 행동을 ā_θ(o)라 할 때 이진 실행가능성 지표는 ζ_θ(o) = 1[Q^s_φ(o, ā_θ(o)) > δ]이고, 게이트된 목적함수는 L_gate(θ) = E_{o~D}[ ζ_θ(o) L_reward(θ;o) + β_t (1-ζ_θ(o)) L_safety(θ;o) ]이다. 여기서 L_reward는 과제 보상에 대한 표준 PPO 클리핑 대리 목적이고, L_safety(θ;o) = -Q^s_φ(o, ā_θ(o))는 ā_θ(o)를 더 높은 안전 값으로 밀어 올리는 결정론적 정책 그래디언트 항이다. 계수 β_t는 비용 예산 c_max에 대한 이중 상승으로 β_{t+1} = clip(β_t + η_β(c̄_t - c_max), β_min, β_max)처럼 갱신되며, 게이트가 안전하지 않다고 표시한 전이에서만 손실에 들어간다. 저자들이 강조하는 통찰은 분리다. 실행가능 영역에서는 안전 페널티가 정확히 0이라 그래디언트가 비제약 PPO 파인튜닝과 동일하고, 실행불가능 영역에서는 보상 신호가 정확히 0이라 ∇_θ L_gate = -β_t [∇_a Q^s_φ(o,a)|_{a=ā_θ(o)}] ∇_θ ā_θ(o)로 안전 회복에만 집중한다. 게이트는 미분 불가능하므로 stop-gradient를 적용한 샘플 단위 마스크로 처리하며, 경계 근처에서 정책 분포가 양쪽에 충분한 질량을 두면 학습 중 실행가능성 경계를 부드럽게 넘나든다.

어떻게 쓰나

남는 문제는 ℓ 자체를 시각에서 어떻게 얻느냐다. 저자들은 에피소드 단위 이진 안전 라벨 하나만 주어진 상황에서 프레임별 마진 추정치 ℓ̂(o_t)를 네 단계로 만든다. 롤아웃을 모으고, 동결된 VLM이 구조화된 루브릭으로 모든 프레임을 [0,1] 앵커 스케일에서 채점하고, 그 원점수를 에피소드 라벨에 대해 보정하고, 보정된 ℓ̂을 HJ 벨만 업데이트에 투입한다. K개의 루브릭 점수를 사람이 정한 정수 가중치 w_k로 가중 합산해 프레임별 원 severity ρ(o_t) = Σ_k w_k V(o_t, c_k) ∈ [0, ρ_max]를 만들고, 클래스 균형 로지스틱 회귀(Platt scaling) P(y=1|ρ) = σ(aρ + b)를 적합해 ℓ̂(o_t) = -(aρ(o_t) + b)를 얻는다. 이 값은 안전 프레임에서 양수, 위험 프레임에서 음수다. 루브릭 세트는 플랫폼별로 다르다. Dubins-VL과 TurtleBot-Nav는 자기중심 장애물 회피 5종 루브릭, Safety-CHORES는 SafeVLA의 실내 로봇 루브릭(corner, dangerous-equipment, blind-spot, fragile, critical), Franka-Reach는 탁상 전용 근접/겹침 쌍을 쓴다. 채점자는 Qwen3-VL-8B이며 전체 스택이 Apache-2.0 오픈 웨이트다. 정적 루브릭이 놓치는 꼬리 실패 모드를 잡기 위해 RTD(Refinement-through-Differentiation)를 돌린다. 층화된 포즈 집합을 채점해 불일치 쌍(안전 프레임이 위험 프레임보다 높게 랭크된 경우)을 찾고, 더 큰 제안자 VLM인 Qwen2.5-VL-72B에게 그 둘을 분리할 새 루브릭을 만들게 한다. TurtleBot-Nav와 Safety-CHORES Nav라는 구조가 다른 두 플랫폼에서 같은 메타 프롬프트가 유사한 교정 기준을 도출했다고 보고한다.

전제와 한계

실험은 다섯 환경에서 이뤄진다. Dubins-VL은 Dubins 자동차 동역학 위의 자체 시각 장애물 회피 과제로 상단 RGB 관측, 단일 연속 각속도 행동, ResNet-18과 동결 CLIP 조합을 쓰며(완전한 VLA는 아니고 안전 집합을 아는 통제 벤치마크), 오라클 절제와 BRT 시각화를 위해 실제 마진 ℓ*(s) = d_min(s) - d_safe를 쓸 수 있다. TurtleBot-Nav는 MuJoCo의 TurtleBot 4 내비게이션으로 자기중심 RGB, 연속 선속도/각속도, OmniVLA 백본을 쓴다. Safety-CHORES Nav와 Fetch는 AI2-THOR의 Stretch RE1, 이중 자기중심 RGB, 20개 이산 행동, SPOC 기반 VLA 백본을 쓰고 SafeVLA의 정책 업데이트 레시피를 그대로 채택해 안전 기제만 비교되게 했다. Franka-Reach는 7-DoF Franka FR3 탁상 조작으로 손목 장착 RGB, 연속 말단 속도 행동, 원통형 장애물 하나, OpenVLA-OFT 백본을 쓴다. 베이스라인은 비제약 VLA, PPO-Lagrangian 기반 SafeVLA, 그리고 Dubins-VL에서 실제 비용을 받는 oracle HJ다. 지표는 성공률 SR(목표 도달과 안전 위반 0을 동시에 만족한 에피소드 비율, 즉 Safe+Reach)과 누적 안전 비용 CSC(에피소드당 평균 총 안전 비용)다. 결과적으로 ShieldVLA는 평균 CSC를 57% 줄이고 SR을 SafeVLA 대비 +0.13 올렸으며, 거의 모든 환경에서 최저 충돌률과 최고 성공률을 짝지었다. 유일한 예외는 Dubins-VL에서 oracle HJ가 SR 우위를 보이는 경우인데, 이는 특권적 실제 비용을 쓰는 이상적 상한이라 예상된 결과이며, 그럼에도 ShieldVLA는 비용 0을 달성해 안전에서는 oracle과 동등하다. 시드 분산 검증을 위해 모든 환경에서 3개 시드로 재학습했고 시드당 200 에피소드를 평가했으며, 표준편차는 SafeVLA 점추정치와의 격차에 비해 작았다.

절제 실험은 두 갈래다. 먼저 비용 신호만 바꿔 보정된 VLM 루브릭 마진을 이진 충돌 지표(안전하면 +1, 충돌 시 -5)로 교체하고 HJ 비평가와 게이트는 그대로 두었다. 그 결과 네 환경 중 세 곳에서 과제 성능이 붕괴했다. TurtleBot-Nav SR은 0.31 대 0.54, Franka-Reach SR은 0.25 대 0.45로 떨어졌다. 충돌 경계에서 멀어진 상태에는 그래디언트 정보가 없어 게이트가 너무 일찍 발화하고 정책을 실행가능 내부에서 잠가버리기 때문이다. 반면 ShieldVLA는 Safety-CHORES Nav에서 이진 비평가를 파레토 지배했고, 일반적으로 CSC가 다소 높아지는 대신 SR을 크게 올렸다. 즉 VLM 루브릭의 보정된 연속 severity가 비평가에게 선택적 게이팅에 충분한 신호를 준다는 것이 이 절제의 결론이다. 다음으로 게이팅 자체의 기여를 분리하기 위해, 학습된 Q^s_φ와 루브릭 감독을 고정한 채 게이트 목적함수를 Lagrangian 스타일 페널티 L_pen = L_reward + λ_t E[max(0, -Q^s_φ(o, ā_θ(o)))]로 바꾸고 λ_t를 β_t와 같은 이중 상승으로 갱신했다. TurtleBot-Nav에서 페널티 변형은 두 축 모두 ShieldVLA에 뒤졌고, 이는 파레토 이득이 비평가 자체가 아니라 실행가능성 게이트에서 온다는 것을 확인해준다. 분포 이동 견고성도 시험했다. 렌더러에 세 가지 시각 교란(+Color, +Light, +All)을 매 프레임 적용하고 정책과 안전 비평가는 학습 시 가중치로 동결했다. ShieldVLA는 모든 (환경, 조건) 셀에서 최저 CSC를 유지했고, Safety-CHORES Nav에서는 교란 시 안전이 오히려 개선되어 평균 ΔCSC = -0.49를 기록한 반면 SafeVLA는 +1.19 악화됐다. SR 변화폭은 두 방법이 비슷했지만(ShieldVLA [-0.04, 0.00], SafeVLA [-0.04, -0.03]) 안전 이득이 과제 성능 비용 없이 나왔다. Safety-CHORES Fetch의 잔여 악화는 SafeVLA의 약 2.9배 작지만 여전히 양수인데, 이는 훨씬 빡빡한 조작 여유 때문이다. 메커니즘은 직관적이다. 시각 불확실성 아래에서 HJ 비평가의 Q^s가 보수적인 값으로 줄고 게이트가 더 일찍 발화해 정책을 위험 영역으로 표류시키는 대신 회복으로 유도한다. 반면 SafeVLA의 단일 라그랑주 승수는 학습 분포의 비용 통계에 맞춰져 있어 테스트 시점에 스스로 재조정할 수 없다.

개발자 관점에서 실무적 의미는 세 가지다. 첫째, VLM 호출은 학습 중 안전 비평가를 감독할 때만 쓰이고 테스트 시점에는 전혀 쓰이지 않는다. 배포되는 산출물은 성능과 안전을 함께 갖춘 단일 VLA 정책이며 별도의 런타임 실드나 필터가 필요 없다. 둘째, 안전 비평가가 비전 인코더와 MLP 헤드로 이뤄진 독립 모듈이라 기존 VLA 파이프라인 위에 얹기 쉬운 구조다. 셋째, 도입 전에 확인해야 할 전제가 있다. 에피소드 단위 이진 안전 라벨이 있어야 하고, 플랫폼별로 루브릭을 다르게 설계해야 하며, 원점수를 라벨에 맞춰 보정하는 Platt scaling 단계가 파이프라인에 들어간다. 또한 안전 경계 근처를 충분히 탐색한 데이터가 있어야 게이트가 의미 있게 학습된다.

저자들이 명시한 한계는 두 가지다. 하나는 VLM 채점자 용량으로, 8B 미만 채점자는 꼬리 프레임에서 모드 붕괴를 보이며 RTD로 루브릭을 확장해도 해결되지 않는다. 다른 하나는 충분한 근경계 탐색의 요구로, 안전 위반 사건이 매우 드물게 발생하는 환경에서는 이를 보장하기 어렵다. 또한 학습된 Q^s는 유한 데이터와 VLM 비용 신호에서 오는 추정 오차를 물려받으므로 저자들은 안전을 이론적 보장이 아니라 경험적으로 보고한다. 가장 가까운 다음 단계로 저자들은 도메인 적응 보정을 포함한 sim-to-real을 통한 물리 로봇 검증과, 모드 붕괴 한계를 깨기 위한 채점자 스케일업을 꼽는다.