안전 제약 강화학습을 하나의 벨만 연산자로 통합한다

A Unified Bellman Operator for Safety-Critical Reinforcement Learning

arXiv2610.12420v1

Nishanth Arun Rao2026-10-08

무엇인가

안전이 중요한 영역의 강화학습은 과제 성능을 최대화하면서 안전 제약을 엄격히 지켜야 한다. 논문은 기존 접근의 딜레마를 이렇게 정리한다. CMDP를 라그랑주 완화로 푸는 방식(PPOLag, SACLag, PCPO 등)은 기대 누적 비용을 제한할 뿐이라 확률적 안전 보장에 그치고, 모델 기반 방식은 예측 롤아웃으로 엄격한 안전을 얻지만 모델 편향이 누적되고 실시간 추론 비용이 크다. HJ 도달가능성 기반 안전 필터는 사전에 학습된 과제 무관 안전망이 경계 근처에서만 개입하는 스위치형 개입이라 떨림이 생기고, Q-CBF 계열은 온라인 행동 투영이 필요해 행동 앨리어싱을 유발한다. 저자들은 안전과 과제 목표를 정책 수준이 아니라 값 함수 수준에서 결합하는 모델 프리 접근을 택한다.

어떻게 동작하나

핵심은 적대적 외란 d를 포함한 결합 벨만 연산자다. 결합 행동가치 Q(s,a,d)는 확률 1-γ로 종료 항 (1-γ)min{r(s,a,d), g(s)}를 받고, 확률 γ로 계속 진행하되 γ·min{ r + E[max_a' min_d' Q(s',a',d')], Q^φ_π(s,a,d) }로 갱신된다. 여기서 Q^φ_π는 결합 정책 π의 안전 가치(시간 할인된 HJ 안전 critic)로, 과제 보상의 추가 적립을 잘라내는 상한 역할을 한다. 즉 안전 critic이 '여기서부터는 과제 보상 대신 안전 값을 본다'는 절단선을 제공한다. 정책은 μ(s)=argmax_a min_d Q, ν(s,μ(s))=argmin_d Q로 정의되는 maximin(제어자는 최대화, 외란은 최소화) 형태이며, 외란은 제어자의 행동을 관측한 뒤 움직인다고 가정한다. 중요한 점은 Q^φ_π가 주어지지 않고 Q와 함께 학습된다는 것이다. 정책은 Q에서 유도되고, Q는 Q^φ_π로 평가되며, 그 값이 다시 Q를 갱신하는 결합 구조다.

무엇과 다른가

이론 분석은 두 단계다. 먼저 정책이 고정되면 안전 벨만 연산자 T^φ_π가, 안전 가치가 고정되면 결합 연산자 T_Y가 각각 상한 노름에서 γ-축소 사상임을 증명한다(명제 1, 2). 그러나 Q에서 정책으로 가는 사상 Q ↦ π_Q가 불연속이라 두 연산자를 합성한 반복은 축소성을 보장하지 못한다. 그래서 저자들은 두 시간 스케일 확률 근사를 도입한다. 빠른 시간 스케일에서는 현재 결합 정책의 안전 critic Y를 추적하고(동점 정책들을 볼록 껍질로 묶은 집합값 미분 포함으로 분석), 느린 시간 스케일에서는 결합 가치 Q를 학습한다. 결합 목적함수는 강건 최적 정지 이론에서 유도되는데, 정지 시간 τ가 '안전 검사관'으로 작동해 궤적이 과제 최적화 영역 Ω^ψ를 벗어나는 순간 이후 기대 수익 적립을 종료 안전 값 J_τ로 대체한다.

어떻게 쓰나

수렴 결과는 구체적이다. 안전 마진을 K배로 키운 조건에서 안전 집합의 전방 불변성과 지수적 끌림을 보이며(정리 3), ρ(q(t)) ≤ ρ(q(0))e^{-(1-γ)t}를 만족한다. 이로부터 유도 정책이 Ω 안의 모든 상태에서 안전함이 따라온다(따름정리 1). 충분히 큰 마진 K ≥ K* = (2-γ)R_max / ((1-γ)δ_Ω)에서 두 시간 스케일 반복은 안전 제약 하 최적 과제 가치 Q*_Ω로 수렴하고(정리 4), δ_Ω = 0인 경우에도 유한 K에서 최적성 격차가 Δ_marg(ζ_K)로 유계이며 K → ∞에서 사라진다(정리 5).

전제와 한계

실험은 MuJoCo 기반으로 Gymnasium 이동 환경 3개와 SafetyGymnasium의 SafeVelocity 환경 8개, 총 11개에서 수행했다. 환경에는 안전 위반이나 생존 방해를 노리는 적대적 외란을 추가했다. 제안 구현 JointSAC은 ISAACS 프레임워크를 따르고 SAC 위에 올렸으며, 제어자와 외란 정책을 τ-GDA(유한 시간 스케일 분리 경사 상승-하강)로 학습한다. 베이스라인은 최소 제한 안전 필터(LRSF)와 CMDP 계열 PPOLag, SACLag, PCPO(omnisafe)다. 학습 시드 5개, 시드당 300회 평가로 총 1,500개 평가 시드를 사용했고, JointSAC은 모든 환경에서 위반이 거의 0이었으며 최대 비용은 Hopper-v4에서 0.03±0.08이었다. 반면 베이스라인은 비용이 불안정했고 PCPO는 SafetyAntVel에서 뒤로 걷는 행동을 보였다. 허용 비용 임계값은 d=0으로 설정됐다.

개발자 관점에서 이 논문의 실용적 요점은 안전을 정책 출력에 사후 개입하는 필터로 붙이지 않고, 가치 함수 안에 절단 항으로 심는다는 설계다. 안전 필터의 경계 떨림이나 온라인 투영 지연이 문제가 되는 로봇 제어 스택이라면, 안전 critic과 과제 critic을 서로 다른 학습률로 분리해 학습하는 이 구조가 대안이 될 수 있다. 다만 도입 전에 확인할 것은 세 가지다. 안전 마진 g(s)를 상태 전역에서 연속적으로 정의할 수 있는지, 외란 모델을 maximin으로 세울 만큼 환경 교란이 실제로 존재하는지, 그리고 마진 스케일 K를 얼마로 잡을지다.

저자들이 밝힌 한계는 분명하다. 첫째, 이론은 엄격한 안전을 보장하지만 고차원 연속 공간으로 확장하려면 신경망 근사가 필요하고, 그 순간 엄격한 전방 불변성은 깨진다. 둘째, 수렴 이론은 안전 마진을 K ≥ K*로 크게 키우는 것을 전제하는데, 이는 수치적 불안정을 부를 수 있어 실제로는 K를 가능한 한 크게 휴리스틱하게 튜닝해야 한다. 셋째, 잘 정의된 연속 안전 마진과 완전한 상태 관측을 가정하는데, 비구조적 실제 환경에서는 이를 정확히 명세하기 어렵다.