정규화가 적대적 모방학습의 표본 복잡도를 1/K+1/N으로 낮춘다

Provable Benefits of Regularization: Fast Rates for Adversarial Imitation Learning

arXiv2609.35698v1

Hanbin Zhou2026-09-28조회 2

무엇인가

이 논문은 적대적 모방학습(AIL)에서 보상 정규화와 정책 정규화가 유한 표본에서 어떤 통계적 이득을 주는지 묻는다. AIL은 전문가와 학습자 행동을 구분하는 적대적 보상을 학습하고 그 보상 아래 정책을 개선한다. GAIL, IQ-Learn, LS-IQ 같은 방법은 보상 정규화와 엔트로피/KL 정책 정규화를 핵심 요소로 쓰지만, 이것이 표본 복잡도를 실제로 얼마나 빠르게 하는지는 덜 밝혀졌다. 특히 보상은 고정된 전문가 데이터셋에서 계속 학습되고 정책은 온라인 상호작용으로 분포를 바꾸므로, 보상 학습자는 두 데이터 원천의 추정 오차를 동시에 통제해야 하고 정책 학습자는 추정 가치함수로 개선해야 한다. 저자들은 이 결합 문제에서 보상 정규화와 정책 정규화가 함께 1/K+1/N 빠른 수렴을 줄 수 있는지 질문한다.

어떻게 동작하나

제안 방법은 Dually Regularized AIL이다. 유한 지평 MDP, 알려지지 않은 전이, 일반 함수 근사를 가정하고, 모델 없이 동작한다. 목표는 max_r min_π L(π,r)=J_r^τ(π^E)-J_r^τ(π)-ψ_π^ω(r)이다. 여기서 J_r^τ는 기준 정책 π_ref에 대한 KL 정규화 가치이고, ψ_π^ω(r)=α/2 Σ_h [ω E_{d_h^E}[r_h^2]+(1-ω) E_{d_h^π}[r_h^2]]는 전문가 점유와 학습자 점유로 가중된 2차 보상 벌점이다. π_ref를 균등분포로 두면 KL 정규화가 엔트로피 정규화가 되어 GAIL·IQ-Learn류 최대 엔트로피 AIL과 연결되고, ω=1/2는 LS-IQ의 동일 혼합 정규화와 맞닿는다.

무엇과 다른가

알고리즘은 K개 에피소드 동안 두 단계를 번갈아 수행한다. 1단계에서는 현재 보상 r_k에 대해 u_{r,h}=r_h+1/2 α(1-ω)r_h^2로 변형한 보상으로 역방향 최소제곱 가치 추정을 한다. F_h 위에서 이전 전이들을 사용해 벨만 타깃을 회귀하고, 탐색 보너스 b_{k,h}=min{4Vmax, β D_F((s,a);D_{k-1,h};λ)}를 더한다. 이어 소프트 벨만 업데이트로 V와 닫힌 형태 정책 π_{k,h}를 구하는데, 이는 낙관적 행동가치와 π_ref로부터의 KL 이탈을 절충한다. π_k를 한 에피소드 실행해 새 궤적을 모은다. 2단계에서는 전문가 데이터와 방금 모은 학습자 궤적을 사용해 경험적 손실 ℓ̂_k(r)=Σ_h {E_{d̂_{k,h}}[r_h+1/2 α(1-ω)r_h^2]-E_{d̂_h^E}[r_h-1/2 αω r_h^2]}를 만들고, 온라인 미러 디센트(OMD)로 보상을 갱신한다. 갱신식은 r_{k+1}=argmin_r <ĝ_k,r>+1/2 αρ Σ_h ||r_h-r_{k,h}||_{k,h}^2이고, ĝ_{k,h}=(1+α(1-ω)r_{k,h})∘d̂_{k,h}-(1-αω r_{k,h})∘d̂_h^E, ||r||_{k,h}^2=kω/N Σ_i r(s_h^i,a_h^i)^2+(1-ω)Σ_{j=1}^k r(s_{j,h},a_{j,h})^2이다. 이 근접 벌점을 보상 곡률에 맞춰 OMD 안정성을 일반화 엘루더 차원으로 통제하고, ρ만큼 곡률을 남겨 전문가·학습자 샘플링 오차를 흡수한다.

어떻게 쓰나

이론 결과는 정규화된 안장점 갭에 대한 고확률 상한이다. Theorem 1과 Corollary 1은 고정된 양의 정규화 계수와 통제된 함수류 복잡도 아래 Gap(π̄_K,r̄_K)≤Õ(1/K+1/N)를 보인다. 따라서 전문가 시연 N개와 온라인 상호작용 K회 모두에서 Õ(1/ε) 표본 복잡도를 얻고, 확률적 전문가에도 적용된다. 구체적으로 K는 Õ(H/ε[(1+αω)^2/(αω)+(1+α(1-ω))^2/(α(1-ω))(d_R+log(2N_R(1/K^2)))]+H^3 Vmax^2 d_F/(τ ε) log(2N_{F⊕B}(Vmax/K^2))) 규모이고, N은 Õ(H(1+αω)^2/(αω ε) log(2N_R(1/N^2))) 규모다. 고정 α,τ,ω에서 Vmax=Θ(H)이므로 정책 계획 부분은 KL-LSVI-UCB의 상호작용 복잡도 차수와 일치한다. 전문가 궤적 요구량은 O(H log(N_R/δ)/ε)로 요약된다.

전제와 한계

증명은 누적 이중 갭을 보상 학습 오차 T1과 정책 계획 오차 T2로 나눈다. T1은 다시 경험적 손실 항과 기대 손실-경험 손실 집중 항으로 분해된다. Lemma 1은 곡률 맞춤 OMD가 Σ_k[ℓ̂_k(r_k)-ℓ̂_k(r)]≤O(H[1+log K+dim_K(R,4/K^2)])-1/2 α(1-ρ)E_K(r)를 만족한다고 말한다. 여기서 E_K(r)은 정규화가 만든 손실 곡률이다. Lemma 2는 적응적 전문가 데이터 재사용 아래 분산 상쇄를 보여, 집중 항이 1/2 α(1-ρ)E_K(r)+Õ((K+N)H/N log covering) 이하임을 준다. 두 부등식을 더하면 supremum 전에 E_K(r)이 정확히 상쇄되고, ρ=1/2가 1/ρ 안정성과 1/(1-ρ) 집중을 균형 잡는다. 전문가 재사용은 Õ(KH/N)을 기여해 평균에서 1/N을 만들며, 결정론적 전문가나 매 에피소드 새 시연을 요구하지 않는다. T2는 KL 정규화 계획 분석을 확장해 T2≤2H^2/τ Σ_kΣ_h E_{d_h^{π_k}}[b_{k,h}^2]≤O(H^3β^2/τ[dim_K(F,λ)+log(8H/δ)])를 얻는다. KL 정규화 성능차 항등식과 Gibbs 공식이 정책 오차를 낙관적 행동가치 오차의 제곱으로 만들고, 벨만 재귀가 이를 제곱 보너스로 환원하며, 집중이 점유 기대값으로 옮긴다. 이 제곱 의존성이 빠른 계획 속도를 준다.

실험과 결과에 대해, 제공된 원문에는 데이터셋, 베이스라인, 표 수치 같은 실험 섹션이나 수치 결과가 제시되지 않았다. 이 논문은 이론적 표본 복잡도 분석과 증명 스케치가 중심이며, 실험적 검증은 원문 범위에 포함되어 있지 않다. 따라서 ‘어떤 데이터셋에서 몇 퍼센트 개선’ 같은 내용은 원문에 근거해 쓸 수 없다.

개발자에게 의미는 AIL 구현에서 보상 정규화와 KL/엔트로피 정책 정규화를 단순한 튜닝 노브가 아니라 유한 표본 빠른 수렴을 만드는 구조적 요소로 이해할 수 있다는 점이다. LS-IQ식 2차 보상 벌점을 전문가·학습자 점유 혼합으로 두고, KL 정규화 정책 업데이트를 함께 쓰는 설계가 이론적으로 정당화된다. 다만 ω가 0이나 1에 가까우면 해당 점유 쪽 오차 상한이 약해지고, α나 τ가 작아지면 정규화 이득과 정규화 편향의 trade-off가 달라진다. 함수류의 커버링 수와 일반화 엘루더 차원, 고정 정규화 계수 가정을 확인해야 하며, 비정규화 모방 갭을 목표로 한다면 이 빠른 비율이 직접 적용되지 않는다.

한계로 저자들은 정규화된 안장점 갭을 다룬다고 명시한다. 빠른 비율은 고정된 양의 보상·정책 정규화 계수와 통제된 함수류 복잡도 아래에서 성립하며, 비정규화 목적함수의 표본 복잡도를 직접 함의하지 않는다. 정규화 편향과 정규화 계수 의존성은 별도로 계산해야 한다. 또한 유한 지평 MDP, 알려지지 않은 전이, 일반 함수 근사, 유계 보상, 독립적인 전문가 궤적, 알려진 기준 정책 같은 전제가 있다. 표본 복잡도 식은 커버링 수와 엘루더 차원이 K,N에 의존할 수 있어 암묵적 충분조건 형태다. 실험 검증이 없으므로 실제 GAIL·LS-IQ 구현에서의 성능 개선 폭은 이 논문만으로 확인되지 않는다.