SCF가 정규화되지 않은 밀도 샘플링을 자기일관성으로 학습한다
Score-Calibrated Flow for Sampling from Unnormalized Densities with Applications to Generative Online Reinforcement Learning
무엇인가
이 논문은 온라인 강화학습에서 생성 정책을 학습할 때 생기는 핵심 문제를 다룬다. 최대 엔트로피 RL의 소프트 정책 개선은 각 상태에서 볼츠만 정책 π^Q(a|s) ∝ exp(τ Q(s,a))를 목표로 삼지만, critic은 Q(s,a)와 ∇_a Q(s,a)만 제공할 뿐 목표 밀도에서 직접 샘플을 주지 않는다. 표준 조건부 흐름 매칭(CFM)은 목표 샘플이 있어야 하는데, 온라인 RL에는 그 샘플이 없으므로 기존 방법들은 중요도 샘플링, 샘플링 경로 역전파, 가치 가중 회귀 같은 대리 목적을 쓴다. 저자들은 중요도 샘플링의 높은 분산과 계산 비용, 경로 역전파의 불안정성을 피하면서 비정규화 밀도에서 샘플링하는 생성 모델을 학습하는 Score-Calibrated Flow(SCF)를 제안한다.
어떻게 동작하나
SCF의 핵심은 흐름 매칭을 목표 샘플로부터 배우는 절차가 아니라, 종단 밀도와 그에 대응하는 이상적 흐름 모델 사이의 일대일 대응으로 재해석하는 것이다. 후보 밀도 ρ가 주어지면 보간 경로의 사후분포 p_{1|t}^ρ 아래 조건부 속도 기대값으로 이상적 속도 v_t^ρ를 정의하고, 명제 3.1은 이를 목표 점수와 연결한다. 즉 v_t^ρ(x_t)는 αdot_t/α_t x_t에 κ_t/α_t 곱하기 사후분포 기대 ∇log ρ를 더한 형태다. 여기서 ρ를 미지수로 두고 prescribed target score τ∇Q를 고정한 뒤, 흐름이 유도하는 밀도가 스스로 이 관계를 만족하도록 요구한다. 정리 3.2는 이 자기일관성 조건이 모든 t에서 또는 어느 한 t에서 성립하는 것과 ρ=π가 동치임을 보인다. 이어서 속도장 자체에 대한 조건을 세우는데, 점수 보정 연산자 I를 정의하고 고정점 방정식 v=I v를 만든다. 정리 3.4는 이 고정점 조건이 ρ^v=π와 v=v^π를 동시에 강제한다고 주장한다. 일반화된 계수 λ, ζ를 쓰는 정리 3.5는 적분 조건 (16) 아래에서 같은 유일해를 보존한다.
무엇과 다른가
학습 목적은 이 고정점 잔차를 샘플 단위 회귀로 바꾸는 것이다. 식 (18)의 목표 Y_{v,λ,ζ}(t,x_t,x_1)는 조건부 속도 v_{t|1}, 현재 속도 v_t(x_t), 그리고 목표 점수 τ∇Q(x_1)를 결합한 형태이며, 그 조건부 기대값이 점수 보정 연산자 (I_{λ,ζ}v)_t(x_t)와 같아진다. 현재 네트워크 v^θ로 종단점 Y_1을 생성해 X_1로 두고, 독립적인 소스 노이즈 X_0와 t를 뽑아 X_t=α_t X_1+β_t X_0로 보간한다. 그런 다음 v_t^θ(X_t)가 stop-gradient가 걸린 Y를 맞추도록 L^SCF(θ)=E||v_t^θ(X_t)-sg(Y_{v^θ,λ,ζ}(t,X_t,X_1))||^2를 최소화한다. 이 절차는 목표 샘플 없이도 CFM의 샘플-보간-회귀 구조를 유지하며, 중요도 샘플링이나 샘플링 궤적을 통한 역전파를 쓰지 않는다. 계수 λ_t, ζ_t는 t→0에서 점수 항의 특이성을 상쇄하도록 설계되고, 유일해 보존을 위한 적분 조건을 만족해야 한다. 유계 행동 공간은 a=tanh x로 잠재 변수에 사상하고, 잠재 목표 점수 τ∇Q(tanh x)-2tanh x와 야코비안 인자를 반영해 원래 밀도를 보존한다.
어떻게 쓰나
온라인 RL 적용은 off-policy actor-critic 구조다. 두 critic Q^{ω1}, Q^{ω2}와 타깃 네트워크를 유지하고, critic 손실은 리플레이 버퍼에서 뽑은 전이와 현재 정책이 생성한 다음 행동을 사용해 r+γ min_j Q^{ωbar_j}(s',a')를 회귀한다. actor는 Q(s,a)=min_i Q^{ω_i}(s,a)를 샘플링 포텐셜로 삼아, 각 상태에서 볼츠만 밀도 π^Q(·|s)를 향해 흐름 정책을 학습한다. 행동은 dY_t/dt=v_t^θ(Y_t,s), Y_0~N(0,I) ODE를 풀고 a=tanh Y_1로 얻는다. actor 손실은 상태 s를 조건으로 붙인 SCF 목적이며, 잠재 목표 밀도 π~^Q(·|s)의 점수는 τ∇_x Q(s,tanh x)-2tanh x로 주어진다. critic의 그래디언트가 생성된 행동 위치에서 목표 점수를 제공하므로, 별도 목표 샘플 없이 actor를 직접 학습할 수 있다.
전제와 한계
실험은 두 부분이다. 장난감 예제에서는 R^2에서 원 위에 균등 가중치로 배치된 8개 가우시안 혼합 밀도를 대상으로, Adjoint Sampling, Adjoint Schrödinger Bridge Sampler, Bridge Matching Sampler, Flow Sampling과 비교했다. 원문은 SCF가 정답 샘플과의 불일치가 가장 낮으면서 학습과 추론 모두 가장 효율적이었다고 보고한다. RL 실험은 DeepMind Control Suite의 연속 제어 과제와 HumanoidBench의 휴머노이드 제어 과제에서 수행했다. 비교 대상은 가우시안 정책을 쓰는 SAC와, 네 범주를 아우르는 생성 정책 베이스라인 DIME, QSM, QFlex, QVPO, MaxEntDP, SDAC, DQS, RFM이다. 원문은 SCF가 모든 과제에서 최상위권 성능을 일관되게 보였다고 쓰고, 부록 C.2의 표 2에서 학습 반복당 wall-clock 시간이 모든 생성 정책 베이스라인보다 적었다고 밝힌다. 다만 제공된 본문 발췌에는 구체적인 점수나 시간 수치가 제시되지 않았고, 그림과 표에 있다고만 언급된다.
개발자 관점에서 SCF는 critic이 Q와 ∇Q를 주지만 목표 행동 샘플은 없는 온라인 RL, 특히 연속 행동 공간에서 다봉형 정책을 쓰고 싶을 때 유용하다. 중요도 샘플링으로 인한 분산 폭발이나 ODE 샘플링 경로 전체를 미분하는 비용을 피하려는 파이프라인에 맞는다. 다만 구현 시 목표 점수 τ∇Q가 안정적으로 계산되는지, 행동 범위를 tanh로 사상할 때 야코비안 보정을 정확히 넣었는지, λ_t와 ζ_t 스케줄이 t→0 특이성을 상쇄하는지, 현재 흐름으로 생성한 종단점을 stop-gradient로 분리했는지 확인해야 한다. ODE 솔버 비용과 twin critic 구조, 리플레이 버퍼와의 상호작용도 기존 생성 정책 학습과 마찬가지로 성능에 영향을 준다.
저자들이 밝힌 전제와 한계도 분명하다. 목표 밀도의 정규화 적분이 유한하다고 가정하고, κ_t>0, 여러 정칙성 조건 (21), (22), (23), (24), 허용 가능한 속도장 조건을 요구한다. 속도 정리는 소스 근처 성장 한계와 생성 밀도의 가중 지수 모멘트를 가정하는데, 생성 밀도 ρ^v가 샘플링 동역학으로 암묵적으로 정의되므로 이를 직접 확인하기 어렵다. 부록 B.3의 명제 B.5는 v와 목표 점수에 대한 적분 가능한 선형 성장 한계와 목표 점수의 다항 성장으로 충분 조건을 제시한다. 또한 일반화된 계수는 적분 조건 (16)을 만족해야 하고, 유계 영역에서는 정확한 변수 변환을 하지 않으면 의도한 목표 밀도가 깨진다. 제공된 본문 발췌만으로는 실험의 정량적 개선폭을 확인할 수 없고, 성능 주장은 대부분 그림과 표에 의존한다.