critic 없이 Bellman 방정식으로 정책 미러 하강을 재구성한 BPO
Bellman Policy Optimization
무엇인가
이 논문이 다루는 문제는 검증 가능한 보상으로 대규모 언어모델의 추론 능력을 높이는 RLVR(Reinforcement Learning with Verifiable Rewards)에서, 정책 최적화를 어떻게 안정적이고 값싸게 하느냐다. GRPO 계열이 널리 쓰이지만 PPO식 clipped surrogate와 token-level importance ratio에 의존한다. 한편 Policy Mirror Descent(PMD)는 action value와 divergence penalty로 정책을 갱신하는 원리적 방법이지만, 언어 생성에 직접 적용하려면 중간 상태마다 가치 추정이 필요해 별도 value model을 학습해야 하고 메모리·연산 비용이 커진다. 학습된 가치 추정이 추론 과제에서 부정확할 수 있다는 문제도 있다. 이 논문은 value model 없이 PMD와 동일한 정책 갱신을 얻는 재구성을 목표로 한다.
어떻게 동작하나
BPO의 핵심은 terminal reward만 있는 자기회귀 생성에서 Bellman 방정식을 쓰는 것이다. 각 토큰의 advantage를 연속한 두 상태의 가치 함수 차이로 표현하면, 응답을 따라 합할 때 중간 항이 상쇄(telescoping)되어 마지막에는 terminal reward와 초기 가치 V^μ(x)만 남는다. 저자들은 이 항등식과 PMD 최적성 조건을 결합해 궤적 수준 residual δ(x,y;π,μ) = η(R(x,y) − V^μ(x)) − Σ_t (log π(y_t|s_t)/μ(y_t|s_t) + D_KL(μ(·|s_t)‖π(·|s_t))) 를 정의하고, rollout 분포 아래에서 이 residual의 제곱 기대값을 최소화하는 목표를 세운다. 초기 가치 V^μ(x)는 프롬프트에 대한 기대 보상이므로 샘플된 응답의 평균으로 추정할 수 있다. Theorem 1은 이 목표와 원래 PMD 목표가 rollout 정책으로 도달 가능한 상태에서 동일한 유일 최적해를 가진다는 것을 증명한다.
무엇과 다른가
실용적인 BPO 손실은 일련의 근사로 얻는다. 먼저 제곱 residual 손실을 π=μ 근처에서 선형화해 residual 인자를 R(x,y) − V^μ(x)로 바꾼다. 초기 가치는 그룹 응답 보상의 평균으로, 프롬프트 가중치 φ(x)는 보상 표준편차의 역수로 두어 그룹 정규화 advantage Â^i가 나오게 한다. 다음으로 전체 reverse KL을 binary KL로 근사하면 gradient가 (1−μ(y_t|s_t))/(1−π(y_t|s_t)) ∇log π(y_t|s_t) 형태가 되는데, π가 1에 가까워질 때 이 계수가 커지므로 더하기 smoothing을 적용해 mismatch-correction weight ω_t^i = (1+ε−μ(y_t^i|s_t^i))/(1+ε−π(y_t^i|s_t^i)) 를 쓴다. 마지막으로 GRPO식 clipping mask M_t^i를 적용하고 ω를 상수 C로 자른다. 최종 손실은 L = −Â^i M_t^i min{sg(ω_t^i), C} log π(y_t^i|x, y_<t^i) 로, GRPO의 importance ratio r_t^i를 smoothed complementary token probability 비율로 대체한 형태다.
어떻게 쓰나
실험은 Qwen3-30B-A3B-Base를 DAPO-Math-17k 영어 부분집합으로 학습하고 AIME24, AIME25, AIME26에서 평가했다. 롤아웃 배치는 프롬프트 256개, 프롬프트당 응답 16개로 총 4096개 응답을 512개씩 8개 미니배치로 나눠 업데이트하며, 400 스텝(3200 옵티마이저 업데이트), 최대 응답 길이 16384 토큰, 모든 방법에 rollout-router replay(R3)를 적용했다. BPO는 ε=0.1, C=3.0을 쓴다. 결과적으로 BPO는 세 벤치마크 평균 최고 정확도 50.5%를 기록했고, GRPO-ClipHigher 39.5%, CISPO 47.4%와 비교해 각각 11.0%p, 3.1%p 앞섰다. GSPO와 DPPO 대비로는 7.0%p, 4.1%p 개선이다. 세 벤치마크 모두에서 BPO가 가장 높았고, 400 스텝 후 최종 평균 정확도도 49.4%로 DPPO의 45.5%를 앞섰다.
전제와 한계
실무에서 RLVR 파이프라인을 돌릴 때 value model을 따로 학습하는 비용을 줄이고 싶다면 BPO의 손실 형태가 직접적인 대안이 된다. GRPO 코드에서 token-level importance ratio를 complementary token probability 비율 ω로 바꾸고 smoothing ε와 cap C를 추가하는 정도의 변경으로 구현할 수 있다는 점이 실용적이다. 다만 π(y_t|s_t)가 1에 가까울 때 ω가 발산하지 않도록 smoothing과 cap이 필수이며, 이 하이퍼파라미터가 학습 안정성에 영향을 준다는 점을 확인해야 한다. 또한 그룹 크기 G와 std 기반 정규화에 의존하므로 보상 분산이 0인 프롬프트 처리 등 GRPO 계열의 기존 구현 이슈를 그대로 안고 간다.
저자들이 밝힌 전제는 terminal reward만 있는 finite-horizon MDP 설정이며, 동등성 정리는 rollout 정책으로 도달 가능한 상태에서만 성립한다. 또한 실용 손실은 선형화, 그룹 추정, binary KL 근사, smoothing, clipping 등 일련의 근사를 거친 결과이므로 원래 목표와 정확히 일치하지는 않는다. 실험은 Qwen3-30B-A3B-Base와 수학 추론 벤치마크(AIME)에 한정되어 있고, smoothing과 truncation 설정에 대한 ablation은 Qwen3-4B-Base에서 유사한 성능을 보였다고만 보고한다. 다른 도메인이나 모델 규모로의 일반화는 이 논문에서 검증되지 않았다.