EasyPPO가 critic 노이즈를 다뤄 PPO 학습 붕괴를 막는다
EasyPPO: Stabilizing the Critic Is Key
무엇인가
PPO는 LLM 후처리 학습에서 검증 가능한 보상 기반 강화학습(RLVR)의 대표 알고리즘이다. 액터-크리틱 구조가 토큰 단위 리턴 추정을 학습해 세밀한 credit assignment와 낮은 분산의 정책 업데이트를 가능하게 하기 때문이다. 그런데 이 논문은 그 강점의 원천인 critic이 LLM 강화학습에서 불안정의 주범이기도 하다는 것을 지적한다. 저자들은 롤아웃 배치를 512개 응답으로 키운 실험에서도 학습을 심하게 흔드는 두 가지 critic 실패 모드를 관찰했다.
어떻게 동작하나
첫 번째는 overlong rollout 필터링이다. 잘린(truncated) 롤아웃의 보상은 불완전한 응답을 반영하므로 GRPO 계열에서는 정책 업데이트에서 제외하는 관행이 있다. 문제는 이 필터링을 critic 업데이트까지 확장할 때 생긴다. critic V(s)는 원래 E[R|s]를 예측해야 하는데, 완료된 롤아웃만으로 학습하면 E[R|s, C](C는 비절단 사건)를 예측하게 된다. 논문은 critic이 정확한 극한에서 이 필터링이 정책 목적함수 자체를 완료 조건부 보상 E[R|s,C]로 바꿔버린다는 것을 quotient rule과 log-derivative 항등식으로 보인다(수식 4). 그 결과 완료된 롤아웃의 보상은 올라가는데 절단 비율은 오히려 증가하고 전체 보상은 낮게 머무는 현상이 나타난다. FrontierCS에서 Qwen3.5-9B로 200문제, 512 롤아웃, 32,768 토큰 응답 제한, 30스텝 critic 워밍업으로 비교한 결과 필터링 없음은 반복적 보상 붕괴를 보였고, 액터와 critic을 모두 필터링하면 절단 비율이 1에 근접했으며, 액터만 필터링하는 쪽이 가장 안정적이고 전체 점수가 가장 높았다.
무엇과 다른가
두 번째는 같은 배치 안에서 프롬프트마다 리턴 노이즈가 다른 이질성이다. critic의 MSE gradient 제곱 기대값은 ||h(s)||²[(V(s)-E[R|s])² + Var(R|s)]로 분해되는데, 예측 오차가 줄수록 Var(R|s) 항이 지배해 리턴 변동이 큰 프롬프트가 유한 배치 업데이트를 좌우한다. EasyPPO는 각 프롬프트의 critic 손실을 그 프롬프트 롤아웃 그룹의 리턴 표준편차 역수로 가중한다. 가중치는 배치 평균이 1이 되도록 정규화하고, 이산 보상에서는 ε = Δ/(2√n) 바닥값을 쓴다. 이렇게 하면 gradient 제곱 기대값에서 노이즈 항이 상수 1로 고정되어 프롬프트 간 불균형이 사라진다. 실제로 정규화 없이 측정한 오프라인 gradient에서 리턴 변동이 큰 프롬프트가 더 큰 gradient를 기여했고, 이 경향은 학습 후반 체크포인트에서 더 강했다.
어떻게 쓰나
세 번째는 critic 미니배치 크기다. EasyPPO는 롤아웃 배치를 critic 미니배치 4개로 나눈다. 작은 미니배치는 gradient clipping이 아웃라이어의 영향을 더 적은 롤아웃에 가두지만 리턴 노이즈를 평균으로 상쇄하는 효과는 약해진다. 논문의 이상화 분석은 단일 아웃라이어가 평균 clipped gradient에 미치는 영향을 O(m), 미니배치당 gradient 분산을 O(1/m)으로 bound한다. FrontierCS에서 K=B/m을 바꾼 실험에서 explained variance가 처음 0 이상이 되는 스텝은 log K에 대해 대략 선형으로 줄었고, K=4와 8이 학습 후반에 더 높은 EV를 보였다. 미니배치 크기를 바꾸면 critic 학습률도 함께 조정해야 한다.
전제와 한계
실험은 세 축이다. 연속 보상 코딩은 FrontierSmith가 생성한 200문제로 학습하고 FrontierCS 알고리즘 트랙으로 검증하며, 이진 보상 수학 추론은 DAPO-Math-17K로 학습해 AIME24로 검증하고, 멀티턴 검색은 Search-R1 혼합 데이터와 7개 검증 데이터셋을 쓴다. 베이스라인은 vanilla PPO, PPO+actor-only 필터링, HL-Gauss PPO, VAPO다. 200~300 업데이트 전 구간에서 EasyPPO만 세 과제 모두 붕괴 없이 안정적이었고, 나머지 방법은 최소 한 과제에서 성능 붕괴를 겪었다. 최고 검증 점수 기준 PPO 대비 상대 개선은 FrontierCS 14.89%, AIME24 2.28%, Search-R1 9.47%이며, 0~100 스케일 절대 개선은 각각 1.92, 1.46, 3.74점이다. 각 과제 2위 방법 대비로는 0.91, 1.46, 0.89점 앞선다.
FrontierCS에서 시드를 바꿔 3회씩 돌린 비교에서 EasyPPO는 한 번도 붕괴하지 않았지만, 가장 강한 베이스라인인 actor-only 필터링 PPO는 3회 중 2회 붕괴했다. 노이즈 정규화 ablation에서는 정규화가 없을 때 미니배치 1개 구성은 회복 가능한 하락에 그쳤지만 같은 롤아웃 배치를 4개로 쪼개면 지속적 붕괴로 이어졌고, 정규화가 있으면 두 구성 모두 학습·검증 점수를 유지했다. critic gradient norm과 explained variance 진단에서도 EasyPPO는 워밍업 이후 gradient norm이 줄고 EV가 완만하게 상승한 반면 베이스라인은 EV가 크게 요동쳤다.
실무적으로 이 논문은 PPO 계열 RLVR 파이프라인에서 overlong 필터링을 액터와 critic 중 어디에 적용하는지, critic 손실을 프롬프트별 리턴 분산으로 가중하는지, critic 미니배치를 몇 개로 쪼개는지를 점검하라는 신호다. 특히 연속 보상이나 보상 스케일이 프롬프트마다 크게 다른 과제에서 critic gradient가 특정 프롬프트에 쏠리는지 확인할 가치가 있다. 다만 저자들이 밝힌 전제와 한계도 분명하다. 노이즈 가중치를 critic 학습에 쓰는 같은 롤아웃 그룹에서 추정하므로 편향이 들어갈 수 있고, 저자들은 이를 실전에서 잘 동작한다고만 말하며 오프라인 프로파일링 같은 대안은 future work로 남긴다. 미니배치 크기를 바꿀 때 학습률 조정이 필요하다는 점, 시드 반복 실험은 학습 비용 때문에 FrontierCS의 두 방법에만 국한했다는 점, 본 실험은 방법·과제당 1회 실행이라는 점도 함께 읽어야 한다.