RL 재학습 없이 새 보상의 결과를 예측하는 정책 합성 프레임워크 PoEM
PoEM: Predicting RL Outcomes from Existing Policies
무엇인가
파운데이션 모델의 후학습은 인간 정렬, 정답성, 지시 수행 같은 특정 보상을 최대화하기 위해 강화학습(RL)으로 이루어진다. 문제는 이 과정이 계산 집약적이고 때때로 불안정하며, 보상 모델이 바뀌거나 여러 보상을 결합하고 싶을 때마다 처음부터 다시 돌려야 한다는 점이다. 이 논문은 여기서 출발해 "새로운 보상 함수가 주어졌을 때, 실제로 RL을 돌리지 않고 그 결과를 예측할 수 있는가"라고 묻고, 이미 다른 보상들로 후학습된 모델 집합을 이용해 답하겠다고 주장한다.
어떻게 동작하나
제안 방법 PoEM(Product of Experts Mixing)의 이론적 출발은 단순하다. 새 보상이 기존 보상들의 선형 결합으로 쓸 수 있으면, KL 정규화 RL 목적함수의 닫힌 형태 해 때문에 새 정책은 로그 공간에서 기존 로그 정책들의 선형 결합이 된다. 즉 π*_tar ∝ π_ref^(1-Σα) × Π π_k^α_k 형태의 전문가 곱(product of experts)이 된다. 자기회귀 언어모델에서는 이 합성을 전체 시퀀스가 아니라 각 접두사(prefix)마다 토큰 단위 로그비 log π_k - log π_ref 에 적용해 다음 토큰 로짓만으로 디코딩한다. 확산 모델에서는 조건부 기대값(denoiser) 수준에서 같은 합성이 성립하는데, 기존 denoiser들의 선형 결합에 σ²(t)∇log Z(x_t) 보정항이 붙는다. 저자들은 이 보정항이 σ(t)→0에서 사라지고, 기저 정책들이 공분산을 공유하는 가우시안일 때 정확히 0이 된다는 점을 밝히면서, 보정항을 버리고 선형 결합하는 것이 근사이지만 RL 학습을 건너뛸 수 있게 해준다고 설명한다.
무엇과 다른가
가중치 α는 사용자가 직접 줄 수도 있지만, 논문의 주된 설정은 새 보상 함수만 주어진 경우다. 작은 캘리브레이션 프롬프트 집합에서 응답들을 샘플링하고, 프롬프트별 평균을 빼서 센터링한 뒤 릿지 회귀로 계수를 추정한다. 기저 보상에 접근할 수 있으면 보상 공간 회귀(새 보상을 기저 보상들로 근사)를, 보상이 없고 정책만 있으면 정책 로그비를 특징으로 쓰는 정책 공간 회귀를 쓴다. 후자는 DPO에서처럼 학습된 정책의 로그비 자체가 암묵적 보상이라는 항등식에 기반한다. 또한 디코딩 시 합성 강도 γ를 곱하는데, GRPO나 DPO가 보상의 스케일을 버리기 때문에 γ=1에서는 합성된 로그비의 크기가 목표 정책보다 작아진다. 이를 보정하기 위해 전문가 로그비의 그램 행렬로 계산하는 γ_geom을 제안한다.
어떻게 쓰나
논문에서 가장 눈에 띄는 실험적 관찰은 정책 공간의 랭크 격차다. Qwen3-0.6B에 서로 다른 20개의 프로그램적 보상으로 학습한 어댑터들을 보면, 가중치 업데이트 Δθ는 사실상 완전 랭크(유효 랭크 19.4/20)이고 어댑터 간 중앙값 코사인 유사도가 0.02로 거의 직교한다. 그런데 기준 모델 대비 로그비 행렬 Φ̃를 센터링하면 유효 랭크가 20 중 6.3으로 3배나 작아진다. 파라미터 공간에서는 20개의 서로 다른 일을 하고 있지만 로그 우도 공간에서는 그렇지 않다는 것이다. 저자들은 이를 근거로 보상의 선형성이라는 강한 가정을 로그 정책의 기하학적 가정으로 대체한다. 그리고 이 부분공간에 목표 정책이 얼마나 들어오는지를 사전에 측정하는 커버리지 점수(목표 보상을 정책 로그비 특징으로 회귀했을 때의 R²)를 제시한다.
전제와 한계
실험은 언어와 이미지 두 모달리티에 걸쳐 있다. 언어 쪽 기저는 20개의 프로그램적 보상(어휘 다양성, 격식성, 가독성 등)으로 학습한 Qwen3-0.6B rank-64 LoRA 어댑터로, GRPO로 온폴리시 학습한 P-GRPO와 DPO로 오프라인 학습한 P-DPO가 있다. 여기에 PPO로 학습한 보상 모델 기저 세 개(RewardBench 상위 4개 RM을 쓴 RM-RB, ArmoRM의 helpfulness/harmlessness 헤드를 쓴 RM-HH, 서로 다른 기관의 공개 RM 10개를 쓴 RM-Div)가 더해진다. 이미지 쪽은 Stable Diffusion v1.4에 DDPO로 학습한 13개 LoRA 전문가(이미지 통계 10개 + aesthetic/PickScore/CLIP 3개)다. 모든 학습과 평가는 UltraChat 프롬프트에서 이루어지고, RM-HH와 RM-Div는 절반가량이 PKU-SafeRLHF의 유해 요청이다.
결과를 보면, γ를 적용한 뒤 PoEM의 보상 회복률은 0.83~1.00까지 올라간다. 참고로 시드를 바꾼 두 번째 RL 실행 자체의 회복 오차가 0.12~0.17인데, PoEM은 프로그램적 기저에서 0.19~0.28로 두 번째 RL 실행과 비슷한 수준이다. P-GRPO와 RM 기저에서 PoEM은 모든 결합 보상에 대해 기준 모델보다 목표 정책 π_tar에 가까웠고, RM 결합 보상에서는 최고 단일 전문가보다도 가까웠다. best-of-N은 비슷한 보상에 도달하지만 디코딩 시점에 목표 보상을 질의해야 하고 프롬프트당 16개 응답이 필요하다. 오프라인으로 학습된 P-DPO만 예외로, γ_geom에서 보상은 맞추지만 정책 거리는 맞추지 못한다. 홀드아웃 보상 실험에서는 커버리지 점수가 보상 오차 순위를 잘 매겼고(ρ = -0.71~-0.81), 커버된 보상은 RL 이득의 0.55~0.69를 회복한 반면 그렇지 않은 보상은 0.22~0.43에 그쳤다. γ를 0.5에서 2로 키우면 커버된 예측의 중앙값 회복률은 0.18에서 0.64로 오르지만, 커버되지 않은 예측은 0.26에 머물고 오히려 멀어진다. RM-Div에서는 홀드아웃 전문가 10개 중 9개에서 최고 단일 전문가보다 목표에 가까웠고, 8개에서 더 많은 보상을 회복했다(0.56 대 0.44). 이미지 확산 모델에서도 남은 전문가들을 합성해 홀드아웃 전문가의 변화(더 진한 채도, 미세한 질감, 흐린 배경 위 중앙 피사체)를 재현했는데, 언어 모델과 달리 가중치를 디노이징 스텝마다 따로 적합시킨다.
개발자 입장에서 이 논문이 유용한 지점은 명확하다. 비싼 보상 모델이나 LLM 심사자, 사람 평가자에 대한 RL을 돌리기 전에, 값싼 보상으로 학습해 둔 어댑터 조합으로 결과를 미리 확인할 수 있다. RM-Div가 이 시나리오를 소규모로 보여주는데, 값싼 보상으로 학습한 전문가들로 홀드아웃된 7~8B 보상 모델을 예측한다. 다만 실무에 적용하려면 두 가지를 반드시 확인해야 한다. 첫째, 커버리지 점수가 높은지다. 커버리지가 낮으면 γ를 어떻게 잡아도 목표 방향을 표현할 수 없다. 둘째, 기저를 어떻게 구성할지다. 커버리지가 가장 낮은 보상을 다음 전문가의 목표로 삼는 식으로 기저를 키워나갈 수 있다. 또한 추론 시 k개의 전문가를 동시에 로드해야 하는 비용이 있으므로, PoEM을 단일 모델로 증류하거나 PoEM에서 출발해 RL을 돌려 빠진 방향만 더하는 방법이 후속 과제로 제안된다.
저자들이 명시한 한계도 분명하다. 방법의 도달 범위는 선택한 기저의 정책 공간 스팬에 의해 근본적으로 제한되며, 목표 방향이 그 밖에 있으면 프로브 집합 크기나 회귀 강도를 키워도 회복되지 않는다. 정확한 합성은 각 전문가가 공유된 기준 모델과 β를 가진 KL 정규화 최적해라고 가정하는데, 실제로는 많은 후학습 실행이 KL 항을 손실에 포함하지 않는다. 보상 평가 비용이 싸질수록 기준 모델에서의 best-of-N이 경쟁력을 갖기 때문에, 이 방법은 보상 평가가 비싸거나 기저가 클 때 가장 설득력이 있다. 긴 문맥 생성은 테스트하지 않았고, 한 기준 모델에서 적합한 가중치가 다른 기준 모델로 전이되는지도 확인하지 않았다.
관련 논문
- UECR-GRPO는 GRPO와 온폴리시 증류를 엔트로피보정 크레딧배분으로 통합한다검증기 보상과 교사 모델 신호를 하나의 GRPO 업데이트 안에서 응답·토큰 수준으로 결합한 UECR-GRPO를 제안한다. 교사 엔트로피로 불확실한 지도를 감쇠하고 응답별 제로섬 투영으로 총 과제 크레딧을 보존한다.
- RLVR 데이터 정책 13종을 같은 GRPO 레시피에서 재검증한 결과, 균일 샘플링을 이기는 재현 가능한 개선은 없었다검증 가능한 보상 기반 강화학습(RLVR)의 데이터 정책을 동일한 GRPO 조건에서 비교하는 평가 플랫폼 DataFlex-RL이 공개됐다. 12개 시드와 12개 벤치마크 실험에서 어떤 롤아웃 선택·재가중 기법도 균등 샘플링을 안정적으로 앞서지 못했다.