UECR-GRPO는 GRPO와 온폴리시 증류를 엔트로피보정 크레딧배분으로 통합한다
When and Where to Trust the Teacher: Unifying On-Policy Distillation and GRPO through Entropy-Calibrated Credit Assignment
무엇인가
검증 가능한 보상 기반 강화학습(RLVR)은 수학 추론을 최종 정답의 정오로만 감독한다. GRPO는 별도 가치 모델 없이 같은 문제에 대한 여러 응답을 비교해 이점을 만들지만, 그 이점은 응답 하나에 스칼라 하나로 계산되어 모든 토큰에 그대로 복사된다. 결정적인 대수적 한 단계, 무해한 문체 토큰, 첫 번째 국소 오류가 모두 같은 이점을 받는다는 뜻이다. 더 나쁜 경우도 있다. 한 그룹 안의 응답들이 모두 같은 이진 보상을 받으면 그룹 상대 신호 자체가 0이 되어 업데이트가 사라진다. 반대로 온폴리시 증류(OPD)는 학생이 실제로 방문한 상태에서 교사가 토큰별 밀도 있는 피드백을 주지만, 교사의 선호가 정답성을 뜻하지는 않는다. 논문은 이 둘의 역할을 분리해 이해하는 것에서 출발한다. Figure 1에 따르면 교사 점수는 검증기가 구분하지 못하는 그룹의 84.3~98.4%를 구분해 주지만, 교사가 만든 순서는 정답-오답 응답 쌍의 39.1~50.8%에서 검증기 정오와 충돌한다. 검증기가 동점을 준 347개 쌍 중 교사 선호가 블라인드 처리된 Opus 4.8의 과정 품질 판정과 일치한 비율은 56.8%에 그쳤다. 교사는 해상도를 더해 주는 정책 상대적 신호일 뿐, 정답성의 대체물도 과정 품질 라벨도 아니라는 결론이다.
어떻게 동작하나
기존 하이브리드는 교사 신호를 어디에 끼워 넣는지에서 갈린다. Distilled RL은 정규화된 GRPO 이점에 교사 대 학생 토큰 비율을 곱하는데, 검증 보상이 동일해 GRPO 이점이 0이면 재가중된 업데이트도 0으로 남는다. ATOD는 이미 정규화된 GRPO 이점에 어닐링된 턴 가중 토큰 수준 OPD 이점을 더하므로 동점 그룹에서도 교사 신호가 살아 있지만, 교사 증거가 그룹 정규화 이후에 들어가 응답 순위와 그룹 통계를 바꾸지 못하고, 토큰 가중치가 응답 평균 업데이트 크기를 보존하도록 제약되지도 않는다. 논문은 이 두 지점, 즉 그룹 상대 비교에 교사 증거를 언제 넣을 것인가와 응답 수준 스케일을 건드리지 않고 과제 크레딧을 어디에 배치할 것인가를 정면으로 다룬다.
무엇과 다른가
1층은 경로 효용 통합(PUU)이다. 자기회귀 분해에서 교사 대 앵커 토큰 로그비의 합은 정확히 경로 로그밀도비가 된다(식 3). 저자들은 이 값을 암묵적 교사 보상으로 보고 검증기 효용과 함께 하나의 KL 정규화 목적함수 J(Q) = E_Q[R_task + α log(P_T/P_0)] − β KL(Q||P_0)로 묶는다. 깁스 최적해는 Q* ∝ exp(R_task/β) · P_T^{α/β} · P_0^{1−α/β}이며, α=0이면 보상 정규화 RL, R_task=0이고 α=β면 교사 분포, R_task=0이고 α>β면 교사-앵커 방향으로 교사를 넘어서는 외삽이 된다. 실제 온폴리시 구현에서는 앵커를 현재 행동 정책으로 두고, 길이로 정규화한 교사 점수 R_i^T = (Σ_t m_{i,t} δ_{i,t}) / (Σ_t m_{i,t})를 검증 보상에 더해 R_i^U = R_i^task + α R_i^T를 만든 뒤, 이 통합 효용으로 그룹 정규화와 PPO 클리핑을 수행한다. 핵심은 교사 증거가 그룹 평균과 표준편차를 계산하기 전에 들어가 응답 순위 자체를 바꿀 수 있다는 점이다. 이점은 A_i^U = A_i^{task|U} + α A_i^{T|U}로 정확히 분해되는데, 두 성분이 같은 분모 σ_U를 공유해 계수 α의 유효값이 그룹마다 흔들리지 않는다.
어떻게 쓰나
2층은 엔트로피 보정 재분배(ECR)다. PUU는 여전히 응답 하나에 스칼라 하나를 모든 토큰에 복사하므로, ECR은 검증기 유래 성분의 배치만 손본다. 먼저 부호 있는 교사-구정책 격차 δ에 응답 이점의 부호 s_i를 곱해 방향 d_{i,t} = tanh(s_i δ_{i,t} / 2τ_δ)를 만들고, 교사의 전체 어휘 엔트로피 H^T로 신뢰도 c_{i,t} = exp(−H^T_{i,t}/τ_H)를 계산한다. 엔트로피가 높은, 즉 다음 토큰 분포가 평평한 지점에서는 교사 지도가 약해진다. 다음으로 신뢰도 가중 응답 평균 μ_i^c를 빼서 q_{i,t} = ½ m_{i,t} c_{i,t} (d_{i,t} − μ_i^c)를 만들고 w_{i,t} = 1 + ρ q_{i,t} (0 ≤ ρ < 1)로 토큰 가중치를 준다. Σ q = 0이므로 유효 토큰에서 w의 산술평균은 정확히 1이고, |q| ≤ 1과 ρ < 1 덕분에 모든 가중치가 양수로 유지된다. 즉 응답별 과제 크레딧 총량과 토큰별 부호를 보존한 채 재분배만 한다. 최종 이점은 A^{final}_{i,t} = A_i^U + ρ A_i^{task|U} q_{i,t} = A_i^{task|U}(1 + ρ q_{i,t}) + α A_i^{T|U}이고, ρ=0이면 정확히 PUU로 환원된다. 실패한 응답에서도 교사가 선호한 토큰은 더 적은 음의 과제 크레딧을 받되 양의 모방 대상이 되지는 않는다.
전제와 한계
실험은 두 규모에서 이뤄진다. 1.7B 설정은 Qwen3-1.7B-Base를 DeepMath-103K의 난이도 5~7 문제로 515스텝 학습하고 Qwen3-4B-GRPO를 고정 교사로 쓴다. 4B 설정은 Qwen3-4B 학생에 Qwen3-8B-Math-GRPO 교사를 붙여 난이도 6~8 부분집합으로 160스텝 학습한다. 두 설정 모두 프롬프트당 G=8, 전역 프롬프트 배치 126, 롤아웃 온도 0.7, 교사·구정책 점수는 온도 1이다. 평가는 AIME 2024, AIME 2025, AMC 2023, HMMT 2025년 2월과 11월의 다섯 벤치마크에서 12샘플 고정 디코딩의 Avg@12 정확도다. 베이스라인은 Vanilla GRPO, Vanilla PG-OPD, 독립적으로 클리핑한 GRPO와 PG-OPD 손실의 단순 합, Distilled RL, ATOD의 단일 응답 적응판이다. 결과는 1.7B에서 평균 17.21%로 ATOD-aligned를 0.89%p 앞섰고, AIME24·AIME25·AMC23·HMMT25-Feb에서 최강 베이스라인을 각각 0.52, 0.28, 1.83, 0.28%p 초과했다. 다만 HMMT25-Nov에서는 Vanilla GRPO가 0.84%p 앞선다. 4B에서는 평균 65.09%로 Distilled RL을 0.56%p 앞섰지만, AIME24와 HMMT25-Feb에서만 각각 0.28, 0.18%p 앞서고 AIME25·AMC23·HMMT25-Nov에서는 최고 베이스라인에 0.56, 0.14, 0.56%p 뒤진다. 저자들 스스로 평균 이득이 모든 벤치마크의 균일한 개선을 뜻하지 않는다고 명시한다.
절제 실험은 1.7B 학생과 Qwen3-4B-GRPO 교사, α=1.0에서 궤적 구성과 토큰 재분배를 분리한다. ECR을 끄고 비교하면 과제 보상만 쓰는 변형, 과제와 교사 이점을 독립 정규화하는 변형, 통합 효용을 정규화하는 PUU가 갈린다. 오프라인 진단에서 검증 보상이 동점인 의사 그룹이 40~53%인 반면, 통합 효용은 전체 그룹의 56~90%에서 의미 있는 변동을 유지했다. 혼합 그룹에서 교사 성분은 절대 성분 크기 합의 17~25%를 차지해, 교사 항이 과제 성분을 압도하지 않으면서 응답 수준 해상도를 더한다. α 민감도 점검에서는 α=1에서 AMC 2023 혼합 그룹 451개, 응답 쌍 22,811개에 대해 정답-오답 순서 역전이 관찰되지 않았는데, 저자들은 이를 홀드아웃 롤아웃에 대한 경험적 관찰일 뿐 보장도 재학습 기반 민감도 결과도 아니라고 못 박는다. ECR 쪽은 혼합 검증 그룹의 실패 응답에 대해 블라인드 Opus 4.8 라벨로 유효/오류 단계를 표시했을 때, Full ECR이 오류-유효 과제 가중치 격차 양수를 보였고 응답 내 엔트로피 위치를 섞은 100개 대조군을 모두 앞섰다. 이는 의도한 국소화 동작을 보인 것이지 정확도 향상의 인과적 증거는 아니다.
실무 관점에서 이 논문이 주는 시사점은 세 가지다. 첫째, 검증기 보상이 포화된, 즉 그룹 내 정답률이 0이나 1로 고정된 배치에서 GRPO 업데이트가 통째로 사라지는 문제를 겪고 있다면, 교사 신호를 그룹 정규화 이전에 넣는 PUU 방식이 직접적인 대안이 된다. 둘째, 교사 모델을 이미 굴리고 있지만 교사 선호가 정답과 자주 어긋나서 도입을 망설였다면, 교사를 과제 정의 신호가 아니라 순위 해상도와 토큰 배치에만 쓰는 이 분리 설계가 참고가 된다. 셋째, 토큰 가중치를 도입할 때 응답별 크레딧 총량이 변하면 학습이 불안정해지는데, Σ q = 0인 제로섬 투영과 ρ < 1 제약은 구현하기 쉬운 안전장치다. 다만 교사 전체 어휘 엔트로피를 매 토큰 계산해야 하므로 교사 forward 비용과 메모리를 미리 가늠해야 하고, α·ρ·τ_δ·τ_H 같은 하이퍼파라미터가 새로 늘어난다는 점도 감안해야 한다.
저자가 명시한 전제와 한계도 분명하다. 교사 증거는 정책 상대적 신호이며 최종 정답성의 대체물이 아니고, 그 자체로 신뢰할 만한 과정 품질 라벨도 아니다. 이론적으로 정확한 경로 로그밀도비는 가변 길이 응답에서 길이 정규화 대리값으로 바뀌므로 더 이상 정확한 경로 비율이 아니다. α 민감도 결과는 홀드아웃 롤아웃에 대한 경험적 관찰이고, ECR의 오프라인 진단은 국소화 동작을 확인한 것이지 정확도 향상의 인과적 증거가 아니다. 성능도 균일하지 않아 4B 설정에서는 세 벤치마크에서 최고 베이스라인에 뒤진다. 실험 범위 자체가 Qwen3 1.7B·4B 학생과 수학 추론 다섯 벤치마크로 한정되며, 다른 도메인이나 모델 계열로의 일반화는 원문에서 검증되지 않았다.
관련 논문
- RL 재학습 없이 새 보상의 결과를 예측하는 정책 합성 프레임워크 PoEM기존 단일 보상으로 학습된 어댑터들의 로그 정책을 선형 결합해, 새 보상에 대한 RL 결과를 추가 학습 없이 예측하는 PoEM을 제안한다. 커버리지 점수로 어떤 보상을 예측할 수 있는지 미리 가려낸다.
- SAGE는 장기 추론의 두 편향을 위상 구조로 완화하는 강화학습 프레임워크다.LLM의 장기 추론 실패를 탐색 편향과 누적 편향으로 진단하고, 대수적 희소화와 쌍곡 공간 유도로 이를 완화하는 SAGE를 제안한다. 12개 벤치마크에서 평균 정확도를 크게 올리고 Andrews-Curtis 문제에서 최대 8배 개선을 보고한다.
- 교사 감독을 스스로 은퇴시키는 에이전트 강화학습 온폴리시 증류멀티턴 에이전트 RL에서 궤적당 스칼라 보상 하나만 주어지는 희소 보상 문제를 자기 교사 증류로 메우려는 시도가 왜 흔들리는지 분석하고, 교사 감독을 스스로 거두는 방법을 제안한다. 특권 정보가 곧 신뢰성을 뜻하지 않으며 감독 이득이 학습 단계에 좌우된다는 관찰이 출발점이다.
- EOS 토큰 불일치가 온폴리시 증류의 응답 길이 팽창을 만든다온폴리시 증류에서 학생 모델 응답이 지나치게 길어지는 길이 팽창 현상이 보고됐다. Qwen3·Llama·Gemma에서 기반 학생과 사후 학습 교사가 서로 다른 EOS 토큰에 정지 확률을 두는 불일치가 원인으로 지목됐다.
- 3비트 미만 추론 붕괴 원인은 배포 경로 온폴리시 증류가 다루는 노출 편향이다3비트 이하 양자화에서 수학·코드 추론이 무너지는 원인을 양자화가 증폭시킨 노출 편향으로 진단하고, 양자화 모델이 스스로 생성하는 경로 위에서 증류하는 온폴리시 기법을 제안한다. 짧은 QA는 회복되지만 긴 생성이 반복 루프에 빠지는 문제를 겨냥한다.