스코어 센터링은 학습·추론 불일치 드리프트를 상쇄해 LLM 강화학습을 안정화한다

Score Centering Stabilizes Off-policy Reinforcement Learning

arXiv2609.20807v1

Martin Marek2026-09-17조회 5

무엇인가

대규모 언어모델의 강화학습(RL)은 학습 엔진과 추론 엔진 사이의 아주 작은 수치 차이, 이른바 학습-추론 불일치(TIM)에 극도로 민감하다. 두 엔진을 완전히 일치시키는 것은 롤아웃 효율을 크게 희생해야 해서 현실적이지 않다. 이 논문은 그 민감성의 원인이 단순한 잡음이 아니라 드리프트, 즉 학습 엔진과 추론 엔진 사이에 매 스텝 누적되는 지속적 편향이라고 주장한다. 저자들은 정책 그래디언트 갱신을 드리프트 항과 신호 항으로 분해해 이 주장을 뒷받침한다.

어떻게 동작하나

구체적으로 어떤 토큰 y_t의 기대 갱신은 E_q[R s_yt] = E_q[R] 곱하기 s_bar 더하기 Cov_q(R, s_yt) 로 쪼개진다. 여기서 s_bar = 시그마_v q_v s_v 는 샘플러 분포 아래의 기대 점수다. 앞 항이 드리프트인데, 이는 보상의 평균만 보고 어떤 토큰이 성공을 이끌었는지는 전혀 반영하지 않는다. 기대 점수 s_bar는 샘플러를 교사로 둔 교차엔트로피(SFT) 손실의 음의 그래디언트이므로, 드리프트는 곧 트레이너를 샘플러 쪽으로 증류하는 힘이다. 문제는 샘플러가 고정된 교사가 아니라 양자화되거나 낡은 트레이너의 편향된 복사본이고, 매 스텝 트레이너 가중치가 다시 샘플러로 동기화된다는 점이다. 그래서 오차가 수렴하지 않고 피드백 루프로 증폭된다. 저자들은 이 구조가 왜 오프라인 증류는 안정적인데 온라인 RL은 작은 수치 차이에도 붕괴하는지를 설명한다고 본다. 중요한 것은 불일치의 크기가 아니라 교사가 고정되어 있는지 학생을 따라 움직이는지다.

무엇과 다른가

저자들은 그룹 센터링(GRPO식 어드밴티지 정규화)이 이 드리프트를 없애지 못한다는 점도 짚는다. 그룹 센터링은 한 프롬프트의 롤아웃들에 대해 어드밴티지 합을 0으로 만들 뿐, 개별 프리픽스에서의 기대 어드밴티지는 0이 아니다. 정답으로 이어질 프리픽스는 양수, 이미 실수를 포함한 프리픽스는 음수다. 즉 학습 신호가 살아 있는 바로 그 지점에서 드리프트가 남는다. 제안 방법인 스코어 센터링은 각 점수에서 샘플러 기준 기대 점수를 빼는 것만으로 이를 정확히 상쇄한다. 즉 s_tilde = s - s_bar 로 바꾸면 기대 갱신은 Cov_q(R, s_yt)만 남고, 이는 온폴리시 갱신과 공분산을 재는 분포만 다르다. TIM이 없어 p와 q가 같으면 보정항이 정확히 0이라 아무 일도 하지 않는다. 중요도 샘플링(IS)도 드리프트를 정확히 상쇄하지만, 확률 비율이라는 곱셈적이고 확률적인 보정을 쓰기 때문에 그래디언트 분산이 커지고, 실무에서는 비율을 클리핑하거나 마스킹하면서 드리프트가 다시 들어온다. 스코어 센터링은 프리픽스가 주어지면 결정적인 가산 보정이라 하이퍼파라미터가 없고, IS와 독립적인 방식으로 TIM을 교정하므로 두 방법을 겹쳐 쓸 수 있다.

어떻게 쓰나

구현에서는 샘플러의 전체 다음 토큰 분포를 저장하는 것이 너무 비싸서 상위 k개(k=128) 로그확률만 기록하고, 꼬리 분포는 트레이너 분포를 샘플러의 꼬리 질량에 맞춰 재조정해 근사한다. 손실은 L = -R(log p_yt - 시그마_{v in H} sg[q_v - rho p_v] log p_v) 형태의 스칼라 손실로 쓸 수 있으며, rho는 샘플러와 트레이너의 꼬리 질량 비율, sg는 stop-gradient다. 실험에서는 k=128은 물론 k=32만 써도 완전한 스코어 센터링과 같은 성능이 나왔다.

전제와 한계

실험은 Qwen3-0.6B-Instruct를 Countdown에, Qwen3-30B-A3B-Base를 INTELLECT-2 수학 서브셋에 학습시켜 진행했다. 공정한 비교를 위해 모든 방법이 그룹 센터링 보상을 쓰는 REINFORCE 목적함수를 공유하고, 각 보정 기법만 그 위에 단독으로 얹었다. 먼저 샘플러 가중치에 인위적 가우시안 잡음을 더한 합성 TIM 실험에서 스코어 센터링, 절단 중요도 샘플링(TIS), 마스킹 중요도 샘플링(MIS)과 그 조합(MIS+SC, TIS+SC)이 가장 좋았다. 잡음이 가장 심한 조건에서는 스코어 센터링과 그 조합만이 안정적으로 학습했고, DPPO는 세 잡음 수준에서 각각 약 160, 80, 20 스텝에서 붕괴했으며 TIS는 가장 작은 잡음에서는 안정적이었지만 나머지 두 조건에서 약 180, 40 스텝에서 붕괴했다. 실제에 가까운 TIM으로 샘플러만 양자화(가중치, 활성값, KV 캐시)한 설정에서도 스코어 센터링 단독 및 TIS/MIS와의 조합이 최고 성능을 냈다. 반면 추론 엔진을 64스텝마다만 갱신하는 심한 스테일니스 설정에서는 스코어 센터링 단독보다 TIS/MIS와 조합한 쪽이 더 좋았다. 저자들은 그 이유를 스코어 센터링이 트레이너가 아니라 샘플러 분포에서 공분산을 재기 때문이라고 설명하며, 트레이너가 동기화 사이에 멀리 움직일 수 있는 상황에서는 IS 보정과 조합할 것을 권한다. PPO와 DAPO는 스테일니스는 견뎠지만 양자화와 가중치 잡음에서는 붕괴했는데, 이는 이들의 클리핑이 정책 이동에서 나오는 비율을 겨냥한 것이지 수치 오차를 겨냥한 것이 아니기 때문이라고 해석한다.

30B 스케일 검증에서는 Qwen3-30B-A3B-Base를 INTELLECT-2 수학 데이터로 학습시켰다. FP8 샘플러에서는 보정 없는 정책 그래디언트도 안정적으로 학습해 58% 학습 정확도에 도달했다. KV 캐시를 FP4로 양자화하면 정책 그래디언트는 200스텝 안에 붕괴하고 MIS는 학습 후반에 붕괴했지만, 스코어 센터링은 52%, TIS는 51%로 안정적으로 버텼다. INT8 샘플러에 INT4 KV 캐시를 쓴 가장 심한 조건에서는 스코어 센터링이 30%, TIS가 12%에 도달한 반면 나머지 모든 방법은 5% 미만에 그쳤다. 참고로 이 모델은 전문가 혼합(MoE) 구조라 샘플러와 트레이너가 전문가 라우팅에서도 어긋날 수 있는데, 저자들은 라우터 인덱스를 재생하지 않았다.

실무적으로 이 논문은 추론 엔진과 학습 엔진의 수치를 완벽히 맞추려는 대규모 엔지니어링(배치 불변 커널 등) 없이도, 또는 그와 별개로 학습 안정성을 확보하는 저비용 수단을 제시한다. 특히 샘플러를 FP8/INT8로, KV 캐시를 FP4/INT4로 낮춰 롤아웃 처리량을 끌어올리는 서빙 구성에서 스코어 센터링은 거의 유일하게 버티는 보정이었다. 도입 시 확인할 점은 세 가지다. 첫째, 샘플러의 상위 k개 로그확률을 로깅해야 하므로 추론 엔진이 top-k logprob을 노출하는지 확인해야 한다. 둘째, 스테일니스가 큰 비동기 파이프라인이라면 스코어 센터링 단독이 아니라 TIS나 MIS와 조합해야 한다. 셋째, TIM이 온폴리시에 가까울 정도로 작으면 보정항이 0에 가까워 이득이 없다는 점, 즉 이득은 불일치가 심할수록 커진다는 점을 감안해 적용 여부를 판단해야 한다.

저자들이 밝힌 한계는 명확하다. 스코어 센터링은 드리프트를 없애지만 남는 갱신은 트레이너가 아니라 샘플러 분포에서 측정한 보상-점수 공분산이며, 이 불일치는 심한 스테일니스에서 문제가 되어 IS와의 조합이 필요해진다. 또한 대표 실험 결과는 짧은 시퀀스에 의도적으로 심한 불일치를 준 설정에서 얻은 것으로, 더 온건한 불일치로 오래 학습하는 상황에 대한 대리 지표라는 점을 인정한다. 실제로 저자들은 몇 GPU 시간 안에 통계적으로 유의한 차이를 낼 만큼 심한 자연 발생 TIM 설정을 찾지 못했다고 밝히며, 온건한 TIM에서는 드리프트가 충분히 누적될 때까지 여러 방법의 성능이 겹쳐 구분이 어렵다고 설명한다. 아울러 스코어 센터링은 정확히 계산하려면 샘플러의 전체 다음 토큰 분포가 필요하다는 실용적 제약이 있고, 이를 top-k 근사로 우회한다.