ReSPO가 오프폴리시 학습의 부호별 경사 기아를 두 갈래 커널로 해소한다

ReSPO: Reshaped Sequence Policy Optimization for Gradient Starvation in Off-Policy Learning

HF Daily2609.35433

Yihang Chen, Yuanhao Ban, Cho-Jui Hsieh2026-09-28

무엇인가

이 논문은 검증 가능한 보상 기반 강화학습(RLVR)에서 롤아웃을 여러 정책 업데이트에 걸쳐 재사용할 때 생기는 오프폴리시 드리프트를 다룬다. GRPO는 토큰 단위 중요도 비율을, GSPO는 길이 정규화 시퀀스 비율을 클리핑하는데, 저자들은 이 클리핑이 부호에 따라 학습 신호를 서로 반대로 굶기는 현상을 규정한다. 양성 어드밴티지(A>0) 응답에서는 현재 정책이 생성할 확률이 낮아진 저중요도 꼬리(W→0)의 응답이 사실상 0에 가까운 가중치를 받아 회복 신호가 사라지고, 음성 어드밴티지(A<0) 응답에서는 과도하게 재생성된 고중요도 꼬리(W→∞)가 클리핑되지 않고 남아 다른 토큰의 경사 기여를 압도한다. 저자들은 이를 부호 의존적 경사 기아(gradient starvation)라고 부른다.

어떻게 동작하나

해법의 출발점은 중요도 가중치 재형성을 측도 변환으로 해석하는 것이다. 원시 시퀀스 비율 W=πθ(o|q)/πold(o|q)에 재형성 커널 φ를 적용하면 μ(o)φ(W(o))라는 비정규화 측도 τ가 정의된다. 저자는 Bregman 발산 기반의 이중 근접 목적식 (1−β)Df(τ‖μ)+βDf(τ‖π)를 최소화하는데, 생성자를 α-발산(f(x)=x^α/(α(α−1)))으로 잡으면 파워 평균 보간 커널 φ0(W)=[(1−β)+βW^(α−1)]^(1/(α−1))이 나온다. 여기에 분산 제어를 위해 두 개의 모멘트 제약을 건 KL 투영을 적용하면 지수 틸트가 붙어 최종 커널 φ(W)=φ0(W)·exp(λ(1−φ0(W)))가 된다. α-발산이 꼬리 모양을, KL 투영이 하드 경계 대신 매끄러운 승수 틸트를 담당하는 구조다.

무엇과 다른가

핵심은 어느 하나의 α로는 양성·음성 요구를 동시에 만족할 수 없다는 관찰이다. α>1이면 φ(0)>0, φ(∞)=0이라 양성 분기에 맞고, α=1 경계에서는 φ(0)=φ(∞)=0이라 음성 분기에 정확히 맞는다. 그래서 ReSPO는 어드밴티지 부호에 따라 분기를 나눈다. 양성 분기는 α(+)=2, β(+)=0.5, λ(+)=2로 φ(+)(W)=((1+W)/2)·exp(1−W)가 되어 W=0에서 최대값 e/2≈1.36을 갖고 W>0에서 단조 감소한다. 음성 분기는 α(−)=1, β(−)=0.5, λ(−)=2로 φ(−)(W)=√W·exp(2(1−√W))이며 W*=1/4에서 e/2로 최대치를 찍고 양쪽 꼬리에서 0으로 사라진다. 두 분기는 W=1에서 값과 기울기가 일치하며, 온폴리시 업데이트(W=1)에서는 둘 다 단위 가중치로 환원된다. 커널은 stop-gradient가 걸린 REINFORCE형 계수로 쓰이고, GSPO식 길이 정규화 대신 비정규화 W에 적용된다. 변분 유도가 시퀀스 분포 위에서 이뤄지므로 길이 정규화가 기하 구조를 왜곡한다는 것이 저자들의 설명이다.

어떻게 쓰나

실험은 dense 모델 Qwen3-1.7B-Base와 MoE 모델 Qwen3-30B-A3B-Base에서 DAPO-MATH-17k로 수행했다. verl과 비동기 vLLM 롤아웃, 미니배치 32, 프롬프트당 G=8, GRPO 어드밴티지 추정기, 학습률 1e-6, KL 페널티 없음, 1024 정책 업데이트(32,768 프롬프트)로 고정했다. 롤아웃 재사용 비율 N∈{8,16,32}을 바꿔 오프폴리시 드리프트를 키우며, N이 커질수록 같은 πold를 더 많은 업데이트에 재사용한다. 평가는 AIME 2025, AIME 2024, AMC 2023, OlympiadBench, MinervaMath, MATH-500 전체 테스트 분할로 했고, 베이스라인은 GRPO, GSPO, VESPO(공개된 최고 성능 부호별 설정)다.

전제와 한계

결과에서 ReSPO는 6개 설정 중 5개에서 가장 높은 초기 피크를 기록했고, 마지막 128 업데이트 평균은 6개 설정 모두에서 최고 클리핑 베이스라인을 4.2~8.4 pp 앞섰다. N=32에서는 1.7B에서 7.9 pp, 30B에서 8.4 pp 차이다. 평가 성능은 N=16, 32의 네 개 모델-N 조합 모두에서 최고 관측 평균을 냈으며, 1.7B에서 0.8·1.3 pp, 30B에서 3.2·1.9 pp씩 최고 베이스라인을 넘었다. 모든 모델-N 설정에서 AIME25와 AMC23 최고값을 기록했고, 30B에서 AIME25·AIME24·AMC23 평균 기준 N=8·16·32에 대해 각각 6.3·5.8·3.4 pp 차이를 냈다. 응답 길이 구간 분석에서는 30개 구간 중 24개에서 최고 정확도를 보였고, N=32에서는 Q1~Q7 구간에서 최고 베이스라인을 8.4·16.0·24.4·21.6·20.8·15.1·8.5 pp 앞섰다.

시드 견고성 실험에서 N=32, 1.7B의 3회 실행 마지막 128 평균은 27.07%(표준편차 0.54 pp)로 VESPO 23.00%, GRPO 19.70%, GSPO 18.41%를 앞섰다. 30B는 57.92%(0.95 pp)로 VESPO 52.30%, GRPO 50.40%, GSPO 49.28%를 넘었다. 최종 체크포인트의 AIME25·24·AMC23 평균은 41.94%(0.47 pp)로 VESPO 38.77%, GRPO 38.43%, GSPO 34.70%보다 높았다. MoE 라우팅 재사용 기법인 Routing Replay와는 직교하며, 30B N=16 비교에서 R3를 추가하면 마지막 128 스텝 평균 페널티 학습 정확도가 56.32%에서 58.16%로 올랐다.

실무 관점에서 이 논문이 주는 시사점은 롤아웃 재사용을 늘려 처리량을 뽑는 RLVR 파이프라인에서 클리핑 임계값만 조정하는 것으로는 꼬리 구간의 경사 배분을 고칠 수 없다는 점이다. 특히 긴 추론 궤적은 토큰 단위 드리프트가 누적되어 log W가 작아지기 쉬우므로 저-W 양성 응답이 조기에 죽는다. ReSPO는 이 구간에 0이 아닌 가중치를 남기면서 고-W 음성 응답을 눌러, N이 큰 설정에서 이득이 커지는 경향을 보인다. 다만 커널 하이퍼파라미터(α, β, λ)가 부호별로 따로 존재하고, 저자들은 β=0.5와 λ=2를 국소 모양 일치 조건으로 고정했을 뿐 광범위한 탐색을 수행하지 않았다.

한계로 저자들은 컴퓨트 예산과 하이퍼파라미터 탐색 범위를 부록 F에서 논의한다고 밝히고 있다. 또한 GSPO의 길이 정규화 W^(1/|o|)가 응답 길이에 의존하는 편향을 유도한다는 점을 지적하며 ReSPO는 비정규화 W를 쓰는데, 이 선택이 매우 긴 응답에서 어떤 수치적 거동을 보이는지는 본문 수치로 제시되지 않았다.