SCAPO가 준반사실 안정성으로 GRPO 토큰 신용을 세분화한다
Semifactual Credit-Augmented Policy Optimization
무엇인가
검증 가능한 보상 기반 강화학습(RLVR)은 수학 추론 같은 과제에서 LLM 성능을 끌어올렸지만, 모델의 예측은 문제 풀이와 무관한 프롬프트 표면 특징에 여전히 흔들린다. 이 논문은 그 흔들림을 토큰 수준에서 진단하고, 진단 결과를 다시 학습 신호로 되돌려 GRPO의 거친 신용 배분을 고치는 SCAPO(Semifactual Credit-Augmented Policy Optimization)를 제안한다. 문제의식의 출발점은 GRPO가 응답 전체에 결과 기반 어드밴티지 하나를 똑같이 부여한다는 점이다. 정답을 맞힌 응답이라도 그 안에는 문제와 무관한 단서에 기대는 토큰이 섞여 있을 수 있는데, 결과 보상만으로는 그런 토큰과 실제 추론에 기여한 토큰을 구분할 수 없다.
어떻게 동작하나
저자들은 답과 문제 자체는 그대로 두고 부수적 표현만 바꾸는 'semifactual' 프롬프트 개입을 쓴다. 유형은 패러프레이즈, 사소한 오타 노이즈, 무관한 시나리오로 감싸기, 무관한 맥락 덧붙이기의 네 가지이며 GPT-5.5로 생성하고 수량·수식·제약·요구값은 보존하도록 지시한다. 원문 프롬프트와 개입 프롬프트 아래에서 동일한 응답 토큰의 확률 p를 재고, d = |p(0)-p(k)| / ((p(0)+p(k))/2) 라는 대칭 유계 거리로 드리프트를 측정한다. 이 값은 [0,2] 범위로 제한되고, 절대 확률 차이가 아니라 국소 평균으로 정규화해 저확률 토큰의 상대적 변화를 살린다. DAPO-Math-17K에서 뽑은 1,000문항에 대해 Qwen3-4B-Base로 측정한 결과, 드리프트는 토큰마다 수십 배 차이가 났고 12.82% 위치는 변화가 아예 없었다. 반성(reflection) 표지 토큰은 전체 평균의 2.74배, 담화 연결어는 2.32배였던 반면 수학 기호는 0.47배, 숫자는 0.37배에 그쳤다. 더 나아가 디코딩 단계에서 후보 토큰을 드리프트 내림차순으로 정렬해 누적 확률 질량이 0.8을 넘지 않는 최장 프리픽스를 마스킹하고 EOS는 유지한 뒤 재정규화하자, 가중치를 전혀 갱신하지 않고도 같은 1,000문항 정확도가 15.8%에서 30.0%로 올랐다(+14.2%p).
무엇과 다른가
SCAPO는 이 신호를 GRPO 어드밴티지에 주입한다. 먼저 원문 프롬프트에서 샘플링한 G개의 응답을 고정한 채, 원문과 K=4개의 개입 프롬프트 각각에 대해 teacher forcing으로 같은 응답 토큰의 확률을 다시 계산한다. 이 확률들로 토큰별 드리프트를 구한 뒤, 개입 유형별로 음의 드리프트를 그룹 내에서 표준화하고 평균 내고 다시 한 번 표준화해 상대적 안정성 점수 u를 만든다. 여기서 음수 부분만 취해 u- = min(u, 0)으로 자른다. 안정성이 곧 정답을 뜻하지는 않으므로 안정한 토큰에 추가 크레딧을 주지 않겠다는 설계다. 최종 토큰 어드밴티지는 Ã = A + λ·sg(u-)이며, sg는 stop-gradient다. 이 때문에 Ã는 항상 원래 A 이하이고, A가 양수일 때는 불안정 토큰의 긍정 강화를 약화시키고 A가 음수일 때는 부정 학습 신호를 강화한다. λ는 학습 초반에만 λ0=0.01로 적용되고 4B 모델은 120스텝, 1.7B 모델은 200스텝 이후 0이 되어 표준 GRPO로 이어진다. 중요도 비율, 클리핑, 손실 축약 방식은 GRPO 그대로 두고 어드밴티지만 바꾼다.
어떻게 쓰나
실험은 약 17,000개 경시대회급 수학 문제로 구성된 DAPO-Math-17K에서 Qwen3-4B-Base를 600스텝, Qwen3-1.7B-Base를 1,000스텝 학습해 진행했다. 롤아웃 배치 128, 업데이트 배치 64, 프롬프트당 8개 롤아웃, 최대 응답 길이 16,384토큰, 학습률 1e-6을 쓰고 R1 스타일 프롬프트 템플릿과 이진 규칙 기반 보상을 사용한다. 비교 대상은 GRPO, GSPO, SAPO, CF-GRPO, FIPO다. AIME 2024–2026 정확도는 GRPO 대비 4B에서 5.63%p, 1.7B에서 4.17%p 올랐고 HMMT는 각각 4.46%p, 2.98%p 개선됐다. 4B에서는 8개 수학 지표 중 6개, 1.7B에서는 8개 전부에서 최고 성적을 냈고 두 규모 모두 평균 정확도가 가장 높았다. 분포 밖 일반화 지표인 NoOp-AIME, ThinkBench-AIME, GPQA-Diamond 세 개 모두에서도 두 규모 모두 최고였으며, GPQA-Diamond는 4B에서 36.26%→42.45%, 1.7B에서 27.42%→31.25%로 올랐다. AIME와 AMC의 Pass@128도 두 규모 모두 최고였다.
전제와 한계
어블레이션은 신용 신호의 출처와 부호를 따로 검증한다. 응답 내에서 보정값을 무작위로 섞는 random shuffle, 답을 바꾸는 개입으로 바꾼 counterfactual 대조군과 비교했을 때 SCAPO가 AIME 24–26에서 각각 3.55%p, 5.56%p 앞섰다. 답이 바뀌는 개입에서의 드리프트는 허위 상관이 아니라 정당한 예측 변화를 반영할 수 있다는 해석이다. 부호 실험에서는 음수만 반영하는 방식이 all-sign, positive-only보다 경시대회 5개 벤치마크 평균에서 가장 좋았다. 비용 측면에서 semifactual 프로빙과 신용 구성은 4B 실험의 전체 학습 런타임 중 1.8%에 불과하다. 샘플링한 응답을 teacher forcing으로 재사용해 개입 프롬프트마다 새로 생성하지 않고, 초기 보강 구간에만 수행되기 때문이다.
실무에서는 RLVR 학습 루프에 끼워 넣는 모듈로 이해하면 된다. 외부 보상 모델이나 프로세스 수준 감독이 필요 없고, 프롬프트 변형 세트를 미리 만들어 두고 고정 응답에 대한 토큰 확률만 다시 재면 된다. 다만 도입 전에 확인할 것이 있다. λ0와 적용 스텝 수 N0가 성능을 좌우하므로 자신의 모델 규모와 데이터에서 민감도를 먼저 봐야 하고, 프롬프트 변형의 품질이 신호 전체를 결정하므로 개입이 문제와 정답을 실제로 보존하는지 검증해야 한다. 또한 이 방법은 안정성을 정답 라벨로 취급하지 않기 때문에, 불안정 토큰을 깎는 것만으로 정답률이 오르지 않는 도메인에서는 이득이 없을 수 있다.
저자들이 명시한 전제는 분명하다. 안정성은 정답을 함의하지 않으므로 안정한 토큰에는 추가 크레딧을 주지 않고, 불안정 토큰의 어드밴티지만 선택적으로 낮춘다. 보강은 학습 초반 궤적 선택을 유도하는 용도로만 쓰고 이후에는 표준 GRPO로 복귀한다. 실험 범위는 Qwen3-4B-Base와 Qwen3-1.7B-Base 두 규모, 수학 추론 벤치마크와 GPQA-Diamond로 확인한 과학 추론 전이까지이며, 저자들은 더 큰 모델과 다양한 아키텍처, 수학 외 도메인으로의 확장을 향후 과제로 남긴다. 또한 semifactual 변형 데이터 생성에 GPT-5.5를 사용했다고 밝히고 있다.