RGPO가 참조 해설을 임시 발판으로 써서 희소 보상 문제를 줄인다

Rationale-Guided Policy Optimization: Learning to Reason with Adaptive Rationale Scaffolding

HF Daily2610.07342

Hoang Phan, Minh Pham, Chau Pham2026-10-05

무엇인가

온폴리시 강화학습, 특히 검증 가능한 보상 기반 강화학습(RLVR)은 대형 언어모델의 추론 능력을 끌어올리는 핵심 패러다임이 됐다. 하지만 정책 모델의 현재 능력을 넘어서는 문제를 만나면 샘플링한 롤아웃이 전부 오답이 되어 보상이 균일해지고, 그룹 상대 이점이 0이 되어 학습 신호가 사라진다. 논문은 이 '능력-난이도 불일치'가 약한 모델에서 특히 심각하며, 정작 추론 향상에 가장 중요한 어려운 예제에서 훈련이 정체된다고 지적한다. 기존 완화책인 오프폴리시 시연, 전문가 추적, 더 강한 모델의 리젝션 샘플링은 보조 데이터가 RL 태스크와 같은 형식을 따라야 한다는 제약이 있고, 참조 해설의 우도만 최대화하면 정책 분포와 어긋나 암기와 일반화 저하를 부른다.

어떻게 동작하나

RGPO(Rationale-Guided Policy Optimization)는 참조 해설을 고정된 모방 대상이 아니라 일시적인 추론 발판으로 쓴다. 학습은 N+1 에폭으로 진행되며, 첫 에폭은 힌트 없이 돌려 각 예제에 대한 모델의 초기 해결 가능성을 측정한다. 참조 해설은 문자 수 기준으로 N개 세그먼트로 나누고, 예제 i의 에폭 t에서 공개된 세그먼트 수를 g_i(t)로 둔다. 갱신 규칙은 단순하다. 해당 예제에서 정답 롤아웃이 하나도 없으면 다음 에폭에 세그먼트를 하나 더 공개하고, 정답이 하나라도 나오면 하나를 회수한다. 이렇게 하면 어려운 문제는 모델이 궤적을 찾을 때까지 힌트가 늘고, 이미 풀 수 있는 문제는 힌트가 0 쪽으로 감쇠한다.

무엇과 다른가

각 에폭에서 롤아웃은 두 번 수행된다. 첫 번째는 원래 프롬프트 x_i에서의 비유도 롤아웃으로, 이는 주 RL 목적함수에 그대로 쓰인다. 두 번째는 원래 문제와 힌트 접두사, 검증기 피드백을 합쳐 만든 유도 프롬프트에서의 수정 롤아웃이다. 유도 응답은 같은 에폭의 비유도 롤아웃 최고 보상보다 마진 δ 이상 높을 때만 보조 버퍼에 들어간다. 이 보상 게이트가 핵심인데, 참조 해설 접두사가 항상 도움이 되지는 않기 때문이다. 버퍼에 담긴 응답에는 감독 손실을 걸되, 조건은 힌트가 붙은 프롬프트가 아니라 원래 프롬프트 x_i로 준다. 힌트 문맥으로 학습하면 추론 시점에 해설에 의존하는 법을 가르치게 되므로, 원래 태스크 분포로 이득을 되돌리는 것이다. 전체 목적함수는 RL 손실에 가중치 λ_t를 곱한 SFT 손실을 더한 형태다.

어떻게 쓰나

논문은 이론적 근거도 제시한다. 이진 보상에서 비유도 롤아웃 성공 확률을 p, 유도 수정의 성공 확률을 s라 하면, 같은 응답 예산 K+K_g에서 성공 궤적을 하나라도 발견할 확률은 RGPO가 1-(1-p)^K(1-s)^K_g, 일반 방식이 1-(1-p)^(K+K_g)이며, s > p일 때만 RGPO가 우세하다. 전원 실패 이벤트에서 GRPO는 이점 신호가 0이지만 RGPO는 확률 (1-p)^K[1-(1-s)^K_g]로 양의 학습 타깃을 얻는다. 또 힌트 수준의 기대 변화량이 2(1-p_t)^K - 1이라, p_t가 1-2^(-1/K)를 넘으면 힌트가 음의 드리프트를 갖는다. 정리 2는 p_0가 0으로 갈 때 RGPO의 목표 도달 시간이 O(log(1/p_0))인 반면 일반 GRPO는 Ω(1/p_0)라고 주장한다.

전제와 한계

통제 시뮬레이션에서 GRPO는 쉬운 문제에서 99.1% 정확도를 내지만 어려운 문제에서는 3 에폭 후에도 0.0%에 머문다. RGPO는 어려운 문제에서 99.5%에 도달하면서 쉬운 문제 성능을 유지한다. 불완전한 참조에 직접 학습하면 체계적 오류가 강화돼 12.8%에서 정체되고, 보상 게이트를 제거해도 거의 같은 결과가 나온다. 전체 해설을 항상 제공하면 평가 시 힌트를 제거했을 때 1% 확률 수준으로 떨어진다. 흥미롭게도 주 실험에서 승인된 유도 응답은 실행당 평균 7.4개뿐인데, 같은 어려운 결정이 문제들에 반복 등장하기 때문에 이 소수가 학습을 부트스트랩하기에 충분했다.

언어모델 실험은 Qwen2.5-3B를 HINT의 DAPO-Math-27K 분할로 GRPO 학습한다. 배치 256, 프롬프트 1024 토큰, 응답 4096 토큰, 프롬프트당 8개 롤아웃(힌트 4개, 비힌트 4개), AdamW 학습률 1e-6, FSDP2와 bfloat16을 쓴다. HINT가 10 에폭인 것과 달리 3 에폭만 돈다. 결과는 AIME24(avg@32), MATH-500, OlympiadBench, Minerva Math(이상 pass@1)에서 RGPO가 모든 인디스트리뷰션 벤치마크 1위이며 평균이 GRPO 19.7에서 26.8로 오르고, 최강 베이스라인 HINT를 5.0점 앞선다. MATH-500과 Minerva Math에서는 HINT 대비 각각 6.6점, 8.7점 개선이다. 분포 밖 평가(ARC-Challenge, GPQA-Diamond, MMLU-Pro)에서도 평균 32.2로 최고 베이스라인 29.9를 넘는다.

비전언어모델에서는 Qwen2-VL-7B-Instruct와 Qwen2-VL-2B-Instruct를 3 에폭 학습한다. MMStar-Math에서 70.1로 베이스 모델보다 23.7점 높고, MathVista-Math에서 73.65로 베이스의 41.11을 크게 앞서며 MM-Eureka 같은 베이스라인도 넘는다. GEO 73.47, ALG 73.62, GPS 73.89로 세부 집합에서도 최고점이다. 다만 Textbook Question Answering 집합의 개선은 상대적으로 작은데, MINT-CoT 학습셋과 도메인이 일부 겹쳐 개선 여지가 적었다고 저자들은 설명한다. 2B 모델에 GRPO를 적용한 경우 RGPO가 2.95배 적은 스텝으로 베이스라인 성능에 도달한다. 전체 힌트를 주는 설정은 짧은 출력으로 정답만 뽑는 지름길 행동을 유발하고 그래디언트 노름이 크게 요동치는 반면, RGPO는 더 완만한 보상 상승과 긴 추론 응답, 안정적인 최적화를 보인다. Mulberry 스타일 프롬프트에서 오프폴리시 전문가 SFT와 RLVR을 결합한 AHPO는 뒤늦게 보상이 오르다 엔트로피가 급격히 붕괴하는데, RGPO는 DeepSeek-R1 스타일의 단순한 형식을 써서 정책 다양성을 조기에 희생하지 않는다.

실무 관점에서 RGPO는 정답 해설과 검증 가능한 보상이 이미 있는 수학·코드·멀티모달 추론 파인튜닝에 바로 얹을 수 있는 구조다. GRPO든 PPO든 첫 번째 라운드 RL 갱신은 그대로 두고, 보상 게이트를 통과한 유도 응답에 대한 두 번째 감독 항만 추가하면 되므로 기존 학습 파이프라인 변경이 작다. 도입 시 확인할 것은 세 가지다. 참조 해설을 몇 세그먼트로 나눌지(논문은 문자 수 기준), 보상 게이트 마진 δ를 0으로 둘지, 그리고 λ_t 스케줄이다. 또한 힌트를 평가 시점에 반드시 제거해야 하며, 그렇지 않으면 지름길 학습으로 성능이 무너진다.

저자들이 밝힌 전제와 한계는 다음과 같다. RGPO는 참조 해설 s_i와 정답 a_i, 그리고 검증 가능한 보상 함수 r(x,y,a)에 대한 접근을 가정한다. 세그먼트 분할은 토큰 수, 문장 경계, 추론 단계 등 어떤 결정적 규칙으로도 가능하지만 실험에서는 단순히 문자 수를 썼다. 보상 게이트는 참조 해설 접두사가 항상 도움이 되지는 않는다는 관찰에 기반한 장치이며, δ=0인 정확 보상 설정을 가장 단순한 형태로 쓴다. 또한 작은 모델이 Mulberry 스타일 템플릿 아래에서 최적화에 어려움을 겪는다는 점을 부록 D.5에서 언급하며, 이것이 더 단순한 DeepSeek-R1 스타일 형식을 주 실험에서 택한 이유다. MathVista의 Textbook QA 하위 집합에서는 학습셋과의 도메인 중첩 때문에 이득이 제한적이었다는 점도 저자들이 직접 밝힌다.