TGRL이 샘플링 온도차를 탐험 신호로 바꿔 RLVR 학습을 앞당긴다

TGRL: Temperature-Grouped Reinforcement Learning for Efficient Exploration in LLMs

HF Daily2609.33589

Zihan Lin, Xiaohan Wang, Jie Cao2026-09-27조회 3

무엇인가

검증 가능한 보상 기반 강화학습(RLVR)은 LLM의 추론 능력을 사후학습으로 끌어올리는 대표 패러다임이지만, 제한된 rollout 예산 안에서 다양하고 보상이 높은 궤적을 찾는 탐험이 여전히 병목이다. 논문은 탐험 실패가 좁은 디코딩 모드로의 조기 수렴을 낳고 성능 상한 자체를 제한한다고 본다. 기존 대응은 크게 두 갈래인데, 테스트타임 스케일링처럼 샘플 수를 늘리거나 온도 제어·온도 스케줄로 디코딩을 흔드는 방식이다. 저자들은 전자가 rollout 시점의 샘플 예산을 키우고, 후자는 탐험의 이득을 정량화하지 않은 채 남겨둔다고 지적한다. GRPO·DAPO·Dr.GRPO 같은 최적화기 개선 연구들도 rollout 그룹이 이미 충분히 다양하다고 가정할 뿐, 고정 예산 안에서 탐험 이득을 능동적으로 추정하고 활용하지는 않는다는 것이 이 논문의 문제 설정이다.

어떻게 동작하나

제안 방법 TGRL(Temperature-Grouped Reinforcement Learning)은 온도가 만든 다양성을 명시적 학습 신호로 바꾼다. 프롬프트마다 rollout 그룹을 저온 그룹(실험에서 T0=0.3, 1개 샘플)과 고온 그룹(T1=1.2, 3개 샘플)으로 나누되 총 rollout 예산 4개는 그대로 유지한다. 두 그룹 평균 보상의 차이 ΔR_g = R̄^T1 − R̄^T0를 프롬프트 수준 탐험 이득의 불편 추정량으로 쓴다는 것이 Lemma 1의 내용이다. 이어서 혼합 그룹 정규화 어드밴티지 A_i = (R_i − μ_g)/√(σ_g²+ε)를 쓰면, 고온 그룹의 어드밴티지에 ΔR_g에 비례하는 항이 가산적으로 더해진다는 것을 Proposition 1로 보인다. 즉 "이 프롬프트에서 더 넓게 탐색하는 것이 검증 보상을 실제로 올리는가"라는 질문에 그룹 간 보상 대비가 답하도록 설계되어 있다.

무엇과 다른가

두 번째 축은 이 그룹 수준 신호를 토큰 수준 크레딧으로 내리는 것이다. 고온 rollout을 재생해 얻은 동일한 logits z에 대해 softmax(z/T0)와 softmax(z/T1)를 만들고 그 사이 Jensen–Shannon 발산 J_i,t를 계산한다. Lemma 2는 J_i,t가 T0에서 T1로 가는 보간 경로 위 로짓 분산의 적분으로 상한이 잡힘을 보여, J가 큰 위치가 온도 개입에 민감한 위치임을 규명한다. Proposition 2는 √(2J_i,t)가 온도 전환 시 기대 continuation value 변화의 상한이며, 단조 증가하는 JS 기반 가중이 균일 가중보다 민감한 위치에 더 많은 크레딧을 준다는 것을 증명한다. 구현에서는 극단적 JS 스파이크를 눌러주는 로그 압축 ω_i,t = log(1 + (J_i,t+ε)/(J̄_i+ε))를 적용한 뒤 궤적별로 평균이 1이 되게 정규화해 w_i,t를 얻는다. 최종 토큰 어드밴티지는 저온 그룹에서 0, 고온 그룹에서 w_i,t·A_i이며, 저온 그룹은 그룹 통계(μ_g, σ_g)만 제공하고 그래디언트는 받지 않는다. 저온 그래디언트를 허용하면 상충하는 업데이트 방향이 생겨 탐험 이득 보정이 약해진다는 것이 저자들의 설명이다. 목적함수는 고온 rollout에 대해서만 계산하는 클리핑된 중요도 비율 대리 목표이고, 학습 초반 20스텝은 모든 궤적을 고온으로 샘플링해 표준 단일 온도 그룹 정규화 어드밴티지로 최적화하는 워밍업을 둔다.

어떻게 쓰나

실험은 수학 6개(AIME 2024/2025, AMC 2023, MATH500, Minerva, Olympiad), 코드 3개(LiveCodeBench, CodeForces, HumanEval+), 장기 에이전트 2개(ALFWorld, WebShop)를 합친 11개 벤치마크에서 이뤄졌다. 베이스라인은 PPO, GRPO, DAPO, Dr.GRPO, RLOO, TAMPO, ReAct, EMPG를 포함하고, 모델은 수학에 Qwen3-4B/14B/32B, 코드에 Qwen3-4B, 에이전트에 Qwen2.5-7B-Instruct를 쓴다. 학습 데이터는 수학 DeepScaleR, 코드 DeepCoder, 에이전트 WebShop·ALFWorld다. 수학 6개 벤치마크 평균에서 TGRL은 14B 69.4%, 32B 70.2%로 최강 베이스라인을 각각 1.4%p, 1.6%p 앞선다. 14B에서는 AIME24 +2.2%p, AIME25 +1.5%p, Olympiad +1.6%p가 개선됐고, 32B에서는 6개 벤치마크 전부에서 최고 성능을 내며 Olympiad +4.2%p, AIME25 +0.4%p를 기록했다. 코드에서는 LiveCodeBench Pass@16을 4.4%p 올렸고 CodeForces 레이팅을 1377.6에서 1574.3으로(+196.7, 백분위 71.9%→84.3%) 끌어올렸으며, 거의 포화된 HumanEval+에서는 최상위 베이스라인과 경쟁력을 유지했다. 에이전트에서는 ALFWorld 성공률 86.7%(+6.3%p), WebShop 74.2%(+4.9%p), WebShop 태스크 스코어 85.7%를 냈고, 다단계 계획 조기 확정이 필요한 ALFWorld Pick2에서 95.0% 대 PPO 68.8%를 기록했다. 효율 측면에서는 DAPO 대비 동등 정확도에 36% 빠르게 도달했고(6.4시간 vs 10.0시간), 12시간 동일 예산에서 AIME-Combined 1.0833 대 GRPO 1.0354를 얻었다. 탐험 지향 베이스라인과의 비교에서도 14B 기준 entropy 정규화 GRPO 67.8%, TAMPO 68.0%로 TGRL 69.4%에 미치지 못했다.

전제와 한계

절제 실험은 두 메커니즘이 서로 다른 몫을 담당한다는 것을 보여준다. 온도만 올린 GRPO@T1은 GRPO@T0 대비 평균 정확도를 14B에서 0.5%p, 32B에서 1.1%p밖에 올리지 못했다. 단일 온도 GRPO를 혼합 온도 그룹핑으로 바꾸면 14B 67.0%→68.2%, 32B 66.2%→67.8%로 첫 이득이 나오고, 여기에 JS 크레딧 배분을 더하면 69.4%/70.2%가 되며 AIME25에서 추가로 2.5%p(14B), 3.5%p(32B)가 오른다. 온도 민감도 실험에서는 T1=0.8처럼 격차가 너무 좁을 때만 성능이 떨어지고 T1∈[1.0, 1.6] 구간은 경쟁력을 유지했으며, T1=1.2가 효율과 안정성의 균형점으로 기본값이 됐다. 학습 동역학에서는 121~150 스텝 구간에서 TGRL이 가장 큰 그래디언트 노름(0.331)과 policy KL(0.160)을 보이면서도 PPO 클립 비율은 0.11% 미만으로 유지했고, 후반 응답 길이는 2476 토큰으로 GRPO@T0 3915, GRPO@T1 3482보다 짧았으며 응답 잘림 비율도 7.2% 대 16.0%/12.4%로 낮았다. 균일 토큰 크레딧을 쓴 변형과는 후반 학습 보상이 0.394 대 0.388로 거의 같은데도 다운스트림 정확도·길이·잘림에서 차이가 났는데, 저자들은 이를 이득이 보상 스케일이 아니라 토큰 수준 크레딧 배분에서 온다는 근거로 해석한다.

개발자 관점에서 이 논문은 RLVR 파이프라인의 rollout 예산을 키우지 않고 탐험 품질을 올리고 싶을 때 검토할 만하다. 적용하려면 고온 rollout을 재생해 위치별 logits를 다시 얻어야 하므로 그만큼의 연산·메모리 오버헤드가 발생하고, T0·T1과 저온/고온 샘플 분할 비율(실험은 1:3), 20스텝 워밍업, 저온 그룹 그래디언트 차단이라는 추가 하이퍼파라미터와 구현 제약을 함께 관리해야 한다. 또 이득이 주로 경쟁형 수학 문제, 포화되지 않은 코드 벤치마크, 희소 보상 장기 과제에서 크게 나타난다는 점을 감안해 자신의 태스크가 어느 쪽에 가까운지 먼저 확인하는 편이 좋다.

저자들이 밝힌 전제와 한계는 다음과 같다. 저온 그룹은 그룹 통계만 제공하고 그래디언트를 받지 않는 비대칭 업데이트가 필요하며, 저온 그래디언트를 허용하면 경쟁 업데이트 방향이 생겨 탐험 이득 보정이 약해진다. 워밍업이 없으면 정책이 안정적인 추론 패턴을 갖추기 전에 저온 그룹이 퇴화된 베이스라인이 될 수 있고, T0=0.3은 보수적 참조값으로 고정된 선택이다. 실험 범위도 Qwen3·Qwen2.5 계열과 rollout 4개 예산, 특정 온도 분할에 국한되며, AIME처럼 문제 수가 30개 수준으로 적은 벤치마크는 5-시드 Avg@16 평가를 별도로 수행해 변동성을 확인했다고 밝힌다. 향후 과제로는 적응적 다중 온도 그룹핑, 더 다양한 토큰 크레딧 기준, 개방형 상호작용 환경으로의 확장을 제시한다.