RL 후학습이 에이전트 해결 범위를 깎는 비용을 수치로 측정한다

Sharpening Tax in Post-Training

HF Daily2610.01509

Changdae Oh, Qi Zeng, Qi Qi2026-10-01

무엇인가

RL 후학습이 근본적으로 새로운 능력을 만드는가, 아니면 베이스 모델이 이미 갖고 있던 행동 몇 개를 증폭시킬 뿐인가. 이른바 분포 샤프닝(sharpening) 가설이다. 지금까지의 증거는 거의 전부 수학과 코딩 과제에서 나왔다. 그런데 이 두 영역은 사전학습 데이터에 노출이 압도적으로 많고, 최종 정답만 채점하는 경우가 많아 운 좋게 정답에 도달한 잘못된 추론 궤적도 성공으로 계산된다. 이 논문은 그 대신 에이전트 과제를 스트레스 테스트 무대로 쓴다. 다중 턴 도구 호출, 시나리오별 인터페이스, 불확실한 환경 피드백, 장기 궤적 유지가 필요해 사전학습 데이터에는 드물고 후학습에서 배운다고 여겨지는 능력들이다. 즉 후학습이 새 능력을 만들어야 한다면 바로 여기여야 한다.

어떻게 동작하나

첫 관찰은 예상을 뒤집는다. 데이터셋 독립적이고 모델에 무관한 가벼운 하네스(간단한 시스템 프롬프트에 완화된 도구 호출·파싱 인터페이스를 결합한 스캐폴딩)를 붙이면, 사전학습만 된 베이스 모델이 에이전트 과제를 놀랄 만큼 잘 해낸다. 단일 시도 정확도(pass@1)는 후학습 모델보다 훨씬 낮지만, 롤아웃 예산이 커지면 해결 범위(pass@K)에서 역전한다. 예컨대 WebShop에서 gemma-4-31B 베이스 모델은 pass@128이 85%를 넘는 반면 같은 모델의 RL 후학습 버전은 56%에 그친다. 하네스 효과 자체도 크다. 베이스 모델 8종 평균으로 BFCL은 pass@1이 5.59에서 15.63으로, pass@32가 15.19에서 49.13으로 뛰고, WebShop은 6.32에서 9.73, 39.48에서 49.15로 오른다. 반면 같은 하네스는 후학습 모델의 성능을 오히려 떨어뜨린다. 교차점은 모델이 클수록 앞당겨진다. Gemma-4 4B는 WebShop에서 교차 예산 k*가 128을 넘지만 31B는 k*≈3이다.

무엇과 다른가

메커니즘은 성공 확률 분포의 이봉화다. 128회 롤아웃 기준으로 과제를 항상 성공, 연산을 주면 성공, 항상 실패로 나누면, 후학습은 중간 범주를 급격히 없앤다. WebShop의 gemma-4-31B에서 '연산을 주면 성공' 비율은 87.6%에서 30.0%로 줄고, 그 과제들이 양극단으로 밀려 항상 성공은 0.0%에서 26.0%로, 항상 실패는 12.4%에서 44.0%로 늘어난다. 중간 영역이 사라지면 추가 롤아웃이 실패를 성공으로 바꿀 여지 자체가 없어진다. 대신 같은 프롬프트 안 롤아웃들의 일관성(pass^K)은 올라간다. 후학습은 샘플링 효율과 일관성을 사고 해결 범위를 지불하는 셈이다.

어떻게 쓰나

저자들은 이 지불액을 하나의 숫자로 요약하는 Sharpening Tax를 제안한다. 예산 K에 대해 먼저 추가 연산이 되찾아 주는 누적 성능 A(K)=Σ_{k=1}^{K-1}[pass@K − pass@k]를 정의하고, 이를 단일 시도 실패율(1−pass@1)로 나눠 0과 1 사이로 정규화한 S(K)=A(K)/((K−1)(1−pass@1))를 쓴다. 세금은 Tax_X(K)=X_Base(K)−X_Post(K)다. Gemma-4, Ministral-3, Qwen2.5, Qwen3.5 네 패밀리의 베이스/후학습 쌍 14개와 BFCL v4 multi-turn base split, WebShop, ACEBench 세 벤치마크, 총 42개 조합에서 측정했더니 Tax_S(128)>0이 42개 중 36개였다. 큰 체크포인트일수록 세금이 크고(gemma-4-31B가 최대), 작은 모델은 k≤8 구간에서 세금이 음수인 경우도 있다(Ministral-3-3B). 또 과제 절반에 8회 롤아웃만 돌려 추정한 Tax_S(8)이 나머지 절반의 Tax_S(32)를 Spearman 상관 ρ=0.85로 예측한다. 일관성 격차 Δpass^8과도 양의 상관을 보인다.

전제와 한계

이 세금을 줄이기 위한 방법이 posterior-tempered group sampling(PTGS)이다. 프롬프트별 난이도를 학습 중 온라인으로 추정해 다음 샘플링 온도를 정한다. 프롬프트 x에 대해 n개 롤아웃을 볼 때마다 망각 계수 0≤γ<1로 누적 할인 성공·실패 카운트 (s̃_x, f̃_x) ← (γs̃_x + s_x, γf̃_x + n − s_x)를 추적하고, 목표 성공률 p̃와 결합해 Beta(a_x, b_x)를 만든다(a_x = 2p̃ + s̃_x, b_x = 2(1−p̃) + f̃_x). 여기서 Thompson sampling으로 p̂_x를 뽑고 T_x = τ^{h(p̂_x)}로 온도를 정한다. h(p)는 p≤p̃(어려운 프롬프트)일 때 (p̃−p)/p̃, p>p̃(쉬운 프롬프트)일 때 (p̃−p)/(1−p̃)이며, 기본 온도 τ>1에 대해 T_x는 [1/τ, τ] 범위를 갖는다. 어려운 프롬프트는 가열해 탐색 롤아웃을, 쉬운 프롬프트는 냉각해 활용 롤아웃을 유도한다. RL 업데이트 자체를 바꾸지 않고 계산 오버헤드도 없어 PPO, GRPO 같은 알고리즘에 그대로 끼울 수 있으며, 테스트 시점에는 이 샘플러를 제거한다.

이론적 근거도 제시한다. Theorem 3에 따르면 가열로 성공 확률이 p에서 p'로 오르면 그룹에 성공이 최소 하나 있을 확률 I_n(p')가 모든 0≤p<p'≤1에서 I_n(p)보다 커지고, 혼합 그룹(성공과 실패가 섞인 그룹) 확률 J_n(p')도 p<p'≤1/2인 동안 증가한다. 즉 PPO 같은 actor-critic 학습기는 강화할 성공을 더 자주 얻고, GRPO 같은 그룹 대조 학습기는 0이 아닌 advantage를 더 자주 얻는다. J_n이 p=1/2에서 최대라는 점은 목표 성공률 p̃를 학습 중 1/2 쪽으로 올리는 동기를 준다. 또한 샤프닝이 각 과제를 확률 λ로 0 또는 1로 밀어낸다고 두면 Tax_A(K)=λ·A_Base(K)≥0이고 S_Post/S_Base=(1−λ)ε/((1−λ)ε+λ_0)이다(ε=1−pass@1_Base). 첫 시도 정확도가 올라가도 λ_0>0이면 보정된 세금은 남는다는 뜻이다. 두 에이전트 환경에서 RL 학습 중 PTGS를 적용하면 고정 온도 베이스라인보다 세금이 작고, 반복 샘플링에서 더 많은 과제를 풀면서 단일 시도 정확도도 함께 개선된다고 보고한다. 다만 원문 제공 범위에는 이 비교의 구체적 수치가 제시되지 않았다.

실무적으로 이 논문이 주는 판단 기준은 명확하다. 반복 샘플링과 검증기, best-of-N 선택으로 성능을 뽑는 파이프라인이라면 pass@1만 보고 후학습 모델을 고르는 것이 손해일 수 있다. 특히 모델이 클수록 교차점이 작아져 31B급에서는 롤아웃 3회 수준에서 이미 역전된다. 베이스 모델에 가벼운 하네스를 붙인 조합을 후보로 함께 두고, 8회 롤아웃 정도의 싼 추정으로 Sharpening Tax를 재서 과제별로 라우팅하는 전략이 현실적이다. 자체 RL 파이프라인을 돌리는 팀이라면 PTGS는 업데이트 코드를 건드리지 않고 샘플러만 교체하는 선택지가 된다. 다만 같은 하네스가 후학습 모델에는 해롭다는 결과를 기억해야 한다. 프롬프트와 스캐폴딩은 모델별로 검증해야 하는 대상이지, 한 번 잘 된 설정을 그대로 옮길 수 있는 것이 아니다.

저자들이 밝힌 한계도 분명하다. 분석에 쓴 오픈소스 모델들은 사전학습·후학습 데이터가 공개되지 않아 이 연구는 개입 실험이 아니라 관찰 연구다. 데이터 구성을 모두 아는 통제 환경에서 재현해야 샤프닝이 언제 어떻게 생기는지 인과적으로 설명할 수 있다. 또 Sharpening Tax가 정확한 후학습 레시피에 의존하지는 않지만, RL과 지도 미세조정, on-policy distillation이 각각 얼마나 다른 세금을 매기는지는 비교하지 않았다. 범위도 텍스트 기반 LLM 에이전트로 한정되며, 멀티모달 LLM이나 비전-언어-행동 모델에서도 같은 정확도-일관성-범위 삼각 관계가 성립하는지는 열린 문제다. 세금 계산이 이진 성공 신호에 의존한다는 점도 한계로, 개방형 생성에 적용하려면 pass@k를 품질 게이트가 걸린 다양성 지표로 바꿔야 한다.