토큰 크레딧을 유일하게 정의하고 크리틱 정렬로 성능을 끌어올린 PACT

PACT: From Credit Assignment to Critic Alignment

arXiv2609.26355v1

Jiayan Fu2026-09-22조회 10

무엇인가

LLM 사후학습에서 강화학습은 핵심 요소가 됐지만, 보상은 궤적이 끝난 뒤 스칼라 하나로 주어지는 반면 업데이트는 개별 토큰 단위로 이뤄진다. 이 입도 차이 때문에 최종 결과를 어느 토큰의 공으로 돌릴지 정하는 크레딧 할당 문제가 생기는데, 논문은 토큰 수준 크레딧에 대해 일반적으로 받아들여지는 수학적 정의 자체가 없다는 점을 출발점으로 삼는다. 자기회귀 생성을 토큰 수준 MDP로 모델링하는 기존 관점은 상태 표현을 줄 뿐, 궤적이 진행되면서 최종 보상에 관한 통계적 정보가 어떻게 변하는지는 설명하지 못한다. 그래서 마르코프 정식화 너머의 추가적인 특성화가 필요하다는 것이 저자들의 주장이다.

어떻게 동작하나

논문은 크레딧 할당이 만족해야 할 세 가지 정규성 조건을 세운다. Completeness는 할당된 크레딧의 합이 최종 보상에서 초기 예측 E[R|F0]을 뺀 값과 같아야 한다는 것이고, Prefix Consistency는 같은 접두사까지 진행된 두 궤적에서 그 시점까지 누적된 크레딧이 동일해야 한다는 것, Neutrality는 다음 토큰에 배정되는 크레딧의 조건부 기댓값이 0이어야 한다는 것이다. 이 세 조건을 모두 만족하는 토큰 수준 크레딧은 존재하며 거의 확실한 동등성 수준에서 유일하고, 그 표현은 C_i = V_i - V_{i-1} = E[R|F_i] - E[R|F_{i-1}] 로 주어진다. 즉 조건부 보상 예측의 차분, 다시 말해 마팅게일 차분열이다. 저자들은 세 조건 중 하나라도 빼면 다른 크레딧 할당이 가능해진다는 것도 부록에서 보여 유일성에 세 조건이 모두 필요함을 밝힌다. 연속된 토큰 구간을 묶으면 턴 수준 같은 거친 단위의 크레딧도 이 표현의 합으로 복원된다.

무엇과 다른가

이 표현은 기존 알고리즘들을 하나의 틀로 설명하는 데 쓰인다. KL 정규화 보상 개선으로 정의된 이상적 교사 아래에서 On-Policy Distillation의 업데이트 방향은 유일 크레딧이 만드는 정책 그래디언트와 β로 나눈 만큼 비례하며, 이때 교사는 명시적 밸류 헤드 없이 암묵적 크리틱 역할을 한다. RLOO의 응답 수준 leave-one-out 베이스라인은 토큰 수준 크레딧과는 입도가 다르지만 기대값에서 동일한 정책 그래디언트 기여를 낸다. 다만 이 동등성은 기대값에서만 성립하고 통계적 효율이 같다는 뜻은 아니며, 응답 수준 베이스라인은 유한 표본의 무작위성을 그대로 안고 있어 장기 호라이즌에서는 그 변동이 국소 크레딧 신호보다 커질 수 있다. 여기에 더해 보상을 [0,1]로 정규화하면 E[Σ C_i²|F0] = Var(R|F0) ≤ 1/4 이고 |C_i| > ε 인 크레딧 개수의 기대값이 1/(4ε²) 이하로 묶인다는 근사적 희소성 정리가 제시된다. 이는 대부분의 국소 크레딧이 작을 수 있음을 뜻하고, GAE에서 중간 크리틱 오차가 실제 크레딧과 비슷해지거나 능가할 수 있다는 분석으로 이어진다. 실제로 Â_t^λ = Σ λ^{i-t} C_i - ε_{t-1} + (1-λ) Σ λ^{i-t} ε_i 로 분해되며, λ=1이면 중간 오차 항이 사라져 Â_t^1 = R - V̂_{t-1} 만 남는다.

어떻게 쓰나

이 분석을 바탕으로 제안하는 Policy Aligned Critic Training(PACT)은 세 가지를 바꾼다. 첫째, 크리틱을 시그모이드로 파라미터화하고 MSE 대신 소프트 이진 교차엔트로피(BCE)로 학습한다. R이 [0,1]에 있을 때 BCE와 MSE의 최적 예측은 같은 조건부 평균 V_i^π이므로 추정 대상 자체는 바뀌지 않는다. 둘째, Actor-then-Critic 순서를 쓴다. 한 iteration에서 현재 크리틱이 액터 최적화에 필요한 밸류를 먼저 제공하고, 액터 업데이트가 끝난 뒤 같은 롤아웃 배치에 업데이트된 액터로 한 번 더 forward pass를 돌려 업데이트 전후 정책 사이의 중요도 비율을 만든다. 이어 크리틱 목표를 원래 보상 R 대신 I_t R 로 바꿔 학습하는데, 여기서 I_t = Π_{k=t}^{τ} π(T_k|F_{k-1})/μ(T_k|F_{k-1}) 는 연속 구간 중요도 비율이고, 환경 동역학이 변하지 않고 연속 분포의 절대 연속성이 성립하면 V_{t-1}^π = E_μ[I_t R | F_{t-1}] 가 성립한다. 즉 액터 업데이트 이전에 모은 궤적으로도 업데이트된 액터에 맞는 크리틱을 학습할 수 있다. 셋째, GAE에서 λ=1을 쓴다. 실제 구현에서는 긴 응답에서 정확한 연속 비율의 분산이 커지므로 현재 토큰 중요도 비율을 detach해 쓰고, 비율이 [ρ_min, ρ_max]를 벗어나는 토큰 수준 크리틱 손실은 마스킹한다. 추가 롤아웃 생성 없이 forward pass 한 번만 더 필요하다.

전제와 한계

실험은 slime 위에 구축된 에이전트 RL 프레임워크 Dressage에서 수행된다. 수학 추론은 Qwen3.5-4B를 DAPO-Math-17k의 3,200문제 부분집합에서 OpenCode 하네스로 학습하고 최종 정답 여부를 결과 보상으로 쓴다. 이 부분집합은 초기 정책이 pass@1에서 실패한 문제를 우선하고 나머지 풀에서 무작위로 추가해 구성했다. 에이전트 코딩은 Qwen3.6-35B-A3B를 OpenSWE에서 Codex 에이전트와 Harbor를 통해 학습하며 종료 보상은 태스크 검증기가 준다. 두 과제 모두 롤아웃 라운드마다 512개 궤적을 만들고, GRPO는 64개 프롬프트당 8개 궤적을 샘플링하며, 최적화 배치 크기는 128로 라운드당 4개 미니배치가 나온다. SAO는 수학에 [0.7, 6.0], 코딩에 [0.6, 3.0]의 DIS 중요도 비율 범위를 쓰고, PACT는 수학에서 SAO와 같은 액터 측 DIS 범위를, 코딩에서는 PPO 클리핑을 쓴다. 크리틱 학습에서는 중요도 비율이 [0, 6]을 벗어나는 샘플을 마스킹한다. 컨텍스트 윈도는 128k 토큰, 상호작용 턴당 최대 생성 길이는 64k 토큰이다.

수학 추론 평가는 AIME 2025, AIME 2026, HMMT 2025년 11월, BeyondAIME 네 벤치마크에서 Avg@16 정확도로 이뤄진다. PACT는 네 벤치마크 모두에서 최고 정확도를 기록하며 평균 72.87%를 달성해 GRPO를 8.80%p, λ=1.0 PPO를 13.16%p, SAO를 21.73%p 앞선다. λ=1.0 PPO가 λ=0.95 PPO보다 좋은 성능을 냈는데, λ=0.95는 학습 중 정책 붕괴를 겪었고 이는 GAE 중간 크리틱 오차 분석과 일치한다. SWE-bench Verified에서는 PACT가 67.4% 통과율로 GRPO를 2.0%p, λ=1.0 PPO를 2.4%p, SAO를 3.8%p 앞선다. 절제 실험에서는 동일 초기화와 동일 온폴리시 롤아웃 데이터로 BCE 크리틱과 MSE 크리틱을 비교했을 때, 두 모델 규모 모두에서 BCE 크리틱이 더 낮은 BCE와 MSE 손실, 그리고 더 큰 밸류 분리(양성 샘플 평균 예측값에서 음성 샘플 평균 예측값을 뺀 Δ±)를 보였다. 중요도 샘플링 보정을 제거한 PACT w/o IS는 평균 67.74%로, 보정을 넣으면 72.87%까지 올라 5.13%p 개선되고 네 벤치마크 모두에서 향상되며 학습도 더 안정적이었다.

실무 관점에서 이 논문이 주는 메시지는 크리틱 쪽에 있다. 토큰 수준 크레딧은 조건부 밸류의 차분이므로, 밸류 추정이 부정확하거나 정책과 어긋나면 국소 크레딧 신호 자체가 오차에 묻힌다. 특히 장기 호라이즌 에이전트 학습에서 PPO식으로 액터와 크리틱을 독립 업데이트하면 크리틱이 한 정책 업데이트만큼 뒤처지는데, PACT는 액터를 먼저 업데이트하고 중요도 보정된 목표로 크리틱을 다시 맞추는 순서로 이 지연을 줄인다. 구현 비용도 크지 않다. 추가 롤아웃 없이 액터 업데이트 후 forward pass 한 번과 비율 마스킹만 더하면 되고, 크리틱 손실을 BCE로 바꾸는 것만으로 수렴이 빨라진다고 보고한다. 다만 중요도 비율의 분산과 마스킹 범위 [ρ_min, ρ_max], [0, 6] 같은 하이퍼파라미터는 자신의 파이프라인에서 직접 확인해야 할 부분이다.

저자들이 명시한 전제와 한계도 분명하다. 이상적 교사는 KL 정규화 보상 개선 문제의 해로 정의되며 보상이 유계이고 정책 p_t가 어휘 전체에 full support를 가진다고 가정한다. 크레딧 희소성 정리는 보상을 [0,1]로 정규화한 경우에 성립하고, GAE 분해에서는 종료 시점 밸류 오차가 0이라고 가정한다. 중요도 보정을 통한 크리틱 동기화는 환경 동역학이 변하지 않고 연속 분포가 절대 연속성을 만족한다는 전제 위에 서 있으며, 정확한 연속 비율은 긴 응답에서 분산이 커서 실제로는 detach한 현재 토큰 비율과 마스킹으로 근사한다. RLOO와의 동등성도 기대값 수준의 그래디언트 동등성일 뿐 통계적 효율이 같다는 주장이 아니라는 점을 논문 스스로 못 박고 있다.