DiffGate가 실패 궤적에만 난이도 비례 교사 지도를 주입한다

DiffGate: Difficulty-Gated Teacher Guidance for On-Policy Distillation

HF Daily2610.04596

Karn Tiwari, Varnith Chordia, Prathosh A P2026-10-03

무엇인가

대규모 언어모델 사후학습에서 온폴리시 증류(OPD)는 학생이 스스로 생성한 궤적 위에서 교사 분포와의 역 KL을 줄여 학습-추론 불일치를 완화한다. 그러나 이 목적함수는 토큰 국소적이고 결과를 보지 않는다. 각 접두사에서 교사-학생 일치도를 높일 뿐, 그 궤적 전체가 정답인지와는 무관하게 확률 차이만큼 토큰을 업데이트한다. 반대로 검증 가능 보상 강화학습(RLVR), 특히 GRPO는 궤적 수준 정답 여부를 직접 최적화하지만 보상이 희소하고, 하나의 궤적 이점을 모든 토큰에 똑같이 전파하는 거친 신용 할당을 하며, 한 그룹의 모든 롤아웃이 같은 보상을 받으면 그룹 상대 이점이 0이 되어 학습 신호가 사라진다. 논문은 이 둘의 실명 지점이 상보적이라고 주장한다. OPD는 조밀하지만 정답 여부를 모르고, GRPO는 정답을 알지만 거칠고 희소하다.

어떻게 동작하나

DiffGate는 GRPO 업데이트에 교사 지도를 선택적이고 유계인 형태로 주입한다. 프롬프트마다 n개의 궤적을 샘플링하고, 각 토큰에서 Δ = log π_T(y_t|c) − log π_θ_old(y_t|c)로 교사-학생 로그확률 격차를 계산한다. 이 값을 2·tanh(Δ/2)로 변환해 (−2, 2) 범위로 눌러, 소수 토큰의 극단적 격차가 최적화를 지배하지 못하게 한다. 궤적 게이트는 w_i = (1−p)^γ (1−R_i)인데, (1−R_i)는 성공한 궤적에서 교사 지도를 완전히 끄고, (1−p)^γ는 그룹 정답률 p가 낮을수록 지도를 키운다. 최종 토큰 이점은 G = A_i^GRPO + λ(1−p)^γ(1−R_i)·2·tanh(Δ/2)이며, 이를 stop-gradient로 취급하고 PPO식 클립 대리 목적함수로 최적화한다.

무엇과 다른가

경계 동작이 이 설계의 요점을 보여준다. 성공 궤적(R_i=1)에서는 G = A_i^GRPO가 되어 GRPO와 정확히 같아지고, 이미 검증기를 통과한 해답에 교사 압력을 추가하지 않는다. 반대로 그룹 전체가 실패하면 p=0이고 A_i^GRPO=0이므로 G = 2λ·tanh(Δ/2)가 되어 교사 게이트가 최대가 된다. 즉 검증기가 어느 궤적에 교사를 붙일지 정하고, 그룹 정답률이 얼마나 세게 붙일지 정하며, 교사는 그 안에서 토큰 단위 업데이트 방향을 제공한다. 게이트는 토큰이 아니라 궤적 수준에서 작동한다. 교사-학생 불일치만으로는 실패 응답 안의 결정적 오류 토큰을 짚어낼 수 없다는 것이 저자들의 판단이다. λ=0이면 GRPO가 되고, γ=0이면 난이도 가중만 뺀 GRPO+OPD 베이스라인이 되어 두 요소의 효과를 분리할 수 있다.

어떻게 쓰나

실험은 Qwen3-0.6B와 1.7B 학생, 고정된 Qwen3-8B 교사로 진행했고, 수학은 DeepMath, 코드는 TACO로 학습했다. 베이스라인은 정방향·역방향 KL 온폴리시 증류, 교사 생성 해답에 대한 SFT, EOPD, Uni-OPD, 그리고 동일 조건의 GRPO다. 수학에서 DiffGate는 GRPO 대비 pass@8을 1.1점과 3.9점 올렸고 avg@8은 0.5점과 0.3점 낮아지는 데 그쳤다. 코드에서는 avg@8이 1.7점과 1.8점, pass@8이 1.6점과 5.7점 올랐다. 수학으로만 학습한 모델을 과학 벤치마크에 그대로 옮긴 OOD 평가에서도 평균 avg@8이 31.2와 39.2로, 베이스 모델의 21.7과 27.5, 최고 OPD 베이스라인의 30.6과 36.7을 앞섰다. 4B 학생(Qwen3-14B 수학 교사, Qwen3-8B 코드 교사)에서는 수학 30.0 avg@8·47.2 pass@8, 코드 57.3 avg@8·70.5 pass@8을 기록해 최강 OPD 베이스라인을 각각 2.9·2.2점, 2.5·2.8점 앞섰다.

전제와 한계

절제 실험은 설계 요소별 기여를 분리한다. γ=0으로 난이도 가중을 없애면 네 설정 모두에서 avg@8이 1.3~2.4점 떨어진다. 유계 변환을 빼고 raw 로그확률 격차를 그대로 쓰면 수학 avg@8이 1.0~1.2점, pass@8이 1.1~1.3점 하락하고 코드 avg@8이 1.1~1.5점, pass@8이 0.8~1.1점 하락하며, 중앙 그래디언트 노름이 1.4~3.3배 커진다. 롤아웃 그룹을 16에서 4로 줄여 보상이 균일한 그룹이 잦아지면 GRPO는 평균 1.9점 떨어지지만 DiffGate는 1.2점만 떨어진다. 0.6B 수학에서는 n=16일 때 GRPO보다 0.5점 낮던 것이 n=4에서는 1.2점 높아진다. λ는 수학에서 0.25~1 구간이 평평하고 그보다 크면 나빠지며 코드는 0.5 근처가 최고였고, γ∈{1,2,3} 변화는 작고 비단조적이었다. 저자들은 게이트를 쓰는지 자체가 게이트의 정확한 예민도보다 중요하다고 정리한다.

학습 동역학 분석은 교사 지도가 실제로 어디서 작동하는지 보여준다. 학습 초기에 프롬프트의 14~36%가 전부 실패 그룹이 되어 GRPO 이점이 정확히 0이 된다. 이런 그룹은 수학에서는 빠르게 줄지만 코드에서는 지속되어, 0.6B 코드 기준 학습 후반에도 약 20%가 남는다. 0.6B 코드에서 실패 롤아웃의 교사-학생 격차는 DiffGate에서 1.04에서 0.37 nats/token으로 줄었고 GRPO는 0.56이었으며, 1.7B에서는 0.19 대 0.30이었다. 게이트는 토큰당 교사 기여를 0.061에서 0.006으로 10배 줄여, 실명 지점이 닫히면 교사를 스스로 끈다. GRPO는 후반 정책 엔트로피가 0.1 아래로 떨어지며 그래디언트 스파이크가 수학 213, 코드 65까지 치솟았지만 DiffGate는 각각 0.7과 2.6으로 억제했고, raw 신호를 쓰면 0.6B 코드의 최대 그래디언트 노름이 4.3에서 342로 뛰었다.

실무 관점에서 이 논문이 주는 시사점은 교사 모델을 RLVR 파이프라인에 붙일 때 적용 범위와 세기를 결과 신호로 라우팅하라는 것이다. 전부 실패한 그룹처럼 그룹 상대 보상이 0이 되는 구간에서만 교사를 켜고, 그룹 정답률이 오르면 교사 가중을 줄이며, 토큰 단위 교사 신호는 반드시 유계로 잘라 그래디언트 폭주를 막는 것이 핵심이다. 또한 롤아웃 그룹 크기를 줄여야 하는 상황(계산 예산 제약)에서 교사 항의 이득이 커진다는 결과는, 그룹 크기를 키우기 어려운 팀에 직접적으로 유용하다. 다만 평가지표가 avg@8과 pass@8 두 개라는 점을 확인해야 한다. 수학에서는 avg@8이 GRPO보다 소폭 낮고 pass@8만 오르므로, 단일 정답률을 최적화하는 워크로드라면 이득이 제한적일 수 있다.

저자들이 밝힌 한계는 명확하다. 평가는 수학 추론과 코드 생성, 그리고 최대 4B 파라미터의 학생 세 가지 크기에 한정되며, 에이전트 추론이나 장기 의사결정 같은 다른 과제에서의 효과는 검증되지 않았다. 계산 자원 제약 때문에 4B보다 큰 학생은 다루지 못했다. 이론 분석도 유계 교사 신호의 고정 접두사 정책 그래디언트 해석, 전부 실패 그룹에서의 지도 제공, 교사 항과 결합 이점의 유계성이라는 세 가지 성질을 특성화할 뿐이며, 전체 PPO 목적함수의 수렴을 보장하지는 않는다고 스스로 못 박는다.