같은 계열 모델에서 온폴리시 증류가 규모에 따라 어떻게 전이되는지 실측한다
Scaling Properties of Same-Family On-Policy Distillation
무엇인가
이 논문은 강화학습으로 추론 능력을 얻은 대형 언어모델의 전문성을 다른 크기의 모델로 옮기는 온폴리시 증류(OPD)가 규모에 따라 어떻게 전이되는지 다룬다. OPD는 학생 모델이 생성한 롤아웃에 교사 정책이 토큰 단위 감독을 주는 방식으로, 교사의 궤적을 그대로 모방하게 하지 않는다. 저자들은 교사와 학생 규모, 교사 점수만으로 OPD를 돌리기 전에 결과 학생 정책의 성능을 추정할 수 있는지 묻는다. 약한 교사에서 강한 학생으로 가는 weak-to-strong 전이는 작은 규모에서 RL 전문가를 한 번 만들어 모델 패밀리 전체에 재사용할 수 있어 특히 중요하다. 실험은 Qwen2.5 Base 0.5B, 1.5B, 3B, 7B, 14B로 수학 추론을 대상으로 한다. 모든 모델은 Dolci-SFT 일부로 기본 지시 수행 SFT를 거치고, 교사는 GSM8K와 MATH 혼합 학습 14.8K 예시에 GRPO RL을 적용해 만든다. 평가는 혼합 테스트 6.3K 예시의 정확도인 gold score로 한다. OPD는 같은 학습 프롬프트로 최대 10에폭 580 업데이트까지 돌리고 주기적으로 held-out 평가한다. 총 25개 교사-학생 조합이 weak-to-strong, same-base, strong-to-weak을 포함한다.
어떻게 동작하나
방법론에서 훈련 진행도는 학생 초기화로부터의 토큰 평균 reverse KL을 비편향 추정한 k3의 제곱근 d로 정의한다. Vanilla-OPD는 시퀀스 수준 reverse KL을 최소화하며, 구현에서는 토큰 보상을 log πT - log πθ로 두고 미래 보상을 0으로 할인해 각 토큰이 즉시 보상만 받는 정책 경사로 최적화한다. Delta-OPD는 교사가 RL로 얻은 정책 변화를 보상으로 쓴다. 즉 log πT - log πT_base를 토큰 보상으로 하고 학생 기준 정책과의 KL 항을 더한다. OffPD는 교사 롤아웃에 대한 SFT다. 저자들은 피크 gold score와 초기 전이 기울기를 학생 규모, 학생 규모로 상한을 둔 유효 교사 규모, 교사의 남은 오차의 멱법칙으로 피팅한다.
무엇과 다른가
25개 Vanilla-OPD 실행에서 초기에는 gold score가 d에 거의 선형으로 오르는 규칙적 useful-transfer 구간이 나타난다. 처음 30개 체크포인트에 대한 선형 피팅은 R² 0.932~0.988, RMSE 0.0026~0.0129, 기울기 0.175~0.721을 보인다. 전이 종료점은 궤적이 초기 선형 피팅의 95% 예측 밴드 아래로 세 체크포인트 연속 내려가기 전의 마지막 d로 정의한다. 그 이후 동역학은 감쇠 개선, 포화, 회귀가 섞여 이질적이다. 큰 학생에서는 교사 규모가 커질수록 피크가 오른다. 7B 학생은 72.7%에서 81.9%로, 14B 학생은 77.7%에서 87.3%로 증가한다. 반면 0.5B 학생은 3B 교사에서 40.8%로 피크를 찍지만 7B 교사에서 39.0%, 14B 교사에서 37.7%로 떨어진다. same-base Vanilla-OPD 피크는 다섯 규모 모두 직접 RL 기준과 0.5%포인트 이내이고 세 규모에서는 앞선다. gold score가 회귀할 때 교사 유도 프록시 점수는 계속 오르므로 후반 회귀는 암시적 보상 과최적화의 흔적이다. 주 규칙에서 25개 중 9개가 관측 지지 안에서 이탈하고, 신뢰 수준과 지속 조건을 바꾸면 8~12개로 변한다.
어떻게 쓰나
규모 법칙 피팅에서 모든 관측된 weak-to-strong 쌍은 학생의 피크 gold score가 교사 자신의 점수를 넘는다. 그 차이는 교사 규모가 학생 규모에 가까워질수록 줄어든다. 두 방법 모두 ζ≈1이라 학생의 피크 오차는 상한을 둔 교사의 남은 오차에 거의 비례하고 학생 규모의 거듭제곱으로 줄어든다. β가 음수라는 것은 같은 점수에서는 작은 교사가 더 잘 전이한다는 뜻이다. 교사 점수를 조건으로 넣은 결합 법칙은 규모만 쓴 기준선의 leave-one-scale-out RMSE를 절반으로 줄이고, 가장 큰 held-out 학생과 교사로 외삽할 때 Vanilla-OPD 0.7%포인트, Delta-OPD 0.4%포인트 이내로 맞춘다. 통제 비교에서 7B 학생을 66.0점의 중간 3B 교사 체크포인트에서 증류하면 결합 법칙은 피크를 0.3%포인트 이내로 예측하고 1.5B RL 끝점 63.6보다 낮은 순서를 맞힌다. 규모만 보거나 점수만 보는 법칙은 더 크고 점수 높은 교사를 선호해 틀린다. 전이 속도 법칙은 교사 남은 오차가 커질수록 급격히 느려지며 ξ=1.9(Vanilla), 2.0(Delta)이고, 같은 점수에서는 큰 교사가 더 느리다. 속도 피팅은 log 공간 R² 0.59와 0.76으로 피크보다 noisy하다. 전이 범위 d_transfer는 Vanilla 0.20~0.36, Delta 0.27~0.34, 중앙값 0.30과 0.29로 약 두 배 안에 머물러 규모 법칙보다 대략 규모 독립적인 KL 예산으로 읽힌다.
전제와 한계
설계 선택 실험에서 Delta-OPD는 같은 교사·학생 규모의 Vanilla-OPD와 17개 셀을 비교한다. 10개는 weak-to-strong, 5개는 same-base, 2개는 strong-to-weak 통제다. Delta-OPD의 처음 40개 선형 피팅은 R² 0.916~0.987, RMSE 0.0049~0.0116이다. 기울기는 17개 공유 셀 중 15개에서 Vanilla-OPD를 넘고, 예외는 0.5B 교사 아래의 두 가장 작은 학생이다. Delta-OPD는 기준선 대비 피크 이득과 절대 피크가 각각 12개 셀에서 더 크며, 대부분 weak-to-strong 쌍 10개 중 9개에 집중된다. 이득은 교사 규모가 커지면 줄어 0.5B 교사는 절대 피크를 2~4%포인트 더 올리지만 더 큰 교사는 약 1%포인트 안에 머문다. 17개 실행 중 5개는 초기 선형에서 벗어난다.
온폴리시 감독 정도를 비교하면 순수 OPD가 모든 셀에서 최고 피크를 낸다. 오프폴리시 콜드스타트는 교사 롤아웃 20K Dolci-Think-RL 프롬프트에 1에폭 SFT를 한 뒤 580 OPD 업데이트를 하는 조건인데, weak-to-strong 격차가 클수록 해롭다. 0.5B 전문가가 가르치는 3B, 7B, 14B 학생에서 각각 6.6, 15.7, 19.4%포인트를 잃는다. 손해는 콜드스타트 자체에서 발생한다. 0.5B 전문가 롤아웃에 1에폭 SFT를 하면 모든 학생이 교사 점수 근처로 고정되어 14B 학생 초기화의 32%포인트를 지우고, 이후 OPD도 이를 회복하지 못한다. 순수 OffPD는 모든 셀에서 순수 OPD보다 낮고, 극단 weak-to-strong 셀에서는 28.4%포인트 낮으며 same-base 셀에서는 1%포인트 미만 차이다.
부트스트래핑 weak-to-strong OPD도 직접 전이를 넘지 못한다. RL은 가장 작은 0.5B에만 적용하고, 더 큰 교사는 이전 단계의 최선 OPD 체크포인트로 삼는다. Vanilla 5개 체인, Delta 3개 체인을 중간 크기를 모두 밟거나 일부 건너뛰며 실행한다. 모든 체인은 같은 학생 규모에서 0.5B 전문가로부터의 직접 OPD보다 피크가 낮다. 3B에서 60.4 대 61.4, 7B에서 70.0~71.3 대 72.7, 14B에서 76.8 대 77.7이다. 더 긴 체인은 더 짧은 체인보다 약간 낮다. 교사 점수와 가르치는 가치도 분리된다. 1.5B OPD 산출물은 53.0%로 0.5B RL 전문가 39.8%보다 높지만, 그 3B 학생은 0.5B 전문가의 직접 학생보다 피크가 낮다. Delta 체인도 전체 체인이 각 단계에서 직접 Delta-OPD보다 낮다. 3B에서 64.5 대 65.3, 7B에서 74.0 대 75.0, 14B에서 79.4 대 79.9다. 학생 자체에 대한 직접 RL은 모든 약한 교사 변형보다 높다.
개발자에게 이 논문은 OPD를 돌리기 전에 학생 규모, 교사 규모, 교사 점수로 결과를 추정하는 체크리스트를 준다. 교사 점수만으로 교사를 고르면 안 된다. 같은 점수에서는 작은 교사가 더 잘 전이하고, 교사 규모가 학생 규모를 넘는 이득은 제한적이다. weak-to-strong에서는 순수 OPD를 쓰고 오프폴리시 콜드스타트를 피하며, 부트스트래핑이 직접 전이를 개선한다고 가정하지 말아야 한다. 한계로 저자들은 파라미터 수가 모델 규모, 데이터 규모, 학습 컴퓨트를 뒤섞은 혼동 변수라서 이 법칙을 compute-optimal 설정에서 읽어야 한다고 밝힌다. 실험은 Qwen2.5 같은 계열의 수학 추론, 0.5B~14B에 한정되고, 가장 작은 학생의 역전은 모델링되지 않은 잔차로 남는다. 전이 범위는 법칙이 잘 서지 않고 속도 법칙은 noisy하다. 또한 증류는 교사의 잘못된 지식, 환각, 편향, 안전하지 않은 패턴을 학생에게 전파할 수 있고 weak-to-strong 부트스트래핑은 이를 증폭할 수 있어, gold score 평가만으로 안전성을 보장할 수 없다고 경고한다.