온폴리시 학습이 정말 유리한지 증류 실험으로 분리해 검증한다
On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics
무엇인가
온폴리시 학습은 치명적 망각을 줄이고, 파라미터 업데이트를 더 희소하게 만들며, 일반화를 개선한다고 주장되어 왔다. 그러나 기존의 지도 미세조정(SFT)과 검증 가능 보상 강화학습(RLVR) 비교는 목적함수, 감독의 출처와 밀도, 최적화 절차를 동시에 바꾸기 때문에 롤아웃 정책 자체의 기여를 분리할 수 없다. 이 논문은 강한 교사에서 약한 학생으로 지식을 옮기는 증류를 통제된 실험대로 삼아, 데이터 생성 정책만 바꾸고 나머지 파이프라인은 고정함으로써 이 모호함을 해소하려 한다. 온폴리시 방식은 학습 내내 계속 생성해야 하지만 오프폴리시 방식은 기존 데이터를 재사용할 수 있으므로, 이점이 다른 설계 선택에서 온 것이라면 그 추가 비용은 불필요할 수 있다는 것이 문제의식이다.
어떻게 동작하나
실험 설계의 핵심은 세 가지 요인을 독립적으로 변화시키는 것이다. 롤아웃 정책(교사가 만든 고정 응답을 쓰는 OffPD 대 학생이 생성한 궤적에 교사가 토큰별 감독을 주는 OnPD), 토큰 수준 KL의 방향(교사 분포에 가중치를 두는 순방향 KL과 학생 분포에 가중치를 두는 역방향 KL), 그리고 학습률(1×10⁻⁵ 또는 5×10⁻⁵)이다. 목적함수는 프롬프트 x를 뽑고 롤아웃 정책 ρ로 출력 y를 생성한 뒤, 각 토큰 위치에서 학생과 교사의 다음 토큰 분포 사이 거리를 평균하는 형태다. 저자들은 전체 어휘에 대해 KL을 계산하고, 학생이 샘플링한 접두사에 대해서는 그래디언트를 끊어 궤적을 고정된 것으로 취급한다. 관례적으로 OnPD는 역방향 KL, OffPD는 순방향 KL과 짝지어지지만, 전체 어휘 KL을 쓰는 이 설정에서는 두 선택이 개념적으로 독립이므로 교차 조합까지 실험한다. 모델은 Llama-3.1-8B 교사에서 Llama-3.2-1B 학생으로, 그리고 Qwen2.5-7B에서 Qwen2.5-1.5B로 증류하며, 의료 추론 MedReason, 과학 추론 Science, 산술 추론 Countdown 세 과제를 쓴다. 각 설정은 150 최적화 스텝, 3개 시드로 학습한다.
무엇과 다른가
최종 목표 과제 정확도에서 온폴리시 롤아웃은 일관된 이점을 주지 못했다. 세 데이터셋 평균 최고 정확도는 OnPD 72%, OffPD 73%로 거의 같았다. 대신 KL 방향이 뚜렷한 차이를 만들었다. 순방향 KL은 모든 롤아웃 정책과 학습률에서 71~73%를 기록한 반면, 역방향 KL은 35~72%까지 넓게 흔들리며 학습률에 훨씬 민감했다. 망각도 마찬가지다. 7개 분포 외 벤치마크 평균 성능은 낮은 학습률에서 최대 1.3%포인트 변하는 데 그쳤지만, 높은 학습률에서는 11.2~14.0%포인트 떨어졌다. 롤아웃 정책 차이는 이에 비해 작았다. 파라미터 업데이트 희소성(초기 체크포인트 대비 절대 변화가 10⁻⁶ 미만인 파라미터 비율)도 낮은 학습률에서 85.3~89.6%, 높은 학습률에서 51.9~60.0%로 학습률이 지배했고, 짝지어진 모든 비교에서 OffPD가 OnPD만큼 또는 그보다 희소한 업데이트를 만들었다. Countdown-3에서 학습률을 1×10⁻⁵에서 6×10⁻⁵까지 쓸어보면 희소성은 거의 선형으로 감소하고 분포 외 성능도 함께 나빠졌으며, 순방향 KL에 작은 학습률을 쓰면 최고 성능을 유지하면서도 기존 능력 손실을 피할 수 있었다.
어떻게 쓰나
저자들은 이 비대칭을 로짓 그래디언트로 설명한다. 순방향 KL의 학생 로짓에 대한 미분은 πS(v) − πT(v)로, 교사와 학생 분포가 다른 곳이면 어디서든 0이 아니고 각 좌표가 [−1, 1] 안에 있다. 따라서 학생 로짓 야코비안이 유계라면 두 롤아웃 정책이 만드는 순방향 KL 업데이트 차이는 두 정책이 유도하는 접두사 분포 사이 총변동 거리에 선형으로 묶인다. 반면 역방향 KL의 미분은 πS(v)[log(πS(v)/πT(v)) − D_RKL]로 가중되는데, 학생 확률이 0에 가까워지면 교사가 그 토큰에 큰 확률을 줘도 그래디언트가 사라지고, 학생이 교사가 극히 비관하는 토큰에 확률을 주면 로그비가 임의로 커질 수 있다. 롤아웃 거리와 야코비안만으로 묶이는 상한이 없다는 뜻이다. 이를 검증하려고 학생과 교사 사이를 보간하는 롤아웃 정책 스펙트럼 πλ를 도입한다. 로짓을 ½(log πS + log πT) + (λ/2)(log πS − log πT)로 두어 λ=−1이 OffPD, λ=1이 OnPD가 되고, λ<−1이나 λ>1은 한쪽 모델이 선호하는 토큰 쪽으로 외삽한다. Countdown-3 실험에서 순방향 KL은 스펙트럼 전체에서 정확도 80% 이상을 유지하며 1×10⁻⁵ 학습률에서 편차가 5.2%포인트에 불과했고, 심지어 일관성 없는 고엔트로피 롤아웃 구간을 지나면서도 학습했다. 역방향 KL은 λ에 따라 평균 성능이 크게 흔들리고 시드 간 분산도 컸으며, 높은 학습률에서는 불안정해 때때로 붕괴했다.
전제와 한계
정확도 외 지표에서는 롤아웃 정책의 효과가 더 분명해진다. 반복 샘플링에서 순방향 KL은 비슷한 pass@1에서도 pass@10이 유의하게 높아, 출력 커버리지는 롤아웃 정책보다 KL 방향이 좌우했다. 반면 학습 없이 더 어려운 Countdown-4E(1~10에서 뽑은 네 개 피연산자)로 일반화를 평가하면, 두 KL 방향 모두에서 온폴리시 쪽(λ>0)이 오프폴리시보다 pass@k가 10~15% 일관되게 높았다. 이것이 온폴리시 롤아웃이 뚜렷한 이득을 준 첫 사례다. 그러나 이 우위는 이후 RLVR에서 유지되지 않았다. Countdown-3 증류 체크포인트를 Countdown-4에서 300 RLVR 스텝 학습시키면, 1×10⁻⁵로 역방향 KL 증류한 체크포인트는 빠르게 개선되다가 나중에 보상이 붕괴했고, 순방향 KL 1×10⁻⁵ 또는 역방향 KL 5×10⁻⁵로 증류한 오프폴리시 체크포인트가 꾸준히 개선되어 최종 성능이 가장 높았다. 초기 일반화 이득이 안정적인 우위로 이어지지 않은 것이다. 부수적 교사 스타일 전이 실험에서는 교사에게 스페인어로 추론하도록 지시했을 때, OnPD와 역방향 KL 조합만 학생의 영어 응답 스타일을 대체로 유지했고 나머지 조합은 거의 완전히 스페인어로 넘어갔다.
저자들은 이 결론이 실험 설계의 세 가지 선택에 기인하지 않는지도 확인한다. 전체 어휘 KL 대신 샘플링 기반 KL 추정기를 쓰면 순방향 KL의 롤아웃 정책 강건성과 역방향 KL의 민감성, 학습률의 지배력이 그대로 재현됐다. 그래디언트 클리핑(전역 노름 1.0)을 제거하면 KL 방향 간 차이는 더 커져 역방향 KL 성능이 크게 나빠지고 순방향 KL은 큰 학습률에서도 유효했지만, OnPD와 OffPD 사이의 일관된 격차는 나타나지 않았다. 교사 응답이 평균 622토큰으로 긴 Numina-MATH(Qwen2.5)에서는 낮은 학습률에서 OnPD와 역방향 KL 조합이 MATH-500 정확도가 가장 높았으나 조건당 한 번만 실행해 시사 수준으로 취급한다.
개발자 관점에서 이 논문의 실무적 함의는 명확하다. 온폴리시 증류를 도입할 근거로 흔히 드는 망각 감소나 업데이트 희소성은 통제된 조건에서 재현되지 않았고, 그 두 가지는 학습률로 거의 결정됐다. 따라서 온폴리시 롤아웃을 위한 지속적 생성 비용을 지불하기 전에 학습률과 KL 방향을 먼저 조정하고, OffPD를 표준 베이스라인으로 함께 측정하는 편이 합리적이다. 온폴리시 데이터는 학습 분포보다 어려운 변형으로의 일반화를 노릴 때만 값어치가 있었고, 그 이득도 후속 RLVR 단계를 거치면 사라질 수 있으므로 다단계 파이프라인에서는 각 단계의 초기 정확도가 아니라 최종 단계 성능으로 체크포인트를 골라야 한다. 스타일 전이 억제가 목적이라면 OnPD와 역방향 KL 조합이 후보가 될 수 있다.
저자가 밝힌 한계는 범위의 제약이다. 학생 모델이 최대 1.5B 파라미터이고, 그에 따라 추론 궤적이 최대 2,000토큰인 과제에 국한된다. 더 큰 모델과 더 긴 롤아웃이 필요한 과제로 확장하는 것이 향후 과제이며, 교사 모델을 고정했기 때문에 특정 학생-교사 조합에서 OnPD와 OffPD의 차이가 나타나는지는 검증되지 않았다. 또한 긴 롤아웃 절제 실험은 조건당 한 번만 실행되어 온폴리시 이점을 시사 수준으로만 주장한다.