다중 교사 온폴리시 증류의 교사 신호가 파라미터와 성능에 미치는 영향을 해부한다

From Gradients to Capabilities: Understanding Multi-Teacher On-Policy Distillation

arXiv2610.02179v1

Siqi Zhu2026-10-01

무엇인가

이 논문은 다중 교사 온폴리시 증류(MOPD)가 수학, 코드, 지시 따르기, 과학처럼 서로 다른 강점을 가진 RL 교사들을 하나의 학생 모델에 합치는 과정에서 교사 신호가 실제 파라미터 변화와 과제 성능으로 어떻게 이어지는지를 다룬다. 강한 교사들을 모아도 학생이 모든 교사의 강점을 습득한다는 보장이 없고, 기존 레시피는 손실 평균화, 도메인 정규화, 어휘 감독 범위, 옵티마이저 설정을 제각각 선택해 왔다. 저자들은 Qwen3-1.7B와 수학, 코드, 지시 따르기, 과학 도메인 교사를 사용하고, 학생과 같은 초기화에서 RL로 학습된 교사들을 비교한다. 추가 진단으로 SmolLM3-3B를 쓰며, 동일한 학생 파라미터와 응답, 옵티마이저 상태에서 그래디언트, 옵티마이저 업데이트, 과제 학습 곡선을 추적한다. 원문은 구체적 데이터셋 이름을 명시하지 않고 도메인 과제와 응답 길이, 학습 스텝 기준으로 비교한다.

어떻게 동작하나

방법의 핵심은 MOPD 손실을 구성하는 평균화 규칙과 증류 손실을 분리해 비교하는 것이다. 학생이 프롬프트 x에서 응답 y를 생성하면 해당 도메인의 고정 교사 q_d가 각 접두사에서 다음 토큰 확률을 제공하고, 배치 안의 각 응답은 자기 도메인 교사와 T_i개의 유효 토큰 손실을 평균한다. 전체 손실은 각 응답 손실에 가중치 w_i를 곱해 합산한다. 이때 전역 토큰 평균화(GT)는 모든 응답 토큰을 동등하게 가중해 도메인 가중치가 토큰 점유율을 따르게 하고, 도메인 토큰 평균화(DT)는 도메인 가중치를 고정하지만 응답 길이에 따라 더 긴 응답에 더 큰 가중치를 준다. 도메인 응답 평균화(DR)는 도메인 가중치를 고정하면서 도메인 내 응답을 동등하게 가중한다. 저자들은 DT의 도메인 내 그래디언트가 평균 그래디언트에 길이와 그래디언트의 공분산 항을 더한 형태가 됨을 보여, 도메인 균형만 맞춰도 긴 응답 쪽으로 그래디언트가 치우칠 수 있음을 설명한다. 증류 손실은 전체 어휘 역KL, 학생이 샘플한 토큰만 쓰는 정책 그래디언트(PG), 학생 top-k와 교사 top-k의 교집합에 대해서만 재정규화한 top-k 교집합 KL을 비교한다.

무엇과 다른가

손실 평균화 실험에서 동일 프롬프트 수를 쓰면 수학 도메인이 지시 따르기보다 약 3배 많은 토큰을 공급해 GT에서 수학이 손실 가중치의 약 44%를 차지한다. DT와 DR의 평균 그래디언트 코사인 유사도는 6개 배치에서 0.68이었다. 500스텝 학습 후 GT, DT, DR 간 네 과제 평균 점수 범위는 PG 손실과 Adam에서 0.28%포인트, top-64 교집합 KL에서 0.06%포인트, PG 손실과 SGD에서 0.68%포인트였다. DR 대비 GT는 PG 손실에서 수학 정확도를 3.0%포인트 높이고 과학을 2.1%포인트 낮췄다. 반면 top-64에서는 수학이 더 큰 가중치에도 1.8%포인트 하락하고 코드가 더 작은 가중치에도 1.5%포인트 상승했다. 즉 손실 함수가 바뀌면 같은 가중치가 과제 성능으로 번역되는 방식도 달라진다.

어떻게 쓰나

Adam의 1차 모멘트는 서로 다른 교사와 평균화 규칙의 업데이트 차이를 줄인다. 원시 그래디언트가 달라도 교사 간 평균 코사인은 0.83, 평균화 규칙 간에는 0.96이었고, 1차 모멘트를 초기화하면 이 정렬이 거의 0으로 떨어졌다. Adam은 클리핑을 더 자주 유발하고, 모멘트를 초기화하면 스텝 크기가 달라진다. 모멘텀을 쓰지 않는 SGD는 PG 손실에서 모든 평균화 규칙에 대해 Adam보다 높은 네 과제 평균 점수를 냈다. DR은 39.94 대 38.91, DT는 39.46 대 38.63, GT는 39.26 대 38.79였다. BF16 반올림은 변화를 숨긴다. MOPD 학생의 FP32 마스터 가중치 약 97%가 초기화와 달라졌지만 BF16으로 반올림하면 7~11%만 달라진다. FP32에서는 상위 약 3분의 1이 전체 변화의 90%를 설명하지만 BF16에서는 약 4%만 그렇다. 따라서 BF16 체크포인트의 희소해 보이는 변화는 실제 최적화 움직임을 과소표현할 수 있다.

전제와 한계

어휘 감독 실험에서 Qwen의 top-64 교집합은 평균적으로 전체 학생 확률의 99.9% 이상, 학생 자신의 top-64 질량의 99.97% 이상을 보존했고, 전체 어휘 KL 그래디언트 방향과 거의 일치했다. 고정 접두사당 1개, 16개, 64개 샘플로 그래디언트를 평균하면 기준 그래디언트와의 코사인이 0.54에서 0.87, 0.97로 올라갔다. 그러나 과제 성능은 평균화 규칙에 따라 갈렸다. 응답 평균화에서는 top-64가 PG보다 수학 정확도를 2.6%포인트 높였지만 지시 따르기와 과학은 낮아졌고 네 과제 평균은 0.16%포인트 올랐다. 전역 토큰 평균화에서는 수학이 2.1%포인트 낮아지고 코드와 지시 따르기가 좋아져 평균은 0.21%포인트 올랐다. SmolLM3-3B에서는 top-64가 초기 97.42%, 학습 후 98.56%를 보존했지만 가중 접두사의 8.42%와 3.65%는 학생 확률을 90% 미만만 보존했고, 그래디언트 오차는 2.16~24.54%에 달했다. 응답 길이 상한을 4K에서 8K로 늘리면 원시 그래디언트 차이는 GT가 가장 크고 DT, DR 순으로 작아졌으며, 100스텝에서 8K 빼기 4K 평균 점수 차이는 GT +1.05, DT +0.32, DR -0.83%포인트였다.

개발자 관점에서 이 논문은 MOPD 레시피를 그대로 복사할 때 생기는 숨은 가정을 드러낸다. 도메인 토큰 비율을 맞추는 것만으로는 도메인 내 긴 응답 편향이 사라지지 않으며, 응답을 동등하게 다루려면 DR 같은 규칙을 명시적으로 선택해야 한다. Adam 모멘텀은 교사별 차이를 정렬해 안정적으로 보이게 하지만 현재 교사 신호에 대한 적응을 늦출 수 있고, 실제로 모멘텀 없는 SGD가 평균 점수에서 더 높았다. BF16 체크포인트만 보고 파라미터 변화가 적다고 판단하면 FP32 마스터 가중치의 광범위한 변화를 놓칠 수 있다. top-k 교집합 KL은 전체 어휘 그래디언트에 가까운 저렴한 근사지만 과제별 이득과 손실이 평균화 규칙에 따라 뒤집히므로, 목표 과제 세트에서 반드시 별도 평가해야 한다.

저자들이 밝힌 한계는 분명하다. 이 발견은 제한된 모델 계열과 규모에서 나왔고 더 큰 규모에서는 다르게 나타날 수 있다. 또한 모든 과제에서 최선인 평균화 규칙은 없었고, 그래디언트 근사가 더 정확하다고 해서 과제 성능이 항상 좋아지지도 않았다. 향후 연구로 Adam의 β1을 더 작게 했을 때 교사 신호 적응이 개선되는지, 그래디언트 클리핑과 2차 모멘트 정규화가 비슷한 기대 그래디언트를 가진 손실들의 다른 과제 결과를 설명할 수 있는지가 제안된다.