교사의 후처리 변화만 옮기는 다중 교사 증류가 더 균형 잡힌 목표를 만든다

Composing What Each Teacher Learned: Multi-Teacher On-Policy Distillation through Teacher-Relative Shifts

arXiv2610.10460v1

Hejian Sang2026-10-07

무엇인가

온폴리시 증류(OPD)는 학생 모델이 스스로 생성한 롤아웃을 교사가 채점하게 함으로써, 학생이 실제로 방문하는 상태에서 감독 신호를 받게 한다. 여러 특화 모델을 하나의 학생으로 합치는 다중 교사 OPD(MOPD)는 두 방식으로 쓰인다. 같은 프롬프트 도메인에서 여러 교사가 동일한 롤아웃을 채점해 신호를 하나의 목표로 합치는 공통 도메인 합성과, 도메인별 프롬프트를 해당 전문가에게 배정하는 라우팅 도메인 증류다. 문제는 두 방식 모두 교사의 엔드포인트 정책을 그대로 옮긴다는 점이다. 엔드포인트에는 후처리 단계가 만들어낸 변화와 그 교사가 물려받은 베이스 모델의 선호가 뒤섞여 있다. 교사의 베이스가 학생의 초기화와 다르면 그 물려받은 차이까지 함께 전이된다. 원래 MOPD 파이프라인은 모든 교사가 학생과 같은 초기 체크포인트를 공유해 이 문제를 피했지만, 공개된 전문가 모델은 그런 경우가 드물다.

어떻게 동작하나

논문은 MOPD 레시피에서 교사 선택과 목표 구성이라는 두 결정을 분리하고, 교사 선택을 고정한 채 목표 구성만 바꿔 비교한다. 제안하는 Δ-MOPD는 각 교사를 자기 베이스 B_i와 비교해 얻은 로짓 시프트 z_Ti − z_Bi를 학생의 동결된 초기화 A에 다시 앵커링한다. 엔드포인트 목표가 z_A + Σ(z_Ti − z_A)라면 Δ-MOPD 목표는 z_A + Σ(z_Ti − z_Bi)이고, 둘 다 소프트맥스로 정규화된다. 같은 상태에서 두 목표의 차이는 정확히 Σ(z_Bi − z_A), 즉 물려받은 베이스 차이다. 교사의 베이스가 학생 초기화와 같으면 두 구성이 완전히 일치하므로, 동일 기원 교사로의 라우팅은 기존 엔드포인트 OPD와 같아진다. 차이는 교차 기원 교사 항에서만 발생한다. 저자들은 엔드포인트 보상을 시프트 항 R^Δ와 베이스 참조 끌림 항 R^B로 분해해, 엔드포인트 감독은 각 교사의 서로 다른 베이스로 학생을 끌어당기는 반면 Δ-MOPD는 학생 초기화라는 단일 참조로 끌어당긴다고 설명한다.

무엇과 다른가

실험은 DeepSeek-R1-Distill-Qwen-1.5B를 앵커이자 학생 초기화로 쓰고, Polaris-7B를 교차 기원 교사로, Nemotron과 JustRL을 동일 기원 교사로 둔다. Polaris는 같은 증류 계열의 더 큰 7B 체크포인트에서 후처리된 모델이다. 진단 지표에서 엔드포인트 감독 하의 Polaris는 베이스 참조 끌림의 그래디언트 노름이 시프트의 약 두 배(Γ_base ≈ 2)였다. 교사 항 노름 비율은 엔드포인트 합성에서 5.2였으나 시프트 합성에서 1.44로 떨어졌고, 목표–학생 KL은 0.152에서 0.031로 약 5분의 1이 됐다. 상쇄 지표는 0.136에서 0.287로 올라 균등 노름 독립 기준(0.293)에 가까워졌고 코사인은 −0.016이었다. 교사 3개일 때 목표–앵커 KL도 0.695 대신 0.483으로 낮았다.

어떻게 쓰나

Polaris 단독 증류 실험에서 Δ-MOPD는 100 스텝에 영어-수학 매크로 2.87pp 앞섰고, 100 스텝에서 47.90%를 기록해 엔드포인트가 195 스텝에서 얻은 최고 46.54%를 이미 넘었다. 전구체 채점 오버헤드와 느린 업데이트 비용을 포함해도 할당 H100 시간은 28.0 대 42.9였다. 초기화 시점에 엔드포인트 목표는 16,384개 공유 프리픽스 상태에서 목표–학생 KL이 4.94배 더 멀었다. 공통 도메인 합성에서 교사 2개일 때 두 목표는 비슷했다(Avg@K 44.91% 대 45.14%, 그리디 37.73% 대 36.25%). 교사 3개로 늘리면 Δ-MOPD가 수학 매크로에서 4.11pp, 5개 벤치마크 매크로에서 1.95pp 앞선다. 동일 기원인 JustRL을 추가했을 때 시프트 합성은 수학 4.40pp, 5종 1.78pp 오르지만 엔드포인트 합성은 0.43pp, 0.58pp 오르는 데 그쳤다. 이득은 AIME 2025에 집중됐고, 이 실행에서 도메인 내 프롬프트를 받지 않은 Science/IF는 엔드포인트 합성보다 1.29pp 낮았다.

전제와 한계

라우팅 설정에서 Polaris는 수학을, Nemotron은 Science/IF를 담당한다. 두 교사가 학습 내내 함께 활성화되는 인터리브 라우팅에서는 5종 매크로 차이가 Δ-MOPD 쪽으로 0.62pp에 불과했고 수학 +0.91pp, Science/IF +0.19pp였다. 각 업데이트가 교사 하나만 보는 경우 두 목표가 비슷하다는 뜻이다. 반면 교사–도메인 쌍이 연속된 위상을 차지하는 단계적 라우팅에서는 Δ-MOPD가 두 순서 모두에서 같은 순서의 엔드포인트 대조군을 5.68pp, 1.60pp 앞섰고, 두 위상 순서 간 격차는 10.50pp에서 6.42pp로 줄었다. 토크나이저가 다른 교사를 투영해 추가한 네 번째 시프트 실험에서는 세 수학 벤치마크가 모두 개선되며 수학 매크로 +3.32pp, 5종 매크로 +1.85pp가 더해졌다.

실무 관점에서 이 논문이 주는 메시지는 명확하다. 공개된 파인튜닝 모델 여러 개를 합쳐 자체 모델을 증류할 때, 교사 모델의 최종 가중치를 그대로 목표로 삼으면 그 교사가 물려받은 베이스 성향까지 함께 학습될 수 있다. 특히 교사가 학생과 다른 베이스 계열에서 왔다면 그 차이가 후처리 변화보다 큰 신호가 되어, 여러 교사를 합성할 때 한 교사가 목표를 지배할 수 있다. Δ-MOPD를 쓰려면 각 교사의 후처리 직전 체크포인트(전구체)와 토크나이저 호환성 또는 명시적 투영 규칙이 필요하다. 블랙박스 API로만 제공되는 교사에는 적용할 수 없다. 또한 시프트 노름은 후처리 변화의 크기와 로짓 온도·확신도의 스케일을 함께 반영하므로, 캘리브레이션을 별도로 다루는 것이 보완적이라고 저자들은 덧붙인다.

저자들이 밝힌 한계는 두 가지다. 첫째, 평가 범위가 공개 추론 전문가와 수학 프롬프트의 공통 도메인 합성에 한정되며 Science/IF는 홀드아웃 평가로만 측정했다. 더 넓은 전문가군과 도메인 혼합 합성은 향후 과제다. 둘째, Δ-MOPD는 블랙박스 OPD와 달리 각 교사의 전구체와 호환 토크나이저 또는 명시적 투영 규칙을 요구한다. 또한 저자들은 교사 신호가 상태 단위로 합성될 때 시프트 목표의 이점이 가장 명확하며, 단계적 라우팅 결과는 그 이점이 학습 단계에 걸쳐 누적되는 신호로 확장될 수 있다는 지지 증거일 뿐이라고 스스로 선을 긋는다.