도메인별 교사 피드백 세기를 정규화해 다중 교사 증류를 개선한다
Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation
무엇인가
대규모 언어모델 후처리 학습은 도메인별 강화학습으로 갈라져 왔다. 수학 추론에는 검증 가능한 보상, 코드에는 실행 피드백, 지시 따르기에는 제약 검사가 쓰이고, 데이터와 보상, 최적화가 달라서 같은 초기 모델에서 출발해도 각 도메인에 특화된 전문가가 따로 만들어진다. 하지만 배포할 모델은 하나여야 한다. 다중 교사 온폴리시 증류(MOPD)는 이 통합을 정책 공간에서 수행한다. 학생이 먼저 답을 생성하고, 프롬프트의 도메인 라벨에 따라 배정된 전문가가 학생이 쓴 토큰마다 로그 확률을 알려주며, 그 차이인 증류 어드밴티지가 조밀한 학습 신호가 된다. 문제는 이 라우팅 규칙이 어느 전문가가 감독할지만 정할 뿐, 그 피드백이 공유 학생을 얼마나 세게 움직이는지는 정하지 않는다는 점이다.
어떻게 동작하나
저자들은 Qwen3.5 9B·4B·2B에서 독립적으로 학습된 전문가 풀을 만들어 이 지점을 실증한다. 라벨 라우팅을 쓰는 MOPD 학생은 세 크기 모두에서 최고 단일 교사에게 배운 학생을 능가하지 못했고, 수학 전문가의 이득은 거의 전이되지 않았다. 8K 평가 예산에서는 그 이득의 14~32%만 남았고, 16K에서는 초기 모델 대비 이득이 아예 없었다. 원인은 피드백 스케일의 불균형이다. 첫 학습 배치에서 지시 따르기 전문가의 토큰 단위 교사-학생 로그비는 전체 풀링 신호보다 2.3~4.4배 분산이 컸고, 수학 로그비는 약 절반 수준이었다. 모든 도메인이 같은 파라미터를 갱신하기 때문에 프롬프트 수가 같아도 이 불균형이 업데이트를 좌우한다. 초기 4B 학생 기준으로 동일 가중치에서 지시 따르기 손실이 결합 그래디언트의 94%를 공급했다.
무엇과 다른가
제안 방법인 DN-MOPD(Domain-Normalized MOPD)는 라우팅은 그대로 두고 도메인별 피드백 스케일만 보정한다. 배치마다 도메인 d의 유효 응답 토큰에 대해 교사 로그 확률과 학생 롤아웃 로그 확률의 차이 r의 모집단 표준편차 σ_d를 구하고, 모든 도메인을 풀링한 σ_all도 구한다. 각 도메인에 승수 w_d = clip(σ_all/σ_d, 0.25, 4)를 적용해 어드밴티지를 Ã_t = w_d·A_t로 다시 스케일한다. 분산이 작은 도메인은 증폭되고 큰 도메인은 감쇠되며, 비퇴화 도메인에서는 스케일된 롤아웃 신호의 표준편차가 σ_all과 같아진다. 평균을 빼지 않고 양수를 곱하므로 각 어드밴티지의 부호, 즉 해당 토큰을 장려하는지 억제하는지는 보존된다. 스케일된 어드밴티지는 stopgrad로 분리해 기존의 클리핑된 OPD 손실에 그대로 넣는다. 추가 교사 모델도, 교사 호출도, 학습된 라우터도 필요 없고, 모든 w_d를 1로 두면 원래 MOPD가 된다.
어떻게 쓰나
실험은 Qwen3.5-9B·4B·2B에서 크기별로 독립 학습된 전문가 풀을 쓰고, 학생은 같은 크기의 교사에게 배운다. 평가는 AIME25/AIME26(수학), LiveCodeBench v5/v6(코드, 167/175개 문제), IFEval/IFBench(지시 따르기)의 6개 벤치마크다. 80회 업데이트, 학생 시드 42(43·44는 부록), 8,192토큰 학습 응답 캡, 16,384토큰 평가 캡이 기본 설정이다. DN-MOPD는 모든 크기와 두 평가 예산에서 MOPD를 앞섰다. 16K에서 1.17~2.36%포인트, 8K에서 2.47~3.08%포인트 평균 점수 개선이며, 짝지은 신뢰구간이 모두 0 위에 있다. 세 학생 시드 모두 DN-MOPD에 유리했고(16K 평균 이득 +1.12, +1.97, +2.34), 최강 단일 교사 학생도 모든 크기에서 앞섰다(일부 구간은 0을 포함). 9B에서 양쪽을 160 업데이트까지 이어가면 격차는 +2.57 [+1.65, +3.46]로 커진다. 이득의 중심은 수학이다. 16K에서 MOPD는 어느 크기에서도 초기 학생 대비 수학 이득이 없었지만 DN-MOPD는 모든 크기에서 수학을 개선했고, MATH-500에서는 MOPD를 +0.74, +1.25, +5.95점 앞섰다. 코드와 지시 따르기 이득은 더 작고 일관성이 약하다.
전제와 한계
효과의 출처를 분리한 통제 실험도 있다. 수학 피드백만 키우고 지시 따르기는 그대로 두는 직관적 처방은 4B에서 DN-MOPD 개선의 절반가량만 회복했고 2B에서는 거의 회복하지 못했다. 반대로 지시 따르기만 줄이면 대부분을 회복하면서 수학이 약 3점 올랐다. 세 도메인 가중치를 DN-MOPD의 첫 배치 승수나 전역 (2, 1, 0.25)로 고정해도 9B·4B의 16K에서 검출 가능한 차이가 없었고, 2B에서만 배치별 재추정이 첫 배치 가중치를 1.10점 앞섰다. 실제 학습에서 승수는 수학을 약 1.5~2.1배 증폭하고 코드는 4B·2B에서 1 근처를 유지했으며, 지시 따르기 승수는 대부분의 배치에서 0.25 하한에 붙어 균등화가 아니라 경계에 걸린 상태로 억제됐다. 지시 따르기는 응답 토큰의 약 1%만 차지하지만 풀링 분산의 최대 절반을 설명한다. 수학 이득은 더 짧은 답변과 생성 캡 도달 응답 감소를 동반했으므로 긴 생성에서 나온 것이 아니다.
실무적으로 이 논문이 주는 신호는 명확하다. 여러 특화 모델을 하나로 합치는 증류를 돌릴 때 도메인 라우팅과 프롬프트 배분만 설계하고 끝내면, 분산이 큰 도메인의 피드백이 공유 파라미터 업데이트를 지배해 다른 도메인의 이득이 사라질 수 있다. DN-MOPD는 롤아웃 채점에서 이미 얻은 로그비만 재사용해 배치별 표준편차 두 개를 계산하는 비용으로 이 문제를 완화한다. 다만 도메인별 그래디언트 노름을 맞추는 것이 아니고 배치 손실 스케일을 고정하는 것도 아니라는 점, 그리고 이 방법이 교사 풀과 학생 초기화 구성에 의존한다는 점은 적용 전에 확인해야 한다.
저자들이 밝힌 한계도 분명하다. 비교는 하나의 모델 패밀리 안에서 크기당 전문가 풀 하나만 사용했고, 학생 시드 3개는 전문가 재학습을 포함하지 않는다. DN-MOPD는 이전 Qwen3 개발 도구에서 선택됐으며, 다른 설정의 이전 Qwen3-4B 비교에서는 뚜렷한 이득이 없었으므로 효과는 교사-학생 구성에 달려 있다. 스케일 추정은 도메인 구성과 응답 길이에 의존하고 클리핑 범위는 크기별로 튜닝하지 않았으며, 지시 따르기 승수가 보통 하한에 머무는 만큼 그 도메인은 균등화가 아니라 경계로만 제한된다. 고정 가중치가 9B·4B에서 비슷한 성능을 내므로 배치별 재추정의 추가 이득은 2B에서만 확인됐고, 학습을 더 길게 했을 때 수렴 시점의 최종 순위는 아직 unresolved로 남아 있다.