도메인별 교사 피드백 세기를 정규화해 다중 교사 증류를 개선한다

Beyond Teacher Assignment: Domain-Normalized Multi-Teacher On-Policy Distillation

HF Daily2609.35347

Xin Li, Hao Jiang, Xin Gao2026-09-28조회 2

무엇인가

대규모 언어모델 후처리 학습은 도메인별 강화학습으로 갈라져 왔다. 수학 추론에는 검증 가능한 보상, 코드에는 실행 피드백, 지시 따르기에는 제약 검사가 쓰이고, 데이터와 보상, 최적화가 달라서 같은 초기 모델에서 출발해도 각 도메인에 특화된 전문가가 따로 만들어진다. 하지만 배포할 모델은 하나여야 한다. 다중 교사 온폴리시 증류(MOPD)는 이 통합을 정책 공간에서 수행한다. 학생이 먼저 답을 생성하고, 프롬프트의 도메인 라벨에 따라 배정된 전문가가 학생이 쓴 토큰마다 로그 확률을 알려주며, 그 차이인 증류 어드밴티지가 조밀한 학습 신호가 된다. 문제는 이 라우팅 규칙이 어느 전문가가 감독할지만 정할 뿐, 그 피드백이 공유 학생을 얼마나 세게 움직이는지는 정하지 않는다는 점이다.

어떻게 동작하나

저자들은 Qwen3.5 9B·4B·2B에서 독립적으로 학습된 전문가 풀을 만들어 이 지점을 실증한다. 라벨 라우팅을 쓰는 MOPD 학생은 세 크기 모두에서 최고 단일 교사에게 배운 학생을 능가하지 못했고, 수학 전문가의 이득은 거의 전이되지 않았다. 8K 평가 예산에서는 그 이득의 14~32%만 남았고, 16K에서는 초기 모델 대비 이득이 아예 없었다. 원인은 피드백 스케일의 불균형이다. 첫 학습 배치에서 지시 따르기 전문가의 토큰 단위 교사-학생 로그비는 전체 풀링 신호보다 2.3~4.4배 분산이 컸고, 수학 로그비는 약 절반 수준이었다. 모든 도메인이 같은 파라미터를 갱신하기 때문에 프롬프트 수가 같아도 이 불균형이 업데이트를 좌우한다. 초기 4B 학생 기준으로 동일 가중치에서 지시 따르기 손실이 결합 그래디언트의 94%를 공급했다.

무엇과 다른가

제안 방법인 DN-MOPD(Domain-Normalized MOPD)는 라우팅은 그대로 두고 도메인별 피드백 스케일만 보정한다. 배치마다 도메인 d의 유효 응답 토큰에 대해 교사 로그 확률과 학생 롤아웃 로그 확률의 차이 r의 모집단 표준편차 σ_d를 구하고, 모든 도메인을 풀링한 σ_all도 구한다. 각 도메인에 승수 w_d = clip(σ_all/σ_d, 0.25, 4)를 적용해 어드밴티지를 Ã_t = w_d·A_t로 다시 스케일한다. 분산이 작은 도메인은 증폭되고 큰 도메인은 감쇠되며, 비퇴화 도메인에서는 스케일된 롤아웃 신호의 표준편차가 σ_all과 같아진다. 평균을 빼지 않고 양수를 곱하므로 각 어드밴티지의 부호, 즉 해당 토큰을 장려하는지 억제하는지는 보존된다. 스케일된 어드밴티지는 stopgrad로 분리해 기존의 클리핑된 OPD 손실에 그대로 넣는다. 추가 교사 모델도, 교사 호출도, 학습된 라우터도 필요 없고, 모든 w_d를 1로 두면 원래 MOPD가 된다.

어떻게 쓰나

실험은 Qwen3.5-9B·4B·2B에서 크기별로 독립 학습된 전문가 풀을 쓰고, 학생은 같은 크기의 교사에게 배운다. 평가는 AIME25/AIME26(수학), LiveCodeBench v5/v6(코드, 167/175개 문제), IFEval/IFBench(지시 따르기)의 6개 벤치마크다. 80회 업데이트, 학생 시드 42(43·44는 부록), 8,192토큰 학습 응답 캡, 16,384토큰 평가 캡이 기본 설정이다. DN-MOPD는 모든 크기와 두 평가 예산에서 MOPD를 앞섰다. 16K에서 1.17~2.36%포인트, 8K에서 2.47~3.08%포인트 평균 점수 개선이며, 짝지은 신뢰구간이 모두 0 위에 있다. 세 학생 시드 모두 DN-MOPD에 유리했고(16K 평균 이득 +1.12, +1.97, +2.34), 최강 단일 교사 학생도 모든 크기에서 앞섰다(일부 구간은 0을 포함). 9B에서 양쪽을 160 업데이트까지 이어가면 격차는 +2.57 [+1.65, +3.46]로 커진다. 이득의 중심은 수학이다. 16K에서 MOPD는 어느 크기에서도 초기 학생 대비 수학 이득이 없었지만 DN-MOPD는 모든 크기에서 수학을 개선했고, MATH-500에서는 MOPD를 +0.74, +1.25, +5.95점 앞섰다. 코드와 지시 따르기 이득은 더 작고 일관성이 약하다.

전제와 한계

효과의 출처를 분리한 통제 실험도 있다. 수학 피드백만 키우고 지시 따르기는 그대로 두는 직관적 처방은 4B에서 DN-MOPD 개선의 절반가량만 회복했고 2B에서는 거의 회복하지 못했다. 반대로 지시 따르기만 줄이면 대부분을 회복하면서 수학이 약 3점 올랐다. 세 도메인 가중치를 DN-MOPD의 첫 배치 승수나 전역 (2, 1, 0.25)로 고정해도 9B·4B의 16K에서 검출 가능한 차이가 없었고, 2B에서만 배치별 재추정이 첫 배치 가중치를 1.10점 앞섰다. 실제 학습에서 승수는 수학을 약 1.5~2.1배 증폭하고 코드는 4B·2B에서 1 근처를 유지했으며, 지시 따르기 승수는 대부분의 배치에서 0.25 하한에 붙어 균등화가 아니라 경계에 걸린 상태로 억제됐다. 지시 따르기는 응답 토큰의 약 1%만 차지하지만 풀링 분산의 최대 절반을 설명한다. 수학 이득은 더 짧은 답변과 생성 캡 도달 응답 감소를 동반했으므로 긴 생성에서 나온 것이 아니다.

실무적으로 이 논문이 주는 신호는 명확하다. 여러 특화 모델을 하나로 합치는 증류를 돌릴 때 도메인 라우팅과 프롬프트 배분만 설계하고 끝내면, 분산이 큰 도메인의 피드백이 공유 파라미터 업데이트를 지배해 다른 도메인의 이득이 사라질 수 있다. DN-MOPD는 롤아웃 채점에서 이미 얻은 로그비만 재사용해 배치별 표준편차 두 개를 계산하는 비용으로 이 문제를 완화한다. 다만 도메인별 그래디언트 노름을 맞추는 것이 아니고 배치 손실 스케일을 고정하는 것도 아니라는 점, 그리고 이 방법이 교사 풀과 학생 초기화 구성에 의존한다는 점은 적용 전에 확인해야 한다.

저자들이 밝힌 한계도 분명하다. 비교는 하나의 모델 패밀리 안에서 크기당 전문가 풀 하나만 사용했고, 학생 시드 3개는 전문가 재학습을 포함하지 않는다. DN-MOPD는 이전 Qwen3 개발 도구에서 선택됐으며, 다른 설정의 이전 Qwen3-4B 비교에서는 뚜렷한 이득이 없었으므로 효과는 교사-학생 구성에 달려 있다. 스케일 추정은 도메인 구성과 응답 길이에 의존하고 클리핑 범위는 크기별로 튜닝하지 않았으며, 지시 따르기 승수가 보통 하한에 머무는 만큼 그 도메인은 균등화가 아니라 경계로만 제한된다. 고정 가중치가 9B·4B에서 비슷한 성능을 내므로 배치별 재추정의 추가 이득은 2B에서만 확인됐고, 학습을 더 길게 했을 때 수렴 시점의 최종 순위는 아직 unresolved로 남아 있다.