도메인 라벨 없이 토큰마다 교사를 고르는 다중 교사 온폴리시 증류
MOPD-Router: Rethinking Teacher Routing in Multi-Teacher On-Policy Distillation
무엇인가
다중 교사 온폴리시 증류(MOPD)는 수학·코드·명령 따르기처럼 서로 다른 RL 파이프라인에서 따로 특화시킨 교사 모델들을 하나의 학생 정책에 통합하는 방법이다. 문제는 기존 관행이 프롬프트 단위 하드 라우팅이라는 점이다. 각 프롬프트에 붙은 도메인 라벨을 보고 그 도메인 교사 하나를 골라 롤아웃 전체를 그 교사가 감독한다. 저자들은 이 방식의 두 가지 한계를 든다. 첫째, 실제 SFT·챗 혼합 데이터는 도메인 라벨이 신뢰할 만하지 않은 경우가 많고, 하나의 프롬프트가 일반 대화·명령 따르기·수학 추론·코드 실행을 섞고 있으면 어느 교사를 붙일지 정할 규칙이 없다. 둘째, 도메인 라벨은 주 교사만 알려줄 뿐 토큰별로 다른 교사가 줄 수 있는 신호의 가치를 무시한다. 수학 프롬프트에서도 코드 교사가 프로그램적 추론을, 명령 따르기 교사가 출력 형식 제약을 도울 수 있고, 이런 유용성은 생성 단계와 토큰 위치에 따라 달라진다.
어떻게 동작하나
MOPD-Router는 이 고정 배정을 토큰 단위 가중으로 바꾼다. 도메인 라벨을 쓰지 않고, 별도의 라우팅 모델도 학습하지 않는다. 학생이 현재 정책으로 롤아웃한 궤적의 각 위치 t에서 교사 i의 샘플 토큰 어드밴티지 A_t^(i) = sg[log π_φi(y_t|h_t) − log π_θold(y_t|h_t)]를 계산하고, 라우팅 가중 w_i,t로 A_t = Σ_i w_i,t A_t^(i)를 만든다. 이 A_t는 별도 크리틱 없이 PPO식 클립 목적식의 어드밴티지 자리에 그대로 들어간다. 라우팅은 플러그인 지표 인터페이스로 추상화되어 있는데, 지표 M은 교사 분포, 롤아웃 학생 분포, 교사들이 post-training 이전에 공유하던 베이스 모델 분포, 현재 컨텍스트 h_t를 받아 점수 s_i,t를 낸다. 이 점수로 매 토큰마다 전체 교사 풀에서 쓸 교사를 고르고 상대 가중을 정한다.
무엇과 다른가
논문은 서로 다른 정보원에 기반한 세 지표를 인스턴스화한다. Entropy는 교사의 다음 토큰 분포 엔트로피가 낮을수록, 즉 더 확신할수록 높은 점수를 주는 음의 예측 엔트로피 방식이다(라우팅 소프트맥스 온도 0.1). Novelty는 학생과 교사가 각각 뽑은 top-k 후보의 교집합 Ω에서 두 분포의 확률 질량을 함께 보는 접근성 항 a_i,t = sqrt(p^S(Ω)p^i(Ω))와, 같은 집합 위에서 재정규화한 분포 사이 JS 발산으로 만든 새로움 항 N_i,t를 곱해 점수로 쓴다(τ_N=0.1, τ_R=0.1, Ω가 비면 점수 0). ExpertAlign은 교사가 post-training에서 얻은 특화가 실제 교수 방향과 맞는지를 본다. 학생의 top-k 지지집합 위에서 교사의 베이스 대비 로그 확률 변화 e_i,t = log p^i − log p^base를 특화 벡터로, 교사의 학생 대비 변화 d_i,t = log p^i − log p^S를 교수 벡터로 두고, 두 벡터의 양의 코사인 유사도 c_i,t를 점수로 삼는다. 내적이 δ=1e-6을 넘는 교사만 유지 집합 E_t에 남기고, 유지된 교사를 균등하게(uniform) 또는 정렬 강도에 비례해(cosine) 가중한다. E_t가 비면 그 위치의 OPD 감독은 건너뛴다. k=16을 쓴다.
어떻게 쓰나
실험은 두 데이터 체제와 두 증류 시나리오에서 이뤄졌다. 라벨 없는 혼합 데이터는 Nemotron-v3에서 뽑은 일반 대화 30K와, 문제 해결에 실행 가능한 코드가 필요한 NuminaMath-TIR 수학 30K를 합친 60K다. 라벨 있는 데이터는 DeepMath-103K 수학 25K, Eurus-RL-Code 코드 25K, HiR-16K 명령 따르기 16K다. 교사는 Qwen3-4B-Non-Thinking을 도메인별 RL로 post-training한 세 모델(수학·코드는 ExOPD 공개 체크포인트, 명령 따르기는 HIR-16K로 직접 학습)이고, 셋 다 Qwen3-4B-Non-Thinking을 pre-RL 베이스로 공유한다. 학생은 Qwen3-1.7B(strong-to-weak)와 Qwen3-4B(same-size) 두 가지다. 비교 대상은 Standard MOPD, Open-MOPD, Mean Aggregation이다. 평가는 AIME 2024·2025, HMMT 2025 Feb·Nov, HumanEval+, MBPP+, LiveCodeBench v6, IFEval, IFBench 아홉 개 지표를 매크로 평균한 Overall 점수다.
전제와 한계
라벨 없는 혼합 데이터에서 Mean Aggregation은 Overall 34.49(1.7B 학생)와 47.88(4B 학생)이었고 Entropy는 이와 비슷했다. LLM이 생성한 도메인 라벨을 쓴 Standard MOPD는 36.33과 48.76, Open-MOPD는 34.02와 49.41이었다. 라벨 없이 원본 데이터에서 직접 라우팅한 MOPD-Router는 Novelty가 두 라벨 기반 베이스라인을 앞섰고, ExpertAlign이 38.58과 53.76으로 최고였다. Mean 대비 5.88점(+12.3%) 개선이다. 라벨 있는 데이터에서는 ExpertAlign이 40.19와 54.58로, 라벨을 쓰는 Standard MOPD와 Open-MOPD를 라벨 없이 앞섰다. Standard MOPD 대비 3.95점(+7.8%)이다. Novelty도 strong-to-weak에서 Standard MOPD와 대등했고 same-size에서 더 좋았다. 저자들은 페어드 부트스트랩 검정과 same-size 라벨 설정의 3시드 반복에서 ExpertAlign이 Mean Aggregation과 Standard MOPD를 유의하게 앞서고 Open-MOPD와 대등하거나 앞선다고 보고한다.
분석에서 나온 몇 가지가 실무적으로 중요하다. 먼저 교사의 확신도는 신뢰할 라우팅 신호가 아니었다. 수학 교사가 두 설정 모두에서 다른 교사보다 일관되게 낮은 엔트로피를 보여 라우터가 특정 교사만 편애하게 되고, 배치 단위 엔트로피 정규화로 이 편향을 제거해도 개선은 미미했다. Novelty의 접근성 항은 학생-교사 지지집합이 어긋날 때 도움이 됐다. strong-to-weak에서 접근성 항을 넣으면 Overall이 34.12에서 36.70으로 7.5% 올랐지만, 지지집합이 잘 맞는 same-size에서는 오히려 NoveltyOnly가 0.55점 높았다. ExpertAlign을 교사 선택과 가중으로 분해하면, 양의 정렬 게이트만 쓰는 Uniform이 Mean 대비 네 설정 모두에서 1.22~4.75점을 올렸고, 코사인 가중을 더하면 Uniform 대비 1.62~3.34점이 추가로 올랐다. 교차 도메인 신호의 가치도 확인된다. 도메인 라벨이 지정한 교사만 남긴 변형보다 전체 교사 풀을 쓰면 Overall이 1.7B·4B 학생에서 각각 2.40, 2.75점 올랐고, 같은 풀에서 응답 단위 가중을 토큰 단위로 바꾸면 3.62, 1.97점이 더 올랐다. 수학·코드·명령 따르기 프롬프트 모두에서 도메인 밖 교사들이 조건부 라우팅 질량의 50% 이상을 받았고, 사례 분석에서는 수학 교사가 수치 추론 구간에서, 코드 교사가 파이썬 검증 구간에서, 명령 따르기 교사가 출력 구조화와 JSON 포맷 구간에서 가중치가 올라갔다.
비용은 same-size 라벨 설정, 8×NVIDIA H20 환경에서 측정됐다. 같은 스텝 예산에서 응답이 짧아진 Entropy와 Novelty는 524.2, 539.6 GPU-hour로 Standard MOPD의 692.9보다 적었고, 토큰 정규화 비용은 각각 1.13배, 1.09배였다. ExpertAlign은 716.9 GPU-hour로 측정 기준 3.5% 증가, 토큰 정규화 1.18배였다. 공유 베이스 모델 forward와 top-k 라우팅 계산이 붙는 것을 감안하면 부담은 크지 않다는 것이 저자들의 주장이다.
실무 관점에서 이 논문이 바꾸는 것은 라벨 파이프라인이다. 도메인 라벨을 붙이는 단계 없이 여러 특화 체크포인트를 하나의 학생에 통합할 수 있고, 라벨이 이미 있는 데이터에서도 라벨을 무시하고 토큰 단위로 라우팅하는 편이 더 나았다. 다만 도입 전에 확인할 것이 있다. ExpertAlign은 교사들이 공유하는 pre-RL 베이스 모델에 대한 접근을 전제하므로, 서로 다른 베이스에서 출발한 교사들을 섞는 파이프라인에는 그대로 옮기기 어렵다. 또 교사 풀 전체에 대해 매 토큰 점수를 계산해야 하므로 교사 수가 늘어날 때 비용이 어떻게 늘어나는지, 그리고 top-k(16)와 온도·마진 같은 하이퍼파라미터가 자기 도메인 벤치마크에서도 같은 방향으로 작동하는지 확인해야 한다. 학생과 교사의 지지집합이 얼마나 겹치는지도 봐야 한다. 겹침이 크면 Novelty의 접근성 항이 오히려 해가 됐다는 결과가 있기 때문이다.
논문이 명시적으로 밝힌 한계 절은 제시된 본문에 없다. 다만 본문에서 드러나는 전제는 분명하다. 라우팅 지표가 교사들의 공유 pre-RL 베이스 모델을 필요로 하고, ExpertAlign은 유지 집합이 비면 해당 토큰의 감독을 아예 건너뛴다. 실험은 Qwen3 계열과 세 개 도메인 교사, 두 학생 크기, 두 데이터 체제로 한정되며, 비용 측정은 초기화·모델 다운로드·검증·체크포인트 I/O를 제외한 스텝 타이머 기준이다. 또한 라벨 없는 설정의 비교에는 DeepSeek-V4-Flash가 생성한 도메인 라벨을 쓴 Standard MOPD·Open-MOPD가 포함되어 있어, 라벨 품질이 베이스라인 성능에 영향을 준다.