여러 전문가의 출력과 은닉 상태를 함께 증류해 하나의 학생 모델로 통합한다
Latent-MOPD: Latent Multi-Teacher On-Policy Distillation
무엇인가
수학·코드·논리 같은 도메인에서 강화학습으로 따로 훈련된 전문가 모델들을 하나의 배포 가능한 모델로 합치는 것이 이 논문의 목표다. 기존 다중 교사 온폴리시 증류(MOPD)는 학생이 생성한 응답을 도메인별 교사에게 라우팅한 뒤, 그 교사의 다음 토큰 분포만 학생에게 전달한다. 즉 교사가 무엇을 예측하는지만 배운다. 저자들은 해석가능성 연구에서 은닉 표현이 발화되지 않은 중간 추론 단계를 담고 이후 계산에 인과적으로 영향을 준다는 점을 근거로, 교사가 어떻게 그 예측을 계산하는지까지 전달해야 한다고 주장한다. 단일 교사를 다루던 표현 수준 OPD(LastOPD, OPRD)와 달리, 여러 전문가의 서로 다른 표현 목표를 하나의 학생 백본에 동시에 학습시키는 방법은 정해져 있지 않았다.
어떻게 동작하나
Latent-MOPD는 프롬프트마다 도메인 라벨로 전문가 한 명을 선택하고, 그 교사가 토큰 예측과 은닉 상태를 모두 제공한다. 토큰 채널은 학생이 고른 상위 k=16 후보에 대해 교사 대 학생 로그확률 비율로 이점(advantage)을 계산하고, 도메인별 마스크 표준편차로 스케일링한 뒤 정책경사 형태로 업데이트한다. 표현 채널은 교사-학생 관계에 따라 목표 층을 고른다. 같은 계열에서는 네이티브 CKA가 대부분 층에서 높고 출력 근처에서 떨어지므로 마지막 3개 층을 정렬하고, 계열이 다르면 중간 깊이의 대응이 급격히 나빠지므로 다음 토큰 예측에 직접 쓰이는 마지막 층 상태를 정렬한다. 은닉 폭이 다를 때(학생 1,536, 교사 3,584)는 라우팅된 교사와 선택 층에 공유되는 학습 가능한 선형 사상을 두고, 도메인별 학생-교사 상태 쌍에 릿지 적합으로 초기화한다. 감독 일정은 교사별 시계를 쓰는 크로스페이드로, α(u)=min(1, u/Tw)인 토큰 항이 커지는 동안 β(u)=max(0, 1−u/Tw)인 표현 항이 사라진다. Tw는 동일 계열 10스텝, 교차 계열 7스텝이며 전체 62 옵티마이저 스텝 중 30스텝과 21스텝을 차지한다. 모든 교사는 동결되고, 추론 시에는 학생만 쓰이며 투영 사상도 필요 없다.
무엇과 다른가
실험은 DeepSeek-R1-Distill-Qwen-1.5B를 학생으로, 추가 교사 훈련 없이 기존 전문가 체크포인트를 재사용한다. 동일 계열 설정은 같은 계보의 RL 튜닝된 1.5B 교사 3개, 교차 계열 설정은 별도 개발된 7B 교사 3개(은닉 폭 3,584, 모두 28개 블록의 Qwen 백본)를 쓴다. 훈련 프롬프트는 DAPO-Math-17k, OpenCodeReasoning, Reasoning Gym에서 도메인당 5,952개씩 총 17,856개이며, 도메인 순수 배치 32개를 섞지 않고 회전시켜 62회 업데이트에서 1,984개 프롬프트 제시와 7,936개 응답을 생성한다. 동일 계열 기본 설정은 수학·코드·논리 9개 벤치마크 전부에서 토큰 전용, 표현 전용, 균일 평균 베이스라인을 앞섰고, 같은 파라미터 수의 벤치마크별 최고 교사를 9개 중 5개(BBH, MuSR, MBPP, MBPP+, Minerva)에서 넘었다. 정규화 점수 Norm은 1.05로 최고 교사 봉투값 1을 넘었고, MOPD식 0.90, 표현 전용 0.64~0.73, OPRD식 결합 0.94와 비교된다. Minerva는 33.5에서 36.3, LiveCodeBench-easy는 68.3에서 73.1, MuSR은 50.7에서 52.4로 올랐다. 크로스페이드는 고정 가중치 대조군보다 9개 중 8개 벤치마크를 개선했다.
어떻게 쓰나
교차 계열 7B 교사에서는 6개 벤치마크 전부에서 두 단일 채널 베이스라인을 앞섰다. AIME24는 36.5에서 39.4, MBPP는 55.4에서 57.9, GYM은 29.2에서 34.1, BBH는 45.8에서 49.5로 올랐고 Norm은 0.16에서 0.26이 됐다. 2층 MLP 투영기도 6개 전부에서 단일 채널을 앞서 Norm 0.27을 기록했으며, 두 투영기 구성은 벤치마크 승리를 3대 3으로 나눴다. 파라미터 병합으로 초기화한 뒤 62스텝 증류한 실험에서는 6개 중 5개가 개선되어 GYM 46.3→52.2, BBH 60.6→63.4, AIME24 48.1→53.8, Norm 0.87→1.03을 기록했고, 같은 병합에서 출발한 토큰 전용(0.97)과 표현 전용(0.91)보다 높았다.
전제와 한계
분석에서 드러난 핵심은 업데이트 구성이다. 동일 계열 전체 층 표현 전용 대조군에서 도메인 순수 배치는 62스텝을 모두 완주해 MATH-500에서 91.7을 얻었지만, 같은 샘플을 도메인끼리 섞으면 20스텝에 22.8, 30스텝에 9.8로 붕괴하고 62스텝에도 43.2로 베이스 84.1에 크게 못 미쳤다. 각 샘플이 받는 교사는 두 경우 모두 같으므로, 한 파라미터 업데이트에 여러 교사가 기여하는지가 안정성을 가른다. 훈련 풀에 없는 일반 벤치마크에서는 베이스 대비 1.1점 이내를 유지했고(ARC-Challenge와 WinoGrande는 개선, HellaSwag는 44.7→44.2), 도메인별 표현 손실은 도메인당 10번째 업데이트에서 최초 기록값의 0.30/0.38/0.39로, 최종 기록에서 0.13/0.19/0.15로 떨어졌다. 표현 감독이 끝난 뒤에도 낮게 유지된다는 점이 β 가중치 감쇠만의 효과가 아님을 보여준다. 또한 선택 층을 28개 중 3개로 줄이면 동일 토큰 수와 정밀도에서 선택 상태 저장량이 89.3% 줄어 0.28GiB가 된다(전체 28개는 2.63GiB).
실무적으로 이 논문은 이미 도메인별로 RL 튜닝된 체크포인트를 갖고 있고, 이를 하나의 서빙 모델로 합치려는 팀에 직접 적용 가능한 레시피를 준다. 교사 재훈련이 필요 없고 추론 시 교사나 투영 사상이 필요 없다는 점이 배포 비용 면에서 중요하다. 다만 그대로 옮기기 전에 확인할 것은 세 가지다. 첫째, 표현 감독을 쓸 경우 옵티마이저 업데이트를 도메인별로 순수하게 유지해야 한다. 섞으면 훈련이 붕괴한다. 둘째, 층 선택은 교사 패널에 따라 달라진다. 같은 계열이면 마지막 3개 층이 9개 중 8개를 개선했지만, 교차 계열에서는 마지막 1개 층이 3개 층과 동등한 집계 이득을 더 적은 목표로 얻었다. 셋째, 표현 감독은 일시적으로 넣고 토큰 채널로 넘기는 크로스페이드가 기본값이며, 교차 계열에서 표현 전용을 계속 유지하면 집계 성능이 학생 초기값 아래로 떨어진다.
저자들이 밝힌 전제와 한계도 분명하다. 논문의 "교차 계열"은 아키텍처가 다른 모델이 아니라 규모와 후처리 훈련이 다른 경우를 뜻하며, 네 모델 모두 28개 블록의 Qwen 백본을 쓴다. 교차 계열의 Norm 0.26은 동일 계열의 1.05에 비해 여전히 낮아, 이질적인 교사로부터의 전이 이득은 제한적이다. 표현 전용 지속 감독이 교차 계열 집계에서 학생 초기 성능을 밑돈다는 관찰도 그대로 보고되며, 저자들은 범위와 확장 가능성은 부록 J에서 논한다고만 밝히고 본문에서는 구체적 수치를 제시하지 않는다.