MoE 병합 후 라우팅 드리프트는 실패의 증거가 아니다

Routing Drift Alone Does Not Diagnose Failure in Merged MoE LLMs

arXiv2609.32821v1

Yuanyi Wang2026-09-26조회 3

무엇인가

MoE(Mixture-of-Experts) 대형 언어모델을 병합(model merging)하면 전문가 파라미터뿐 아니라 토큰이 어느 전문가로 가는지를 정하는 라우팅도 함께 바뀐다. 이 논문은 이 변화를 라우팅 드리프트라고 부르고, 최근의 라우팅 재정렬 기법들(HARC 등)이 드리프트를 곧 라우팅 실패로 간주해 병합된 라우터를 소스 모델 쪽으로 되돌리는 흐름에 정면으로 의문을 제기한다. 저자들의 핵심 질문은 두 가지다. MoE 병합 후의 라우팅 드리프트가 실제로 라우팅 실패를 뜻하는가, 그리고 수리를 정당화하려면 어떤 증거가 필요한가. 라우팅 실패를 라우팅 자체의 구조적 변화가 아니라 라우팅 때문에 생긴 과제 관련 성능 저하로 정의하는 것이 이 논문의 출발점이다.

어떻게 동작하나

방법의 핵심은 통제된 반사실 개입(counterfactual intervention) 도구상자다. 같은 토큰 시퀀스에 대해 소스 모델과 병합 모델의 라우터 입력(은닉 상태)과 라우터 파라미터를 서로 교차시켜 넣어봄으로써, 전문가 재배정이 표현(입력) 변화 때문인지 라우터 파라미터 변화 때문인지 국소적으로 분리한다. DeepSeekMoE, OLMoE, Qwen3-MoE 각각에 Average 병합과 Task Arithmetic 병합을 적용한 6개 설정에서, 설정당 256개의 도메인 균형 프롬프트, 모든 연속 토큰, 모든 희소 레이어를 분석했다. 여기에 더해 라우팅 실패를 비라우팅 파라미터를 고정한 채 특정 라우팅 개입 하에서 회복 가능한 과제 손실로 조작적으로 정의한다. 즉 기준 정책 π와 대안 정책 π′의 과제 손실 차이 H_D(π;π′)를 동일한 문항에서 측정하고, 신뢰구간이 0보다 완전히 위에 있을 때만 회복을 인정한다. 대안 정책 자체가 추정 대상의 일부이며, 스케줄 재생·온라인 라우터 교체·보정된 라우터는 서로 다른 개입이라는 점도 명시한다.

무엇과 다른가

결과는 드리프트의 해석을 뒤집는다. 6개 설정에서 토큰–레이어 전문가 집합이 바뀌는 비율은 26.5~54.3%였는데, 그중 경로가 바뀐 사례의 77.7~96.9%는 표현만 교체했을 때 바뀌고 라우터 파라미터만 교체했을 때는 바뀌지 않았다. 라우터 파라미터 때문에 생긴 변화는 최대 1.8%에 그친다. 즉 대부분의 전문가 재배정은 라우터가 망가진 게 아니라 라우터에 들어가는 입력 표현이 달라진 결과다. 게다가 전체 분포의 Jensen–Shannon 발산 같은 구조적 차이는 소스 경로 복원으로 얻는 다음 토큰 우도 이득을 거의 예측하지 못했다(AUROC 0.47~0.52, 우연 수준 0.5). 같은 병합 은닉 상태에서 소스 라우트와 병합 라우트가 만드는 전문가 혼합 출력의 평균 코사인 유사도는 0.896~0.976으로, 들어오고 나가는 전문가 쌍의 최대 출력 코사인(0.041~0.096)보다 훨씬 높았고, 표본 727개 사례 전부에서 혼합 코사인이 전문가 쌍 최대치를 넘었다. 전문가 수·병합 라우트와의 중첩·라우팅 가중치를 맞춘 무작위 대안 32개와 비교해도 관측 라우트가 평균 코사인에서 0.112~0.147 앞선다. 다른 전문가를 골라도 출력이 기능적으로 중복될 수 있다는 뜻이다.

어떻게 쓰나

이 정의가 실제로 작동하는지는 양성 대조군으로 확인한다. OLMoE의 k∈{1,4,16}개 레이어에서 전문가 로짓을 뒤섞어 라우팅을 고의로 망가뜨린 뒤, 원래의 깨끗한 라우트 스케줄을 재생하면 ARC 256문항에서 4개 레이어 교란은 12.50~14.84%p, 전체 레이어 교란은 26.56~32.81%p의 정확도 회복이 나타났다. k=4,16의 8개 비교는 12개 검정에 대한 Holm 보정을 통과했지만 k=1에서는 아무것도 통과하지 못했다. 재생 정확도는 50.39~51.56%로 깨끗한 기준 50.78% 근처에 머물러, 이것이 깨끗한 순전파를 재구성한 것이 아님을 보여준다. 반면 자연스러운 대안 정책, 즉 소스에서 유도한 라우팅 결정의 재생이나 동결된 LC 보정 라우트 스케줄 재생은 어떤 설정에서도 정확도나 정답 선택 마진의 신뢰구간이 0보다 위에 오지 않았다. LC 재생은 부모당 문항 하나의 정답만 바꿔 Average에서 −0.39%p, TA에서 +0.39%p였다.

전제와 한계

저자들은 소스 정보가 선택적 수리를 정당화하는지도 별도로 시험한다. 이를 위해 제안하는 Selective Router Repair(SRR)는 병합 라우터 입력 위에서 소스 기반 전문가 쌍 보정을 적합하는 사례 연구다. 각 프롬프트에 대해 소스 전문가와 베이스 모델의 로짓 차이를 중심화하고, 베이스 대비 소스의 우도 이득에 시그모이드를 씌운 가중치로 평균 내어 선호 프로필을 만든다. 활동도(activity) 0.002 이상, 부호 일관성 0.75 이상이라는 고정 스크린을 통과하고 벤치마크 점수는 쓰지 않은 채 도메인·레이어당 두 쌍을 고른다. 그다음 캐시된 병합 부모 입력에 대해, 소스-부모 로짓 잔차를 소스-베이스 차이로 클리핑한 목표를 리지 회귀로 적합하고(τ=0.5, γ=10⁻³), 선택된 라우터 행을 w_a′ = w_a + η/2·v*, w_b′ = w_b − η/2·v*로 갱신한다(η=0.0625). 마지막 5개 희소 레이어의 선택된 행만 바뀐다. 진단 결과는 냉정하다. 1024개 이벤트 중 471개가 소스 이득 양성이었고 소스 방향과 적합 방향은 83.4%(95% CI 80.0~86.6%)에서 부호가 일치했지만, 어느 쪽도 국소적 개선을 입증하지 못했다. 또 적합은 부모 입력에서 이뤄지지만 실제 실행 시 앞선 갱신이 뒤 입력을 바꾸며, 최종 레이어에서 입력 반응의 RMS는 직접 보정 RMS의 약 0.38~0.86배였다.

본 실험은 MMLU, HellaSwag, ARC-C, ARC-E, PIQA, WinoGrande, BoolQ, GSM8K를 5-shot lm-evaluation-harness와 VLLM 백엔드로 평가한다. 각 쌍은 35,326개 문항 정체성을 공유하고 결정적 프로토콜로 5회 반복한다. OLMoE/Qwen3-MoE 8개 설정에서 평균 점수 변화는 −0.056~+0.139%p였고, 5개가 양수였다. OLMoE는 Average·TA·TIES에서 양수, Qwen3-MoE는 TA·TIES에서 양수였지만 WUDI-Merge에서는 두 모델 모두 음수였다. HARC와 비교하면 8개 설정 중 4개씩 서로 우위를 가져 순위가 백본에 따라 뒤집힌다. OLMoE–WUDI에서 SRR은 −0.021%p로 HARC(−0.075%p)보다 낫지만 둘 다 부모보다 낮다. DeepSeekMoE에서 HARC는 TIES −0.133%p에서 Average +0.236%p까지 변동한다. 과제별 이질성도 크다. OLMoE–Average에서 SRR은 GSM8K +1.74%p, WinoGrande −0.63%p였고, Qwen3–TA에서는 GSM8K +0.38%p, PIQA −0.22%p였다. 선택 규칙의 증분 가치를 보기 위한 440개 매칭 쌍에서도 소스 방향 대비가 양성 지지 이벤트의 효용이 더 높다는 증거는 나오지 않았다.

실무적으로 이 논문은 MoE 병합 후 라우팅이 바뀌었다는 사실만으로 라우터를 손대는 것을 멈추라고 말한다. 병합 파이프라인에서 라우팅 일치율이나 JS 발산 같은 구조 지표를 모니터링하는 것은 원인 진단에 도움이 되지 않으며, 소스 라우트로 되돌리는 개입은 이 논문이 평가한 모델들에서 과제 이득을 만들지 못했다. 대신 비라우팅 파라미터를 고정한 상태에서 특정 라우팅 개입을 정의하고, 동일 문항에 대한 과제 손실 차이를 신뢰구간과 함께 측정해야 한다. 고의로 라우터를 망가뜨린 양성 대조군에서는 이 절차가 회복을 잡아내므로, 검정 자체는 민감하다. 또한 소스 전문가가 더 높은 우도를 준다는 신호는 수리 후보를 만들 근거로는 쓸 수 있어도, 그 후보가 이롭다는 증거는 아니라는 점을 기억해야 한다. 병합 결과를 배포할 때는 부모 대비 평균 점수 변화와 과제별 편차를 함께 보고, 다른 수리 기법보다 조금 낫다는 사실이 부모보다 낫다는 뜻은 아니라는 점을 확인해야 한다.

저자들이 밝힌 한계는 분명하다. 신뢰구간이 0을 포함하는 결과는 무해함도 최적성도 입증하지 않는다. 라우팅을 통해 손실을 회복했다고 해서 원래 성능 저하의 원인이 라우터 파라미터 변경이었다고 단정할 수 없다. 이 비교들은 병합된 라우팅이 최적이라거나 다른 라우팅 정책에서 회복 가능한 손실이 없다는 것을 배제하지 못한다. SRR 평가는 고정된 체크포인트에 대한 쌍대 평가이므로 평균적인 과제 이득을 입증하지 못하고, 수리 시드 간 변동도 다루지 않는다. 백본 간 비교는 아키텍처와 파라미터 수를 동시에 바꾸므로 모델 크기 효과를 분리하지 못한다. 또한 적합 목적함수는 과제 손실이 아니라 선택된 로짓 잔차를 맞추는 대리 목표이며, 부록의 2-전문가 반례는 대리 적합이 좋아져도 토큰 우도가 개선되지 않을 수 있음을 보여준다. 마지막으로 국소 귀속은 상류 라우팅 효과를 배제하지 못한다.