MoE 라우터 정렬로 디코더 전용 LLM의 다국어 성능을 높인다

Cross-Lingual Alignment for Decoder-Only Models using MoE Routers

HF Daily2610.01921

Lucas Bandarkar, Clark Peng, Ahmed Haj Ahmed2026-10-02

무엇인가

디코더 전용 LLM에서 언어 간 표현 정렬은 오래된 난제다. 인코더 기반 다국어 모델은 문장 하나에 대한 시퀀스 임베딩이 자연스럽게 나오기 때문에, 번역 쌍의 임베딩을 당기고 무관한 쌍을 밀어내는 대조 학습을 그대로 적용할 수 있었다. 반면 디코더 전용 LLM은 정렬할 만한 시퀀스 레벨 표현이 없고, 언어마다 토크나이제이션과 언어 구조가 달라 번역 쌍의 토큰을 1대1로 맞추기도 어렵다. 마지막 토큰의 은닉 상태나 은닉 상태 평균 풀링이 대안으로 쓰이지만, 둘 다 시퀀스 전체의 의미를 안정적으로 담지 못한다. 그 결과 번역 병렬 데이터가 풍부한데도 다국어 LLM은 언어 간 정렬을 유도하는 귀납적 편향 없이 학습되고, 중간 레이어에 암묵적으로 생기는 언어 공통 표현의 활용도는 언어별로 크게 갈린다.

어떻게 동작하나

이 논문이 제안하는 것은 Mixture-of-Experts(MoE) 라우터의 출력을 정렬 대상으로 삼는 방법이다. MoE 레이어의 라우터는 각 토큰에 대해 expert들 위의 확률분포(top-k 로짓에 대한 softmax, 나머지 expert는 0)를 만든다. 저자들은 이 라우팅 가중치를 시퀀스의 모든 토큰에 걸쳐 평균 풀링하면 "시퀀스 전반의 expert 활용도"라는 해석 가능한 시퀀스 레벨 표현이 된다고 본다. 은닉 상태 평균 풀링은 고차원 벡터를 평균 내는 과정에서 서로 다른 방향으로 인코딩된 토큰 특징이 상쇄될 수 있지만, 라우팅 가중치는 확률분포라 pooling에 더 잘 견딘다는 것이 근거다. 저자들은 Li and Zhou (2025)가 임베딩 과제에서 평균 풀링한 라우팅 가중치가 평균 풀링한 은닉 상태보다 유의하게 낫다고 보고한 결과를 이 구분의 실증적 지지로 인용한다.

무엇과 다른가

손실 함수는 단순하다. 선택된 중간 레이어 집합 M에 대해, 영어 시퀀스와 타깃 언어 시퀀스의 평균 풀링된 라우팅 분포 사이 KL 발산을 각 레이어에서 계산하고 평균 낸다. L_XLR = (1/|M|) Σ_{l∈M} D_KL(p̄_eng,l ‖ p̄_tgt,l). 전체 손실은 기존 언어모델링 손실에 가중치 α를 곱한 보조 항을 더한 L = L_LM + α·L_XLR 형태다. 그래디언트는 타깃 언어 시퀀스로만 흐르고, 영어 시퀀스는 라우팅 분포를 얻는 데만 쓰여 업데이트를 받지 않는다. 어떤 레이어를 정렬할지는 Bandarkar et al. (2026c)의 언어 간 라우팅 발산 곡선으로 정해, 언어 간 expert 공유가 이미 나타나는 중간 레이어 범위를 모델마다 고정한다. 구현에서는 소스와 타깃 시퀀스를 패딩 없이 한 번의 forward에 함께 패킹하고, variable-length attention으로 시퀀스 경계를 보존하며, split-forward로 마지막 정렬 레이어 이후 소스 토큰 처리를 중단한다. 이 최적화로 단일 언어 CPT 베이스라인 대비 추가 연산 부담이 작다.

어떻게 쓰나

실험은 MoE LLM 4종(Qwen3-30B-A3B, GPT-OSS-20B, Granite-4.0-H-Tiny, Marco-Nano)과 7개 언어로 구성됐다. 작은 두 모델(Granite, Marco)은 베트남어·싱할라어·헝가리어, 큰 두 모델은 텔루구어·칸나다어·태국어·키르기스어를 쓴다. 언어별로 고품질 병렬 데이터에서 20만 샘플을 큐레이션해 계속 사전학습(CPT)했고, 부족한 경우 OPUS 번역 데이터셋으로 보충했다. 비교군은 언어모델링 손실만 쓰는 표준 CPT 베이스라인, 라우터만 학습하고 나머지 파라미터를 동결한 router-only 조건(전체 파라미터의 0.1% 미만 업데이트), 그리고 은닉 상태 평균 풀링에 코사인 유사도 손실을 적용한 L_XLH 조건(Marco-Nano에 헝가리어·싱할라어만)이다.

전제와 한계

내부 지표부터 변화가 뚜렷하다. 학습에 쓰지 않은 FLORES 평가 데이터로 측정한 라우팅 정렬(JS 발산 기반, 레이어 간 비교를 위해 최대 엔트로피로 정규화)은 모든 모델·언어에서 보조 손실을 쓴 쪽이 가장 크게 개선됐고, 베이스라인 CPT는 원본 체크포인트 대비 미미한 변화만 냈다. 라우팅 손실의 그래디언트가 앞단 파라미터로 전파되기 때문에 은닉 표현 자체도 영어 쪽으로 가까워지는데, SoftCKA 정렬 지표로 측정한 Qwen3 결과가 이를 보여준다. 다운스트림 성능은 14개 모델-언어 조합 중 13개에서 베이스라인을 앞섰고 1개(Marco-Nano 베트남어)는 동률이었다. 개선폭은 최대 2.1점, 전체 평균 0.9점이다. 은닉 상태 정렬과의 비교에서는 싱할라어가 26.1에서 26.3(L_XLH) 대 26.8(L_XLR), 헝가리어가 37.4에서 36.9(L_XLH, 오히려 하락) 대 38.1(L_XLR)로, 평균 풀링한 라우터 분포가 더 나은 정렬 타깃이었다. Router-only 학습은 0.1% 미만 파라미터로도 가끔 베이스라인을 맞추거나 넘겼지만 설정별 변동이 컸다. 저자들은 이 결과를 근거로 라우팅 손실의 이득이 라우팅 함수 자체의 변경보다 라우터에 입력되는 표현의 변화에서 온다고 해석한다.

평가는 lm-eval-harness로 수행했고 과제 구성이 넓다. 생성은 FLORES(eng→tgt), 이해는 Belebele, 언어 간 지식 전이는 Global-MMLU 의학 서브셋과 MMLU-ProX, 지역 지식은 MultiLoKo와 INCLUDE, 물리 추론 전이는 Global-PIQA, 수학 추론은 MGSM(더 많은 언어로 확장한 Global-MGSM 포함)과 PolyMath를 쓴다. 벤치마크의 언어 커버리지가 달라 타깃 언어별로 사용 가능한 과제 수가 키르기스어 4개에서 베트남어 9개까지 차이가 난다.

실무 관점에서 이 방법은 이미 사후학습된 MoE 체크포인트에 병렬 데이터로 짧게 CPT를 걸 때 바로 얹을 수 있는 저비용 옵션이다. 별도 아키텍처 변경이나 토큰 정렬 없이 라우터 분포만 비교하면 되고, 패킹 구현을 쓰면 오버헤드가 작다. 다만 기대할 수 있는 이득은 평균 1점 미만 수준이고, 병렬 데이터가 있는 언어쌍에만 적용 가능하다. 라우터만 학습하는 방식은 파라미터 효율적 대안이 될 수 있지만 결과 변동이 커서 전체 학습을 대체할 만한 신뢰할 수단은 아니라고 저자들은 선을 긋는다.

저자들이 밝힌 한계도 분명하다. 평가를 위해 어쩔 수 없이 완전히 사후학습된 LLM에 CPT를 적용했는데, 베이스 모델을 쓰면 추론·지시 수행 능력이 없어 평가가 노이즈해지기 때문이다. 사후학습된 모델에 대한 CPT는 민감하고 비효율적이라 베이스라인 자체의 이득이 작았고, 그만큼 실험 조건 간 차이도 작게 나왔다. 이 방법은 전적으로 병렬 데이터에 의존하며, 기존 병렬 코퍼스는 대부분 문장 단위이고 분포가 좁아 그것만으로는 다운스트림 성능을 크게 올리기 어렵다. 대조 학습에서 흔히 쓰는 부정 쌍(negative pair)은 쓰지 않았는데, MoE LLM이 항상 로드 밸런싱 보조 손실과 함께 학습되어 expert 사용이 균등해지므로 표현 붕괴 위험이 낮다는 전제다. 이 상호작용은 대규모 사전학습이 필요해 검증하지 못했다. 또한 정렬이 언어·문화 특정 정보를 희생시킬 수 있고, 정렬이 추론·수학처럼 언어 특정 정보 의존도가 낮은 과제에 더 유리하다는 가설은 결과로 입증하지 못했다. 저자들은 이 방법이 사후학습보다 사전학습 단계에서 훨씬 효과적일 것으로 보며, MoE 라우팅 동역학이 사전학습 초기에 형성된다는 최근 연구를 근거로 든다.