반복 순환과 MoE 희소성을 함께 묶는 스케일링 법칙

Scaling Laws for Looped Mixture of Experts

HF Daily2609.40316

Yanbei Chen, Anirudh Goyal, Raghuraman Krishnamoorthi2026-09-30

무엇인가

이 논문은 언어 모델 확장에서 모델 크기와 데이터 외에 두 축, 즉 반복 순환(looped transformer의 recurrence)과 MoE 희소성(sparsity)을 동시에 다루는 스케일링 법칙을 세운다. 순환은 저장 파라미터를 늘리지 않고 계산 깊이를 늘리고, MoE는 활성 컴퓨트를 늘리지 않고 총 용량을 늘린다. 문제는 기존 법칙들이 둘 중 하나만 모델링한다는 점이다. Parcae나 Iso-Depth 같은 순환 스케일링 법칙은 순환 이득을 선형 또는 거듭제곱 형태로 두어 R이 커질수록 무한히 커진다고 가정하고, MoE 스케일링 법칙은 전문가 수만 다루고 순환을 빼놓는다. 최근의 루프 MoE 연구들도 순환을 2회 패스로 고정한 채 희소성만 본다. 저자들은 여기서 두 질문을 던진다. 각 순환 패스가 더하는 유효 용량은 얼마이며 그 이득은 무한히 자라는가, 그리고 희소성이 커지면 그 이득이 커지고 더 오래 유지되는가.

어떻게 동작하나

핵심 제안은 유계이고 희소성 조건부인 순환 매핑이다. 기존 법칙이 모델 파라미터 N을 유효 파라미터 N_eff(R)로 치환하는 것과 달리, 이 논문은 N_eff(R) = N + κ1·N_loop·(1 − e^{−(R−1)/κ2}) 형태를 쓴다. κ1은 순환이 더할 수 있는 점근적 유효 파라미터 상한(κ1·N_loop)을, κ2는 그 상한에 얼마나 빨리 접근하는지를 정한다. R=1에서 N으로 정확히 환원되고 R→∞에서 유한한 값으로 수렴한다는 것이 이 매핑의 경계 성질이다. MoE로 확장할 때는 활성 파라미터 비율 m = N_act/N_total을 도입해 κ_j(m) = κ_j·m^{−θ}로 계수를 m의 함수로 만든다. 희소성이 클수록(m이 작을수록) m^{−θ}가 순환 곡선을 수직으로 올리고 수평으로 늘려, 점근 상한을 높이면서 더 많은 순환 패스에 걸쳐 이득을 유지시킨다. 직관은 라우터가 패스마다 다른 전문가로 토큰을 보내, 가중치를 공유하면서도 패스마다 새로운 파라미터 경로에 도달할 수 있다는 것이다. 이 매핑을 MoE 스케일링 법칙의 활성 파라미터 항에 대입한 것이 최종 MoE 루프 스케일링 법칙이며, 전문가 수 변환 항 Ê와 로그 보정항까지 포함한다. 이 법칙은 E=1에서 밀집 루프 법칙, R=1에서 표준 MoE 법칙, E=1·R=1에서 표준 밀집 법칙으로 각각 환원된다.

무엇과 다른가

실험은 네 축을 함께 스윕한다. 활성 파라미터 N_act ∈ {0.3, 0.6, 1.0}B, 학습 토큰 D ∈ {100, 200, …, 500}B, 전문가 수 E ∈ {1, 2, 4, 8, 16}, 순환 R ∈ {1, 2, 3, 4, 6, 8}이다. 루프 방식은 중간 블록을 반복하는 middle-cycle looping으로, 앞 두 개 프렐류드 층과 뒤 두 개 코다 층은 공유하지 않는다. R ≤ 8로 적합한 법칙을 R = 16으로 외삽했을 때, 선형 매핑은 유효 파라미터 이득을 크게 과대평가하고 거듭제곱 매핑은 감소 추세는 잡지만 여전히 낙관적이며, 유계 매핑만 손실 포화를 따라간다. 보지 못한 N, D, R에 대한 홀드아웃 RMSE도 유계 매핑이 가장 낮다. MoE 비교에서도 희소성 조건부 유계 매핑이 전문가 수 전 구간에서 손실 평탄 구간을 추적하며 최저 홀드아웃 RMSE를 기록한다.

어떻게 쓰나

하류 성능은 14개 벤치마크로 확인한다. 추론(BBH, GSM8K), 과학(ARC-C/E, OpenBookQA), 상식(HellaSwag, PIQA, SIQA, WinoGrande), 독해(BoolQ, DROP), 지식(MMLU, Natural Questions, TriviaQA)이며 Overall은 14개 평균, Reasoning은 GSM8K와 BBH 평균이다. 5×10^20 FLOPs에서 E ≥ 8인 0.3B MoE가 1.0B 밀집 모델을 Overall과 Reasoning 모두에서 앞서는데, 이는 활성 파라미터 약 3배를 희소성으로 상쇄한 것이다. 10^21 FLOPs에서 E = 8로 고정하고 순환을 늘리면 R ≥ 4인 0.3B가 R = 1인 0.6B와 대등하거나 앞서고, R ≥ 3인 0.6B가 R = 1인 1.0B와 대등해 추론에서 총 파라미터 약 2배를 상쇄한다. 두 축을 함께 키운 E = 8, R > 1 조합은 같은 학습 컴퓨트에서 밀집 베이스라인(E = 1, R = 1)을 일관되게 앞선다. 실전 사례로 A0.6B-2.9B MoE(0.6B 활성/2.9B 총, E = 8, R = 1)를 비루프 기준으로 두고, 적합 법칙과 순환 선택 기준으로 A0.3B-1.3B LoopMoE(0.3B 활성/1.3B 총, E = 8)의 순환을 도출해 같은 컴퓨트에서 학습했다(약 3T 토큰 대 약 6T 토큰). 활성·총 파라미터가 약 2배 적은데도 R ∈ {4, 5}인 LoopMoE가 BBH와 GSM8K 추론에서 대등했고 Overall에서는 뒤졌다. 대신 추론 시 순환을 R = 1에서 R = 5로 올리면 Overall이 36.6에서 46.9로 10.3포인트 오르는 테스트타임 스케일링이 가능하다.

전제와 한계

설계 지침도 수치로 제시된다. 학습 컴퓨트가 클수록, 희소성이 클수록 계산 최적 순환 R*가 커진다. 가중치 메모리 예산이 크고 순환이 높을수록 메모리 최적 전문가 수 E*가 커진다. 컴퓨트와 메모리를 함께 묶은 공동 최적화에서는 3GB에서 1.0B 활성·E = 8·R = 2가, 10GB에서 1.6B 활성·E = 16·R = 1이 선택되어, 컴퓨트가 고정일 때 메모리가 빠듯하면 순환 쪽으로, 메모리가 넉넉하면 희소성 쪽으로 최적점이 이동한다.

실무자 관점에서 이 논문은 루프와 MoE를 별개 하이퍼파라미터로 감으로 고르던 상황을 바꾼다. 배포 메모리 상한이 정해진 추론 서빙이라면 순환을 늘리고 전문가 수를 줄이는 쪽이, 메모리는 여유가 있고 학습 컴퓨트가 제한적이라면 전문가 수를 늘리는 쪽이 유리하다는 판단 근거를 준다. 다만 순환을 늘리면 저장 파라미터는 그대로여도 학습·추론 컴퓨트가 언롤 파라미터 수 N_unroll(R) = N_act + (R−1)·N_loop에 비례해 늘어난다는 점을 반드시 함께 계산해야 한다. 또 순환 선택 기준에는 최소 유의 손실 감소 허용치 ε이 들어가는데, 저자들은 이를 적합 법칙의 RMSE로 설정해 그보다 작은 예측 개선은 적합 오차와 구분하지 않는다.

저자가 명시한 한계도 분명하다. κ1·N_loop나 κ1·m^{−θ}·N_loop 같은 점근 상한은 관측된 순환 범위를 넘어서는 보장이 아니라 매핑의 성질일 뿐이라고 반복해서 밝힌다. 메모리 최적화는 가중치 메모리만 다루며 KV 캐시나 런타임 상태는 범위 밖이다. 실험은 middle-cycle looping 한 가지 전략에 한정되며, 공식이 특정 루프 전략에 의존하지는 않지만 다른 전략은 향후 과제로 남긴다. 또한 법칙 적합은 R ≤ 8, E ≤ 16, N_act ≤ 1.0B, D ≤ 500B 범위의 스윕에 기반하므로, 이 범위를 크게 벗어난 스케일에서의 외삽 정확도는 원문에 수치가 제시되지 않았다.