IntBMoE는 블록 수준 조건화로 전문가 참여·실행·메모리를 분리하는 MoE다.

IntBMoE: Integrating Block-Level Conditioning into Expert Composition for Full-Participation Mixture-of-Experts

HF Daily2609.21346

Ran Cheng, Longfei Xu, Zheng Liu2026-09-18조회 4

무엇인가

이 논문은 MoE에서 한 토큰의 출력에 지식을 제공하는 전문가 수인 참여, 실제로 계산되는 전문가 수인 실행, 만들어 저장해야 하는 전문가 크기 파라미터 집합 수인 materialization을 서로 독립적으로 정할 수 없다는 문제를 다룬다. 기존 희소 라우팅은 실행과 materialization을 낮추지만 참여를 줄이고, dense output mixing은 참여를 회복하지만 실행이 전문가 수에 비례해 커지며, parameter merging은 실행을 한 전문가로 유지하지만 라우팅 단위마다 합성 파라미터를 만들어 materialization이 커진다. 저자들은 전문가 변환의 구성과 토큰 실행이 결합되어 있기 때문에 세 요구를 동시에 만족할 수 없다고 보고, 전체 전문가 풀이 재사용 가능한 변환을 먼저 만들고 각 토큰은 그중 일부만 선택해 실행하는 IntBMoE를 제안한다.

어떻게 동작하나

IntBMoE는 Transformer의 FFN 서브레이어를 대체한다. 블록 수준에서는 K개의 학습된 코드북 임베딩이 각각 하나의 후보 블록을 나타내고, 공유 하이퍼네트워크가 각 임베딩을 value와 gate 합성 계수로 매핑한다. 이 계수는 각 내부 레이어의 전문가 풀을 결합해 K개의 토큰 독립적인 L층 블록을 만든다. 토큰 수준에서는 라우터가 토큰마다 Top-k 블록을 고르고, 선택된 블록은 블록 조건 특징 필터링을 거친 뒤 L개의 합성 전문가를 순차 통과한다. 선택된 블록 출력은 라우팅 확률로 가중 합산되고, 항상 활성화되는 공유 SwiGLU 전문가 출력이 더해진다. 따라서 모든 블록이 전체 전문가 풀을 사용하므로 참여는 풀 전체가 되고, 토큰은 k개 블록만 실행하므로 실행은 희소하며, 코드북 크기 K가 materialization을 제한한다.

무엇과 다른가

구체적으로 코드북은 C={c_b}로 두고, 각 내부 레이어 ℓ의 전문가 풀은 P^(ℓ)={(W_e^(ℓ), b_e^(ℓ))}_{e=1}^E로 둔다. 하이퍼네트워크는 q_b=ReLU(LN(A c_b+a))를 거쳐 alpha_b^v=A_v q_b+a_v와 alpha_b^g=A_g q_b+a_g를 출력한다. 이 계수는 softmax나 sigmoid로 정규화하지 않아 음수가 될 수 있고 합이 1일 필요도 없어, 전문가 기저의 볼록 껍질이 아니라 선형 스팬 위에서 합성할 수 있다. 대신 1/sqrt(E)를 곱해 분산을 보존한다. 각 경로 p가 v 또는 g일 때 W_{b,p}^(ℓ)=(1/sqrt(E))Σ_e alpha_{b,e}^p W_e^(ℓ), b_{b,p}^(ℓ)=(1/sqrt(E))Σ_e alpha_{b,e}^p b_e^(ℓ)로 합성한다. DPRG는 value 경로 v=W_{b,v}^(ℓ)z+b_{b,v}^(ℓ)와 gate 경로 g=RMSNorm(W_{b,g}^(ℓ)z+b_{b,g}^(ℓ))를 z~=v⊙(1+λ SiLU(g))로 결합하고, 내부 레이어 사이에는 LayerNorm을 적용한다. 특징 필터는 m=sigmoid(W_f[x_t||c_b]+b_f), z0=x_t⊙m로 같은 토큰을 블록마다 다르게 본다. 라우팅 확률은 pi=softmax(r_t)_b이고 최종 출력은 y_t=Σ_{b in B_t} pi_{t,b}F_b(x_t)+S(x_t)다. 비용은 합성 O(KED)와 실행 O(TkD)로, 캐싱하면 합성 항이 요청 시점에서 사라져 고정된 K,k에서 요청 시점 계산이 전문가 풀 크기 E에 의존하지 않는다.

어떻게 쓰나

ImageNet-1K 실험은 128만 장 학습, 5만 장 검증, 1000개 클래스, 8층 DeiT-Tiny 스타일 백본에서 세 시드 평균으로 수행됐다. 비교 대상은 dense 백본과 Switch Transformer, DeepSeek-V3 MoE, ReMoE, V-MoE, Expert Choice, DynMoE, MASS 같은 희소 라우팅 계열, Soft MoE, SMEAR, Lory, μMoE 같은 dense 참여 계열이다. IntBMoE는 Top-1 73.76%, Top-5 91.48%를 기록해 dense 백본보다 각각 7.36, 3.79 퍼센트포인트 높았고, 가장 강한 경쟁자인 SMEAR보다 Top-1 1.98, Top-5 1.15 퍼센트포인트 앞섰다. 모든 MoE 방법이 약 24M 총 파라미터를 쓰는 조건에서 IntBMoE는 전체 전문가 풀이 블록 구성에 참여해 23.111M 파라미터를 활성화한다. 추론 비용은 배치 크기 1에서 캐싱 없이 이미지당 4.063 GFLOPs, 캐싱 시 3.457 GFLOPs다. 절제 실험에서는 gate 경로 제거가 가장 큰 성능 하락을 냈고, 2층 블록을 파라미터 수를 맞춘 1층으로 줄인 변형이 그다음이었다. 공유 전문가와 특징 필터는 작지만 일관된 이득을 주었고, λ 고정과 softmax 정규화 계수는 전체 공식보다 나빴다. 민감도 실험에서 K를 8에서 32로 늘려도 Top-1은 0.07 퍼센트포인트, E를 16에서 64로 늘려도 0.15 퍼센트포인트만 올랐고, k는 키울수록 좋아져 토큰당 계산을 제한하면서 k=2를 기본으로 삼았으며, 블록 깊이는 L=2가 가장 좋았다.

전제와 한계

저자들은 전체 풀 참여가 실제로 유효한지도 검증한다. ImageNet-1K에서 한 MoE 레이어의 모든 블록 합성에서 전문가 기저 하나를 제거하는 실험을 Layers 0, 2, 4, 6의 16개 기저에 대해 총 64가지로 수행했고, 재학습 없이 원래 체크포인트를 평가했다. 제거로 인한 스케일 변화를 보정하려고 1/sqrt(E)를 1/sqrt(E-1)로 바꿨다. 어떤 기저를 제거해도 Top-1이 떨어졌고, Layers 0, 2, 4, 6의 평균 하락은 각각 1.60, 0.49, 1.17, 0.78 퍼센트포인트였다. Layer 0에서는 E1, E12, E15 제거가 각각 4.10, 4.99, 9.15 퍼센트포인트를 떨어뜨릴 만큼 기여가 불균등했지만, 뒤 레이어로 갈수록 Layer 2는 0.26~0.74, Layer 4는 0.60~1.95, Layer 6은 0.45~1.04 퍼센트포인트 범위로 더 고르게 분포했다. 가장 작은 하락도 0.26 퍼센트포인트여서 모든 전문가 기저가 기여한다는 결론을 뒷받침한다. 라우팅 분석에서는 같은 레이어 안에서도 이미지 클래스별로 선호 블록이 달랐고 깊이에 따라 선호가 바뀌었다. 예를 들어 Layer 4에서 hen은 b4, Boston bull은 b6을 선호했지만 Layer 6에서는 각각 b0과 b3으로 이동했다. 블록별 합성 계수도 달라서, value 경로의 블록 간 평균 코사인 유사도는 Layer 0의 0.796에서 Layers 2, 4, 6에서 0.079, 0.019, 0.010으로 감소했고, gate 경로는 0.726에서 0.126, 0.083, 0.043으로 감소했다. 얕은 층은 합성 패턴을 공유하고 깊은 층은 더 다양한 레시피를 학습한다는 해석이다.

언어 모델링과 추천으로의 일반화도 확인한다. MiniPile은 중복 제거된 Pile의 6GB 부분집합이고 18층 Llama 스타일 인과 Transformer를 쓰며, IntBMoE는 테스트 손실 2.6802, PPL 14.5878을 기록했다. 가장 강한 베이스라인인 μMoE(CP)보다 PPL을 2.9% 줄였고 dense 백본보다 12.4% 줄였다. IntTravel은 1억 6280만 사용자, 730만 POI, 41억 3000만 상호작용을 가진 데이터셋으로 다음 여정의 목적지 POI를 예측하는 Where 과제에서 HR@1, HR@5, NDCG@5 평균이 가장 높았다. 두 과제의 절제 실험에서도 gate 경로가 MiniPile에서 가장 큰 영향을 주고 IntTravel에서도 가장 영향력 있는 구성 요소 중 하나였으며, 1층 변형은 전체 모델보다 나빴고, 공유 전문가는 작지만 일관된 이득을 주었고, λ 고정과 특징 필터 제거는 두 인과 과제 모두를 해쳤고, 비정규화 분산 스케일 계수가 softmax 정규화보다 일관되게 좋았다. AMap의 생성형 추천 시스템에서는 앱을 열 때 보이는 초기 지도 화면용 POI 추천에 캐싱된 IntBMoE를 배포했다. Top-10 POI를 예측해 지도 뷰포트와 줌을 정하며 60ms 응답 예산이 필요한데, 입력 독립적인 합성 블록 파라미터를 미리 계산해 캐싱하여 블록 합성을 요청 경로에서 제거했다. 일주일 온라인 A/B에서 초당 약 5000 쿼리를 처리했고 Alibaba T-Head PPU에서 평균 지연 19ms, P99 38ms를 기록해 예산 안에 들었으며 UVCTR이 상대적으로 2.4% 개선되어 정식 배포됐다.

개발자 관점에서 IntBMoE는 전체 전문가 지식을 활용하고 싶지만 dense 실행 비용을 감당하기 어렵고, 지연과 메모리 예산이 빡빡한 서빙 환경에서 검토할 만하다. 특히 추론 전에 K개 블록을 캐싱할 수 있으면 요청 시점 계산이 전문가 풀 크기 E와 분리되므로, 전문가 수를 늘려 용량을 확보하면서도 지연을 통제할 수 있다. 다만 K, k, L, E의 균형을 확인해야 하고, 캐싱은 고정 메모리 비용을 추가하므로 작은 전문가 풀에서는 오히려 손해일 수 있으며 원문 기준 E가 16 이상일 때 메모리 효율이 좋아진다. 또한 블록 합성은 입력 독립적이므로 토큰별 적응은 라우팅과 특징 필터가 담당하고, 학습 중에는 미니배치의 모든 이미지가 같은 합성 블록을 공유해 합성 비용이 배치당 한 번만 발생한다는 전제를 이해해야 한다.

논문은 별도의 한계 절을 두지는 않지만 본문에서 몇 가지 전제와 비용 조건을 밝힌다. 캐싱을 쓰면 요청 시점 계산이 E에 의존하지 않지만, 캐싱 자체가 고정 메모리를 쓰므로 전문가 풀이 작을 때는 비캐싱보다 메모리를 더 쓴다. 이 독립성은 K와 k를 고정했을 때의 이야기이고, 블록 합성은 학습 시 배치마다 한 번 수행된다. 인과 예측 과제에서는 Soft MoE를 현재와 이전 토큰만으로 슬롯을 구성하도록 바꾸고 SMEAR는 토큰 수준 합성을 쓰는 등 베이스라인을 인과 설정에 맞게 조정했다. 전문가 제거 분석은 재학습 없이 원래 체크포인트를 평가한 것이며, 스케일 보정을 위해 1/sqrt(E-1)을 사용했다. 또한 모든 MoE 방법이 약 24M 총 파라미터 예산을 쓰는 조건에서 비교되었고, IntBMoE는 23.111M을 활성화한다는 점도 결과 해석의 전제다.

관련 논문