Foil은 MoE를 루프하며 전문가를 펼치고 어텐션을 분리한다.
How to Loop MoE: Flatten the Experts, Untie the Attention
무엇인가
루프 트랜스포머는 같은 층 블록을 여러 번 재사용해 저장된 파라미터 수는 그대로 두고 연산량을 늘리는 방식으로 모델을 강화한다. 희소 MoE는 반대로 층마다 많은 전문가를 두되 토큰마다 소수만 활성화해 파라미터를 연산에서 분리한다. 두 철학은 자연스럽게 맞물린다. 같은 층을 여러 번 지날 때마다 토큰은 매번 새 라우팅 결정을 받아 서로 다른 전문가와 그 조합에 도달할 수 있기 때문이다. 논문은 이 지점에서 실무적인 질문을 던진다. 전문가 파라미터와 토큰당 전문가 연산을 고정했을 때, 루프 블록 안에 전문가를 어떻게 배치해야 하는가 — 층마다 전문가를 몇 개 두고, 블록은 몇 층이며, 몇 번 루프하는가. 그리고 각 패스가 어떤 파라미터를 소유해야 하는가. 기존 연구들은 루프와 전문가를 결합했지만 이 배치 문제를 고정 예산 아래에서 비교하지 않았다. 하드웨어 연산이 메모리 용량과 대역폭보다 훨씬 빠르게 성장하는 상황에서, 연산을 저장된 파라미터와 맞바꾸는 선택은 점점 매력적이다.
어떻게 동작하나
논문은 먼저 회계를 정리한다. E개의 전문가를 담은 뱅크 D개로 이루어진 블록을 L번 순회한다고 할 때, 실제 전문가 수는 E_real = E×D, 유효 깊이는 D_eff = D×L, 등가 전문가 수는 E_eq = E×D×L, 토큰당 전문가 호출 수는 E_comp = k×D×L이다. Foil의 첫 번째 축인 평탄화(flattening)는 (E, D, L)을 (2E, D/2, 2L)로 사상한다. 층은 절반, 층당 전문가는 두 배, 패스는 두 배다. 이 변환은 전문가 파라미터(E_real), 토큰당 전문가 호출 수(E_comp), 유효 깊이(D_eff)를 모두 고정한 채 라우팅 결정이 고르는 풀의 크기 E와 등가 전문가 수 E_eq만 키운다. (8,8,2)에서 세 단계를 밟으면 (16,4,4), (32,2,8), (64,1,16)이 되고 E_eq는 128에서 1024로 커진다.
무엇과 다른가
두 번째 축은 어텐션 분리(untying)다. Foil은 Huginn의 루프 골격을 따른다. 토큰 임베딩, 일반 MoE 층 하나로 된 프렐류드, D개 층을 L번 적용하는 루프 블록, 일반 MoE 층 하나로 된 코다, 출력층 순서다. 프렐류드와 코다는 각각 전문가 8개를 가지며 한 번만 실행되고 평탄화되지 않는다. 문제는 관행적인 루프 모델이 어텐션까지 포함한 블록 전체를 패스 간에 공유한다는 점이다. 그러면 평탄화가 어텐션 파라미터 세트를 함께 버린다. (8,8,2) 블록은 어텐션 세트를 8개 갖지만 (64,1,16)은 1개만 남아 모든 패스에서 재사용된다. Foil은 전문가와 라우터는 패스 간에 공유하되 각 패스에 자기 어텐션을 준다. 전체 시퀀스에 걸쳐 DL=16개의 어텐션 세트가 생기고 패스 임베딩은 쓰지 않는다. 어텐션 분리는 연산을 전혀 늘리지 않는다. 공유가 버리던 어텐션 파라미터를 되돌려 놓을 뿐이다. 논문이 비교하는 모델은 Foil-1 (64,1,16), Foil-2 (32,2,8), Foil-3 (16,4,4), 그리고 어텐션만 분리한 비평탄화 기준 Base (8,8,2)다. 어텐션을 공유하는 대조군은 Base-tied와 proto-Foil-3/2/1이다. Base와 Foil들은 각각 553.7M 파라미터, 어텐션 공유 모델들은 490.8~520.2M 파라미터다. 모든 모델은 선형 라우터의 softmax로 토큰마다 상위 k=2 전문가를 고르고 가중치를 재정규화하며, 전문가는 SwiGLU다.
어떻게 쓰나
전문가 활용은 세 지표로 측정한다. U_t는 한 토큰이 패스들을 거치며 도달하는 서로 다른 전문가 수로, 루프가 토큰 하나에 몇 개의 전문가를 열어주는지 보여준다. B_2는 층별 라우팅 요청 점유율로 계산한 로드 밸런스(Jain 공정성 지수)이고, MMR(median margin ratio)은 라우터 1순위 확률을 전체 풀의 중간 순위 전문가 확률로 나눈 값, 즉 exp(z_(1) − z_(E/2))다. 선택된 집합 안이나 경계가 아니라 중간 순위 전문가를 기준으로 마진을 재는 것이 특징이다. 저자들은 B_2와 MMR 모두 전문가 수 E에 의존하므로 절대값을 서로 다른 E끼리 비교하지 않고, 같은 형태(equal shape)에서 두 지표가 같은 방향으로 움직일 때만 라우팅이 건강해졌다고 읽는다고 못 박는다. 별도로, 라우팅 트래픽이 가장 적은 전문가를 마스킹하고 트래픽을 맞춘 무작위 그룹과 비교하는 테스트도 쓴다.
전제와 한계
실험은 20B 토큰 사전학습과 100B 토큰 지속학습으로 진행됐다. 모든 모델이 같은 데이터를 같은 순서로, 같은 초기화 시드와 같은 학습률 스케줄로 학습했고, 비교한 여덟 모델 기준 파라미터당 35~40 토큰으로 Chinchilla 비율에 충분한 양이다. 다운스트림은 단어 예측(LAMBADA), 문장 이어쓰기(HellaSwag), 상호참조 해결(XWinograd) 세 가지 제로샷 과제로 평가했다. 전체 실험은 약 12.6k NVIDIA H200 GPU-시간을 소모했고(이전 대조·실패 런 포함 약 18.2k), 각 런은 H200 8장 한 노드를 넘지 않았다. 결과는 평탄화가 양쪽 학습 길이 모두에서 이긴다. 20B에서 세 Foil 모두 Base보다 낮은 손실을 냈고, 두 번째 평탄화 단계까지 손실이 떨어지다가 평탄해지며 Foil-1이 Base보다 0.007 nat 낮았다. 100B에서는 평탄화 단계마다 손실이 단조롭게 개선돼 가장 평탄한 Foil-1이 Base보다 0.012 nat 낮았다. 다운스트림은 20B에서 Foil들이 표준오차 안에서 Base 이상, 100B에서는 세 Foil 모두 Base보다 1~2 표준오차 높았다. 어텐션 분리의 효과도 일관된다. 20B에서 분리 모델이 네 쌍 모두에서 이겼고 가장 평탄한 쌍에서 Foil-1이 proto-Foil-1보다 0.042 nat 낮았으며, 100B 지속학습 후 격차는 0.049 nat로 커졌다. 세 과제 평균 다운스트림 점수도 네 쌍 모두에서 분리 모델이 앞섰고, 100B에서 가장 평탄한 두 쌍은 2 표준오차를 넘어 Foil-1이 proto-Foil-1보다 3.3점 높았다. 같은 형태에서 분리 모델은 네 쌍 모두 로드 밸런스 B_2와 라우팅 신뢰도 MMR이 함께 높았다.
절제 실험은 20B 토큰에서 수행됐다. 첫째, 넓히기와 루프는 서로를 증폭한다. (8,4,L)을 (16,4,L)로 넓힐 때 이득은 L=2의 0.038 nat에서 L=8의 0.049 nat로 커졌고, 패스를 4에서 8로 늘릴 때 (16,4)는 0.041 nat를 얻어 실제 전문가가 절반인 (8,4)나 층이 두 배인 (8,8)의 최대 0.033 nat를 앞섰다. 반대로 넓히기의 수확 체감도 나타난다. (8,8,2)를 (16,8,2)로 넓혀 얻는 이득은 층당 전문가를 4개가 아니라 8개 늘렸는데도 (4,8,2)→(8,8,2) 이득의 1.2배에 그쳤다. 둘째, 로드 밸런스만으로는 건강한 전문화를 알 수 없다. 라우팅 트래픽 하위 10% 전문가를 마스킹했을 때 최소 사용 그룹이 무작위 평균보다 손실을 더 올린 경우가 비교한 여덟 모델 중 일곱이었고, 무작위 그룹 범위 아래로 떨어진 모델은 없었다(예외인 proto-Foil-2는 무작위 중앙값과 동등). 셋째, 라우팅 신뢰도가 루프 이득과 함께 움직인다. (8,8,L) 계열에서 L이 2에서 8로 갈 때 모델 수준 MMR은 4.15에서 3.36으로, 비루프 (8,8,1) 대비 패스당 평균 이득은 0.064에서 0.022 nat로 함께 줄었다. 또 여러 모델에서 MMR이 특정 패스까지 오르다가 떨어지는데, 이 피크가 지나면 이득이 거의 소진된다. proto-Foil-2를 proto-Foil-1로 더 평탄화하면 손실이 0.017 nat 올랐고, 피크가 있는 Foil-1은 20B에서 Foil-2보다 0.0020 nat 높아 약 3 표준오차 차이였다.
개발자 관점에서 이 논문이 주는 실무 지침은 명확하다. 전문가 파라미터와 토큰당 연산이 고정된 예산이라면, 층을 얇게 가져가고 층당 전문가를 넓힌 뒤 패스를 늘리는 쪽이 같은 예산의 비평탄화 루프 MoE보다 손실과 다운스트림에서 낫다. 어텐션 분리는 추가 연산 없이 파라미터만 되돌려 손실과 라우팅 품질을 함께 개선하므로, 루프 MoE를 설계한다면 거의 공짜에 가까운 선택지다. 라우팅을 점검할 때는 로드 밸런스 하나만 보지 말고 MMR을 함께 보고, 패스별 MMR 곡선이 피크를 찍는지 확인해 평탄화·패스 추가를 언제 멈출지 판단하라는 것이 저자들의 권고다. 다만 검증 규모는 553.7M 파라미터, 20B·100B 토큰, 영어 제로샷 세 과제에 한정된다는 점을 감안해야 한다.
저자들이 명시한 전제와 한계도 분명하다. 절제 실험의 비교들이 한 번에 여러 양을 바꾸기 때문에, 넓고 희소한 층이 루프 수확 체감을 늦춘다는 결론만 말하고 원인을 하나로 특정하지 않는다. 설계상 E_real을 고정한 채 층을 넓힐 수 없어서, 넓히기의 수확 체감 일부는 E_real 변화에서 올 수 있다고 인정한다. MMR 피크와 이득 소진의 관계도 사례가 적어 규칙이 아니라 '매우 그럴듯한' 수준으로만 주장한다. B_2와 MMR은 전문가 수 E에 의존하므로 서로 다른 형태끼리의 절대 비교는 하지 않는다. 회계에서 라우터 스코어링 비용은 세지 않았는데, 가장 평탄한 형태에서도 전문가 연산의 1% 미만이라고 밝힌다. 논문 본문은 한계와 향후 과제를 부록 J에서 다룬다고만 적고 있으며, 제공된 발췌에는 그 부록이 포함되어 있지 않다.