SplitMoE가 영상 확산 모델의 균일성 함정을 깬다
Breaking the Uniformity Trap: Scaling Video Diffusion Model via SplitMoE
무엇인가
이 논문이 푸는 문제는 영상 확산 모델을 Mixture-of-Experts(MoE)로 키울 때 생기는 구조적 실패다. Diffusion Transformer 기반 영상 생성은 파라미터를 늘릴수록 계산 비용이 감당하기 어려워지는데, MoE는 총 용량과 활성 FLOPs를 분리하는 해법이다. 문제는 기존 시각 MoE가 언어 모델용 설계를 그대로 가져온다는 점이다. 언어 토큰은 이산 구문 덕분에 의미 단위가 비교적 잘 나뉘지만, 영상 토큰은 시공간적으로 중복되고 의미 분포가 롱테일이다. 저자들은 토큰을 전문가에 균일하게 흩뿌리는 로드 밸런싱이 같은 객체의 인접 패치를 서로 다른 전문가로 보내고, 시각적으로 중복된 배경 패치가 여러 전문가를 차지하게 만든다고 지적하며 이를 균일성 함정(uniformity trap)이라 부른다. 논문은 언어 토큰과 시각 토큰의 자기유사도 패턴을 비교하고, 세그멘테이션 마스크로 토큰을 묶어 라우팅된 전문가를 분석해 표준 MoE가 의미 구분성(semantic distinctiveness)과 영역 내 라우팅 지배성(intra-sample routing dominance) 모두에서 일관되게 낮은 값을 보인다고 보고한다. 그 결과가 라우팅 파편화, 시간적 떨림(temporal jitter), 공간 줄무늬(spatial striping), 의미 파편화다.
어떻게 동작하나
제안 방법 SplitMoE의 핵심은 전문가 풀을 두 개의 겹치지 않는 부분집합으로 쪼개는 것이다. 의미 전문가 집합과 일반 전문가 집합으로 나누고 전체 전문가 수는 두 집합의 합으로 유지한다. 라우터는 토큰을 투영해 각 전문가에 대한 친화도를 시그모이드로 계산하는데, 전역 소프트맥스 대신 독립적인 시그모이드 점수를 쓰기 때문에 하나의 토큰이 의미 전문가와 일반 전문가에 동시에 높은 점수를 가질 수 있다. 이후 각 그룹에서 독립적으로 TopK를 뽑아 의미 전문가 K_s개, 일반 전문가 K_g개를 선택한다. 전문가 선택에는 편향이 섞인 점수를 쓰지만 최종 혼합 가중치는 깨끗한 원점수로 다시 계산해 라우팅 충실도를 지킨다. 출력은 두 그룹 기여의 합이며, K = K_s + K_g를 표준 MoE 베이스라인의 Top-K와 같게 맞춰 계산 예산이 늘어난 것이 성능 원인이 되지 않도록 했다.
무엇과 다른가
의미 전문가 쪽에는 프로토타입 유도 라우팅이 붙는다. VAE 특징 공간에 학습 가능한 프로토타입 집합을 두고 각 의미 전문가의 의미 앵커로 사용한다. 라우터 정렬 손실은 깨끗한 VAE 특징과 프로토타입의 온도 스케일 코사인 유사도로 만든 교사 할당을 고정 타깃으로 두고, DiT 토큰에서 나온 라우터의 의미 라우팅 분포와 KL 발산으로 정렬한다. 이때 stop-gradient를 걸어 라우터 목적이 프로토타입 토폴로지를 직접 왜곡하지 못하게 한다. 프로토타입 자체는 pull과 push 두 힘으로 최적화된다. pull 항은 현재 미니배치 특징과 원형 토큰 뱅크에 저장된 과거 특징 쪽으로 프로토타입을 끌어당겨 죽은 모드를 줄이고, push 항은 마진을 두고 프로토타입 간 반발을 걸어 여러 프로토타입이 중복된 배경 영역으로 붕괴하는 것을 막는다. 로드 밸런싱은 비대칭이다. 일반 전문가에는 DeepSeek-V3식 무손실 밸런싱을 적용하지만, 의미 전문가는 명시적 밸런싱을 걸지 않고 의미 정렬을 통해 자연스럽게 균형을 얻는다. 전체 목적함수는 플로우 매칭 손실에 정렬 손실과 프로토타입 손실을 가중합한 형태이며, 별도의 보조 최적화 손실은 추가되지 않는다.
어떻게 쓰나
실험은 Wan 2.2 저노이즈 체크포인트를 업사이클하는 방식으로 이뤄졌다. 15번부터 35번까지의 짝수 레이어에 있는 dense FFN을 MoE 레이어로 교체하고 나머지는 그대로 둔다. 각 MoE 레이어는 항상 활성화되는 공유 전문가 1개와 라우티드 전문가 100개로 구성되며, 100개는 의미 20개와 일반 80개로 나뉜다. 토큰마다 Top-8 라우터가 의미 전문가 2개와 일반 전문가 6개를 활성화한다. 총 27B 파라미터 중 14B를 전방 패스마다 활성화해 dense 베이스라인과 계산량을 맞췄고, 모든 모델을 동일한 80k 스텝으로 학습했다. 평가는 VBench-2.0의 창의성·상식·제어성·인간 충실도·물리 5개 차원과 T2V-CompBench의 일관 속성·상호작용·수량 3개 차원에서 이뤄졌고, CogVideoX-1.5, Mochi, HunyuanVideo, LongCat-Video, LTX-2, Wan2.2, OmniWeaving(think)과 비교했다. 생성은 각 모델 기본 설정으로 81 프레임이다.
전제와 한계
다만 원문에 실린 본문에는 표 1의 구체적인 점수 수치가 제시되지 않았다. 저자들이 서술한 결과는 방향 수준이다. Wan2.2 대비 창의성과 인간 충실도가 향상됐고, T2V-CompBench에서 조합 정렬 결과가 경쟁력 있었다는 것이다. 정성 비교에서는 수박 자르기 사례에서 Wan2.2, LongCat-Video, LTX-2가 동작이 진행되며 손 형태와 수박 기하가 비자연스럽게 변형·융합되는 반면 제안 방법은 시간적 일관성과 물리적 경계, 구조 디테일을 유지했다고 보고한다. 말이 서 있다가 달리는 전환 사례에서는 베이스라인들이 다리 아티팩트와 구조 이상을 만들지만 제안 방법이 더 부드러운 전환과 정확한 생리 구조를 보존했다고 한다.
같은 출처를 공유하는 통제 실험도 여럿 있다. Dense Wan2.2-FT 대비 SplitMoE는 모든 평가 차원에서 앞서는데, 이는 MoE 업사이클링이 토큰당 활성 파라미터를 늘리지 않고도 용량과 성능 상한을 올린다는 뜻이다. 검증 확산 손실에서 SplitMoE는 더 빨리 수렴해 약 70%의 학습 스텝에서 비슷한 손실에 도달하고 이후에도 더 낮은 손실을 유지했다. 일반 전문가 100개짜리 표준 MoE(Wan2.2-MoE)와 프로토타입 유도를 뺀 SplitMoE 변형의 성능이 비슷했다는 점은, 전문가를 나누기만 해서는 이득이 제한적이며 명시적 의미 유도가 필요하다는 근거로 제시된다. pull과 push 중 하나만 남기면 정량 지표가 안정적으로 개선되지 않고 프로토타입 유도가 없는 변형보다 못할 수도 있는데, push가 없으면 pull이 지배적 시각 영역으로 프로토타입을 몰아 VAE 매니폴드 커버리지를 줄이고, pull이 없으면 push가 프로토타입을 데이터 매니폴드 밖으로 밀어 사용되지 않거나 죽은 의미 전문가를 만든다고 설명한다. 계산 오버헤드는 dense 대비 반복당 약간의 지연이 있고 베이스라인 MoE 대비로는 무시할 수준이다.
흥미로운 관찰은 시간 단계에 따른 라우팅 변화다. 50 스텝 디노이징 궤적을 추적하면 의미 전문가에 배정되는 가중치가 초기 고노이즈 단계인 10~15 스텝 부근에서 정점을 찍고, 이후 국소 외형과 디테일 정련으로 넘어가면서 점차 줄어든다. 명시적인 타임스텝 조건 라우팅 제약을 걸지 않았는데도 나타난 창발적 현상으로, 저자들은 이를 거친 것에서 세밀한 것으로 가는(coarse-to-fine) 생성 순서와 맞물린다고 해석한다.
개발자 입장에서 이 논문의 실무적 의미는 명확하다. 영상 생성 모델을 sparse하게 스케일링할 계획이라면 로드 밸런싱을 기본값으로 균일하게 걸지 말고, 토큰 분포가 실제로 어떤 의미 구조를 갖는지 먼저 확인해야 한다. 또 하나 확인할 지점은 프로토타입 유도가 외부 표현 모델이 아니라 동결된 VAE 특징을 교사 신호로 쓴다는 점, 그리고 라우팅 연산 자체의 지연이 완전히 사라지지는 않는다는 점이다. 활성 파라미터 예산을 맞춘 비교를 하지 않으면 이런 구조 변경의 효과를 잘못 해석하기 쉽다.
저자들이 밝힌 한계는 두 가지다. 동결된 시각 특징에 의존한다는 점과 스파스 라우팅 오버헤드가 남는다는 점이다. 향후 과제로 적응적 전문가 분할, 효율적인 분산 라우팅, 더 넓은 영상 생성 태스크로의 확장을 제시한다. 또한 실험 프로토콜상 Dense Wan2.2-FT는 저노이즈 체크포인트만으로 학습되기 때문에 고노이즈·저노이즈 이중 모델 앙상블을 쓰는 공식 Wan2.2보다 자연히 낮은 성능을 낸다는 전제도 함께 밝히고 있다.