Hunyuan-A13B는 80B 중 13B만 활성화하는 오픈소스 MoE LLM이다
Hunyuan-A13B Technical Report
무엇인가
대형 언어모델의 성능은 빠르게 올라가고 있지만, GPT-4o나 o1, Gemini 2.5, DeepSeek-R1, Qwen3 같은 최상위 시스템을 실제로 배포하려면 막대한 연산 자원과 높은 추론 지연, 상당한 하드웨어 비용이 따른다. 이 비용이 접근성을 가로막는 병목이라는 것이 이 논문의 출발점이다. Hunyuan-A13B는 이 문제를 희소 전문가 혼합(MoE) 구조로 푼다. 총 800억 개 파라미터를 담고 있지만 입력 하나를 처리할 때는 130억 개만 활성화한다. 밀집(dense) 구조로 같은 규모를 맞춘 모델과 비교해 추론 지연과 연산 오버헤드를 줄이면서 언어 모델링 능력을 유지하는 것이 목표다.
어떻게 동작하나
구조를 보면 세부 전문가 64개와 공유 전문가 1개로 이루어진 세밀한(fine-grained) MoE를 쓴다. 모든 전문가는 동일한 중간 차원을 갖는다. 학습과 추론 과정에서 공유 전문가는 항상 활성화되고, 비공유 전문가는 한 번에 8개만 동시에 켜진다. 저자들은 MoE 스케일링 법칙 실험에서 공유 전문가가 하나도 없으면 성능이 눈에 띄게 떨어지지만, 하나를 넘겨 늘리면 개선폭이 미미하거나 오히려 흔들린다고 관찰해 이 구성을 택했다고 밝힌다. 활성화 함수는 Hunyuan-Large, Hunyuan-TurboS와 같은 SWiGLU를 쓰고, 어텐션에는 KV 캐시 메모리 효율을 높이는 그룹 쿼리 어텐션(GQA)을 적용했다. 토크나이저는 Hunyuan-Large와 동일하며 어휘 크기는 128K다.
무엇과 다른가
사전학습 데이터는 Hunyuan-TurboS의 큐레이션 파이프라인을 재사용하되 STEM 쪽을 강화했다. 이 파이프라인은 중복 제거·저품질 필터링·노이즈 제거·토픽 라벨링을 하는 전처리 모듈, 텍스트를 추출하는 모델 기반 추출 모듈, 추출된 코퍼스에 저품질 필터링과 의미 수준 중복 제거를 하는 후처리 모듈로 구성된다. 여기서 STEM 데이터 수집과 정제를 개선해 2500억 토큰 규모의 고품질 STEM 코퍼스를 확보했고, 지식 라벨링 체계와 다차원 난이도 등급 프레임워크도 새로 설계했다. 학습은 세 단계다. 기반 학습 단계는 20T 토큰을 처리하며 학습률을 0에서 3×10⁻⁴까지 선형으로 올린 뒤 13.5조 토큰에 걸쳐 3×10⁻⁵까지 코사인 감쇠하고, 이후 최소 학습률을 유지한다. 이 단계의 컨텍스트 창은 4096으로 고정된다. 빠른 어닐링 단계는 300B 토큰에 걸쳐 3×10⁻⁵에서 8×10⁻⁶까지 급격히 감쇠하며 컨텍스트를 8192로 늘린다. 장문 컨텍스트 단계는 NTK-aware 위치 인코딩을 쓰고 알파 값을 50과 1000으로 두어 컨텍스트 창을 32K, 다시 256K로 확장한다.
어떻게 쓰나
사후학습은 두 축으로 나뉜다. 먼저 추론 지향 미세조정 단계에서 수학·코드·논리·과학 네 영역의 복잡한 추론 능력을 강화한다. 수학 문제는 교재, 표준 시험, 경시대회에서 모아 기초 산술부터 올림피아드 수준까지 포괄하고, 생성 보상 모델과 자동 풀이 검증으로 CoT 예시를 반복 정제해 검증을 통과한 쌍만 남긴다. 코드 데이터는 GitHub 등에서 가져와 다단계 검증과 샌드박스 실행 테스트를 거친다. 논리 데이터는 ZebraLogic에서 착안한 자동 합성으로 늘리고, 과학 데이터는 대학원·올림피아드 수준 문항까지 LLM 검증기로 단위 변환, 수치 근사, 화학 표기 오류를 잡아낸다. 이 위에 GRPO 기반 강화학습을 얹는데, 보상은 두 가지다. 결과 보상 모델은 최종 답이 정답과 맞는지를 1 또는 0으로 주되 형식·단위·동의어 차이를 정규화해 거짓 음성을 줄인다. 샌드박스 피드백은 Python, C++, Go, Java 등 36개 언어를 지원하고 분산 CPU 클러스터에서 1000건 이상을 동시 실행하며 파일·네트워크 격리를 적용한다. RL 데이터는 15만 샘플로 수학:코딩:논리:과학 비율이 2:2:1:1이고, 10%는 SFT 데이터와 겹치고 90%는 새 사례다. 객관식·참거짓·증명 문제는 추측에 보상을 주지 않기 위해 제외한다. 학습은 24K 컨텍스트 1단계, 32K 컨텍스트 2단계로 진행하고 KL 발산 제약을 제거했으며, on-policy 학습, 큰 배치, 롤아웃 수 증가, 0.6~0.8의 낮은 샘플링 온도를 함께 쓴다. 두 번째 축인 전 시나리오 미세조정은 창작, 지식 QA, 명령 수행, 멀티턴 대화 등으로 범위를 넓히고, 정답 여부와 스타일·일관성·적응성을 함께 보는 이중 신호 최적화를 쓴다. 이 단계는 16개 서브토픽과 30개 이상의 스코어링 서비스를 묶는다. 추론 깊이를 조절하는 이중 CoT도 여기서 도입한다. 빠른 사고 모드는 thinking 블록을 비워 두고 짧게 답하며, 느린 사고 모드는 단계별 추론을 블록 안에 채운다. 사용자는 /no_think와 /think 태그로 모드를 고르고, 태그가 없으면 느린 사고가 기본값이다.
전제와 한계
사전학습 모델 평가에서 Hunyuan-A13B는 Hunyuan-Large 대비 14개 벤치마크 중 12개에서 더 나은 점수를 냈는데, 활성 파라미터는 4분의 1, 총 파라미터는 약 5분의 1에 불과하다. 총 파라미터가 비슷한 Qwen2.5-72B와 비교해서는 거의 모든 벤치마크에서 앞섰고, 총 파라미터가 약 3배, 활성 파라미터가 약 2배인 Qwen3-A22B와는 12개 중 7개에서 우위를 보이며 여러 차원에서 비슷한 수준에 도달했다. 사후학습 모델은 AIME2024에서 최고 점수를 냈고 ZebraLogic과 BBH 같은 논리 추론에서도 선두에 섰다. 과학 지식과 명령 수행에서는 자주 2위권에 들면서 훨씬 큰 모델을 앞질렀다. 코딩은 전체적으로 조금 낮지만 FullstackBench, ArtifactsBench 같은 평가에서는 큰 모델과 비슷한 결과를 냈다. 에이전트 능력은 BFCL-v3, τ-Bench, ComplexFuncBench, C3-Bench에서 선두 성능을 보였고, 특히 과제 조합이 바뀌는 C3-Bench에서도 정확도를 유지해 실제 환경의 개방형 문제를 다룰 수 있음을 보였다.
장문 컨텍스트에서는 PenguinScrolls 87.7점으로 Gemini 2.5 Pro의 88.3에 근접하고 DeepSeek R1의 87.5, Qwen3-A22B의 87.1을 앞섰다. LongBench-v2는 55.0점으로 Gemini 2.5 Pro의 60.9에 이어 2위였고 DeepSeek R1의 53.8, Qwen3-A22B의 48.4보다 높았다. 반면 FRAMES는 81.1점으로 Gemini 2.5 Pro의 80.1은 넘었지만 DeepSeek R1의 85.7, Qwen3-A22B의 84.0에는 못 미쳤다. RULER의 QA 하위 과제에서는 평균 76.7점을 기록했고, 컨텍스트가 64K~128K로 늘어난 구간에서도 73.9점을 유지해 DeepSeek R1의 65.6, Qwen3-A22B의 66.6을 크게 앞섰다. 저자들은 성능 저하 폭이 Gemini 2.5 Pro 다음으로 완만하다고 강조한다. 추론 효율 측면에서는 vLLM, SGLang, TensorRT-LLM과 연동되고 W16A16 정밀도로 바로 배포할 수 있으며, Auto Prefix Caching과 Chunk Prefill, Weight Only INT8·W8A8·KV Cache FP8 양자화, Tensor Parallel·Expert Parallel·FusedMoE 가속을 지원한다. 다만 처리량 수치는 본문에 숫자로 제시되지 않고 Table 7에 담겨 있다.
개발자 입장에서 이 모델의 핵심 매력은 지연에 민감한 환경에서 130억 활성 파라미터만 감당하면 된다는 점이다. 단일 노드나 제한된 GPU 자원에서 800억 규모 모델의 지식을 쓰고 싶을 때 현실적인 선택지가 된다. 이중 CoT는 같은 모델로 단순 질의는 빠르게, 복잡한 다단계 문제는 느리게 처리하는 라우팅을 애플리케이션 레벨에서 구현할 수 있게 해 준다. 에이전트 워크플로를 만든다면 도구 호출 벤치마크에서의 강세가 참고가 되고, 장문 문서 처리 파이프라인이라면 RULER에서 보인 64K~128K 구간 안정성이 눈에 띈다. 다만 실제 도입 전에는 원문이 밝힌 평가 설정(5-shot, CoT 등)과 자체 태스크의 조건이 얼마나 다른지, 양자화 포맷별 정확도 손실이 어느 정도인지 직접 확인해야 한다.
한계도 원문에 드러나 있다. FRAMES에서는 DeepSeek R1과 Qwen3-A22B에 뒤져 RAG 특화 장문 처리에 개선 여지가 남아 있다고 저자들이 인정한다. 코딩 성능도 전체적으로 비교 모델보다 약간 낮은 편이다. 또한 논문은 별도의 한계 절을 두지 않았고, 사전학습 벤치마크 결과는 5-shot·CoT 등 특정 평가 프로토콜에 기반하므로 데이터 오염을 줄이기 위한 내부 테스트셋 결과와 함께 해석해야 한다. 처리량을 포함한 효율 수치 상당수는 표에만 있고 본문 서술에는 구체적 값이 제시되지 않았다.
관련 논문
- SSD 가중치층으로 35B MoE를 라우팅 예측으로 24GB 데스크톱에서 서빙한다소비자 하드웨어에서 35B급 MoE 추론은 가중치 메모리에 묶이며, 4비트로도 19.5GB가 필요하고 희소성은 연산만 줄인다. Edge0는 다음 레이어의 전문가 선택을 미리 예측하는 프리라우터로 SSD 스트리밍 읽기를 연산 뒤에 숨기는 추론 엔진이다.
- IntBMoE는 블록 수준 조건화로 전문가 참여·실행·메모리를 분리하는 MoE다.MoE에서 토큰별 전문가 참여도·실행량·파라미터 저장량을 독립적으로 정하지 못하는 문제를 다룬다. 블록 수준 조건화를 전문가 구성에 통합해 전원 참여를 목표로 하는 IntBMoE를 제안한다.
- MoE expert를 개별 점수가 아니라 쌍 상호작용까지 고려해 잘라내는 2차 프루닝, HOPEMoE 언어 모델의 메모리 병목을 줄이려고 전문가를 2차 목적함수로 프루닝하는 HOPE를 제안한 논문이다. 전문가를 독립적으로 다루던 기존 가정 대신 협력적 사용을 반영한다.