7.39B 오픈 모델로 256K 문맥의 수학 추론과 에이전트 검색을 겨냥한 ZGCM-1
ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search
무엇인가
ZGCM-1은 7.39B 파라미터 dense 기반 모델을 처음부터 학습해 수학 추론과 에이전트 검색을 수행하는 완전 오픈 프로젝트다. 논문이 겨냥하는 문제는 두 가지다. 첫째, 프런티어급 추론과 심층 에이전트 검색이 수천억 파라미터 시스템의 전유물로 여겨져 컴퓨트가 제한된 연구자가 배제된다는 규모 장벽이다. 둘째, 경쟁력 있는 모델 대부분이 완전 오픈소스가 아니라 가중치만 공개하는 오픈웨이트 형태로 나와 업스트림 필터링 레시피, 중간학습 커리큘럼, 장문맥 스케줄, 멀티턴 에이전트 트레이스가 블랙박스로 남는다는 불투명성 장벽이다. 저자들의 핵심 명제는 소형 모델이 정적 파라미터 용량에 묶여 있지만, 의도적 내부 사고와 능동적 외부 탐색을 결합하면 그 한계를 넘어설 수 있다는 것이다. 즉 오픈 웹을 수동적으로 암기하는 대신 장기 체인오브소트 추론과 자율 도구 사용으로 웹 증거를 수집하고, 시스템 터미널과 상호작용하며, 심볼이 제거된 바이너리 프로그램을 분석한다.
어떻게 동작하나
구조는 decoder-only Transformer에 GQA, RMSNorm, SwiGLU, RoPE를 얹은 형태다. 32개 층, 히든 차원 4,096, SwiGLU 중간 차원 11,008, 쿼리 헤드 32개와 KV 헤드 8개(헤드 차원 128), 최대 문맥 256K다. 핵심은 gated 슬라이딩 윈도 어텐션(SWA)과 전역 어텐션을 5:1로 교차한 하이브리드 백본이다. 32개 층 중 27개가 128토큰 윈도의 gated SWA를 쓰고 5개가 전역 인과 어텐션을 쓴다. 전역 층은 6, 12, 18, 24, 30번에 놓여 로컬 5개 뒤에 전역 1개가 오는 블록이 다섯 번 반복되고 뒤에 로컬 2개가 붙는다. QK 정규화는 RMSNorm으로 구현하고 Partial RoPE의 rotary fraction은 0.33이다. 게이트가 걸린 SWA는 GatedSWA(h) = o_proj(A_SWA(q,k,v) ⊙ σ(g_proj(h)))로 정의된다. 학습된 시그모이드 게이트가 로컬 어텐션 출력을 원소별로 변조한 뒤 출력 투영을 적용하고, 전역 층은 이 게이팅 없이 전체 문맥을 본다. 어텐션 스케줄을 고르기 위해 full attention, Flash-GQA, MLA, 그리고 로컬 대 전역 비율 1:1, 3:1, 5:1의 SWA를 8개 H100에서 시퀀스 길이 4,096으로 10B 토큰씩 학습해 비교했다. SWA 5:1이 9,566 tokens/s/GPU로 최고 처리량을 내면서 tail loss 1.93으로 full attention과 동등했다. SWA 3:1은 tail loss 1.92로 가장 낮았지만 처리량이 약간 낮았고, MLA는 7,645 tokens/s/GPU로 처리량 손해가 크면서 손실 개선도 없었다. 문맥 길이를 4K에서 256K로 늘리면 SWA 5:1의 처리량 이점이 1.13배에서 3.94배로 확대된다. KV 캐시는 27개 SWA 층이 128토큰 윈도만 유지하므로 토큰당 footprint가 128 KiB에서 20 KiB로 줄고, 256K 문맥에서 full attention 32.0 GiB, 선형 어텐션 베이스라인 GDN 3:1이 7.0 GiB, 하이브리드가 5.0 GiB로 6.4배 절감된다. 자기회귀 디코딩이 메모리 대역폭 병목이므로 이 절감이 곧 디코드 처리량으로 이어진다.
무엇과 다른가
사전학습은 두 단계다. General Pre-Training은 Stage 1이 약 0.99T 토큰, Stage 2가 약 3.20T 토큰이며, 0.3B 프록시 모델을 약 30B 토큰에 학습해 데이터 믹스를 먼저 탐색한다. 웹, 학술·OCR, 코드, 수학, LaTeX 논문, 특화 추론 데이터를 소스별로 필터링하고 GLM-5.1 토크나이저로 토큰화한다. Stage 1은 커리큘럼 사전학습으로 일반 언어 문서를 어휘 복잡도가 낮은 것에서 높은 것으로 정렬하되 코드와 수학은 별도로 인터리브한다. 어휘 복잡도가 코드·수학의 난이도 대리 지표로는 부적합하다는 것이 확인됐다(Finding 1). 7B 프로브에서 코딩 BPB는 1.99에서 0.81로, 수학 BPB는 0.97에서 0.94로 낮아졌고 일반 벤치마크 BPB는 0.03에서 0.09만큼 상승했다. 최적화는 Muon(모멘텀 0.9, spectral scaling, Newton–Schulz 5스텝, 상수 학습률 2×10^-4, weight decay 0.1, gradient clipping 1.0)을 쓰고 스칼라 파라미터는 Adam을 쓴다. 행렬곱은 Transformer Engine 하이브리드 FP8(E4M3 forward, E5M2 backward)에 delayed scaling을 적용하고 1,024스텝 이력의 최대 절댓값으로 스케일을 갱신한다. TWEO를 활성 정규화로 적용해 극단적 중간값을 억제한다(Finding 2). 16K 프로덕션 런은 약 585 model TFLOP/s/GPU로, H100 BF16 dense peak 989 TFLOP/s 대비 약 60% BF16 등가 MFU를 낸다. 효율은 SWA 5:1의 1.4배, FP8의 1.5배, Muon의 1.8배, Pre-LN의 1.1배를 곱해 약 4.2배로 계산된다(Finding 3). Mid-Training은 2.86T 후보 풀에서 600.51B 토큰을 샘플링해 16K, 64K, 256K로 문맥을 확장한다. 각 단계는 누적식이라 64K 단계는 16K 이하 180.89B와 16K–64K 구간 59.11B로, 256K 단계는 16K 이하 127.81B, 16K–64K 21.72B, 64K 초과 30.98B로 구성된다. 코드와 수학은 전 구간 약 20%씩 유지되고 지식 데이터는 10.50%에서 14.23%로, 에이전트 데이터는 1.50%에서 3.30%로 늘고 사전학습 리플레이는 13.00%에서 9.00%로 줄어든다. 옵티마이저 스텝당 약 12.6M 토큰을 유지하도록 전역 배치를 768, 192, 48로 조정하고 학습률은 10^-4, 256K 단계는 RoPE base 10M에 전체 활성화 재계산을 쓴다. 직접 256K 경로(30B 토큰)와 단계적 경로(64K에서 10B 후 256K에서 20B)를 비교했을 때 단계적 경로의 최종 손실이 약간 낮았다. 에이전트 데이터는 상호작용 트레이스를 MDP 스타일의 상태 조건부 다음 행동 예측 예제로 재구성해 전체 궤적 문맥과 국소 의사결정에 대한 조밀한 감독을 결합한다.
어떻게 쓰나
평가는 20개 표준 벤치마크에서 이뤄졌다. 7B–8B 규모에서 14개 추론 벤치마크 평균 1위를 기록했고 AIME 2026 75.0%, MATH-500 97.1%, HMMT 2025 70.4%를 냈다. 에이전트 검색에서는 WebWalkerQA 63.1%, BrowseComp 19.4%, Binary Function Search 62.0%다. Binary Function Search는 C/C++ 프로젝트에서 의미 있는 함수를 골라 만든 11,000개 이상 태스크 풀에서 10개 대표 프로젝트(tmux, tree, GNU Wget2, XZ Utils, YAJL, zlib, libuv, libgit2, nm, Lua)마다 5개씩 뽑은 50개 태스크 평가셋으로 구성되며, 10개 프로젝트 모두 학습 데이터에서 홀드아웃됐다. 에이전트는 제어 흐름, 피호출자, 상수, 오류 처리, 출력에 대한 단서가 담긴 행동 설명을 받고 Ghidra 기반 구조화 인터페이스로 함수를 열거하고 리터럴과 오류 메시지를 검색하며 후보를 디컴파일하고 참조를 추적하고 어셈블리를 검사해 후보를 좁힌 뒤 정확한 함수 진입 ELF 가상 주소를 제출한다. 심볼이 제거되지 않은 바이너리로 만든 숨겨진 오라클과 정확히 일치해야 정답으로 인정된다. ZGCM-1-7B는 62%로 동급 베이스라인(Qwen3-8B 12%, 나머지 0%)을 크게 앞서고 GLM-5.1(66%)에 근접하며 DeepSeek-R1과 GPT-4o를 앞선다.
전제와 한계
논문은 개발 전 과정에 AI 에이전트를 투입한 AI-native R&D 워크플로도 함께 보고한다. 데이터 정제에서는 에이전트가 품질 요구사항을 받아 휴리스틱 필터링·변환 스크립트를 작성하고 코퍼스에 실행한 뒤 분포 통계를 검사해 기준에 못 미치면 스크립트를 자동으로 반복 개선한다. 클러스터 관리에서는 개발 머신 생성, 학습 잡 제출, 자원 설정 변경, 로그 스트리밍, 상태 필터링을 노출하는 스킬 패키지로 사람 개입 없이 실험 실행과 모니터링, 실패 진단, 하이퍼파라미터 조정을 수행한다. 자동 연구 워크플로로는 스토리지 클러스터의 데이터 전송 특성을 프로파일링해 학습 프레임워크 I/O 파이프라인을 조정하고 학습 속도를 개선했다. 평가는 ACE(Atomic Capability Evaluation)로 2,503개 프로브를 18개 카테고리, 183개 원자 능력으로 조직하며 1회 실행에 약 2~3분이 걸린다. 9명의 핵심 기여자가 11개 태스크 범주를 5단계 루브릭으로 평가해 99개 평점을 냈는데, 실험과 모니터링, 배포는 L4, 모델 아키텍처 설계와 학습 알고리즘 설계는 L2로 어느 것도 L3를 넘지 못했고 나머지 7개는 L3였다. 99개 중 L5는 하나뿐이다(Finding 8). 학습 중에는 약 80스텝 구간에 걸쳐 처리량이 585에서 554 model TFLOP/s/GPU로 점진 하락하는 것을 발견했고, overlap buffer 해제로는 완전히 해결되지 않아 100회 반복마다 CUDA allocator 캐시 정리와 GC를 추가해 585로 안정화했다.
개발자 관점에서 이 논문의 실무적 가치는 장문맥 에이전트 워크로드를 7B급 모델로 감당하려 할 때의 구체적 수치에 있다. 256K 문맥에서 5:1 gated SWA 하이브리드가 full attention 대비 3.94배 처리량과 6.4배 KV 절감을 낸다는 결과는 어텐션 스케줄 선택 실험을 설계할 때 바로 참고할 수 있는 형태다. 4K에서 256K까지 문맥을 스윕하면서 tail loss와 tokens/s/GPU를 동시에 측정하는 방식, MLA가 처리량 손해만 크고 손실 이득이 없다는 비교 결과도 유용하다. FP8 학습을 시도하는 팀에게는 delayed scaling만으로 부족하고 TWEO 같은 활성 이상치 억제가 필요하다는 Finding 2가 실무적으로 중요하고, Muon이 AdamW 대비 step-to-loss 1.8배를 준다는 것도 확인할 만하다. 가중치뿐 아니라 사전학습·중간학습·사후학습 단계별 가중치, 중간 체크포인트, 학습 코드, 단계별 데이터와 레시피, W&B 로그, 평가 하네스까지 공개하므로 재현과 ablation의 출발점으로 쓸 수 있다. 다만 Binary Function Search 62%는 홀드아웃 프로젝트 50개 태스크에 한정된 수치이고, 에이전트 실행이 엄격한 스키마 정렬과 안정적 환경 피드백에 의존한다는 점을 감안해야 한다.
저자들이 밝힌 한계는 네 가지다. 첫째, 파라미터 지식 한계다. 의도적 사고와 외부 검색이 많은 사실 누락을 보상하지만 정적 메모리 용량은 7.39B dense 규모에 근본적으로 묶여 있어, 검색 지원 없는 순수 폐쇄형 암기 중심 태스크에서는 거대 프런티어 시스템에 자연히 뒤진다. 둘째, 지시 준수 대 추론 장황함이다. ACE와 데이터 믹스 ablation에서 무거운 추론 감독이 장황함을 유발하고 IFEval이나 복잡한 표면 제약 같은 엄격한 비추론 지시 준수를 약간 훼손할 수 있다. 셋째, 일반 소프트웨어와 터미널 에이전시는 아직 초기 단계다. 웹 심층 연구나 바이너리 분석 같은 구조화 환경에서는 뛰어나지만 SWE-bench Verified 같은 저장소 수준 장기 엔지니어링과 Terminal-Bench 2.0 같은 비구조적 리눅스 터미널 탐색은 완료율이 낮다. 넷째, 환경과 프로토콜 취약성이다. 극단적 관측 노이즈, 도구 호출 형식 이탈, 외부 검색 API 지연이 다단계 롤아웃 궤적을 깨뜨릴 수 있다. 향후 방향으로는 하이브리드 SWA, Muon, MDP 중간학습 레시피를 sparse MoE 백본으로 확장하는 것, 실제 실행 샌드박스 안에서 다중턴 상호작용 RL로 전환하는 것, 파라미터 불확실성이 감지되면 검색 서브루틴을 동적으로 트리거하는 자율 검색을 통합하는 것, AI4AI 에이전트 하네스를 가설 수립과 커널 최적화, 합성 환경 설계까지 확장하는 것을 제시한다.