METASTONE, PCIe GPU만으로 DeepSeek 추론 처리량 6.87배 향상 주장

量子位 QbitAI16일 전조회 11

METASTONE(是石科技)이 자체 개발한 대규모 언어모델 추론 엔진 Meta-Infer를 공개했다. 회사 측 설명에 따르면 이 엔진은 PCIe 전용 8장 GPU 서버에서 DeepSeek 계열 모델의 입력 처리량을 최대 6.87배까지 끌어올렸다. 모델 가중치나 구조를 건드리지 않고, 기존 하드웨어 위에서 소프트웨어 스택만 다시 정렬해 얻은 결과라고 회사는 밝혔다.

가장 구체적인 수치는 DeepSeek-V4.1-Flash 사례다. 8장 PCIe-Only 환경의 커뮤니티 Day0 베이스라인에서 입력 처리량은 1932 tok/s였다. 여기에 sparse-MLA Prefill 빠른 경로를 살리고, FP8 dense GEMM의 느린 커널을 교체하고, PCIe-IPC 통신 빠른 경로의 적용 범위를 넓히자 5850 tok/s로 올라섰다. 이어 어텐션 연산자 융합, 추측 디코딩 드래프트 길이 조정, 연산-통신 오버랩, Prefill과 Decode 단계별 병렬 전략 분리, 메모리 용량 파라미터 재조정을 적용해 13274 tok/s를 기록했다는 것이 회사 측 설명이다. 최종 배수는 6.87배이며 1M 토큰 초장문 컨텍스트도 지원한다.

다른 모델에서도 비슷한 폭의 개선이 보고됐다. DeepSeek-V4-Flash는 입력 처리량이 14546 tok/s에서 22584 tok/s로 1.55배 늘었고, GLM5.3은 3236.78 tok/s에서 6222.72 tok/s로 1.92배 증가했다. GLM5.3의 P95 첫 토큰 지연은 141.6초에서 46.6초로 줄었고, 컨텍스트 상한은 27만 토큰에서 105만 토큰으로 확장됐다. 비디오 생성 쪽에서는 MiniMax H3에 희소 어텐션과 위험 인지 캐시 재사용, Turbo LoRA를 조합해 15초 참조 이미지 기반 영상 생성 속도를 2.48배 높였고, 단일 8장 서버 기준 텍스트→비디오 최대 5.33배, 참조 이미지→비디오 4.98배를 기록했다고 한다.

비교 기준도 함께 제시됐다. 동일 동시성 지점에서 B300의 입력 처리량은 이 8장 서버의 약 4.9~5.6배(DeepSeek-V4-Flash, B300은 SGLang cookbook 권장 파라미터 기준)였고, GLM-5.3에서는 3.5~4.7배였다. 통합 기준(8장, 5초/768P/16:9)으로 보면 텍스트→비디오가 시간당 296건으로 B300의 439건 대비 67%, 참조 이미지→비디오는 131건으로 225건 대비 58% 수준이다. 캐시 기법을 적용하면 6000D 약 2.6대가 B300 1대의 텍스트→비디오 처리량에 해당한다는 계산도 덧붙였다.

배경에는 GPU 조달 비용과 공급 제약이 있다. PCIe 카드는 NVLink 같은 고속 카드 간 인터커넥트가 없고, 주요 오픈소스 프레임워크의 공식 검증 매트릭스에도 들어 있지 않다. 이 경우 프레임워크는 오류를 내지 않고 조용히 저효율 범용 구현으로 되돌아가며, 집합 통신에는 NVLink 하드웨어용 튜닝 파라미터가 그대로 쓰인다. Meta-Infer는 이 간극을 네 가지 축으로 메운다. 커널 보완, 연산자 최적화와 통신 재구성, 병렬·용량 튜닝, 캐시 재사용이다.

실무적으로 참고할 만한 항목은 구체적이다. 하드웨어와 프레임워크 사이의 메타데이터 정의를 맞추고 페이지 크기 설정을 고쳐 네이티브 고성능 연산자 경로를 여는 것, 통신 빠른 경로의 발동 임계값을 넓혀 더 많은 규모의 통신 작업이 느린 폴백을 피하게 하는 것, Prefill과 Decode에 서로 다른 텐서·컨텍스트 병렬 전략을 적용하는 것이 그 예다. 국산 GPU의 경우 어텐션 모듈에서 해당 플랫폼용 NSA 희소 어텐션을 명시적으로 켜고, NVIDIA·AMD용으로 만들어진 Shared Expert 융합 기능은 꺼야 한다는 설명도 있다. Prefill은 DeepEP normal 모드, Decode는 low_latency 모드로 나누고 Shared Expert와 Routed Expert를 두 개의 스트림으로 병렬 제출하는 것만으로 35쌍 동일 구성 비교 테스트에서 11.26%의 처리량 향상이 있었다고 회사는 전했다.

다만 이 수치는 모두 회사가 자체적으로 공개한 결과이며 독립적인 재현이나 제3자 검증은 언급되지 않았다. 비교 대상인 B300 역시 SGLang cookbook 권장 파라미터를 기준으로 삼았고, 특정 모델 버전과 특정 워크로드 조합에 한정된 측정이다. 회사가 강조하는 논점 자체는 검증 대상과 무관하게 유효하다. 모델 가중치를 내려받아 서비스를 띄우는 '일단 돌아가는' 상태와, 프로덕션 규모로 안정적으로 서비스할 수 있는 상태 사이에는 여전히 소프트웨어 최적화로 메울 수 있는 큰 간극이 남아 있다는 것이다.