화웨이, KV Cache 전용 스토리지 OceanStor M900 공개
화웨이가 추론 과정에서 쌓이는 KV Cache를 겨냥한 전용 스토리지 장비 OceanStor M900 AI 메모리 스토리지를 공개했다. 기존에 널리 쓰이던 L1(VRAM)·L2(DRAM)·L3(로컬 SSD) 3계층 캐시 구조 바깥에 L3.5 계층을 두고, KV Cache를 연산 노드 안의 임시 자원이 아니라 클러스터 전체에서 공유·보존·재사용하는 데이터 자산으로 다루는 것이 목표다.
발표된 수치는 규모와 지연 양쪽을 겨냥한다. 단일 클러스터 기준 64PB 용량을 제공하고, NPU 한 개가 쓸 수 있는 KV Cache 용량을 GB 단위에서 TB 단위로 끌어올린다. 화웨이 자체 테스트와 고객 POC에서는 토큰 적중률이 약 두 배로 오르고 첫 토큰 지연(TTFT)이 줄었다고 한다. 접근 지연은 10~15마이크로초, 대역폭은 40GB/s 수준이다. 기존 PCIe+RoCE 구성에서 GPU·NPU가 SSD 풀에 접근할 때 5번 필요했던 데이터 이동을 1번으로 줄여 I/O 지연과 TTFT를 절반 이상 낮췄다는 설명이다.
배경에는 KV Cache의 성격 변화가 있다. 짧은 질의응답에서는 세션이 끝나면 캐시를 버리면 됐지만, 에이전트와 AI 코딩은 코드 저장소·프로젝트 컨텍스트·이전 생성 결과를 며칠에서 몇 주 단위로 재사용한다. 화웨이 측은 실제 운영 요구대로 컨텍스트를 보관하면 필요한 용량이 TB가 아니라 PB급이라고 본다. 그래서 어떤 KV를 얼마나 보관하고 언제 버릴지를 업무별로 정하는 캐시 수명주기 관리가 필요해진다.
SSD로 내려보내면 용량과 비용은 해결되지만 지연이 문제다. VRAM·DRAM은 나노초, SSD는 밀리초 단위다. 매번 SSD에서 토큰을 읽으면 캐시 재사용 이득이 사라질 수 있어 결국 KV 스케줄링이 관건이 된다. 화웨이는 오픈소스 추론 프레임워크 Mooncake을 기반으로 다음에 쓰일 KV를 미리 예측해 VRAM·DRAM·SSD에 계층적으로 프리페치하는 방식을 쓴다. 또 KV를 파일로 변환해 디렉터리로 찾고 다시 파싱하는 과정을 없애고, KV 의미 단위로 바로 접근하는 경로를 만들었다고 한다.
쓰기 내구성도 변수다. 일반 기업용 SSD의 DWPD(하루 전체 용량 쓰기 횟수)는 1~1.5 수준인데, KV Cache는 생성·갱신·폐기가 반복돼 훨씬 가혹하다. 화웨이는 매체·칩·제어 소프트웨어를 함께 최적화해 수명 능력을 약 16배 높였다고 주장했다. 수명 문제가 풀리지 않으면 값싼 SSD에 KV를 두는 구상 자체가 성립하기 어렵다는 점에서 이 수치가 비용 경쟁력을 좌우한다.
하드웨어는 네트워크·CPU·디스크 제어를 하나로 묶은 구조에 Lingqu(灵衢) 네트워크와 Ascend 초노드를 결합한다. Ascend나 초노드가 아닌 이기종 환경에는 표준 네트워크를 쓰는 OceanStor M800을 별도로 제공한다. 두 제품은 상하위 구성이 아니라 대상 인프라가 다른 별개 라인이라는 설명이다. 화웨이는 Mooncake 팀과 협력 중이며 관련 추론 코드 일부를 커뮤니티에 기여할 계획이라고 한다. 상위에는 KV Cache 라이브러리, 지식베이스, 메모리 라이브러리를 UCM(Unified Cache Manager)으로 묶는 AI 데이터 플랫폼 구상도 있다.
추론 서빙을 운영하는 개발자 입장에서는 캐시 계층이 설계 변수로 올라온다. 프리픽스 캐싱이나 KV 재사용을 어디까지 확장할지, 프리페치 정책을 어떻게 잡을지가 처리량과 비용을 가른다. 다만 M900은 Ascend 초노드 구성이 전제라, 다른 가속기를 쓰는 팀은 M800이나 자체 캐시 계층을 검토해야 한다.
주의할 점은 공개된 수치 대부분이 화웨이 내부 테스트와 고객 POC 결과라는 것이다. 독립 검증이 나온 것은 아니며 회사 측이 제시한 값으로 읽어야 한다. L3.5 계층 자체도 시장이 초기 단계이고, 실제 효과는 클러스터 규모와 워크로드에 따라 달라진다.