알리바바 클라우드, Agentic Cloud 전략 공개…AgentCore·차세대 CPFS 등 신제품 발표

雷锋网18일 전조회 9

알리바바 클라우드가 항저우 윈치 콘퍼런스(Yunqi Conference)에서 'Agentic Cloud' 전략과 함께 신규 제품군을 공개했다. 회사 CTO Li Feifei는 모델(Model), 하네스(Harness), 컨텍스트(Context)를 세 축으로 삼아 에이전트가 실제 업무 흐름 안에서 돌아가도록 클라우드 스택을 다시 짠다고 설명했다. 눈에 띄는 것은 에이전트 구축·거버넌스 플랫폼 AgentCore, 실행 격리 환경 Agent Sandbox, 차세대 고성능 스토리지 CPFS, 컨텍스트 엔진 등이다.

인프라 쪽 발표는 수치가 구체적이다. 자체 개발 초노드 'Lingjun Zhenwu M890'은 10만 카드 규모의 클러스터로, 2조 파라미터를 넘는 Qwen3.8 Max와 KIMI K3 같은 모델에 상용 서비스를 제공하는 데 쓰였다고 회사는 밝혔다. 내년에는 후속 모델 V900을 내놓을 계획이며, 3배 성능 향상과 200Pbps 통신 대역폭, 6마이크로초 지연, 단일 클러스터 50만 카드 확장을 목표로 제시했다. 차세대 CPFS는 100TB/s급 처리량과 억 단위 IOPS, 단일 파일시스템 100PiB 규모를 내세운다. 회사 측 자료에 따르면 모델 기동 시간이 평균 50% 줄고 피크 연산 활용률이 30% 오르며 AI 스토리지 비용은 69% 낮아진다.

추론 비용을 겨냥한 제품도 나왔다. KV 캐시 관리·스케줄링 시스템 Tair KVCM은 메모리 풀, KV 캐시 스토어, 원격 공유 스토리지를 묶어 유효 적중률 99%, 토큰당 비용 50% 절감을 주장한다. 저장 계층에 놓이는 KV CacheStore는 장문맥·다중 턴 대화·복잡한 에이전트 작업이 만들어내는 캐시를 받아내며, 고객 환경에서 캐시 커버리지 시간 창이 900% 늘고 처리량이 20% 향상, 첫 토큰 지연이 54% 감소했다고 한다. 2계층 구조의 지능형 컴퓨팅 센터 네트워크 TPN은 접속 대역폭 2.5배, 네트워크 규모 10배, 지연 1/3 수준을 목표로 한다. PAI에는 비동기 Agentic RL 학습 프레임워크가 추가돼 궤적 샘플링부터 파라미터 업데이트까지의 루프를 자동화하며, Qwen 후속 학습에서 5일 만에 SOTA 모델 후속 학습을 마쳤다고 밝혔다.

에이전트 실행 계층에서는 AgentCore가 중심이다. 장시간 작업, 실패 재시도, 중단 지점 복구, 비동기 실행을 지원하고 보안 실행 환경과 자원 격리, 신원·권한 관리, 전 구간 감사를 제공한다. 모델과 MCP 서버, 스킬 자산을 한곳에서 관리하며 작업 완료율 99% 향상, TCO 70% 절감을 주장한다. Agent Sandbox는 분당 10만 개 생성 처리량과 600ms 미만의 심수면 깨우기를 내세우고 E2B와 쿠버네티스 호환을 표방한다. Agentic OS는 토큰 소비를 30% 이상 줄이고 샌드박스 배치 밀도를 3배 높인다고 하며, Agentic Computer는 에이전트 전용으로 상시 대기하는 클라우드 PC 워크스테이션으로 GUI 조작과 Computer Use를 지원한다.

Context Engine은 저장·처리·컨텍스트 엔지니어링을 한 덩어리로 묶는 시도다. 하위 계층은 대화, 영상 프레임, 포인트 클라우드, 궤적, 에이전트 피드백 같은 멀티모달 데이터를 저장하고, 중간 계층은 통합·변환·품질·모델링을 담당하며, 상위 계층은 지식베이스와 지속 메모리, 실시간 컨텍스트 조립으로 흩어진 데이터를 에이전트가 호출할 수 있는 형태로 만든다. Agent Context는 복잡한 지식 검색 정확도를 50%포인트 높이고 토큰 사용 효율을 3배 이상 개선한다고 하며, OpenLake는 단일 데이터로 여러 엔진을 돌려 TCO를 38% 낮춘다고 한다. Apsara Lakebase는 초 단위 이하의 제로카피 데이터 브랜치를, MC-MaxFrame은 멀티모달 분산 연산 프레임워크로 12% 성능 향상을, Flink Streaming Agent는 60여 종의 멀티모달 연산자로 실시간 데이터 스트림을 실행 가능한 흐름으로 바꾸는 것을 내세운다.

배경에는 에이전트의 성격 변화가 있다. 질의응답을 넘어 스스로 계획하고 실시간으로 판단하는 에이전트가 늘면서 클라우드에는 초대규모 클러스터 안정성과 밀리초 단위 탄력, 수백만 동시성, 그리고 학습·추론·환경 배포의 통합 운영이 동시에 요구된다는 것이다. 회사는 모델 파라미터가 조 단위에서 수십조 단위로 커지고, 학습 패러다임이 사전학습과 후속학습, 에이전트 강화학습을 거쳐 재귀적 자기개선으로 이동한다는 전제를 깔고 있다.

실무적으로 보면 이번 발표는 에이전트를 만들 때 반복적으로 부딪히는 지점들, 즉 실행 환경 격리와 재시도, 상태 복구, KV 캐시 비용, 컨텍스트 조립을 관리형 서비스로 흡수하려는 시도다. 다만 제시된 수치와 절감률 대부분은 알리바바 클라우드가 자사 환경에서 측정했거나 목표로 내건 값이며 외부 검증은 아직 없다. V900 초노드를 비롯한 일부 항목은 출시 예정이거나 계획 단계로만 언급됐고, 자사 클라우드 스택에 종속된 구성이라는 점도 함께 봐야 한다.