알리바바 클라우드, 데이터·모델·연산을 한 흐름으로 묶는 AI 인프라 공개
알리바바 클라우드가 연례 기술 컨퍼런스에서 데이터와 AI 인프라 제품군을 한꺼번에 업데이트했다. 회사가 제시한 문제의식은 분명하다. 데이터 처리, 모델 학습, 추론, 자원 스케줄링을 더 이상 분리된 계층으로 다룰 수 없다는 것이다. 학습 전에 데이터를 미리 준비해 두는 방식이 아니라, 데이터가 만들어지는 순간부터 모델과 연산 자원이 함께 움직이는 구조를 전제로 제품을 재배치했다.
가장 눈에 띄는 변화는 MaxCompute AI 컴퓨팅 엔진이다. 기존 대규모 데이터 처리는 CPU 기반이었지만, 멀티모달 데이터의 이해·필터링·라벨링에 AI 추론이 끼어들면서 CPU와 GPU, 대규모 언어모델 토큰 호출을 하나의 자원 관리 체계에서 스케줄링해야 하는 상황이 됐다. 이를 위해 MaxFrame과 SQL AI Function으로 Python·SQL 데이터 처리 코드에서 AI 기능을 직접 호출할 수 있게 했고, 코딩·자율주행·embodied AI 등 도메인별 데이터 처리 경험을 재사용 가능한 형태로 묶었다. 회사 측 발표에 따르면 이 구성은 하루 수백만 장 규모의 이미지 처리와 수십억 건의 토큰 호출을 함께 소화한다.
PAI 라인업도 세 갈래로 확장됐다. PAI-EgoX는 단안·양안·다시점·어안 렌즈 데이터를 다루며 사전·사후 품질 검사와 데이터 변환을 하나의 파이프라인으로 연결한다. PAI-RoboX는 VLA, 월드 모델, 파인튜닝, 강화학습, 평가를 담당하며 실기 데이터와 시뮬레이션 데이터, 1인칭 시점 데이터를 같은 학습 체계에 넣는다. PAI-TurboX는 학습·추론·데이터 처리에서 발생하는 성능 문제를 하위 계층에서 다룬다. 학습이 느린 이유를 진단하는 DLC 3.0의 Xfuse는 인프라, 학습 프레임워크, 모델 작업 계층의 정보를 함께 모아 원인을 추적하고 Agent가 연관 문제를 좁혀 나간다.
데이터 레이크 쪽에서는 OpenLake가 Agentic Lake로 확장됐다. DLF가 정형·반정형·비정형·벡터·스트리밍 데이터를 통합해 담고, 같은 데이터가 배치·스트림·분석·검색·AI 학습으로 이어진다. ADA는 메인 에이전트가 DataWorks Agent, MaxAgent, EMR Agent, Flink Agent, Hologres Agent, Agentic PAI 같은 전문 에이전트를 조직하고 기업 시맨틱 그래프, 온톨로지 모델링, 지식 검색, 데이터 자산과 연결하는 구조다. Flink Streaming Agent는 영상·음성·파일·업무 스트림을 계속 받아들여 Agent가 새 정보에 맞춰 후속 동작을 조정하게 한다.
자기 진화 영역에서는 소수 GPU로 대규모 학습을 미리 모사하는 이른바 풍동이 소개됐다. 알리바바 측이 공개한 내부 테스트 기준으로 32장으로 8192장 규모 학습을 시뮬레이션했고, 자원 절감은 99%를 넘겼으며 반복 시간 예측 오차는 0.58%, 피크 메모리 오차는 0.01% 미만이라고 밝혔다. TPC 최적화에서는 3.2배 성능 향상을 얻었고, TPC-H 3000GB 결과에서 Hologres가 8,443,627 QphH와 390.47 CNY/kQphH를 기록해 해당 부문 1위라고 발표했다.
배경에는 embodied AI 데이터 파이프라인의 특수성이 있다. 로봇이 작업을 한 번 수행할 때마다 영상, 포인트클라우드, 동작 궤적, 실패 샘플이 새로 생긴다. 한 기업 사례에서는 수집이 끝난 데이터가 다음 학습 라운드에 들어가기까지 2주에서 한 달이 걸리고, 그 사이 전처리·품질 검사·라벨링 과정에서 데이터 호출이 수십 번 발생한다. 데이터가 학습 전 준비물이 아니라 지능 생성, 적용, 다음 최적화까지 전 과정을 관통한다는 뜻이다. AI for Science도 비슷하다. 기존 과학 계산 소프트웨어는 인터페이스가 흩어져 있고 효율이 낮아 계산 플랫폼이 GPU만 제공해서는 해결되지 않는다는 지적이 나왔다.
개발자 입장에서 달라지는 지점은 두 가지다. 첫째, 데이터 파이프라인 비용을 CPU·GPU·토큰·스토리지·네트워크를 함께 놓고 계산해야 한다. 둘째, Agent가 데이터 플랫폼의 새로운 사용자라는 점이다. 사람이 던지는 쿼리는 간격이 있지만 Agent는 결과를 받자마자 다른 경로를 시도하고 여러 엔진을 동시에 호출할 수 있어 부하가 수십에서 수백 배로 커질 수 있다. 읽기와 쓰기·삭제의 위험 수준이 다르기 때문에 제약된 환경에서 실행하는 데이터 샌드박스 같은 경계 장치가 필요해진다.
다만 공개된 수치는 알리바바 자체 발표와 내부 테스트 기준이며 독립 검증 결과가 아니다. TPC-H 순위 역시 회사가 밝힌 내용이다. embodied AI가 아직 빠른 탐색 단계라 알고리즘 쪽에서 새 연산자와 새 라벨링 방식이 계속 나오고, 장기간 고정된 데이터 파이프라인을 미리 정하기 어렵다는 점은 당사자도 인정했다.