앤트그룹, 대규모 모델 학습 데이터 처리 시스템 Altum 설계 공개

InfoQ 中文19일 전조회 8

앤트그룹(蚂蚁集团)이 대규모 모델 학습용 데이터 처리 시스템 'Altum'의 설계와 운영 경험을 공개한다. 오는 10월 22~24일 열리는 QCon 상하이 2026에서 'AI Infra: 연산 효율이 규모화를 결정한다' 세션의 하나로 발표될 예정이며, Altum 기술 책임자 Wang Xin이 연사로 나선다. Wang Xin은 아파치 소프트웨어 재단 멤버이자 여러 아파치 톱레벨 프로젝트의 PMC 멤버·커미터이고, 알리바바를 거쳐 빅데이터 분야 초기 스타트업에 참여한 이력이 있다. 현재는 AI 데이터 인프라 구축을 주로 다룬다.

공개된 발표 내용에 따르면 Altum은 크게 네 축을 겨냥한다. 첫째는 이기종 연산 융합 스케줄링으로, 상위로는 서로 다른 연산자 체계를 수용하고 하위로는 여러 종류의 연산 하드웨어를 지원해 전체 자원 활용률을 끌어올리는 것을 목표로 한다. 둘째는 데이터 레이크 저장소 Paimon을 기반으로 한 엔드투엔드 개선이다. 데이터 수집 단계부터 모델 학습이 데이터를 소비하는 단계까지 전 구간을 최적화해 저장과 네트워크 입출력 성능을 높인다. 셋째는 연산자 성능 최적화와 증분 계산이다. 전역 중복 제거, 샘플 재시도, 증분 동기화 같은 기법으로 GPU 연산 성능을 개선한다. 넷째는 운영 안정성으로, 샘플 단위 재시도, 엔드투엔드 관측성과 SLA 보장, 회로 차단 보호, 지능형 운영 진단을 포함한다.

여기에 더해 시나리오별 엔드투엔드 파이프라인과 에이전트형 데이터 처리도 다룬다. 전자는 노드와 연산자를 확장하는 방식의 개발 패러다임과 사람과 기계가 협업하는 개발 방식을 가리키고, 후자는 데이터 한 건마다 여러 차례 에이전트 처리를 수행하는 기능을 지원한다.

배경에는 AI 시스템의 성격 변화가 있다. 추론 모델의 성능 경계가 넓어지고 코딩 에이전트가 개발 과정에 깊숙이 들어오면서, AI는 질문에 답하는 모델에서 스스로 계획을 세우고 도구를 호출해 작업을 수행하는 소프트웨어 시스템으로 옮겨가고 있다는 것이다. 이렇게 되면 팀이 고민할 대상도 모델 학습이나 배포, 프롬프트 최적화에서 자율성을 가진 AI를 안정적이고 신뢰할 수 있으며 통제 가능하게 운영하는 문제로 바뀐다. 모델이 무엇을 할 수 있는지를 정한다면 시스템은 그 AI가 실제로 가치를 만들 수 있는지를 정한다는 것이 발표의 문제의식이다.

개발자 입장에서 눈여겨볼 지점은 데이터 파이프라인이 학습 효율의 병목이라는 사실이다. 학습 데이터 규모가 커지고 모델 반복 주기가 짧아지면 GPU 연산 효율, 작업 안정성, 데이터 전달 시점이 곧 학습 비용과 직결된다. Altum이 제시하는 샘플 단위 재시도나 증분 계산, 이기종 자원 스케줄링은 데이터 엔지니어링과 AI 인프라를 함께 다루는 팀에 참고할 만한 설계 선택지다.

다만 발표는 트레이드오프도 함께 짚는다. 여러 엔진을 하나의 추상화로 묶으면 엔진별 고유 최적화를 일부 포기해야 하며 '손실 없는 추상화'는 사실상 불가능하다는 것이다. 샘플 단위 재시도 역시 실패한 샘플만 다시 돌려 GPU 낭비를 줄일 수 있지만, 실패 회로 차단 임계값을 어디에 두느냐에 따라 정상 작업을 잘못 중단시키는 문제와 쓸데없이 자원을 태우는 문제 사이에서 균형을 잡아야 한다. 이 내용은 발표 예고와 초록을 통해 공개된 것으로, 구체적인 성능 수치와 운영 결과는 발표에서 확인될 예정이다.