Mooncake가 강화학습 롤아웃 데이터 전송과 가중치 동기화 병목을 겨냥한다
KV 캐시 오픈소스 프로젝트 Mooncake가 강화학습(RL) 시스템의 데이터 전송과 가중치 동기화를 담당하는 구성요소를 소개했다. Mooncake 메인테이너인 Ma Teng 박사가 QCon 상하이의 AI Infra 세션에서 발표할 예정이며, 공개된 발표 개요에 따르면 이 작업의 초점은 모델 학습 자체가 아니라 학습 주변에서 발생하는 데이터 이동 비용을 줄이는 데 있다.
RL 파이프라인에서는 Rollout으로 생성한 경험 데이터를 Learner로 넘기고, 갱신된 가중치를 다시 추론 쪽에 배포하는 과정이 반복된다. Mooncake는 이 구간을 고성능 데이터 평면으로 처리한다. 구조화 객체와 DataProto, typed-ragged 포맷, BufferPool, RDMA를 조합해 Rollout 데이터 흐름을 최적화하고, Miles를 통해 기존 Ray Object Store를 대체한다. 동기 실행과 Fully Async 실행 두 가지 모드를 모두 지원한다.
가중치 갱신은 여러 경로를 병행한다. NCCL Broadcast, TransferEngine 기반 P2P RDMA, disk-delta 방식이 그것이다. 발표 개요에 따르면 Kimi-K2 환경에서 P2P 방식이 약 7배 빠른 전송을 보였다고 한다. 여기에 TP·PP·EP·DP 조합이 다른 이기종 환경에서의 Reshard, 가중치 스냅샷 저장, MoE 전문가의 희소 Delta 반영도 지원한다.
배경에는 RL 시스템 특유의 병목 구조가 있다. 연산량이 큰 학습 단계보다 Rollout 데이터 전송, 경험 재생, 가중치 동기화에서 대기가 길어지는 경우가 많다. 특히 Fully Async 모드에서는 Actor, Rollout, Learner가 분리되면서 데이터 일관성과 가중치 버전 관리, 학습 안정성이라는 새로운 문제가 따라붙는다. 이기종 병렬 구성 간 Reshard는 프레임워크마다 구현이 달라 다른 스택으로 옮기기 어렵다는 점도 부담이다.
Mooncake는 이미 vLLM, SGLang, TRT-LLM, Dynamo 등 여러 추론·서빙 커뮤니티에 연동됐다고 밝혀졌다. 프로젝트에는 알리바바 클라우드, 칭화대, 문샷, 앤트그룹, 바이트댄스, 샤오홍슈 등이 참여하고 있으며, Ma Teng 박사는 SGLang과 RBG 커뮤니티의 커미터이기도 하다.
실무 관점에서 눈여겨볼 지점은 데이터 포맷과 전송 계층을 분리해 다룬다는 점이다. Rollout 데이터를 구조화된 형태로 다루고 버퍼 풀과 RDMA로 전송 비용을 낮추는 접근은, 자체 RL 파이프라인에서 Ray 기반 오브젝트 스토어가 병목이 된 팀이 대안으로 검토할 수 있는 설계다. 가중치 동기화를 단일 경로가 아니라 NCCL, P2P RDMA, disk-delta로 나눠 상황에 맞게 고르는 구조도 참고할 만하다.
다만 7배 가속을 비롯한 수치는 발표자 측이 제시한 값으로, 독립적으로 검증된 결과는 아니다. 실제 효과는 모델 크기, 병렬 구성, 네트워크 환경에 따라 달라질 수 있다. 발표 개요 단계에서 공개된 내용인 만큼 세부 구현과 벤치마크 조건은 발표와 코드 공개를 통해 확인할 필요가 있다.