칭화대·Infinigence AI, 로봇·GPU를 한 작업으로 묶는 클라우드 네이티브 플랫폼 RLark 오픈소스 공개
칭화대와 Infinigence AI(无问芯穹)가 로봇·카메라 같은 현장 장비와 클라우드 GPU, 학습·추론 프로그램을 하나의 작업 단위로 묶어 관리하는 클라우드 네이티브 플랫폼 RLark를 오픈소스로 공개했다. 사용자 인터페이스와 API, 백엔드 서비스부터 작업 오케스트레이션, 클러스터 간 연결, 장비 런타임까지 전체 스택을 열어둔다고 밝혔다. 저장소는 GitHub의 RLinf/RLark다.
핵심은 두 가지다. 하나는 'embodied-runtime'이라 부르는 장비 런타임으로, 로봇과 카메라를 Kubernetes가 인식할 수 있는 자원으로 등록한다. 장비 플러그인이 하드웨어를 발견해 등록하고, 각 클러스터의 에이전트가 자원 정보와 상태를 중앙 제어면에 동기화하는 구조다. 이렇게 등록된 로봇 팔과 카메라는 GPU처럼 신청·할당·재사용할 수 있는 자원이 된다. 다른 하나는 작업 단위의 클러스터 간 네트워크 연결 기술이다. 가상 주소와 TUN 인터페이스, gVisor 사용자 공간 네트워크 스택, SSH 보안 터널을 조합해 실행 인스턴스의 통신 주소를 실제 배포 위치에서 분리한다. 라우팅과 터널, 포워딩 경로는 플랫폼이 관리하고, 통신 도메인과 인증서로 접근 범위를 제어한다.
작업은 Job·Task·Worker 3계층으로 기술한다. Job이 전체 실험이라면 Task는 학습·추론·실기 상호작용 같은 역할이고, Worker는 그 역할을 실제로 수행하는 인스턴스다. 제어면이 배포 설정을 해당 클러스터에 내려보내면 에이전트가 Worker를 만들고 상태를 되돌려준다. 여러 Job을 묶는 Workflow도 지원한다.
팀은 RLinf 강화학습 프레임워크와 RLark를 결합해 광둥의 클라우드 GPU 클러스터와 베이징의 로봇 현장을 연결한 실기 실험을 진행했다. 발표에 따르면 이 실험은 약 36분간 연속 실행되며 전역 학습 스텝 323까지 진행됐고, 장비 등록·클러스터 간 스케줄링·실기 데이터 회수·클라우드 학습·정책 갱신 전 과정을 한 번에 통과했다. 팀이 제시한 수치는 3개 클러스터와 약 100개의 클라우드·엣지·단말 노드, 4종 장비를 통합 관리했으며 장비 등록이 기존 1시간에서 약 5분으로, 작업 제출 후 시작이 10초 이내로 줄었다는 것이다. 네트워크 성능은 제한된 환경에서 대용량 패킷 단일 스트림 처리량이 비교 대상 VPN 방식보다 약 49%, 소용량 패킷이 약 14% 높았고, 고대역폭 환경에서는 대용량 패킷 단일 스트림이 2Gbps에 근접했다고 밝혔다.
배경에는 로봇이 한 대에서 여러 대로 늘어날 때 생기는 운영 부담이 있다. 장비마다 접속하고, 작업마다 배포하고, 클라우드와 현장 사이 네트워크를 반복 설정하고, 문제가 생기면 장비·네트워크·프로그램을 하나씩 확인해야 하는 과정이 규모에 비례해 커진다. RLark는 이 반복 작업을 한 번의 설정으로 재사용 가능하게 만드는 쪽을 겨냥한다.
개발자 입장에서 눈에 띄는 부분은 로봇을 외부 장비가 아니라 클라우드 자원과 같은 계층에서 선언한다는 점이다. 한 작업 설정 안에 GPU와 로봇 팔, 카메라의 종류와 수량을 함께 적고, 이후 실험에서는 장비나 역할 규모, 배포 위치만 바꿔 같은 설정을 재사용하는 흐름이다. 실행 중에는 작업에서 역할, Worker 순으로 좁혀 들어가며 이벤트와 로그, 연결된 노드·장비 상태를 확인할 수 있고, 웹 터미널과 TensorBoard 진입점도 제공한다.
다만 수치는 조건부다. 5분과 10초는 자원이 이미 연결돼 있고 실행 조건이 갖춰진 테스트 환경에서 측정된 값이라고 원문은 전제를 달고 있다. 새 로봇과 센서, 카메라가 계속 추가되는 상황과 현장마다 다른 네트워크 조건 검증은 남은 과제로 제시됐다. 관련 기술은 RSS 2026에 발표된 RLinf-USER 논문으로 정리됐다고 팀은 밝혔다.