칭화대·Infinigence AI, 오픈소스 임바디드 에이전트 인프라 RPent 공개
칭화대와 Infinigence AI(无问芯穹) 등이 공동으로 발기한 오픈소스 임바디드 에이전트 인프라 RPent가 공개됐다. 코드는 GitHub의 RLinf/RPent 저장소에서 받을 수 있다. 핵심 구상은 하나의 모델이 모든 것을 처리하는 대신, 범용 대형 모델이 과제를 이해하고 계획을 세우며, VLA(시각-언어-행동) 계열 전문 모델이 정밀 조작을 맡고, 여기에 메모리·도구·로봇 인터페이스를 연결해 인식부터 판단, 실행, 피드백에 이르는 루프를 닫는 구조다. 개발 주체는 대규모 임바디드 강화학습 프레임워크 RLinf의 핵심 팀이라고 밝혔다.
공개된 수치를 보면 LIBERO-PRO 벤치마크에서 과제 성공률 92.6%를 기록했고, 엔드투엔드 과제 완료 속도는 7배 이상 개선했다고 한다. 지연 최적화의 핵심은 'Task Card'와 'Flash Mode'다. 탐색 단계에서 성공한 과제 흐름을 고정 좌표가 아닌 과제 단계·행동 원시연산·검사 조건 형태로 압축해 저장해 두고, 이후에는 이를 우선 실행하면서 시각 모듈이 물체 위치만 다시 잡는 방식이다. 검사가 실패하거나 환경이 어긋날 때만 다시 계획기를 호출한다. LIBERO Object 200회 평가에서 평균 실행 시간이 283.6초에서 40.9초로 줄었고, 성공률 하락은 3.5%포인트에 그쳤다고 발표했다. 메모리 시스템을 도입한 LIBERO-Pro Goal 실험에서는 물체 위치를 바꾸는 과제의 성공률이 31.0%에서 87.0%로 올랐다는 결과도 함께 제시됐다.
구조는 사용자·지능·인터페이스·환경의 네 계층으로 나뉜다. 지능 계층은 기반 모델과 메모리, 도구 라이브러리를 묶어 과제를 분해하는 Agentic Planner와, VLA·WAM 및 코드 기반 정책을 표준 도구로 감싼 Action Primitive로 구성된다. 인터페이스 계층은 MCP로 호출 가능한 능력을 기술하고, RPC로 도구·모델 서비스·로봇 환경을 연결하며, MHS로 다양한 물리 장비에 대한 읽기·쓰기·제어 추상화를 제공한다. 사용자 계층은 Claude Code나 Codex에 가까운 대화형 CLI와 선택적 웹 대시보드를 제공해 추론 과정과 시각 입력, 동작 궤적을 확인할 수 있게 했다. 시뮬레이션은 LIBERO-PRO, RoboCasa, RoboTwin, RoboDojo를, 실기기는 Franka와 양팔 Franka, YAM, SO101을 지원한다고 밝혔다. 새 로봇은 robots/ 디렉터리에 독립 모듈로 추가하면 프레임워크가 인식하는 방식이다.
배경에는 디지털 세계에서 검증된 에이전트 패턴을 물리 세계로 옮기려는 시도가 있다. 코드는 되돌릴 수 있지만 로봇의 동작은 그렇지 않다. 환경이 계속 변하고 상태를 완전히 관측할 수 없으며, 한 번 실행한 동작을 취소하기도 어렵다. VLA 하나로 관측을 넣고 동작을 받는 방식은 정밀 조작에서 강점을 보이지만 과제가 길어지거나 지시 표현이 달라지고 장면이 흔들리면 성능이 빠르게 떨어진다는 것이 발표 측의 문제의식이다. 반대로 범용 모델이 동작을 직접 출력하는 방식은 센티미터 이하 정밀도와 실행 지연, 사용할수록 강해지는 능력에서 약점이 남는다. RPent는 두 접근을 절충하는 대신 능력을 계층으로 쪼개 각 모델이 잘하는 일만 맡게 하는 쪽을 택했다. 알고리즘 기반은 팀이 지난 7월 공개한 Harness VLA 연구라고 설명했다.
성능 비교를 위해 리더보드도 운영한다. 발표에 따르면 LIBERO-Pro에서 RPent와 GPT-6 Astra 조합이 92.63%로, 같은 프레임워크에 Opus-4.7을 얹은 82.4%보다 10.23%포인트 높았고 π_RLinf의 50.0%와는 큰 격차를 보였다. 주방 장기 과제를 다루는 RoboCasa365 Target50에서는 59.20%로 GPT-5.5 조합의 57.1%를 앞섰다. LIBERO에서는 Opus-4.7 조합이 96.0%, RoboTwin에서는 GPT-5.5 조합이 62.4%를 기록했다. 다만 이 수치는 모두 발표 측이 자체 리더보드에 올린 값이며, 특정 모델이 모든 제어를 단독 수행했다는 뜻은 아니라고 원문은 강조한다.
개발자 관점에서 눈에 띄는 지점은 추상화의 방향이다. 디지털 에이전트에서 MCP가 검색·코드·데이터베이스 같은 자원을 도구로 노출했다면, RPent는 같은 발상을 로봇과 센서, 시뮬레이터로 확장하려 한다. 상위 과제 로직이 특정 로봇이나 시뮬레이터에 묶이지 않도록 하고, 지능 계층과 환경 계층을 별도 프로세스로 분리해 모델 서비스나 로봇 제어, 시뮬레이션을 독립적으로 배포·재시작할 수 있게 한 것도 같은 맥락이다. 기기마다 에이전트를 새로 개발해야 하는 상황을 줄이려는 설계로 읽힌다.
주의할 점도 있다. 공개된 성능 수치는 대부분 시뮬레이션 벤치마크 결과이고, 실기기 시연은 정해진 과제 몇 건을 보여주는 수준이다. GPT-6 Astra와 Opus-4.7, GPT-5.5 같은 모델 조합은 발표 시점 기준이며 실제 배포 환경에서의 재현성은 별도로 검증돼야 한다. 메모리 시스템은 기록마다 적용 범위와 유형, 신뢰도, 근거를 함께 저장하고 검증을 통과해야 신뢰도를 올리며 상충하는 기록은 격리한다고 설명하지만, 장기 운용에서 메모리가 오염되거나 성능이 퇴화하는 문제에 대한 데이터는 아직 제시되지 않았다.