RoboFoundry가 로봇 에이전트의 지원 시스템 자체를 정책으로 진화시킨다

RoboFoundry: System-as-Policy Evolution for Self-Learning Embodied Agents

HF Daily2609.32862

Jingsong Liang, Shuhao Liao, Shizhe Zhang2026-09-26조회 2

무엇인가

로봇에 파운데이션 모델을 붙이는 연구는 대개 에이전트 스택의 한 조각만 손본다. 상호작용 하네스를 개선하거나, 메모리 시스템을 붙이거나, 재사용 가능한 스킬을 쌓거나, 물리 피드백으로 코드를 고치는 식이다. 저자들은 이런 개선이 컴포넌트 국소적이어서 한 부분을 고쳐도 다른 병목이 어디인지 알 수 없고, 그 개선이 시스템 전체로 어떻게 전파되는지도 결정되지 않는다고 지적한다. 게다가 상호작용만으로는 자기개선이 되지 않는다. 대부분의 시스템은 배포 후 고정되어 있고, 상호작용이 계속 드러내는 지원 부족이 다음 에피소드에서도 반복된다. 실행 경험이 평가나 수동 디버깅에 쓰일 뿐 지속적이고 검증된 시스템 변경으로 전환되지 않기 때문이다. 논문의 질문은 이것이다. 임베디드 에이전트가 자기 시스템 전체를 정책으로 취급하고, 그 시스템이 어디서 행동을 제한하는지 진단하고, 임베디드 경험으로 해당 컴포넌트를 진화시킬 수 있는가.

어떻게 동작하나

RoboFoundry의 형식화는 System-as-Policy다. 고정된 파운데이션 모델 M과 이를 둘러싼 지원 시스템 H(M)이 있을 때, M의 파라미터를 업데이트하는 대신 H(M)을 파일시스템 조작으로 진화시켜 모델-시스템 쌍의 실효 능력을 높인다. 모델은 cat, grep 같은 연산으로 지원 시스템을 들여다보고 add, modify, delete로 편집한다. 지원 시스템은 과제별 컴포넌트 H_t와 일반 컴포넌트 H_g로 나뉘고 각각 최적화 공간 S_t, S_g를 갖는다. H_t는 다시 의미 수준의 과제 정식화 S_t^c와 구현체별 실행 S_t^e로 분해된다. 진화는 내부 루프와 외부 루프로 돈다. 내부 루프는 현재 시스템으로 과제를 실행하고 시스템·도구 호출, 단계별 관측과 로봇 상태, 실행 결과, 과제 피드백을 담은 트레이스 τ를 수집한다. 외부 루프는 시스템 편집을 제안하고, 그 편집을 배포해 다음 내부 루프 롤아웃으로 평가한다. 수식 (1)은 현재 과제에서의 과제 수준 편집 ΔH_t를 고르는 문제, 수식 (2)는 여러 과제와 구현체에 걸쳐 누적된 트레이스로 일반 수준 편집 ΔH_g를 고르는 문제를 나타낸다.

무엇과 다른가

진화가 작동하는 표면은 두 개다. 컨텍스트 표면은 에피소드 내부의 활성 컨텍스트와 에피소드 사이에 지속되는 파일시스템 메모리를 관리하며, 연산 공간은 SAVE, RETRIEVE, UTILIZE 세 가지다. SAVE는 관측·행동·피드백 이력에서 과제 관련 증거를 골라 영구 저장하고, RETRIEVE는 다음 결정에 쓸 증거를 고르고, UTILIZE는 그것을 활성 컨텍스트에 넣는다. 무엇을 남길지는 과제 의미에 달려 있다. 가림 과제는 물체와 공간 관계가, 세기 과제는 관련 행동의 발생이 필요하다. 스킬 표면은 원자적 스킬, 재사용 가능한 조합, 실패 조건부 복구로 계층화된다. 원자적 스킬은 grasp나 move-to처럼 더 쪼갤 수 없는 실행 단위이고, 이들이 과제의 의미 논리를 보존하는 절차로 조합된다. 내부 루프 동안 핵심 상태를 노드로, 스킬 실행과 실패 전이를 간선으로 하는 복구 트리를 유지하고, 실패하면 실패한 행동을 반복하는 대신 트리에서 재계획 가능한 유효 상태를 찾는다. 예컨대 운반 중 큐브가 떨어지면 받침면에 놓인 상태에서 다시 파지 계획을 세운다. 진단 단계에서는 실패나 비효율을 perceive, reason, plan, save, retrieve, utilize 여섯 능력 중 하나에 귀속시킨다. 앞의 셋은 의사결정, 뒤의 셋은 메모리 관리를 나타낸다. 과제 수준 편집이 실패를 해결하면 커밋하고 그 트레이스를 능력별로 색인해 둔다. 이후 같은 능력의 다른 과제 트레이스(held-out)에 후보 일반 편집을 적용해 재생해 보고, 수식 (3)의 능력 조건부 전이 Δ_cap이 0 이상일 때만 일반 시스템으로 승격한다. 즉 과제 수준 평가는 관측된 실패를 고쳤는지 보고, held-out 평가는 같은 능력 격차를 다른 과제에서도 메우는지 본다. 구현체 불변 결정과 구현체별 실행을 분리하는 공유 의미 인터페이스(BIND_s, BIND_e) 덕분에 한 로봇에서 진화한 시스템은 바인딩만 바꿔 다른 로봇에 재사용되고, 같은 지원 시스템이 다른 파운데이션 모델에도 붙는다.

어떻게 쓰나

EmbodiedBench는 4개 환경 1,128개 과제를 평가한다. EB-ALFRED와 EB-Habitat은 고수준 의미 계획을, EB-Navigation과 EB-Manipulation은 저수준 실행 가능 행동을 요구한다. GPT-6 Astra, GPT-5.5, Qwen3.7-Plus, Qwen3.8-27B, GLM5.3-Flash 다섯 백본에서 일관된 이득을 냈다. GPT-5.5를 27.8% 끌어올렸고, Qwen3.7-Plus를 70.3%까지 올려 RoboFoundry(GPT-5.5)의 72.7%와 거의 동등하게 만들었다. 최전선급 GPT-6 Astra도 상대적으로 8.5% 이득을 봤다. 일반 진화를 제거한 RoboFoundry-Lite 대비 Qwen3.7-Plus에서 11.2% 상대 이득이 나온 것이 일반 범위 진화의 기여를 분리해 보여준다. 16K 토큰 컨텍스트 예산 실험에서 GLM5.3-Flash는 4K의 62.0%에서 16K의 61.3%로 오히려 떨어졌지만, RoboFoundry는 16K에서도 모든 백본을 상대적으로 7.9~13.1% 개선했다. EB-Habitat 공간 하위 집합 추적에서는 커밋된 편집 3개가 held-in 성공률을 21.4%에서 50.0%로 올렸고, 후보 2개는 시스템을 바꾸지 않고 폐기됐으며, 마지막 하나가 승격 태그를 받아 78.0%에 도달했다. 진화는 데이터 효율적이어서 held-in 과제의 4분의 1만으로 EB-ALFRED 78.0%, EB-Habitat 66.0%에 도달했고, 4분의 3이면 최종 점수의 대부분을 회복해 EB-Habitat은 74.0%에서 포화했다.

전제와 한계

RoboMemArena는 26개 과제를 Transfer, Occlusion, Counting, Sequence 네 범주로 나눠 장기 기억을 평가한다. Qwen3.7-Plus 백본에서 TSR 53.5%, CSR 72.8%로 모든 범주에서 모든 베이스라인을 앞섰고, PrediMem 대비 Transfer에서 상대 TSR 이득이 213.3%로 가장 컸다. π0.5 단독과 PrediMem에도 적용해 두 아키텍처 모두 TSR·CSR이 모든 범주에서 개선됐고, PrediMem은 Transfer에서 상대 TSR 이득 200.0%를 냈다. LIBERO-PRO에서는 Object, Goal, Spatial 스위트의 30개 과제를 Position과 Task 교란 아래, 과제·교란당 50회 시행으로 평가했다. 특권적 물체 자세를 쓰지 않는 방법 중 평균 성공률이 가장 높았고(91.9% 대 Harness VLA(CC) 87.8%), CaP-Agent0 대비 Spatial 위치 교란에서 최대 679.7% 상대 이득을 냈다. 시뮬레이터의 특권적 물체 자세를 주면 Object와 Goal 과제 교란에서 100%에 도달했다.

실세계에서는 GPT-5.5를 지원 모델, π0.5를 조작 백엔드로 쓰고 과제당 10회 시행을 보고했다. AgileX COBOT MAGIC에서 중첩 인형 조작은 작은 것에서 큰 것 순서와 정밀 삽입을 모두 요구하는데, 초기 실패가 스킬과 컨텍스트 수정을 이끌어 정렬 검사가 삽입을 개선하고 진행 추적이 마지막 완료 하위 과제부터 재개하게 했다. 최종 70% 성공으로 π0.5 단독의 30%를 크게 앞섰다. 파란 수건에서만 진화한 접기 스킬은 외형·기하·재질이 다른 초록·분홍 수건으로 추가 적응 없이 전이돼 80% 이상 성공했고, π0.5는 20% 미만이었다. Unitree G1 휴머노이드에서는 RGB 관측에서 식별한 정수기로 "Find drinking water"를 매핑하는 의미 내비게이션으로 확장됐다. 6개 종속 하위 과제로 구성된 화학 실험에서는 컨텍스트 표면으로 하위 과제 상태를 보존하고 재사용 스킬 조합과 복구 구조로 실행을 조율해, 마지막 붓기 단계가 여러 하위 과제 전에 기록된 깔때기 준비 상태를 검색해 쓸 수 있었다.

실무적으로 이 논문이 주는 시사점은 프롬프트나 모델 교체가 아니라 에이전트 주변 시스템을 버전 관리 대상으로 다루라는 것이다. 메모리 저장·검색·활용 정책과 스킬 계층, 실패 복구 트리를 파일로 두고 실행 트레이스로 편집하는 구조는 기존 에이전트 하네스에 이식하기 쉬운 형태다. 특히 개선을 즉시 일반 규칙으로 승격하지 않고 같은 능력의 held-out 트레이스에서 재생해 검증한 뒤 승격한다는 규율은 자기수정 에이전트의 회귀를 막는 실용적 장치다. 도입을 검토한다면 세 가지를 확인해야 한다. 첫째, 백본을 바꿔도 이득이 유지되는지(논문은 다섯 백본에서 확인했다), 둘째, 컨텍스트 예산을 늘리는 것 자체가 성능을 보장하지 않는다는 점, 셋째, 진화가 특정 로봇 바인딩에 과적합되지 않는지다.

원문 발췌에는 별도의 한계 절이 없다. 다만 저자들이 본문에서 밝힌 전제는 분명하다. 진화는 고정된 모델 M의 파라미터가 아니라 지원 시스템 H(M)만 바꾼다. 일반 수준 승격은 같은 능력으로 색인된 held-out 트레이스가 존재할 때만 검증 가능하다. LIBERO-PRO에서 특권적 물체 자세를 주면 성공률이 더 오르는 것은 지각이 여전히 병목임을 보여준다. 결론에서 저자들은 시뮬레이션과 실세계 경험을 연결하는 embodied flywheel, 비임베디드 데이터에서 임베디드 과제로의 지식 전이, 시스템 진화와 모델 학습이 서로를 강화하는 구조를 앞으로의 과제로 남겼다. 표에 담긴 개별 베이스라인 수치 전체는 이 발췌에 제시되지 않았다.