EmbodiedRSI가 물리 실험을 정보가치로 골라 로봇 스킬을 스스로 진화시킨다
EmbodiedRSI: Active Continual Robot Learning Through Hypothesis-Guided Co-Evolution
무엇인가
로봇 파운데이션 모델(VLA)은 시각-운동 제어에서 강력하지만, 물체 위치나 작업 지시가 바뀌면 성능이 떨어진다. 이를 고치려면 텔레오퍼레이션 같은 방법으로 대량의 로봇 데이터를 모아 후속 학습을 해야 하는데 비용이 크다. 에이전트 하네스는 모델 주변에서 실행 계층을 적응시키는 대안이지만, 기존의 자기진화 하네스는 어떤 코드와 스킬 변경을 시도할지 정할 때 로봇 시행을 비효율적으로 쓴다. 이 논문은 물리적 상호작용을 가장 유용한 증거로 바꾸는 실험을 스스로 고르는 문제를 다룬다.
어떻게 동작하나
제안 시스템 EmbodiedRSI는 Fast-Slow 이중 시스템 구조를 쓴다. Fast 시스템은 코드 가설과 스킬 가설을 Hypothesis Graph의 노드로 유지하고, 각 가설에 Beta(α, β) 사전분포를 두어 지지 실험 수 n_sup과 반박 수 n_ref로 사후 평균 신뢰도 c_i = (n_sup+α)/(n_sup+n_ref+α+β)를 계산한다. 탐색 불확실성은 각 가설의 지지율이 1/2을 넘을 확률 q_i의 이진 엔트로피 합 H_exp로 측정한다. 다음 실험 선택은 Value-of-Information 방식이다. 실험 t가 어떤 가설 부분집합 S_t의 신뢰도를 갱신할 수 있는지 선언하면, 가능한 결과 e에 대한 기대 엔트로피 감소 G_k(t)를 계산하고, 시간·시뮬레이터 스텝·GPU·리셋 비용을 가중 합한 C(t)로 나눈 VOI_k(t) = G_k(t)/C(t)가 최대인 실험을 고른다. H_exp가 임계값 아래로 내려가거나, 최대 VOI가 임계값 미만이거나, 롤아웃 예산이 소진되거나, 모든 가설이 평가 상한 n_max에 도달하면 광범위 탐색을 종료한다.
무엇과 다른가
선택된 실험은 코드와 스킬을 어떻게 갱신할지에 대한 증거를 준다. Code-Skill Co-Evolution은 동일한 초기 상태에서 코드 가설 C_i, 스킬 가설 S_j, 그리고 둘의 결합 실행을 각각 평가해 결합 이득 w_ij = R(C_i,S_j) − max{R(C_i), R(S_j)}를 측정한다. 이 값이 양수면 결합 실행의 성공률이 더 높다는 뜻이고, Slow 시스템은 이를 Hypothesis Graph에 양방향 works-with 엣지로 기록한다. Slow 시스템은 세 층의 Hierarchical Memory를 만든다. M1은 궤적 τ, 호출 도구 κ, VLA 호출 시점 ν, 행동 a, 텔레메트리 z, 물리적 결과 y, 보상 r을 담은 실행 기록이고, M2는 Hypothesis Graph의 가설, M3는 반복 증거에서 증류한 재사용 인지다. Reward-Grounded Memory Learning은 Retain, Merge, Abstract, Compress, Forget, Skip의 행동 공간에서 어떤 기억 조작이 이후 Fast 시스템 개선에 값을 주는지를 PPO로 학습한다. 보상은 r_t^mem = λ1(R_{t+1}−R_t) + λ2(H_t−H_{t+1}) − λ3 C_{t+1}로, 성공률 향상과 불확실성 감소에서 다음 실험 비용을 뺀 형태다. 인코딩에는 동결된 Qwen3-Embedding-0.6B를, 기억 갱신 실행에는 동결된 Qwen3.5-122B-A10B를 쓴다.
어떻게 쓰나
실험은 RoboCasa365와 LIBERO-Pro 두 시뮬레이터 벤치마크에서 이뤄졌다. 각 태스크를 10개 랜덤 시드, 시드당 10회 시행으로 평가하고, 진화에는 별도의 10개 시드를, 평가에는 서로 겹치지 않는 또 다른 10개 시드를 쓴다. RoboCasa365에서 EmbodiedRSI는 전체 성공률 77.0%를 기록했고, 사전학습에 없던 작업 조합을 다루는 Composite-Unseen에서 71.3%로 최고 베이스라인인 Harness VLA의 40.1%를 크게 앞섰다. LIBERO-Pro에서는 전체 86.8%로 Harness VLA의 72.1%를 넘고 8개 교란 셀 전부에서 우위를 보였으며, 특히 SPATIAL과 LIBERO-10의 위치 교환(position-swap) 조건에서 격차가 컸다. 절제 실험에서는 50회 물리 에피소드 후 무작위 탐색이 27.1%인 데 비해 72.9%를 달성했고, 학습 AUC는 0.309 대 0.635였다. 기억 학습을 떼면 Composite-Unseen 성공률이 검색 기반 선택 61.7%, 태스크 보상만 쓴 PPO 65.2%로 떨어지고 AUC도 0.556, 0.589에 그쳤다.
전제와 한계
시뮬레이션에서 진화시킨 하네스를 물리 로봇에 제로샷으로 옮긴 실험도 있다. SO-101 암에 SmolVLA를 백본으로 올리고, 태스크마다 사람 텔레오퍼레이션 시연 50개를 모아 4대의 NVIDIA H200에서 20,000 스텝 완전 미세조정한 뒤, 시행 중에는 모델을 동결했다. 조건당 태스크별 30회 시행에서 케이크 쌓기·수건 개기(다단계 조작), 오레오 배치·포커칩 선택(의미·산술 추론), 안경 다리 집기(정밀 파지) 같은 과제를 수행했고, 전체 실로봇 성공률이 46.0%에서 71.3%로 올랐다. 포커칩 과제는 5를 곱해 100이 되는 칩(20)을 무작위로 섞인 배치에서 골라내야 하는데, 하네스가 산술 지시를 해석해 정답 칩을 찾아 SmolVLA를 유도하면서 가장 큰 향상을 냈다.
개발자 관점에서 이 논문의 핵심은 로봇 정책 자체를 건드리지 않고 실행 계층의 코드와 스킬만 갱신해 배포 환경 변화에 적응한다는 점이다. 물체 위치나 지시가 자주 바뀌는 현장에서 재학습 데이터를 모으기 어려울 때, 소수의 물리 시행을 정보가치 기준으로 배분하는 스케줄러로 쓸 수 있다. 다만 실험 선택이 시뮬레이터 비용 모델(스텝 수, GPU 비용, 리셋 비용)에 의존하므로, 실기에서는 그 비용 가중치를 실제 셋업에 맞게 다시 잡아야 한다. 또한 성능 수치는 RoboCasa365·LIBERO-Pro라는 특정 벤치마크와 SmolVLA 백본 조합에서 나온 것이므로, 다른 VLA나 다른 로봇에 그대로 옮겨질지는 별도 검증이 필요하다.
저자들이 밝힌 한계는 명확하다. Code-as-policy와 에이전트 하네스 계열 방법은 물리 궤적으로부터 실행 가능한 행동을 학습하지만 로봇 파운데이션 모델의 파라미터는 갱신하지 않는다. 향후 연구로 하네스가 선택한 궤적을 온라인 모델 업데이트에 활용해 코드, 스킬, 모델이 함께 개선되는 방향을 제시한다. 즉 이 논문의 이득은 동결된 모델 위의 하네스에 한정되며, 모델 자체의 능력 향상은 범위 밖이다.