로봇 정책을 코드로 다시 쓰는 자기진화형 코딩 에이전트

Self-Evolving Coding Agents: From Digital Programs to Physical-World Intelligence

HF Daily2609.35432

Hongcheng Gao, Jingjing Zhou, Zelin Zheng2026-09-28조회 6

무엇인가

이 논문이 겨냥하는 문제는 로봇 정책이 지시를 실제로 이해하지 않는다는 것이다. VLA(시각-언어-행동)와 WAM(월드-행동) 모델은 관측과 지시를 곧바로 행동 청크로 매핑하는데, 저자들은 LIBERO에서 QwenGR00T 정책을 학습시킬 때 지시를 마스킹해도 성공률이 92.3%로, 지시 조건부 모델의 96.2%와 최대 6.0%포인트 차이밖에 나지 않는다는 실험을 제시한다. 즉 장면이 과제를 결정하면 정책은 장면을 궤적으로 매핑할 뿐이다. 시점이나 초기 로봇 상태가 조금만 바뀌어도 성공률이 절반 이상 떨어지고, 물체 배치가 흔들리면 0에 가까워진다. 저자들은 원인을 표현(representation)에서 찾는다. 과제 요구사항, 조건, 진행 상황, 실패 복구가 모두 행동 시퀀스와 정지 신호 안에 암묵적으로 인코딩되어 있어서 검사하거나 수정할 수 없다는 것이다.

어떻게 동작하나

제안은 Physical Coding이다. 물리 과제의 상태와 실행 절차를 실행 가능한 프로그램으로 표현한다. Code as World는 물체, 관계, 관측, 상태 변수, 제약, 진행 술어(predicate)를 기록하고, Code as Policy는 계획, 도구 호출, 결과 검증, 복구, 행동 실행을 조직한다. 이 둘은 하나의 실행 가능한 인터페이스를 이루며, 중간 진행이 검사 가능해지고 실패가 국소화되며 수정안을 테스트할 수 있게 된다. 이를 구현한 것이 HexaAnything으로, 지각·계획·제어 도구를 호출하되 VLA/WAM 정책도 그중 하나의 행동 도구로 취급한다. 핵심은 하네스(Harness)다. 하네스는 과제 상태를 유지하고 실행을 조율하며, 모델 자신의 완료 주장과 독립된 검증기로부터 pass, fail, insufficient evidence, blocked, safety stop 같은 타입화된 판정을 받는다. 모든 관측에는 출처(provenance)가 붙고, 검증을 통과한 실행 궤적은 재사용 가능한 Physical Coding 레코드·메모리·학습 데이터가 된다. 저자들은 진화 대상을 하네스, 모델, 데이터·환경, 하드웨어·연산 기반의 네 축으로 묶고, 1단계 코딩-행동-상태-피드백 루프 부트스트랩, 2단계 데이터-모델-하네스 루프 폐쇄, 3단계 실제 센서·사용자·안전 게이트가 있는 물리 워크플로 전이의 3단계 경로를 제시한다.

무엇과 다른가

조작 실험은 RoboCasa365에서 이뤄졌다. 행동 모델 XR-1을 고정한 채 하네스만 얹었을 때 Composite-Unseen 성공률이 34.3%에서 38.3%로 올랐다. 같은 모델로 구동한 Codex 대비 전체 우위는 1.6%포인트이며, Atomic-Seen에서는 Codex가 앞선다. 하네스가 수집한 궤적으로 학습한 HexaModel은 모든 split에서 베이스 모델을 이겼는데, 저자들은 이를 코드 궤적이 물리 실행을 내재화했다는 증거로 해석한다. RoboDojo의 세 과제에서는 고정된 평가기에 맞춰 도구를 개정하는 것만으로 성공률이 올랐다. 도구 진화는 실물 로봇에서도 이뤄졌다. toss 도구는 팔이 펌웨어 관절 속도 한계에서 기준 궤적을 0.25초 뒤처지는 것이 트레이스에서 드러나 릴리스 시점을 측정된 팔 위치로 옮겼고, 사람이 던지는 영상을 한 번 녹화하자 에이전트가 오버핸드 버전을 작성했다. 더 빠른 기준 궤적과 높은 로브(lob) 두 버전은 로봇에서 거부되어 롤백됐다.

어떻게 쓰나

물리 실험 자율 수행도 평가한다. 제안한 PhyBench 시뮬레이션 실험실 벤치마크에서 훅의 법칙, 단진자, 결합 진동자 세 과제를 GPT-6-Astra와 Opus 5.5가 각각 30회 전부 유효한 결과로 완료했고, GPT-5.6-Sol은 30회 중 27회를 완료했다. 세 모델 모두 모든 과제에서 평균 상대오차(MRE)를 5% 아래로 유지했으며, Opus 5.5는 훅의 법칙 1.3%·단진자 1.0%, GPT-6-Astra는 결합 진동자 0.8%로 가장 정확했다. 반면 Qwen3.8-Max는 훅의 법칙 10회 중 5회, 나머지 두 과제는 각각 10회 중 3회만 유효 추정에 도달했고 평균 오차는 12.4%, 2.4%, 3.7%였다. 훅의 법칙 사례 연구에서는 Opus 5.5가 k = 24.82 ± 0.40 N/m를 얻어 기준값 25.16 N/m 대비 1.36% 오차를 냈고, 픽셀당 약 0.11cm 보간에 표준 불확도 0.10cm를 보고했다. 실물에서는 AgileX PiPER-X 양팔 로봇(6-DoF 암 2개, RealSense D435 4대)에 URAI 도구 계층을 얹어 7개 탁상 과제를 수행해 5개를 3회 모두 성공시켰다. 틱택토는 5.0분(GPT-Policy 13.6분, 2.7배 빠름), 병뚜껑 풀기는 5.1분(17.9분, 3.5배), 블록 그릇 넣기는 1.0분·443 출력 토큰(Robocurve 2.5분·2.1k 토큰, 2.4배 빠르고 토큰 4.7배 적음)을 기록했다. 실패한 두 과제는 도구가 아니라 지각과 도달에서 무너졌다.

전제와 한계

개발자 관점에서 이 논문의 실용적 주장은 명확하다. 로봇 정책 가중치를 건드리지 않고도 상태 표현, 검증 술어, 도구, 복구 절차를 코드로 고쳐 성능을 올릴 수 있고, 그 수정이 버전 관리·회귀 테스트·롤백의 대상이 된다는 것이다. 특히 검증기를 모델 자신의 판정에 의존시키지 않고 타입화된 판정과 출처 추적을 요구한다는 설계 원칙, 그리고 실행 궤적을 그대로 다음 모델의 학습 데이터로 되돌리는 데이터-모델 루프는 에이전트 하네스를 만드는 쪽에 직접 옮길 만하다. 다만 하네스 효과가 단일 행동 모델(XR-1)과 단일 벤치마크에서 측정됐고, 전체 우위가 1.6%포인트에 불과하다는 점은 도입 판단 시 확인해야 할 부분이다.

저자들이 밝힌 한계는 분명하다. 이 보고서의 증거는 예비적이다. 장기 지평(long-horizon) 증거는 RoboCasa365의 내장 복합 과제에서 나왔고, 저자들이 별도로 설계한 더 긴 과제들은 아직 어떤 시스템으로도 평가되지 않았다. RoboDojo 도구 진화 비율은 시드 수가 적으며(Fold cloth는 5개), Fold cloth에서는 별도 프로그래밍 에이전트가 도구를 고치는 동안 운영자가 매 호출의 픽셀을 골랐다. PhyBench는 모델·과제당 10회, 실물 로봇은 과제당 3회 시행이고, 인용한 공개 결과들은 다른 하드웨어에서 얻은 것이다. 미해결 문제로는 모델과 검증기의 공동 적응(co-adaptation) 방지, 희소 궤적에서 물리 인과 학습, lifelong 메모리의 프라이버시, 전문가 교정·시뮬레이터 궤적·실물 실패를 좁거나 자기 생성적인 평가기로 최적화되지 않게 결합하는 일, 그리고 안전하지 않은 로봇 행동·파괴적 명령·프롬프트 인젝션·비밀 유출에 대한 안전 테스트가 남아 있다. 자율적 아키텍처 탐색, 무제한 자기 재작성, 비제약 물리 환경 배포는 이 논문이 입증한 바가 아니다.