고정된 모델 하나로 로봇 조작 하네스를 스스로 진화시키는 PhysEvo

PhysEvo: Astra Can Act, Let It

HF Daily2610.08995

Wenqing Tian, Zeyu Zhang, Zhaocheng Liu2026-10-06

무엇인가

이 논문이 푸는 문제는 "이미 로봇을 제어할 수 있는 모델이 왜 안정적으로 조작하지 못하는가"다. 저자들은 RoboDojo 10개 태스크 평가에서 직접 Astra가 물체 분류는 100% 성공하지만 전체 성공률은 26%에 그치고, 전용 VLA 정책 π0.5와 결합해도 48%라는 수치를 근거로 든다. 병목은 모델이 아니라 모델과 로봇 사이의 하네스, 즉 도구·스킬·실행 로직이다. 붓기 과제에서는 쥔 병이 액체 전달을 감시하는 손목 카메라 시야를 가리고, TCP(공구 중심점) 인터페이스에서는 로컬 IK가 팔을 방해 자세로 접어버리는데 Astra가 관절 구성을 선택할 명시적 방법이 없다. 저자들의 주장은 새 행동을 하나 추가하는 것으로는 부족하고, 유용한 시야나 자세에 대한 직접 권한을 에이전트에게 줘야 한다는 것이다.

어떻게 동작하나

해법의 골격은 하나의 고정된 모델을 두 역할로 나누는 것이다. r번째 반복에서 지속 시스템은 태스크 하네스와 메타 하네스의 쌍 H_r = (H_task_r, H_meta_r)로 정의된다. 태스크 에이전트는 지시문, 선택된 스킬, 카메라 이미지, 로봇 고유수용감각을 받아 행동 또는 관측 도구를 고르고, 관측 도구는 물리 환경을 진행시키지 않고 증거 조회나 기하 계산을 수행하며 이동 도구는 명령을 실행하고 결과 상태와 이미지를 돌려준다. 메타 에이전트는 실행 궤적을 코드 구현과 나란히 검토해 실패 가설을 세우고, 추가 검사나 진단 실험으로 검증한 뒤 도구·스킬·실행 로직·진단 유틸리티를 고친다. 중요한 점은 메타 에이전트가 자기 자신의 진단 도구까지 수정할 수 있다는 것이며, 편집 가능한 대상은 하네스뿐이다. 모델 가중치, 로봇 동역학, 태스크 평가자는 편집할 수 없다.

무엇과 다른가

개선 루프의 절차는 실행, 진단, 수정, 테스트, 상속이다. 하네스는 요청된 각 행동을 실제 디스패치된 명령과 관측된 결과에 연결해 두기 때문에, 실패한 파지도 최종 점수가 아니라 접근·그리퍼 닫힘·이후 물체 움직임 단위로 추적할 수 있다. 후보 수정은 최종 채점에 쓰이는 held-out 레이아웃이 아니라 개발 단계에서 검증한다. 먼저 편집한 코드가 실행되고 도구가 의도한 출력을 내는지 확인하고, 행동 변화가 있으면 같은 태스크·같은 초기 장면에서 현재 하네스와 비교해 점수가 오르거나 점수 감소 없이 실패 지점을 넘어서면 채택하고 점수가 떨어지면 기각한다. 채택된 변경은 에피소드 사이에 적용되며, 태스크 하네스 변경은 이후 실행을, 메타 하네스 변경은 이후 진단과 수정 방식을 바꾼다. 그래서 한 라운드에서 만든 리뷰 도구가 다른 라운드의 다른 수정을 가능하게 하는 식으로, 시스템이 행동하는 방법뿐 아니라 개선하는 방법 자체를 상속한다.

어떻게 쓰나

이 루프가 만들어낸 구체적 아키텍처는 세 축이다. 첫째, 관절 수준 제어다. 기본 control_arms 인터페이스는 12개의 절대 관절 타깃과 2개의 연속 그리퍼 명령을 받고 양팔을 지원하며 물체를 쥔 상태에서도 쓸 수 있다. TCP 제어는 말단 목표만 받고 자세 선택을 IK에 위임하지만, 관절 제어는 자세를 정책 결정의 일부로 만든다. 둘째, 능동·회고 관측이다. 한 팔이 물체를 조작하는 동안 다른 팔을 움직여 손목 카메라 시야를 확보하고, review_frames로 현재 에피소드의 이전 이미지와 정렬된 로봇 상태를 물리 진행 없이 되불러온다. 기하는 픽셀 투영, 다중뷰 삼각측량, 손목 카메라 이동 중 모은 시점을 쓰는 시간적 삼각측량으로 계산하며, 무엇을 어디서 볼지는 모델이 정하고 계산과 유효성 검사는 결정적 도구가 맡는다. 셋째, 재사용 스킬과 진단 도구다. 스킬은 도구를 그것이 유용한 물리적 조건에 묶는다. 언제 파지를 검증하고, 언제 다른 시야를 얻고, 언제 물체를 재배향하고, 언제 장애물을 치우고, 언제 놓기를 확인하는지가 스킬에 담긴다. 붓기 스킬은 붓는 동안과 세워 회복하는 동안 자유 팔로 측면 시야를 유지하도록 지시한다.

전제와 한계

실험은 42개 RoboDojo 시뮬레이션 태스크 전체를 일반화·정밀도·장기 지평·기억·개방형 지시 수행의 5개 차원으로 평가한다. 태스크별로 고정된 배포 버전을 held-out 레이아웃 5개에서 채점한 결과, 5차원 동일 가중 평균 68.14/100, 성공률 62.00%로 비교군에서 가장 강한 공개 참조인 RoboDawn의 일회성 Astra 에이전트 47.17%를 14.83%포인트 앞선다. 42개 태스크를 동일 가중하면 65.00점, 58.57%다. 차원별로는 기억에서 46.67%포인트, 개방형에서 17.50%포인트, 정밀도에서 15.00%포인트를 RoboDawn 대비 개선했다. GPT-as-Policy 10개 태스크에서는 68.00%로 직접 Astra 26.00%, 하이브리드 48.00%를 앞선다. 직접 Astra가 거의 못 하는 조작 8개 태스크(VLA 성공률 20% 이상, 직접 Astra 5% 미만으로 외부에서 정의된 부분집합)에서는 55.00% 성공률과 62.88점을 기록해 직접 Astra의 1.25%·5.96점 대비 53.75%포인트를 올렸고, Simate-beta 50.83%, Liber-0 Preview 46.44%, RoboDawn 45.00%보다도 높다. 붓기 두 과제에서는 RoboDawn 대비 공 붓기가 0%에서 80%로, 액체 붓기가 80%에서 100%로 올랐다.

실기 적응 실험도 있다. 시뮬레이션에서 진화한 하네스를 AgileX PiPER에 배포하고 실행-수정 루프를 계속 돌린 결과, 5개 태스크 각 5회 총 25회 시행에서 평균 90.60/100, 성공률 84.00%를 기록했다. 블록 쌓기, 그릇 쌓기, 펜 놓기는 각각 100%, 붓기와 필기는 각각 60%다. 수정 사례 두 가지가 원리를 잘 보여준다. 액체 줄기의 전방 운동량 때문에 컵을 넘겨 흐르자 메타 에이전트는 병 입구를 컵 기준 뒤쪽으로 옮기도록 붓기 스킬을 고쳐 관측된 흐름을 보정했다. 또 실제 팔의 위치 정밀도가 시뮬레이션보다 낮아 먼 시점 국소화가 불안정하자, 기하 우선 순서를 뒤집어 시각 피드백으로 거친 접근을 하고 근거리에서 기하로 정밀 위치를 잡도록 스킬을 바꿨다.

개발자 관점에서 이 논문의 실무적 의미는 로봇 파운데이션 모델을 도입할 때 모델 가중치나 별도 행동 정책 학습에 손대지 않고도, 실행 궤적을 근거로 도구·스킬·관측 인터페이스를 개선하는 절차를 쓸 수 있다는 것이다. 특히 TCP 대 관절 제어를 모델·스킬·초기화·예산을 고정한 두 레이아웃 비교에서 평균 점수가 TCP 40, 관절 100, 둘 다 55로 나온 점은 시사적이다. 도구 메뉴를 늘리는 것만으로는 부족하고 자세에 대한 권한을 주는 것이 핵심이며, 관절 단독이 둘 다 제공한 경우보다 높았다. 도입 시 확인할 것은 채택 기준(점수 향상 또는 점수 감소 없는 실패 극복), 채점 레이아웃의 수정·버전 선택 배제, 태스크별 배포 버전 고정, 채점 에피소드 전 세션 컨텍스트·과거 프레임 인덱스·쓰기 가능 메모리 초기화 같은 경계 설정이다.

저자들이 밝힌 전제와 한계도 분명하다. 모델 가중치, 로봇 동역학, 태스크 평가자는 편집 대상이 아니며 개선은 하네스에 국한된다. 후보 수정은 개발 단계에서만 테스트되고 최종 점수를 매기는 held-out 레이아웃에서는 수정과 버전 선택이 금지된다. 공유 범위도 제한적이어서 태스크 에이전트 수준에서는 도구와 태스크 무관 스킬만 공유되고 태스크 특화 스킬은 해당 태스크에 머문다. 기하 도구 쪽에는 물리적 제약이 있다. 시간적 삼각측량은 정지한 점과 병진 시야 베이스라인을 요구한다. 실기에서는 시뮬레이션보다 팔의 위치 정밀도가 낮다는 점을 인정하고 있으며, 실기 평가 규모는 5개 태스크 25회 시행으로 크지 않다.