강한 에이전트의 개입 경험을 플레이북으로 증류해 로봇 조작 성공률을 높인다

Recursive Harness Distillation across Agents for Robot Manipulation

HF Daily2609.33378

Seungyeon Kim, Junhoo Lee, Minkyu Kim2026-09-27조회 4

무엇인가

VLA(vision-language-action) 모델은 언어 지시와 시각 관측으로부터 로봇 행동을 만들어내는 범용 정책이지만, 장면과 실행 상태가 바뀌면 실패를 스스로 진단하고 행동을 고치지 못한다. 논문은 이 지점을 외부 에이전트의 개입 문제로 본다. 강한 에이전트는 정책과 상호작용하면서 어떤 상황에서 어떤 개입이 통하는지 배울 수 있지만, 실행 내내 그런 고성능 모델을 붙여두는 비용이 크다. 그래서 저자들은 제한된 토큰 예산 아래에서 강한 에이전트의 전문성을 가벼운 배포용 에이전트로 어떻게 증류할 것인가를 질문으로 세운다.

어떻게 동작하나

제안하는 Recursive Harness Distillation(RHD)의 산출물은 하네스다. 하네스는 고정된 VLA 실행을 관찰하고 개입하는 인터페이스와, 그 인터페이스를 언제 어떻게 쓸지 적어둔 플레이북 두 부분으로 이루어진다. 인터페이스는 VLA 계산 경로를 따라 세 곳을 건드린다. 지시 개입은 언어 입력을 최대 512자 텍스트로 바꾸고, 어텐션 개입은 선택한 이미지 영역의 시각 토큰에 0~4 강도의 어텐션 로짓 바이어스를 주며, 출력 개입은 생성된 행동의 엔드이펙터 이동과 그리퍼 명령을 최대 5 제어 스텝까지 수정한다. 각 연산에는 항등 선택지가 있어 해당 부분을 그대로 둘 수도 있고, 에이전트는 순서에 얽매이지 않고 허용된 부분집합을 조합해 쓸 수 있다. 결정이 반드시 환경을 진행시키지는 않는다. 같은 환경 스텝에서 대안 후보를 요청해 살펴볼 수 있고, 승인되면 후보의 선택된 앞부분만 실행기에 넘어간다.

무엇과 다른가

절차는 교사-플레이북-학생의 재귀 루프다. 강한 에이전트 T(실험에서는 GPT-6 Astra)가 먼저 인터페이스를 통해 과제를 수행하며 경험을 쌓고, 관측 가능한 상황과 개입 선택, 그 결과를 연결한 초기 플레이북 P0를 뽑아낸다. 가벼운 에이전트 S(GPT-5.6 Luna)가 그 플레이북으로 실행하면, T가 S의 롤아웃에서 어떤 개입이 선택됐고 VLA와 환경이 어떻게 반응했는지 검토해 모호한 적용 조건과 비효율적 선택을 고치는 수정안을 제안한다. 논문은 이를 플레이북 공간에 대한 정책 최적화로 형식화한다. 목표는 플레이북 P가 유도하는 S의 궤적 성공 확률 J_S(P)를 최대화하는 것이고, 유한 지평 성능차 항등식은 개선의 표적이 교사의 자기 궤적이 아니라 수용자가 실제로 마주치는 히스토리에서 더 나은 결정을 내리게 하는 것임을 보여준다. 수정안은 개발용 과제 n개에서 평가해 교사의 경험적 성공률 η 이상이면 채택하고, 첫 번째로 조건을 만족한 후보를 받아들인다. 어떤 후보도 기준을 넘지 못하면 실행 피드백이 다음 제안을 이끈다. VLA 파라미터도 에이전트 파라미터도 갱신하지 않고, 축적된 지식은 전부 플레이북에 남는다.

어떻게 쓰나

시뮬레이션 평가는 SimplerEnv의 Bridge 세팅에서 WidowX 조작 과제 4개(spoon-on-towel, carrot-on-plate, cube stacking, eggplant-in-basket)로 한다. GR00T-N1.7-SimplerEnv-Bridge 체크포인트를 고정하고, 개발용 초기 배치 12개와 평가용 12개를 나눠 스플릿당 48 인스턴스를 쓴다. GR00T 단독은 41.7%, 플레이북 없는 Luna는 43.8%로 거의 차이가 없었지만, 정제된 플레이북을 쥔 Luna는 66.7%까지 오른다. 같은 플레이북을 강한 에이전트 Astra가 쓰면 79.2%가 된다. 흥미로운 대목은 초기 플레이북이 Luna의 성공률을 43.8%에서 31.3%로 떨어뜨렸다는 점이다. 재귀적 정제가 그 하락을 뒤집어 66.7%까지 끌어올렸고, 대부분의 과제에서 에피소드당 평균 토큰 사용량은 초기 플레이북 대비 늘지 않았다.

전제와 한계

실물 실험은 7자유도 Franka Panda에 손목·전면·측면 RGB 카메라를 달고 Cube-to-Tray, Cube Stacking, Button Pressing 세 과제를 수행한다. 과제당 사람 텔레오퍼레이션 시연 50개로 π0.5를 파인튜닝한 뒤 정책을 고정하고, 50cm×50cm 작업공간에서 매 시행 물체 위치를 무작위화해 과제당 25회, 총 75회 성공률을 잰다. 플레이북은 Luna의 전체 성공률을 64.0%로 끌어올린 반면, π0.5 단독은 37.3%, 정책은 있지만 플레이북이 없는 Luna는 0%였다. 개입 도구를 쥐여주는 것만으로는 물리 로봇을 제어하지 못한다는 뜻이다. 교사 역할도 비교한다. Luna가 스스로 플레이북을 만들어 재귀 정제한 경우 성공률은 22.9%로, 플레이북 없는 43.8%보다도 낮았다. 개입 지점별 기여도 실험에서는 지시 편집을 끄는 것이 가장 큰 성능 하락을 일으켰다. 배포 비용은 Luna가 전체 테스트셋에서 30.03달러, Astra가 164.61달러로 에피소드당 0.63달러 대 3.43달러, Astra가 약 5.5배 비쌌다.

실무적으로 이 논문은 로봇 정책 자체를 재학습시키지 않고도 성공률을 올리는 경로를 제시한다. 이미 배포한 VLA를 고정한 채, 그 정책에 대한 개입 노하우를 텍스트 플레이북으로 축적하고 더 싼 모델로 실행을 맡기는 구조다. 플레이북에 담긴 지식은 구체적이다. 가림 뒤에 로봇 부품을 물체로 착각한 사례에서 외형과 장면 랜드마크로 물체를 재식별하라는 항목, OPEN 지시에도 닫는 행동이 나올 수 있으니 정책 출력을 확인하고 필요하면 행동을 직접 고치라는 항목, 그리퍼를 닫기 전에 교정된 파지 형상이 유지되는지 확인하고 놓기 전에 물체-목표 기하와 지지 안정성을 확인하라는 항목 같은 식이다. 도입을 검토한다면 세 가지를 먼저 확인해야 한다. 개입 인터페이스가 정책 내부 어텐션과 행동 출력까지 노출하는지, 개발용 인스턴스와 평가용 인스턴스를 분리해 플레이북을 고정했는지, 그리고 교사 모델이 수용자보다 실제로 강한지다. 마지막 조건이 깨지면 재귀 정제가 오히려 성능을 떨어뜨린다는 결과가 논문에 있다.

저자들이 밝힌 전제는 분명하다. VLA 파라미터와 에이전트 파라미터는 모두 고정이고, 학습되는 것은 플레이북뿐이다. 채택 규칙은 종료를 보장하지 않는다. 어떤 후보도 교사 수준 η를 넘지 못하면 갱신이 받아들여지지 않은 채 다음 제안을 기다린다. 플레이북 구축과 정제는 개발 인스턴스로만 하고 평가는 그 과정에서 제외한 초기 배치로 하며, 시뮬레이터의 물체 상태와 성공 신호는 에이전트 입력에서 배제한다. 실물 실험에서는 Astra가 GR00T에서 얻은 플레이북을 물리 과제와 파인튜닝된 π0.5에 맞게 적응시킨 뒤 Luna가 그 지침을 쓴다는 점도 조건이다. 즉 이 방법은 정책을 바꾸지 않고 외부 지침만으로 실패를 복구하는 접근이라, 정책 자체의 일반화 한계나 새로운 개입 지점이 필요할 만큼 근본적인 실패 유형은 다루지 않는다.