시뮬레이션에서 배운 로봇 스킬을 공용 코드 API로 실기체에 그대로 옮긴다
Skill2Real: Agentic Skill Learning for Zero-Shot Sim-to-Real Robot Manipulation
무엇인가
이 논문이 푸는 문제는 제로샷 sim-to-real 로봇 조작이다. 시뮬레이션에서 얻은 경험을 실기체에서 과제 학습 없이 실행하는 것이 목표인데, 외형·동역학·접촉·embodiment 차이 때문에 시뮬레이션 정책이 현실로 잘 넘어가지 않는다. 특히 장기(long-horizon) 조작에서는 개별 동작 전이를 넘어 로컬 스킬을 조합해 과제 수준 행동을 만들고, 중간 동작이 실패했을 때 복구하는 능력까지 필요하다. 저자들은 기존 방법의 병목을 이렇게 진단한다. 도메인 랜덤화와 비대칭 actor-critic은 신경망 정책이나 표현을 적응시키는 데 학습 예산을 쓰기 때문에, 조명·텍스처 같은 과제 무관 변이를 모델링하다 정작 재사용 가능한 조작 지식을 얻지 못할 수 있다. 코드 생성 계열은 행동을 조합 가능하게 만들지만 주어진 primitive를 조립할 뿐, 로컬 스킬과 과제 전략을 경험에서 습득하지는 않는다.
어떻게 동작하나
Skill2Real의 핵심 아이디어는 스킬 학습을 감독하는 데 쓰는 정보와, 학습된 스킬을 실행하는 데 필요한 정보를 분리하는 것이다. 시뮬레이터의 특권 정보는 행동을 평가·개선하는 데 쓰되, 지속되는 스킬 지식은 전부 공개 관측과 API 의미론으로만 표현한다. 이를 위해 시뮬레이션 환경과 실제 환경이 동일한 API 계약을 노출하는 공용 코드 기반 정책 인터페이스를 둔다. 이 계약은 공통 의미를 가진 공개 관측과 로봇 연산을 제공하고, 구현은 환경별로 다르지만 정책은 오직 이 공유 인터페이스를 통해서만 추론한다. 논문의 수식 1은 Proposer가 언어 목표 g, 시점 t까지의 공개 관측·API 반환 이력, API 문서, 그리고 활성화된 Cerebellum·Brain 메모리를 조건으로 실행 가능한 프로그램 c_t를 샘플링하는 과정을 나타낸다. 실행 결과는 다시 이력에 추가되므로, 시뮬레이션 학습과 실제 배포가 같은 정보 채널에 접지된다. 이 인터페이스가 곧 전이 경계이며, 각 백엔드가 자신의 인지·캘리브레이션·저수준 제어를 담당한다.
무엇과 다른가
학습은 Proposer–Verifier–Governor(PVG)라는 비대칭 루프로 이뤄진다. Proposer는 공개 관측과 API 결과만으로 프로그램과 스킬 업데이트를 제안한다. Verifier는 시뮬레이터 전용 상태 궤적과 결정론적 실행 평가기 결과를 볼 수 있지만, 수식 2가 보여주듯 그 피드백 f는 공개 관측과 API 의미론으로만 표현 가능한 집합에 속하도록 제약된다. 즉 특권 정보는 학습을 감독하되 배포 시점에는 요구되지 않는다. Governor는 후보 업데이트 δ에 대해 이후 롤아웃에서 수집한 검증 증거(과제 완료, 실패, 업데이트 이전 메모리 대비 회귀 등)를 집계해, 관측된 검증 행동이 개선을 뒷받침할 때만 메모리에 수용한다. 세 역할 모두 같은 LLM이 맡고, 배포 시에는 Proposer와 공유 인터페이스, 동결된 스킬 메모리만 남는다.
어떻게 쓰나
스킬은 두 계층으로 나뉘어 순차 학습된다. Stage I의 Cerebellum은 재사용 가능한 로컬 조작 스킬을 담고, 각 스킬은 자연어 가이드, API 수준 코드 템플릿, 가벼운 구조화 상태 기술의 조합이다. Stage II의 Brain은 Cerebellum 라이브러리를 동결한 채 컨텍스트로만 받아, 그것을 장기 프로그램으로 조합하는 과제 수준 스킬을 학습한다. 수식 3이 이 의존성을 나타내는데, Cerebellum은 빈 메모리에서 학습해 동결되고, Brain은 그 동결된 라이브러리를 조건으로 별도의 빈 메모리에서 학습된다. 따라서 Brain은 자신이 의존하는 로컬 스킬을 수정하지 않고 조합법만 배운다. 두 계층 모두 같은 PVG 절차를 공유하되 표현의 세분성과 학습 맥락이 다르다.
전제와 한계
실험은 LIBERO-90과 7개 Robosuite 과제에서 GPT-5.6 Sol과 Claude Opus 5로 각각 별도의 계층을 처음부터 학습해 진행됐다. 학습은 Cerebellum 3회(C1–C3), 이어서 C3를 동결한 Brain 4회(B1–B4)로 구성되고, 과제마다 5개의 시드 롤아웃을 돌린다. LIBERO-90에서는 반복당 450 에피소드, C1–B4 전체 3,150 에피소드이며, Robosuite는 반복당 35, 총 245 에피소드다. Governor를 쓰는 실행은 학습과 겹치지 않는 시드로 후보당 25개의 검증 롤아웃을 평가한다. LIBERO-90에서 학습한 체크포인트를 학습하지 않은 LIBERO-Pro Long에 그대로 동결해 평가한 결과, 메모리 없음 2.0%에서 Cerebellum만으로 35.3%, 전체 계층으로 56.3%까지 올라간다(Astra 기준). Opus 5는 0.5%에서 29.3%, 49.0%로 오른다. Brain이 추가한 폭은 각각 21.0, 19.8 퍼센트포인트다. B4 시점의 instruction/position 성공률은 Astra 76.0%/36.5%, Opus 66.5%/31.5%로, 물체 배치가 두 모델 모두 더 어려운 축으로 남는다. Robosuite에서는 7개 과제 평균이 Sol 16.6%→45.6%→85.1%, Opus 19.4%→49.6%→89.4%로, Brain이 각각 39.6, 39.9 퍼센트포인트를 더한다. 실제 UR5e(Pika 그리퍼, scene·wrist RGB-D 카메라)에서는 학습된 스킬이 전혀 없을 때 27.50%이던 평균 완료율이 전체 계층에서 78.75%가 되며, Brain만 쓴 경우 37.50%, Cerebellum만 쓴 경우 56.25%를 앞선다. 서랍 조작 과제는 전체 계층만 50%로 완수했다. 역할 제거 실험에서는 Verifier를 빼면 최종 Pro Long 성공률이 39.0%로 17.3 퍼센트포인트, Governor를 빼면 43.0%로 13.3 퍼센트포인트 떨어진다.
베이스라인 비교도 있다. LIBERO-Pro Long에서 Sol로 학습한 C3/B3 계층을 고정하고 Astra를 Proposer로 쓴 경우 Skill2Real은 Overall 55.3%, Task 75.0%로 Zetta의 51.5%, 63.0%를 앞선다. 같은 계층을 Opus 4.6에 붙이면 35.3%로 ASPIRE의 30.5%를 넘어, 학습된 지식이 테스트 시점의 Proposer를 바꿔도 전이된다는 점을 보인다. 다만 위치 교란 조건에서는 Zetta가 40.0% 대 35.5%로 앞서는데, bowl-in-drawer나 book-in-caddy처럼 좁은 공간 집기에서 end-to-end VLA 정책이 코드 기반 스킬 인터페이스보다 더 촘촘한 반응 제어를 제공하기 때문이라고 저자들은 설명한다.
개발자 관점에서 이 논문의 실무적 의미는 전이 단위를 모델 파라미터가 아니라 실행 가능한 프로그램과 스킬 메모리로 잡았다는 점이다. 시뮬레이터 특권 정보는 학습 루프 안에만 가두고, 배포 시에는 공개 관측과 API 의미론만으로 동작하는 구조이므로, 실제 로봇 백엔드가 인지·캘리브레이션·저수준 제어를 구현하기만 하면 동결된 지식을 그대로 접지할 수 있다. 다만 이 구조는 API 계약의 의미가 시뮬레이션과 현실에서 일치한다는 전제 위에 서 있고, 성능이 Proposer로 쓰는 파운데이션 VLM의 추론 능력에 의존한다는 점을 함께 봐야 한다.
저자들이 밝힌 한계는 명확하다. 현재 Skill2Real은 로봇 백엔드가 인지와 저수준 제어를 제공하는 공유 정책 인터페이스를 통해 동작하며, 순수한 code-as-policy 인터페이스에 머문다. 향후 과제로 end-to-end 정책을 호출 가능한 도구로 노출하는 것과, 더 빠른 폐루프 실행을 위한 VLM 추론 지연 단축을 제시한다. 또한 좁은 공간 집기처럼 반응 제어가 중요한 국면에서는 end-to-end VLA가 더 유리하다는 비교 결과가 남아 있어, 코드 기반 스킬 계층이 모든 조작 국면에서 우위라는 주장은 하지 않는다.