재사용 스킬로 로봇 정책을 스스로 개선하는 스킬 스페이스 슈팅

Skill-Space Shooting for Autonomous Robot Policy Improvement

arXiv2609.38178v1

Zihang Rui2026-09-29조회 7

무엇인가

실제 환경에 배치된 로봇은 새로운 물체, 장면 변화, 작은 실행 오류 때문에 초기 학습 범위를 넘어서는 상황을 만난다. 그런데 단순히 시도를 늘리는 것만으로는 개선에 필요한 경험이 생기지 않는다. 로봇이 같은 실수를 반복할 뿐 올바른 수정을 발견하지 못하기 때문이다. 사람이 매번 시연이나 교정을 제공하는 방식은 과제가 늘어날수록 비용이 계속 커진다. 최근의 에이전트형 로봇 시스템은 파운데이션 모델로 학습된 행동을 조합해 과제를 완수하지만, 그렇게 과제를 끝내는 것 자체가 과제 정책에게 자기 실패를 극복하는 법을 가르치지는 않는다. 이 논문은 그 간극을 메우는 문제, 즉 도움을 받아 성공한 실행을 다시 정책 학습용 감독으로 바꾸는 문제를 다룬다.

어떻게 동작하나

저자들의 핵심 통찰은 많은 교정 행동이 여러 과제에 걸쳐 반복되는 짧은 행동, 즉 스킬이라는 점이다. 예를 들어 집기 전용 스킬은 국소적인 파지 문제만 풀면 되고, 정책이 아직 끝까지 완수하지 못하는 긴 조립 과제 안에서도 유용한 행동을 제공할 수 있다. 정책이 현재 도달한 상태에서 그 스킬을 호출하면, 정책 자신의 이전 행동이 만들어낸 조건에 대응하게 되므로 깨끗한 초기 상태에서 찍은 새 시연이 다루지 못하는 실패 상태까지 커버한다. 이 논문이 제안하는 스킬 스페이스 슈팅(skill-space shooting)은 학습된 스킬을 과제 정책 롤아웃의 후보 연속 동작으로 자율적으로 시험하는 절차다. 실패 감지기가 언제 개입할지 정하고, 파운데이션 모델이 어떤 스킬을 시도할지 고르고 수리가 됐는지 확인하며, 수용된 수리 구간이 DAgger 방식으로 정책을 갱신한다.

무엇과 다른가

절차는 네 단계다. 첫째, 실패 감지다. 관측 o_t와 정책이 제안한 H스텝 행동 청크 a_{t:t+H-1}를 함께 점수화해 V_φ(o_t, a_{t:t+H-1}) < τ이면 시험을 발동한다. 구현에서는 원시 관측과 행동 대신 DINOv2 이미지 특징과 인코딩된 행동 토큰을 쓰고, 플로우 매칭 헤드가 청크 이후 로봇 상태와 스칼라 값을 예측한다. 성공 실행에는 +0.5, 기록된 실패 직전 한 행동 지평부터는 −0.5를 목표로 학습해, 스킬이 아직 교정할 수 있는 시점에 다가오는 실패를 표시하게 만든다. H=16, 임계값 τ=0으로 모든 과제에서 고정이며 과제별 감지기는 초기 라벨링된 에피소드로 학습한 뒤 동결한다. 둘째, 스킬 선택이다. 위험한 동작이 감지되면 Gemini 2.5 Pro를 판정자로 두고 현재 장면, 과제 지시문, 사용 가능한 스킬 목록을 주어 어떤 스킬을 시도할지 고른다. 셋째, 슈팅이다. 선택된 스킬이 정책이 멈춘 지점에서 제어권을 넘겨받고, 값 모델이 스킬을 모니터링하다가 연속 c회 비음수 확인 또는 최대 M=100 행동 후에 판정자에게 해당 단계가 수리됐는지 묻는다. 수용되면 정책에 제어권을 돌려주고, 아니면 같은 스킬을 현재 상태에서 재시도한다. 롤아웃당 최대 3회 재시도하며 예산을 다 쓰면 그 롤아웃은 버린다. c는 Stack-3, Drawer, Sweeping에서 8, 스킬이 더 긴 Coffee에서 16이다. 넷째, 학습이다. 수리된 롤아웃에는 실패로 이어진 실수도 섞여 있으므로, 판정자가 완료로 확인한 롤아웃에서 수용된 스킬 실행 수리 구간만 남기고 과제 지시문으로 재라벨링한다. 정책의 행동과 거부된 시험은 제외한다. 이렇게 모은 데이터를 D_{k+1} = D_0 ∪ ⋃ R_j 형태로 초기 시연과 누적해 이전 체크포인트에서 모방학습으로 갱신한다.

어떻게 쓰나

실험은 실제 환경의 네 과제에서 이뤄졌다. Stack-3는 큐브 3개를 순서대로 쌓고, Drawer는 서랍을 열고 테이프 롤을 넣고 닫으며, Coffee는 우유·커피·얼음을 붓고 젓는 막대를 넣는다. Sweeping은 작은 빗자루를 가져와 블록 6개를 목표 구역으로 쓸고 빗자루를 다시 거는 과제다. 비교 대상은 희소 종료 성공 보상으로 사전학습 정책의 잠재 노이즈 입력을 최적화하는 dsrl, 같은 스킬 라이브러리를 사람의 상위 수준 안내로 실행하는 cop, 그리고 새로 남긴 수리 데이터와 총 길이가 맞는 완전 과제 시연을 추가하는 human이다. 평가는 값 모델, 판정자, 스킬 라이브러리 없이 정책만으로 수행해 교정 행동이 정책에 내재화됐는지 확인한다. 회차당 21~81개 롤아웃을 모으고 Stack-3, Drawer, Sweeping은 4회, Coffee는 6회 반복했다. 결과적으로 네 과제 모두에서 새 사람 시연 없이 반복 갱신마다 무보조 성능이 올랐고, 스킬 스페이스 슈팅이 네 과제 모두에서 관측된 최고 성능 구간에 도달했다. 특히 Drawer는 초기 정책이 20회 평가에서 한 번도 성공하지 못했는데, 한 번 갱신 후 무보조 성공이 7/20에 이르렀고 dsrl은 첫 갱신 후에도 0에 머물다 최대 2/20에 그쳤다. dsrl 대비 우위는 Coffee에서 55 진행도 점수, Sweeping에서 63.8점이었다. 초기 정책은 cop보다 낮은 성능에서 시작했지만 이후 모든 과제에서 cop을 앞섰다.

전제와 한계

개입과 수리의 신뢰성도 정량화됐다. 값 모델의 발동 정확도는 71~83%, 판정자가 적절한 단계나 원시 동작을 식별한 정확도는 90~100%였다. 올바르게 발동된 실패 사례 중 스킬이 수리에 성공한 비율은 70~77%이며, 재시도 예산을 고려하면 3회 시도 안에 수리할 확률은 97.3~98.8%로 계산된다. 시험 결과를 검증하고 수리 구간을 남길지 결정하는 완료 판정 정확도는 90~95%였다. 스킬 공유 실험에서는 Stack-3의 큐브 집기 시연 150개(큐브 3종 각 50개)로 사전학습한 체크포인트를 쓰면, 새 스펀지 집기 시연이 10개뿐일 때 파지 성공률이 5%에서 70%로 올랐고, 30개를 쓰면 공유 없이 거의 두 배의 시연으로 얻는 성공률에 맞먹었다. 완전히 새로운 Sponge Wiping 과제(스펀지 집기, 흰 그릇 닦기, 보관함에 넣기)에서도 공유 조건은 더 적은 새 시연으로 45%에서 관측된 완전 성공까지 도달했고, 비공유 조건보다 한 회차 먼저 그 수준에 도달했다.

개발자 관점에서 이 논문이 주는 실무적 시사점은 명확하다. 정책이 전 구간을 성공하지 못해도 국소적으로 잘하는 짧은 스킬이 있으면, 그 스킬을 실패 지점에서 자동 호출해 감독 데이터를 만들 수 있다. 즉 강화학습의 희소 보상 탐색이나 사람의 반복 교정에 의존하지 않고도 개선 루프를 돌릴 수 있다. 다만 도입 전에 확인할 것은 세 가지다. 과제를 단계로 분해하고 단계별 스킬을 정의할 수 있는지, 실패 감지기의 발동 정확도가 충분한지(논문 기준 71~83%), 그리고 수용된 수리 구간만 남기는 필터링이 제대로 동작하는지다. 스킬과 판정 프롬프트, 동결된 값 모델을 고정해 두면 사람의 개입은 초기 시연과 장면 리셋으로 줄어든다.

저자들이 밝힌 한계도 분명하다. 스킬을 지정하고 가르치는 초기 사람 노력은 여전히 필요하며, 반복 개선이 고정된 라이브러리로도 가능하다는 것을 보였을 뿐 라이브러리 확장 자체는 자동화하지 않았다. 개선 루프는 자율적이지만 롤아웃 사이의 장면 리셋은 사람이 한다. 실패 감지기도 과제별 학습이 필요하다. 스킬 선택과 수리 검증은 공통 절차를 공유하지만, 언제 개입할지 판단하는 부분은 과제마다 따로 준비해야 한다는 뜻이다. 저자들은 학습된 리셋 행동이나 과제 루프, 그리고 시간 추론이 향상된 파운데이션 모델로 감지기까지 통합하는 것을 향후 방향으로 제시한다.