APPL은 스킬 학습에 쓴 구조적 사전확률을 런타임 조합 인터페이스로 재사용한다
Agent Priors-guided Policy Learning
무엇인가
로봇은 소수 시연만으로 배우지만 배치될 때는 새로운 목표, 익숙한 동작의 새 순서, 새 위치의 물체를 마주한다. 이때 필요한 두 가지 일반화가 서로 얽혀 있다. 조합 일반화는 배운 스킬을 재조합해 새 과제를 푸는 능력이고, 스킬 일반화는 각 스킬의 정책이 물체가 움직이거나 앞선 스킬이 남긴 상태에서도 작동하는 능력이다. 문제는 두 층 사이에서 정보가 소실된다는 점이다. 스킬이 어디서 작동하는지는 그 정책이 어떤 구조로 학습됐는지가 결정하는데, 조합 층은 스킬을 이름이나 지시문, 기호 연산자 같은 별도 설명으로만 보기 때문에 그 구조를 알 수 없다. 이 논문은 각 정책의 구조적 사전확률을 조합과 스킬 사이의 인터페이스 일부로 쓰자는 아이디어를 제안한다. 구조적 사전확률이란 그 행동이 무엇에 의존하는지를 밝힌 가정이다. 예컨대 파지가 물체에 대한 그리퍼의 상대 자세에만 의존한다는 식이다. 학습에 반영되면 정책이 어디로 일반화할지를 형성하고, 언어로 서술되면 조합 층에 그 정책이 어디에 적용되는지를 알려준다.
어떻게 동작하나
이 아이디어를 구현한 것이 Agent Priors-guided Policy Learning(APPL)이다. 구성 단계에서 구성 에이전트가 완전한 시연을 재사용 가능한 스킬로 분할하고, 각 스킬마다 서로 다른 계열의 구조적 사전확률을 여러 개 제안한다. 하나의 미리 정의된 추상화나 하나의 정책 구현에 확정하지 않는다. 사전확률마다 조건부 확산 정책(Diffusion Policy)을 하나씩 학습시키는데, 학습 목표는 시연 행동 복제 손실에 사전확률별 보조 손실을 가중합한 형태다. 사전확률은 정책 표현, 행동 매개변수화, 아키텍처, 보조 목표를 통해 구현되며 이렇게 만들어진 정책 클래스가 성공 영역을 결정한다. 예를 들어 물체 상대 사전확률은 행동 청크 시작 시점의 물체 프레임으로 말단 목표를 변환해 절대 위치가 아니라 물체 상대 기하에 의존하도록 만든다. 같은 사전확률이 런타임 인터페이스에도 들어간다. 변환된 관측이 시연 범위 안에 있으면 적용 가능 영역으로 간주하는 식이다. 인터페이스는 사전확률 서술, 핸드오프 조건, 시연 지원 범위, 검증 증거의 네 필드로 구성되고, 정책이 요구하는 타입 있는 인자도 함께 선언한다. 논문은 좋은 인터페이스의 조건으로 충실성(적용 가능 영역이 실제 성공 영역의 부분집합일 것)과 정보성(성공 영역을 최대한 담을 것)을 든다.
무엇과 다른가
구성 절차는 단계적으로 진행된다. 먼저 시연 궤적에 스킬 경계를 제안하고 같은 동작을 하는 구간을 하나의 스킬 데이터셋으로 묶는데, 인접 스킬 구간을 전이 지점 주변에서 의도적으로 겹치게 해 후속 정책이 전임 정책이 실제로 도달하는 상태에서 출발할 수 있게 한다. 다음으로 스킬마다 여러 사전확률을 제안하고 구현·학습한 뒤, 시연된 스킬 진입 상태에서만 검증한다. 각 정책을 해당 구간 진입 상태에서 초기화해 구간 길이의 1.5배만큼 실행하고 최종 상태를 시연된 종료 조건과 비교한다. 구성 에이전트는 이 결과를 받아 관측된 결과와 자신의 추론을 분리한 검증 보고서를 쓰고, 그 피드백으로 스킬마다 사전확률을 하나 더 제안해 같은 방식으로 학습·검증한다. 런타임에서는 별도의 에이전트가 동결된 정책들 중에서 고르고, 타입 있는 인자와 실행 시간, 정지 조건을 지정해 호출한다. 실행기는 매 스텝마다 정지 조건을 확인하고 조건이 발화하거나 전체 목표가 충족되면 제어를 에이전트에게 돌려준다. 에이전트는 제어 코드를 작성하거나 동결된 라이브러리를 수정할 수 없고, 에피소드 사이에 기억이 초기화된다.
어떻게 쓰나
실험 1은 스킬 일반화만 분리해 본다. MetaWorld를 개조한 6개 과제(pick-place-wall, assembly, drawer-open, door-open, peg-insert-side, stick-push)에 각 20개 시연을 쓴다. 테스트 상태는 IID, 두 공간 요인을 재조합한 C, 둘 다 시연 구간 밖으로 밀어낸 E로 나뉘고 OOD는 C와 E를 동등하게 가중한다. 베이스라인 B0는 순수 확산 정책, B1은 미리 정의된 역할 상대 벡터 3개를 학습해 넣은 고정 관계 사전확률이다. 에이전트는 성능 피드백 없이 후보 A1~A3를 먼저 제출하고, 개발 결과를 보고 A4를 새로 설계한다. 24개 과제-시연 수 조건에서 총 144개 모델을 학습했다. 결과적으로 N=2에서 q4가 89.58%로 B0의 28.96%, B1의 37.92%를 크게 앞섰고, B1 대비 격차는 N=2, 5, 10, 20에서 각각 51.67, 50.83, 41.04, 36.88%포인트였다. 시연 수가 큰 구간에서는 IID 성공률이 방법 간 비슷해 이득이 과적합이 아니라 일반화에서 온다는 것을 보인다. 첫 제안만으로도 B1을 18.1~22.5%포인트 앞섰고, 세 개를 제안해 개발 OOD로 고르면 10.2~24.0%포인트가 더해지며, 피드백 라운드가 2.9~12.1%포인트를 추가한다. A4는 24개 조건 중 15개에서 선택됐고 테스트 성공률은 10개에서 상승, 13개에서 동일, 1개에서 하락했다. 사례도 제시된다. drawer/N=2에서 A1이 75.00%였는데, 시연된 평면 동작이 4(p_handle − p_hand)에 가깝다는 점을 이용해 이 항을 행동 인코딩에서 빼고 잔차만 예측하게 만든 A4가 100.00%에 도달했다. assembly/N=5에서는 너트와 목표 위치의 상관을 단축 경로로 쓰던 것을 제거해 41.25%에서 93.75%로 올랐다. 반대로 door/N=20은 q3의 100.00%에서 q4의 96.25%로 떨어지기도 한다.
전제와 한계
실험 2는 물체가 이동한 상태와 시연에 없던 과제 변형에서 조합까지 함께 본다. 스크립트 플래너로 모은 12개 시연씩의 ManiSkill 5개 과제를 쓴다. 비교 대상은 전체 과제 확산 정책(DP), 같은 언어모델이 설계한 사전확률을 쓰되 런타임 에이전트가 없는 SinglePrior, 스킬 이름을 지시문으로 받는 하나의 VLA 정책으로 라이브러리를 대체한 Agent+VLA다. 절제 실험은 네 가지다. 인터페이스 정보를 모두 숨기고 스킬 이름과 익명화된 정책 라벨만 남긴 경우, 사전확률·핸드오프·지원 서술을 숨기되 검증 점수와 종료 기준은 남긴 경우, 에이전트를 시연 순서를 따르는 고정 규칙으로 바꾼 경우, 검증을 생략한 경우다. APPL은 물체 이동 OOD에서 50.0% 성공으로 DP와 SinglePrior의 각 10.0%를 크게 앞섰고(둘 다 McNemar p<0.001), 과제 수준 OOD에서 92.5%, 시연에 없던 조합 16개 중 8개를 풀었다. 같은 정책 라이브러리를 유지하되 인터페이스 정보를 숨기면 물체 이동 OOD가 50.0%에서 20.0%로, 과제 수준이 92.5%에서 65.0%로, 조합이 8/16에서 2/16으로 떨어진다. 고정 규칙으로 바꾸면 각각 22.5%, 52.5%, 1/16이다. 사전확률 서술만 숨기고 검증 점수와 종료 기준을 남긴 경우는 3/16으로, APPL만의 고유 성공 6건 대 절제만의 고유 성공 1건이라는 차이가 난다. 검증 정보는 전반적으로 선택을 돕지만 시연 진입 상태에서 얻은 점수가 이동 상황에서 정책 순위를 뒤집을 수 있다는 것도 보고한다. 덮인 peg 조립에서 검증 보고서가 런타임 핸드오프 규칙에서 유용한 정책을 억제하고 다른 정책을 밀어 성공이 8/8에서 1/8로 떨어졌다. 남은 실패는 물체를 떨어뜨리거나 서랍이 닫히거나 스킬이 학습된 진입 조건 밖에서 호출된 경우에 집중되며, 시연에 복구 궤적이 없고 잃어버린 물체로 다시 접근하는 스킬도 라이브러리에 없다.
개발자 관점에서 이 논문의 실용적 시사점은 정책의 일반화 가정을 학습 후 버리지 않고 런타임 선택 정보로 남긴다는 설계 패턴이다. 스킬 라이브러리와 조합 에이전트를 분리한 시스템을 만든다면, 각 정책이 어떤 관계에 의존하도록 학습됐는지, 어떤 진입·종료 조건을 갖는지, 시연 지원 범위가 어디까지인지를 구조화된 인터페이스로 함께 저장하는 것이 선택 정확도를 좌우한다는 절제 실험 결과를 참고할 수 있다. 다만 검증을 시연 진입 상태에서만 수행하면 배치 시점의 상태 분포와 어긋나 순위가 뒤집힐 수 있으므로, 검증 프로토콜을 실제 배치 상태와 핸드오프 규칙에 맞춰 설계해야 한다는 경고도 함께 읽어야 한다.
저자들이 밝힌 가장 큰 한계는 구조적 사전확률이 의도된 일반화를 서술할 뿐 능력을 보장하지 않는다는 점이다. 정책은 시연 지원 범위 밖에서 여전히 실패할 수 있고, 현재 라이브러리는 복구에 충분하지 않을 수 있다. 저자들은 검증 개선, 표적 데이터 수집이나 증강을 통한 스킬 지원 확대, 모션 플래너 같은 보완 도구 통합을 다음 단계로 제시한다. 또한 두 실험 모두 시뮬레이션 조작만 평가하며, 여기서 다룬 런타임 점검과 사전확률만으로 실제 배치가 안전해지지는 않는다고 명시한다.