자기대국 게임으로 사람이 직접 조작하는 로봇 스킬을 발견한다

Game-Guided Skill Discovery through Self-Play for Playable Agent Control

HF Daily2609.40137

Seungeun Rho, Jeonghwan Kim, Xue Bin Peng2026-09-30

무엇인가

물리 시뮬레이션 속 로봇이나 고자유도 에이전트를 사람이 직접 조작하려면 보통 저수준 관절 토크를 일일이 지정해야 한다. 이 논문은 그 대신 소수의 학습된 스킬 버튼만으로 에이전트를 제어하는 인터페이스를 목표로 한다. 저자들은 기존 비지도 스킬 발견 기법이 상호정보량(MI)이나 Wasserstein 의존성 측도(WDM)를 최대화해 스킬 간 구별 가능성만 높인다고 지적한다. 에이전트가 복잡해질수록 스킬이 서로 달라질 방법은 많아지지만 그 차이가 행동적으로 의미 있으리라는 보장은 없어져, 구별은 되지만 해석하거나 재사용하기 어려운 스킬이 나온다는 것이다. 그래서 의미적으로 구별되고, 해석 가능하며, 표현력이 있고, 고자유도로 확장되는 스킬을 동시에 얻는 것이 이 논문이 푸는 문제다.

어떻게 동작하나

GGSD는 1대1 경쟁 게임의 규칙과 자기대국(self-play)을 스킬 발견의 지도 신호로 쓴다. 자기대국은 현재 정책의 복사본과 붙이는 대신 과거 체크포인트 풀을 유지하는 방식이다. 매 에피소드 시작에 상대를 하나 뽑아 에피소드 내내 고정하므로, 상대 정책이 연속적으로 변하는 대신 조각별로 정지한 단일 에이전트 MDP가 된다. 최신 체크포인트를 확률 p로 뽑고 나머지 확률을 이전 체크포인트들에 균등 분배하며, p는 0.6~0.8을 쓴다. 구현에서는 4,096개 병렬 환경을 10개 그룹으로 나눠 그룹마다 하나의 상대 정책을 공유하게 했고, 2,000 업데이트마다 현재 정책을 풀에 추가하고 200 업데이트마다 그룹별 상대를 다시 뽑는다.

무엇과 다른가

에이전트는 계층적 정책으로 제어된다. 상위 정책은 게임 전체 상태를 보고 이산 스킬 z 중 하나를 고르고(M은 환경에 따라 5 또는 6), 그 스킬은 k=10 환경 스텝 동안 고정된다. 하위 정책은 자기수용 감각(proprioceptive) 관측과 스킬 코드만 받아 매 스텝 모터 행동을 낸다. 두 계층은 각각 별도의 PPO 목적함수와 가치함수로 동시에 학습된다. 상위 정책은 게임 보상만 최적화하되 특정 스킬로 붕괴하지 않도록 범주형 엔트로피 항을 더하고, 하위 정책은 게임 보상에 MI 보상 r_MI = log q_φ(z_j | s_t)를 더해 최적화한다. 판별자 q_φ 역시 자기수용 관측만 보도록 제한해서, 상대방 상태에 따라 스킬의 운동학적 의미가 흔들리지 않게 한다. 상위 정책이 상대 의존적 전략 판단을 전담하고 하위 스킬은 상대와 무관하게 유지되는 구조다.

어떻게 쓰나

실험은 AntSumo, AntFencing, FrankaAirHockey, G1Boxing 네 게임에서 이뤄졌다. 70k 업데이트까지 학습한 최종 정책을 2k~70k 체크포인트와 각각 1,000 게임씩, 3회 독립 학습으로 평가했을 때 승률과 무승부율의 합이 모든 체크포인트 상대로 50%를 넘었고, G1Boxing은 자기 자신(70k)을 뺀 모든 과거 체크포인트에 대해 80% 이상 승률을 기록했다. 사람 4명이 AntSumo 최종 체크포인트와 5판씩 둔 결과 사람 승리는 2판, 즉 사람 승률 10%였다. 정성적으로는 AntSumo에서 회전·이동·밀기, G1Boxing에서 기본 이동과 펀치·가드(팔을 상체 앞으로 올리는 방어 자세) 같은 해석 가능한 행동이 나왔다. 특히 FrankaAirHockey에서 개별 스킬은 정적으로 보이지만 스킬 전환이 퍽을 치는 빠른 동작을 만들어내고, G1Boxing에서는 스킬 5에서 2로의 전환이 뒤로 젖히는 회피 동작을, 반대 전환이 앞으로 강하게 지르는 펀치를 만든다. 저자들은 이를 콤보 행동이라 부르며 소수의 이산 스킬만으로 개별 스킬보다 풍부한 표현력을 얻는다고 주장한다. 정량 비교에서는 스킬별 롤아웃 영상을 5fps로 샘플링해 Gemini-3.6-Flash로 행동 설명을 생성하고 Gemini-Embedding-2로 설명 간 거리를 재는 의미적 다양성 점수를 썼다. DIAYN, DADS, METRA와 비교해 GGSD가 모든 embodiment에서 가장 높았고, Ant와 G1에서는 가장 강한 베이스라인보다 약 2배, Franka에서는 28% 높았다.

전제와 한계

사람이 직접 플레이한 실험도 있다. AntSumo에서 배운 정책으로 AntMaze와 AntCubePush를, G1Boxing 정책으로 G1Maze를 평가했는데, 하위 정책은 고정한 채 상위 정책만 사람 입력으로 바꾸고 추가 학습은 하지 않았다. 저자 2명을 포함한 5명이 과제당 5회씩 시도해 평균 성공률이 세 과제 모두 84% 이상이었다. 학습은 Isaac Lab에서, 평가는 MuJoCo web에서 이뤄진 시뮬레이터 차이와, 학습 게임에 없던 벽 접촉·물체 조작이 포함된 과제라는 점에도 사람이 스킬을 조합해 과제를 풀었다는 것이 저자들의 근거다.

개발자 관점에서 이 논문의 실용적 요점은 게임 규칙 몇 줄과 자기대국만으로 사람이 누를 수 있는 스킬 인터페이스를 얻는다는 것이다. 태스크별 저수준 컨트롤러를 새로 학습하지 않고도 로봇이나 캐릭터를 소수 버튼으로 조작하게 만들려는 프로젝트라면 참고할 만하다. 다만 스킬 수가 5~6개로 고정되어 있고, 스킬의 의미가 선행 스킬이 만든 상태에 따라 달라지는 상태 의존성이 존재한다는 점을 전제로 삼아야 한다. 또한 학습 환경과 평가 환경이 다르다는 점, MI 판별자를 자기수용 관측으로 제한하는 설계가 상대 의존성을 상위 계층으로 몰아넣는 핵심 장치라는 점을 확인할 필요가 있다. 논문은 대화형 데모 페이지도 공개했다.

한계로 저자들은 학습되는 스킬 목록이 게임이 요구하는 행동에 묶인다고 밝힌다. 단순한 게임은 좁은 범위의 행동만 요구하므로 하위 과제로의 전이가 제한되고, 예컨대 G1Boxing으로 학습한 정책이 정교한 조작 기술을 얻기는 어렵다. 더 넓고 다양한 운동 능력을 요구하는 게임으로 GGSD를 확장하는 것이 향후 과제라고 말한다.