교사 감독을 스스로 은퇴시키는 에이전트 강화학습 온폴리시 증류
RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning
무엇인가
이 논문이 다루는 문제는 다중 턴 LLM 에이전트 학습에서 보상이 지나치게 희소하다는 것이다. 검증 가능한 보상 기반 강화학습(RLVR)은 궤적 하나당 스칼라 보상 하나만 주기 때문에 긴 상호작용의 중간 결정들은 감독되지 않는다. 이를 보완하는 것이 온폴리시 증류(OPD)로, 학생이 샘플링한 궤적 위에서 교사가 토큰 단위의 조밀한 감독을 제공한다. 에이전트 학습에서 교사는 대개 훈련 중에만 쓸 수 있는 특권 컨텍스트, 즉 검색된 태스크 스킬에 조건화된 같은 모델이다. 학생은 그 컨텍스트 없이 훈련되어 스킬을 파라미터에 내재화하고, 추론 시에는 추가 컨텍스트가 필요 없게 된다. 저자들은 이 패러다임이 두 가지 가정 위에 서 있다고 지적한다. 교사는 특권 컨텍스트를 보므로 학생보다 확실히 낫다는 가정, 그리고 교사를 따라가는 것이 훈련이 끝날 때까지 계속 유용하다는 가정이다. ALFWorld와 WebShop에서 확인한 결과 둘 다 성립하지 않았다.
어떻게 동작하나
첫 번째 발견은 특권 정보만으로 교사가 신뢰할 만해지지 않는다는 것이다. GRPO와 온폴리시 자기증류(OPSD)를 함께 쓰는 설정에서 교사와 학생이 하나의 공유 정책을 이루는 두 브랜치일 때, 스킬 조건화 브랜치가 자신이 감독하는 학생을 일관되게 능가하지 못했다. 공유 파라미터가 주로 스킬 없는 학생 목적함수로 최적화되기 때문에, 정책은 애초에 스킬 컨텍스트에 따라 행동하도록 훈련된 적이 없다. 모델 크기도 해결책이 아니어서, 같은 스킬을 프롬프트로 준 7B 모델은 ALFWorld에서 성공률 23.4%에 그쳤다. 교사가 감독자가 되려면 먼저 자신의 특권 컨텍스트를 활용하도록 훈련되어야 한다는 결론이다.
무엇과 다른가
두 번째 발견은 교사 감독의 이득이 단계 의존적이라는 것이다. GRPO에 OPD를 더하면 순수 GRPO의 느린 출발과 순수 OPD의 낮은 천장을 동시에 피할 수 있다. 그러나 교사-학생 격차는 처음에는 좁아지다가 이후 다시 벌어진다. 학생이 스킬이 유도하는 행동을 내재화하고 나면 보상 최적화는 교사가 택하지 않는 행동을 선호하게 되고, 두 그래디언트가 충돌하기 시작한다. 이 지점을 넘겨 계속 교사를 따라가면 학생은 교사의 성능 천장 근처에 묶인다. 논문 부록의 1차 분석에 따르면 격차가 정체된다는 것은 국소적으로 서로 반대되는 그래디언트를 뜻한다. 즉 교사 감독은 일시적인 발판이며, 문제는 언제 걷어내느냐가 된다. 기존 연구는 훈련 전에 고정한 스케줄로 이 질문에 답한다. 증류 가중치를 어닐링하거나 정해진 스텝에서 증류를 RL로 전환하는 식이다. 어느 쪽도 교사가 아직 유용한지 관측하지 않는다. 저자들의 실험에서 격차 감소가 멈추는 지점은 모델과 태스크에 따라 50스텝에서 90스텝 사이로 달라졌기 때문에, 어떤 단일 스케줄이든 어떤 설정에서는 너무 이르고 어떤 설정에서는 너무 늦게 지도를 거둔다.
어떻게 쓰나
제안 방법 RetireOPD는 세 단계로 구성된다. 첫째, 교사 구축 단계다. 교사 정책과 학생 정책을 같은 베이스 모델, 동일 아키텍처로 초기화하되 서로 분리하고, 교사만 태스크 관련 스킬 컨텍스트 c+를 받은 상태에서 GRPO로 환경 보상을 최대화하도록 훈련한다. 목적식은 φ* = argmax E[R(τ)]이며, 훈련이 끝나면 교사를 동결해 스킬 교사로 쓴다. 둘째, GRPO-OPD 결합 훈련 단계다. 학생은 c+ 없이 L_student = L_GRPO + λ L_OPD를 최적화한다. GRPO 항은 그룹 상대 어드밴티지에 클리핑을 적용한 표준 형태이고, OPD 항은 학생이 방문한 상태에서 학생 분포와 교사 분포 사이의 reverse KL이다. 전체 어휘를 합산하는 정확한 KL은 오버헤드가 크므로 학생이 샘플링한 토큰에 대해 Δ_t = log π_T(y_t | x, c+, y<t) − log π_θ(y_t | x, y<t)를 계산해 단일 샘플 몬테카를로 추정으로 대체한다. 교사는 별도 궤적을 생성하지 않고 학생이 지나간 상태에만 감독을 준다. 셋째, 적응적 교사 은퇴 단계다. 훈련을 W스텝짜리 모니터링 윈도우로 나누고, 스텝 수준 정렬 지표 K_n과 윈도우 평균 K̄_m을 구한 뒤 ρ_m = (K̄_m − K̄_{m−1}) / K̄_m과 상대 역량 η_m = (SR_m + SR_{m−1}) / (2 SR_T)를 계산한다. ρ_m이 음수면 격차가 아직 줄고 있다는 뜻이고, 0 이상이면 감소가 멈추거나 되돌아섰다는 뜻이다. η_m은 교사 성공률 대비 학생의 역량을 두 윈도우 평균으로 완만하게 측정한다. 은퇴 시점은 m* = inf{ m ≥ 2 : ρ_m ≥ δ ∧ η_m ≥ γ }로 정해지며, 이 조건이 처음 만족되는 윈도우에서 OPD를 제거하고 이후에는 GRPO만으로 훈련한다. 두 신호를 함께 요구하는 이유는 학생이 아직 약할 때 일시적 변동으로 조기 은퇴하는 것을 막기 위해서다.
전제와 한계
실험은 Qwen2.5-1.5B, 3B, 7B-Instruct 세 규모에서 ALFWorld와 WebShop으로 수행했다. ALFWorld는 자연어 지시로 여러 단계의 가사 작업을 수행하는 텍스트 기반 환경으로 장기 계획과 상태 추적을 평가하고, WebShop은 검색과 탐색을 거쳐 사용자 제약을 만족하는 상품을 고르는 온라인 쇼핑 환경으로 목표 지향적 다단계 정보 수집을 평가한다. 하이퍼파라미터는 은퇴 기준을 5 평가 스텝마다 확인하고 역량 임계값 γ = 0.9, 격차 정체 임계값 δ = 0을 기본값으로, 증류 계수 λ = 0.01로 두었다. 특권 정보로는 SkillRL의 SkillBank를 쓰고 SDAR의 키워드 매칭 검색 전략을 따랐다. 비교 대상은 훈련 없는 Vanilla와 Skill-Prompt, RL 계열의 GRPO, GiGPO, PPO, RLOO와 스킬 조건화 교사 역할의 Skill-GRPO, 증류 계열의 OPD와 OPSD, 하이브리드 계열의 GRPO+OPD와 GRPO+OPSD다.
결과 수치는 명확하다. ALFWorld에서 RetireOPD는 Qwen2.5-3B 기준 93.8%로 GRPO의 75.0%를 18.8점 앞섰고, 1.5B와 7B에서도 각각 17.0점, 14.1점을 더했다. WebShop에서는 1.5B에서 75.8%로 GRPO의 56.8%를 19.0점 앞섰고, 3B와 7B에서 각각 14.0점, 11.8점을 더했다. 모든 설정에서 자기 교사도 능가했는데, 3B의 경우 학생이 ALFWorld 93.8%, WebShop 77.3%를 기록해 교사의 79.7%, 64.8%를 넘어섰다. 어블레이션에서 교사를 명시적으로 최적화하지 않으면 3B와 7B 교사가 각각 28.9%, 23.4%에 머물렀지만 환경 보상으로 최적화한 뒤에는 79.7%, 90.6%로 올라갔고 학생 성능도 함께 좋아졌다. OPD를 훈련 내내 유지하면 82.8%에 그친 반면 완전한 방법은 92.2%를 기록했고, 정렬 진행과 상대 역량 중 하나만 쓰면 89.0%로 두 신호를 결합한 경우보다 낮았다. 임계값 민감도 실험에서 전환 스텝이 55에서 95까지 움직여도 성공률은 89.1%에서 92.2% 사이로 비교적 안정적이었고, γ가 0.80~0.96, δ가 −0.10~0.04 범위에서 은퇴 스텝은 기본 설정 대비 ±5 스텝 안에 머물렀다. ATOD의 선형 어닐링과 비교하면 선형 어닐링은 초반에 빠르게 오르다 정체하는 반면 적응형 전략은 계속 향상됐다. 은퇴 시점 체크포인트에서 GRPO만으로 이어서 훈련했을 때 성공률이 76.6%에서 93.8%까지 올라간 것도, 은퇴 후 보상 기반 최적화가 교사 정렬 목적과 충돌하지 않게 됨을 보여준다.
개발자 관점에서 이 논문이 주는 실무적 시사점은 두 가지다. 하나는 교사 품질을 가정하지 말라는 것이다. 특권 컨텍스트를 붙여주는 것만으로는 교사가 학생보다 낫다는 보장이 없으므로, 교사를 별도로 환경 보상으로 훈련시키고 그 성공률을 실제로 측정한 뒤 증류 신호로 써야 한다. 다른 하나는 증류 종료를 스케줄이 아니라 신호로 결정하라는 것이다. 교사와 학생의 토큰 로그확률 격차를 윈도우 단위로 평균 내 그 변화율이 멈추는지 보고, 동시에 학생 성공률이 교사의 일정 비율에 도달했는지를 함께 확인하는 방식은 구현 부담이 크지 않으면서 조기 종료와 과도한 유지 양쪽을 피한다. 은퇴 이후에는 교사 순전파가 필요 없어지므로 훈련 비용도 함께 줄어든다.
논문에는 별도의 한계 절이 없지만 본문에 드러난 전제와 제약은 분명하다. 교사와 학생이 동일 아키텍처와 동일 초기화를 공유하는 같은 용량 설정을 가정하며, 교사는 훈련 시에만 접근 가능한 스킬 컨텍스트와 SkillBank에 의존한다. 은퇴 판정은 δ와 γ 두 임계값에 의존하고, 격차 감소가 멈추는 지점이 모델과 태스크에 따라 50~90스텝으로 달라 단일 고정 스케줄이 부적절하다는 관찰이 방법의 출발점이다. 또한 교사가 최적화되지 않았을 때 학생 성능이 교사 품질에 크게 의존한다는 어블레이션 결과는, 교사 구축 단계가 제대로 되지 않으면 전체 파이프라인이 흔들릴 수 있음을 시사한다.