불확실한 턴만 골라 교사가 대신 행동하는 온폴리시 증류, UOPD

UOPD: Uncertainty-Aware Intervention for On-Policy Distillation of Multi-Turn Agents

arXiv2609.34036v1

Wenbo Zhang2026-09-27조회 2

무엇인가

다중 턴 에이전트는 한 번의 잘못된 판단이 이후 관찰과 결정을 연쇄적으로 바꿔버린다. 온폴리시 증류(OPD)는 학생이 직접 만든 롤아웃 위에서 교사가 토큰 단위 감독을 주지만, 학생이 제안한 나쁜 행동을 실행 단계에서 막지는 못한다. 그 행동은 그대로 환경에 실행되고, 이후 궤적과 교사 감독의 품질까지 끌어내린다. 기존 연구들은 교사 감독 재가중, 롤아웃 길이 조절, 교사 접두사(prefix) 제공 등으로 드리프트를 완화하려 했지만, 문제가 발생하는 바로 그 턴에서 신뢰할 수 없는 학생 행동을 교정하지는 않았다. 이 논문은 "언제 개입할 것인가"를 교사 불확실성으로 결정하는 UOPD(Uncertainty-Aware Intervention for On-Policy Distillation)를 제안한다.

어떻게 동작하나

UOPD의 절차는 턴 단위로 명확하다. 매 턴 학생이 행동 a_t^S를 제안하면, 교사가 그 행동에 대해 느끼는 불확실성 점수 δ_t를 계산한다. 점수가 임계값 τ_n보다 크면 교사가 a_t^T를 샘플링해 학생 행동 대신 실행하고, 그렇지 않으면 학생 행동을 그대로 실행한다. 임계값은 고정값이 아니라 최근 불확실성 점수 버퍼 D_n의 분위수(Quantile_{1-r_n})로 정해지며, 목표 개입률 r_n이 "얼마나 개입할지"를, 불확실성이 "어디서 개입할지"를 담당한다. 임계값은 에피소드 시작 시 재계산해 에피소드 내에서는 고정한다. 개입률 자체도 학습 초반에는 높게 시작해 r_n = r_start + (r_end - r_start)·min(n/N_decay, 1) 식으로 점차 낮춘다. 손실 함수는 턴에 따라 방향이 갈린다. 개입하지 않은 턴에서는 학생 행동에 표준 OPD의 역방향 KL 손실을 적용하고, 개입한 턴에서는 실행된 교사 행동을 정답으로 삼아 SFT(순방향 KL) 손실 -β·log π_θ(a_t^T|h_t)을 적용한다. 교사 샘플에 대한 역방향 KL 항의 기대값이 음의 순방향 KL이 되어 그대로 쓸 수 없기 때문에, 교사 엔트로피가 θ와 무관하다는 점을 이용해 SFT와 순방향 KL의 기대 그래디언트가 동일하다는 성질로 우회한 것이다.

무엇과 다른가

이론적 근거도 제시한다. 교사 교정의 두 역할(실행할 행동, 모방할 타깃) 중 실행 효과에 대해, 선택적 개입이 만든 보조 정책 π_G와 학생 정책 π_S의 기대 리턴 차이가 개입된 턴들의 Q값 차이 합과 정확히 같다는 항등식을 보인다. "평균 회복 가능성(average recoverability)" 가정, 즉 선택된 턴에서 교사 행동의 평균 어드밴티지가 γ>0 이상이라는 전제 아래에서 리턴 개선이 γ·E[N_int] 이상 보장된다. 모든 교정이 좋아야 한다고 요구하지 않고 평균만 본다는 점이 특징이다. 또한 3개 행동·이진 보상으로 구성된 1스텝 문제에서, 역방향 KL 그래디언트 한 스텝은 리턴을 오히려 낮추지만 교사 행동 SFT 그래디언트 한 스텝은 리턴을 높이는 사례를 구성해, 개입 턴에서 굳이 SFT를 쓰는 이유를 정당화한다.

어떻게 쓰나

실험은 ALFWorld(seen/unseen 성공률), WebShop(태스크 점수·성공률), Search(4개 멀티홉 데이터셋 exact match)에서 수행했다. 학생은 Qwen2.5-3B-Instruct와 Qwen2.5-1.5B-Instruct, 교사는 태스크별 GiGPO-Qwen2.5-7B-Instruct이며 Search는 SearchR1-Qwen2.5-7B-em-ppo를 쓴다. 비교 대상은 OPD, TCOD-F2B, TCOD-B2F, FTB-OPD다. WebShop에서 1.5B 학생의 점수는 OPD의 66.3에서 76.8로, 성공률은 52.3%에서 58.6%로 올랐고 평균 턴 수는 7.9에서 6.8로 줄었다. 초록 기준으로 표준 OPD 대비 WebShop 점수 최대 15.8% 상대 개선이다. Search에서는 OPD 대비 2.67~8.00%포인트 향상, 평균 턴 수 5.19에서 3.90으로 감소를 보고했다. 6개 평가 설정 중 5개에서 UOPD가 가장 적은 상호작용 턴을 사용했다.

전제와 한계

절제 실험(3B 학생)은 각 구성 요소의 기여를 분리한다. 불확실성 대신 무작위로 개입 턴을 고르면 unseen ALFWorld 성공률이 83.8%에서 88.8%로, WebShop 점수가 77.3에서 82.4로 떨어지고 WebShop 턴 수는 7.4로 늘어난다. 즉 개입 시점 선택 자체가 성능을 만든다. SFT 손실을 제거하면 unseen ALFWorld에서 최대 8.0%포인트가 빠져, 교사 행동을 실행만 하는 것으로는 이득이 회복되지 않는다. 교사 실행만 켠 경우 WebShop 점수는 77.6에서 82.4로 오르고 턴 수는 7.2에서 6.5로 줄어, 학습 신호와 실행 효과가 서로를 보완한다. 개입률은 높을수록 좋지 않다. 50%→30% 스케줄은 seen ALFWorld만 소폭 개선하고 unseen과 WebShop에서는 나빠졌으며, 상수 15%는 ALFWorld에서 경쟁력 있고, 30%→5%가 WebShop에서 최고 점수와 최소 턴을 냈다. β는 1이 가장 좋았고 2로 올려도 추가 이득이 없었다. 학습 시간은 FTB-OPD 대비 ALFWorld 13.8%, WebShop 36.5% 절감되지만 OPD 대비로는 11.5%, 14.7% 오버헤드가 붙는다.

실무 관점에서 이 논문이 주는 것은 "교사 신뢰도가 낮은 턴"이라는 값싼 신호 하나로 롤아웃 품질을 통제하는 패턴이다. 별도 보상 모델이나 검증용 추가 롤아웃 없이, 이미 계산하는 교사 로그확률만으로 개입 지점을 정하고 그 턴만 SFT로 학습한다. 다중 턴 도구 호출 에이전트를 소형 모델로 증류할 때, 실패 궤적을 걸러내는 필터링보다 "실패 직전에 교사가 대신 행동하게 하는" 쪽이 궤적 자체를 개선한다는 주장은 실무 파이프라인 설계에 직접 적용 가능하다. 다만 도입 전에 확인할 것은 세 가지다. 첫째, 불확실성 점수의 구체적 정의(교사 신뢰도인지 학생-교사 신뢰도 격차인지)는 본문이 아니라 부록 D.4에 있어 이 원문만으로는 확정할 수 없다. 둘째, 개입률 스케줄은 태스크마다 최적값이 달랐으므로(ALFWorld 상수 15%, WebShop 30%→5%) 자체 환경에서 재튜닝이 필요하다. 셋째, 교사가 학생보다 확실히 강해야 개입이 의미를 갖는다.

저자들이 밝힌 전제와 한계도 분명하다. 이론적 리턴 개선 보장은 "선택된 턴에서 교사 행동의 평균 어드밴티지가 γ>0"이라는 평균 회복 가능성 가정 위에 서 있으며, 개별 교정이 항상 좋다는 것을 요구하지 않는 대신 평균적으로 우수한 교사를 전제한다. 실험은 ALFWorld·WebShop·Search 세 벤치마크에 한정됐고, 학생 모델도 Qwen2.5 계열 1.5B·3B 두 크기뿐이다. 결론에서 저자들은 더 긴 호라이즌 태스크로 확장하는 것과, 개입 예산을 태스크 난이도와 학생 진척도에 맞춰 적응적으로 조절하는 것을 향후 과제로 남겼다. 즉 현재의 개입률 스케줄은 학습 스텝에만 의존하는 고정된 감쇠 곡선이며, 태스크별 난이도 정보를 반영하지 않는다.