PivotOPD가 다중 턴 에이전트의 결정적 실수 복구를 학습한다

PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents

arXiv2609.40285v1

Yinghui He2026-09-30조회 9

무엇인가

이 논문은 다중 턴 언어 에이전트의 실패가 어디서 생기고 왜 잘 복구되지 않는지를 다룬다. on-policy distillation(OPD)은 학생이 만든 궤적에 교사가 토큰 단위 감독을 주는 방식이지만, 다중 턴에서는 잘못된 행동 하나가 이후 관찰과 가능한 행동을 바꾸어 오류가 누적된다. ALFWorld에서 Qwen3-8B, 30B-A3B, 235B-A22B를 140개 held-out task에 굴린 분석에서 실패 궤적의 59%가 남은 최적 궤적 길이를 늘리거나 과제를 불가능하게 만드는 결정적 실수(pivotal mistake)를 포함했고, 첫 결정적 실수는 30턴 중 중앙값 8~12턴에 일찍 나타났다. 세 모델 모두 이후 18~21턴을 복구 없이 낭비했다. Qwen3-8B의 실패 72개에서 첫 결정적 턴을 oracle action으로 고치면 replay 성공률이 8%에서 59%로 올랐고, 실수는 두고 다음 두 턴에 oracle action을 강제해도 58%에 도달했다. 즉 실패는 초반 한 턴에 좌우되지만 대부분 복구 가능하다.

어떻게 동작하나

기존 OPD가 이 복구를 못 하는 이유도 분석한다. 표준 OPD는 held-out task 실패율을 79%에서 56%로 낮췄지만, 결정적 턴 이후 실패는 51%에서 49%로만 줄었다. 다른 표현으로 전체 실패율은 23.6% 줄었는데 결정적 턴 이후 실패는 2.1%만 줄었고, 결정적 턴이 없는 실패가 21.4% 줄어 대부분 이득이 거기서 나왔다. OPD는 이미 저지른 실수의 확률을 0.999에서 10^-5 아래로 낮추지만, oracle action은 모든 평가 결정적 턴에서 10^-2 미만이라 8개 rollout 그룹이 한 번도 샘플하지 못해 직접 보상을 받지 못한다.

무엇과 다른가

PivotOPD는 group-based RL에 결정적 턴과 그 이후 턴에 집중한 dense token-level supervision을 더한다. 먼저 pivot detection에서 교사 모델이 rollout과 결과를 보고 학생이 틀렸을 수 있는 후보 턴을 최대 m개 고르고 gold action을 제시한다. 학생이 실제로 한 행동과 gold action이 다를 때만 pivotal turn으로 취급한다. ALFWorld 실패 궤적에서 교사가 찾은 pivotal turn이 oracle-labeled pivotal turn과 한 턴 이내로 일치하는 비율은 평균 77.8%로, 무작위 턴보다 최소 두 배 높았다. 이후 교사는 각 pivotal turn 뒤 최대 K개 recovery turn에 대해 recovery action을 제시한다.

어떻게 쓰나

토큰 단위 목표는 privileged self-teacher로 만든다. frozen student에게 gold/recovery action을 hint로 주면, 교사는 행동 이름만 제공하고 토큰 확률은 학생 자신의 추론 스타일로 계산된다. Preventive distillation은 pivotal turn에서 gold action을 hint로 준 self-teacher와 학생의 reverse KL을 최소화해 학생을 gold action 쪽으로 밀고 이미 한 실수에서 멀어지게 한다. Recovery distillation은 pivotal turn 이후 recovery turn에서 self-teacher가 recovery action hint를 받고 쓴 응답을, 학생은 hint 없이 그 문맥을 보도록 forward KL로 학습한다. forward KL은 mass-covering이라 학생이 거의 샘플하지 않는 recovery action의 확률을 올린다. 전체 목적함수는 RL loss에 preventive 항과 recovery 항을 가중합한 형태다. 구현에서는 hint가 frozen student의 토큰 로그확률을 얼마나 바꾸는지로 distillation advantage를 만들어 PPO 업데이트에 넣는다. 이론적으로 학생이 recovery action에 낮은 확률을 줄 때 학생 샘플 기반 업데이트는 작아지지만, recovery distillation은 self-teacher 확률 q에 기반해 g(a*) ≥ δ(q(a*)-p(a*)) > 0의 양의 업데이트를 준다.

전제와 한계

실험은 ALFWorld, WebShop, Search-based QA, SWE-Bench Verified에서 한다. 학생은 Qwen3-1.7B와 Qwen3-8B이고 각각 Qwen3-30B-A3B, Qwen3.5-122B-A10B 교사를 쓴다. 13개 베이스라인에는 GRPO, OPSD, RLSD, SDAR, TurnOPD, TCOD, SOD, StepOPSD, AgentOPSD, Skill-GRPO, OPID, Skill-SD, PivotRL이 포함된다. 160 training step, task당 8 rollout으로 학습한다. PivotOPD는 세 주요 벤치마크의 여덟 per-benchmark 평균 모두 1위다. 1.7B 학생은 가장 강한 베이스라인보다 ALFWorld +5.5%, Search-based QA +5.9% 높고, 8B 학생은 최소 +1.8% 높다. WebShop에서 1.7B 학생은 RLSD보다 normalized score는 +1.2%만 높지만 success rate는 +14.1% 높다. 교사 없이 학생이 자기 교사가 되는 설정에서도 세 벤치마크 모두 1위이며 최강 베이스라인보다 최소 +1.5% 높다. 다만 강한 교사 대비 Search-based QA와 WebShop success rate는 5% 이내로 유지되지만 ALFWorld는 10.2% 낮다. Nemotron-3.5-SFT 학생과 Nemotron-3-Super 교사로 SWE-Bench Verified를 평가하면 resolve rate가 +3.2% 오르고, 표준 OPD는 +0.2%에 그쳤으며 교사와의 격차 약 3분의 1을 줄였다.

복구 행동 분석은 방법의 핵심 주장을 뒷받침한다. oracle이 표시한 72개 pivotal mistake를 fresh ALFWorld에서 replay하고 정책당 8회씩 총 576회 돌린 결과, 최종 recovery rate는 Base 8.3%, 표준 OPD 20.3%, preventive-only 45.8%, PivotOPD 72.7%였다. 72개 pivotal mistake별 paired 비교에서 표준 OPD는 20개 개선, 4개 악화, 48개 그대로였고, preventive-only는 47개 개선, 6개 악화, 19개 그대로였으며, PivotOPD는 60개 개선, 0개 악화, 12개 그대로였다. 복구한 replay의 pivotal mistake 이후 완료까지 평균 턴은 정책별 recovered set이 48, 117, 264, 419개로 달랐지만 own-set optimal mean은 5.2~5.8턴으로 비슷했다. recovery budget K는 성능에 크게 영향을 주며 WebShop에서 학습 끝 점수는 budget에 따라 최대 19.5% 차이 났고, K=1에서 K=3으로 늘리면 점수가 7.8% 낮아졌다.

개발자 관점에서 PivotOPD는 추론 시 추가 비용이 없다. 테스트 때 학생은 교사, hint, recovery 없이 행동하므로 inference overhead가 없고, 학습 때만 self-teacher forward pass와 recovery rollout이 추가된다. ALFWorld Qwen3-1.7B, H100 4장 한 노드에서 GRPO가 training step당 367.3초였고, K=1 recovery rollout은 이미 도달한 post-mistake state에서 시작해 환경 replay가 필요 없어 저렴하다. K=2부터는 이후 recovery turn을 환경 replay로 도달해야 해 recovery rollout 시간이 10배 이상 커진다. WebShop은 K=1이 선택되어 16 GPU로 첫 41 step 측정 시 GRPO 대비 training step 시간이 12.2%만 늘었다. 따라서 다중 턴 에이전트의 오류 누적을 줄이려는 팀은 K=1 같은 저비용 설정부터 검증하고, pivot detection 품질과 recovery action 품질을 함께 확인해야 한다.

저자들이 밝힌 한계는 분명하다. 첫 recovery turn 이후는 기록된 행동을 환경 복사본에서 replay해 같은 관찰을 재현할 수 있어야 하므로, live website처럼 정확한 replay가 안 되는 환경에는 K>1 적용이 어렵다. 교사가 제시한 gold/recovery action이 틀리면 잘못된 distillation target이 된다. ALFWorld에서 pivot detection이 oracle과 한 턴 이내 일치하는 비율은 77.8%라 나머지 경우 감독이 첫 oracle pivotal turn에서 벗어날 수 있고, mismatch check가 합리적 대안 행동을 pivotal로 표시할 수도 있다. 학생이 자기 교사가 되는 설정은 강한 교사보다 ALFWorld 성공률이 낮다. recovery budget K와 recovery weight w_rec는 상호작용하므로 새 벤치마크마다 validation sweep이 필요하다. 결정적 실수 진단은 ALFWorld의 symbolic oracle에 의존하고 다른 벤치마크에서는 교사 모델이 pivotal turn을 추정할 뿐이다. 또한 모든 에이전트가 최대 5턴의 history window를 보므로, 분석에서 센 pivotal mistake 이후 낭비 턴 일부는 제한된 history 때문일 수 있다.