SRD는 보상 신호가 사라진 롤아웃에서 사전 예측 능력을 학습한다

Self-Retrospection Distillation: Turning Post-hoc Experiences into Prior Foresight

HF Daily2610.08077

Haoxiang Zhang, Qinglin Chen, Hiroaki Hayashi2026-10-06

무엇인가

강화학습과 검증 가능한 보상(RLVR)은 LLM 에이전트를 사후학습시키는 표준 패러다임이 됐지만, 보상은 상호작용이 끝난 뒤에야 나오는 사후 신호다. GRPO 같은 그룹 상대 objective에서는 한 프롬프트에 대한 롤아웃 G개가 모두 같은 보상을 받으면 advantage가 0이 되어 학습 신호가 통째로 사라진다. 실무에서는 이런 uniform-reward 그룹을 버리고 다시 샘플링하는데, 논문은 그 버려지는 궤적 안에 과제가 무엇을 요구하는지와 에이전트가 어떻게 실패하는지에 대한 정보가 들어 있다는 점에 주목한다. 질문은 이렇다. 사후 경험이 행동 이전에 예측했어야 할 것을 가르칠 수 있는가.

어떻게 동작하나

논문이 제안하는 prospective learning은 사후 경험 z_hind를 행동 정책이 아니라 예측의 감독 신호로 쓴다. 상호작용 정보 없이 과제 x와 환경 문맥 e만 보고 만드는 foresight 분포 p_fore = π_θ(·|x,e)와, 완료된 궤적에서 뽑은 사후 정보를 특권 문맥으로 붙인 hindsight 분포 p_hind = π_θ̄(·|x,e,z_hind)를 정의하고, foresight가 hindsight가 드러낸 것을 미리 예측하도록 두 분포를 정렬한다. 회고적 방법들이 사후 정보로 행동 분포 π_θ(·|h_t)를 직접 개선하는 것과 달리, 여기서 감독 대상은 상호작용 이전 시점의 예측 표현이다.

무엇과 다른가

구체적 구현이 Self-Retrospection Distillation(SRD)이다. foresight를 두 관점으로 나눈다. Knowledge는 상호작용 중 필요할 지식, Pitfall은 마주칠 실패다. 롤아웃 그룹 안에서 성공 궤적(r=1)은 Knowledge 감독을, 실패 궤적(r=0)은 Pitfall 감독을 제공한다. 각 롤아웃 i에 대해 관점 지시문 c^i를 정하고, 특권 사후 문맥 f^i = (τ^i, y*, ε^i)를 만든다. y*는 정답이나 gold solution, ε^i는 해당되는 경우의 오류 주석이다. 학생은 p_fore^i = π_θ(·|x,e,c^i)에서 foresight 시퀀스 z_fore를 샘플링하고, hindsight teacher는 같은 학생 생성 프리픽스에 사후 문맥 f^i를 붙여 토큰 분포를 평가한다. 손실은 롤아웃 그룹 전체에 대한 토큰 레벨 증류로, divergence로는 일반화 Jensen-Shannon divergence JSD_β를 쓴다. teacher는 현재 정책의 stop-gradient 복사본이다. 이 항은 가중치 λ=0.01로 GRPO·OPSD·RLSD 같은 기존 objective에 보조 손실로 붙는다. foresight는 학습 타깃일 뿐이라 추론 시점에 명시적으로 생성할 필요가 없다.

어떻게 쓰나

실험은 4개 범주 10개 벤치마크에서 이뤄진다. Math는 AIME 2024, AIME 2026, AMO-Bench, Code는 LiveCodeBench-v6와 OJBench, Search는 HotpotQA, 2WikiMultiHopQA, BrowseComp-Plus, Agentic은 ALFWorld와 WebShop이다. 모델은 Qwen3.5-4B와 9B, 베이스라인은 Vanilla, DAPO 스타일 GRPO, OPSD(온폴리시 자기증류), RLSD(GRPO에 OPSD의 teacher-student divergence를 재가중한 하이브리드)다. 4B GRPO에 SRD를 더하면 Math 평균 +10.03, Code +8.33, Search +8.05pp, ALFWorld +3.25, WebShop +5.92pp가 오른다. 9B OPSD+SRD는 Math 평균을 39.70%에서 56.92%로(+17.22pp) 끌어올리고 Search도 +10.31pp다. RLSD+SRD는 ALFWorld를 66.25%에서 77.25%로(+11.00pp) 올린다. 학습은 stdin 포맷, 평가는 functional 포맷인 Code에서 OJBench +8.12pp, 미학습 환경 ALFWorld에서 1.12~13.74pp, 학습 롤아웃보다 상호작용 지평이 10배 이상 긴 BrowseComp-Plus에서 6개 설정 중 5개가 최대 9.52pp 개선됐다. 전체에서 유일한 퇴행은 9B OPSD의 WebShop −3.61pp이며, 최대 개선폭은 24.2pp다.

전제와 한계

보상 대비가 희소한 영역에서 효과가 두드러진다. 코드 도메인만 쓰고 dynamic sampling을 끈 실험에서 학습에 쓸 수 있는 배치 비율은 63%를 넘지 않았고, 버려지는 비율은 능력 수준에 따라 U자(98.0, 39.1, 37.0, 41.3 포인트)를 그렸다. 정책이 약하면 all-zero 그룹이 98.0%에서 13.4%로 줄고, 강해지면 all-one 그룹이 0.0%에서 27.9%로 늘어 어느 쪽이든 보상 대비가 남지 않는다. 2B 설정에서는 그룹의 98%가 all-failure라 GRPO 학습이 최고 1.6% 성공률을 찍고 최종 0.0%로 끝나는데, 같은 롤아웃 예산에서 SRD를 더하면 60.6%에 도달한다. 순수 자기증류의 불안정성도 완화한다. 9B OPSD 단독은 HotpotQA −5.50, 2Wiki −3.76, LCB-v6 −2.18pp로 미학습 정책보다 낮아졌고 Math 평균도 4B 41.81%보다 낮은 39.70%로 스케일 역전이 나타났는데, SRD를 붙이면 4B 48.11%, 9B 56.92%로 정상 순서를 회복한다.

분석 실험 몇 가지가 실무적으로 유용하다. 두 관점 중에서는 Pitfall 단독이 더 싸고 안전하다. Knowledge 채널을 Pitfall 위에 더하면 이득이 없고 위험만 늘어 4B AMO-Bench에서 4pp 하락, 9B AIME26에서 62.92% 대 65.42%로 밀린다. 학습 중 Pitfall 채널의 divergence는 47%와 30% 줄어드는데 Knowledge 채널은 거의 평평(~0.0045, ~0.003)해서 잘 맞지 않는다. 롤아웃이 한 학습 스텝의 78~87%를 차지한다는 점을 감안하면 이 차이는 비용 문제다. 토큰 재배분도 측정됐다. SRD는 롤아웃당 연결 산문 +8.6, 계획 언어(we, need, think) +3.7, 문제 구조를 명명하는 단어(key, insight, constraint) +1.4개를 늘리는 대신 인라인 수식 −6.7, 구두점 −4.3, 숫자 −4.1, 인라인 변수명 −3.0개를 줄이고 툴 호출 문법은 +0.03으로 건드리지 않는다. 합계가 +0.6 토큰이라 정책이 말이 많아진 게 아니라 고정 예산의 배분이 계산 인라인에서 문제와 계획 명명으로 옮겨간 것이다. Fisher 계측에서는 SRD가 GRPO 방향을 따라 30% 더 멀리 가고(α/||A||=1.30) 직교 성분도 비슷한 크기(||E⊥||/||E||=0.49)를 더하며, RL 변위는 0.39에서 0.86으로 늘리지만 이미 조밀한 OPSD 변위는 1.97에서 0.57로 줄인다. 테스트 시점에 foresight를 명시적으로 말하게 하는 것은 거의 효과가 없다. 네 체크포인트 중 하나만 +5.00pp였고 나머지 셋은 800 롤아웃 중 2, 3, 11개가 바뀌는 수준이었다.

개발자 관점에서 이 논문의 값어치는 GRPO 계열 파이프라인에서 all-correct·all-wrong 그룹을 버리는 관행을 되돌아보게 한다는 데 있다. 보상이 누구에게도 차별적이지 않은 순간에도 궤적은 여전히 무언가를 가르칠 수 있고, SRD는 그것을 별도 롤아웃 없이 학생 자신의 foresight 시퀀스에 대한 토큰 레벨 증류로 바꾼다. 도입 시 확인할 것은 세 가지다. 첫째, foresight 샘플링이 추가 상호작용을 요구하지 않는지(논문은 정책 자체의 생성만 쓴다). 둘째, λ=0.01 같은 작은 가중치로 기존 objective와 충돌하지 않는지, 특히 이미 자기증류 항을 가진 RLSD류에서는 Knowledge 채널이 오히려 역효과였다는 보고. 셋째, 평균 지표 뒤의 태스크별 트레이드오프다. 여덟 개 arm 중 ALFWorld 여섯 태스크 타입을 모두 개선한 것은 하나도 없었고, 같은 태스크 타입이 arm에 따라 −20.13pp에서 +40.28pp까지 움직였다. 추론 시점 오버헤드가 없다는 점은 분명한 장점이다.

저자들이 밝힌 한계는 분명하다. RLSD에서 Knowledge 채널이 해를 끼친 결과는 두 objective, 한 스케일, 한 시드에서 나온 것이라 추측 이상으로 주장하지 않는다. 테스트 시점 foresight는 틀릴 수 있고, 논문이 든 예시에서는 두 객체 과제의 용량 한계를 에이전트가 아니라 목적지에 놓는 오류를 범한다. 학습 타깃으로서의 잘못된 foresight는 이후 업데이트로 교정될 여지가 있지만, 행동 전에 발화되면 에피소드 전체를 조건화하므로 추론 시 생성은 공짜가 아니다. 윤리 항목에서도 자기 hindsight 증류가 베이스 모델과 학습 데이터, 피드백의 오류와 편향을 강화할 수 있으며 벤치마크 향상이 배포 안전성이나 공정성을 보장하지 않는다고 못 박는다.