LLM 에이전트 반복 자기증류의 성능 붕괴를 ReSAIL이 막는다

ReSAIL: Mitigating Collapse in Iterative Agent Self-Distillation

HF Daily2609.39306

Shengjie Jin, Hengbo Xu, Zelong Sun2026-09-30

무엇인가

LLM 에이전트가 배포를 반복하면서 스스로를 개선하는 재귀적 자기개선(RSI) 경로에서, 반복 자기증류는 훈련 중에만 주어지는 특권 정보(PI)에 조건화된 교사의 행동을 학생 모델의 파라미터로 옮기는 방법이다. OEL은 배포 중 경험 수집과 오프라인 자기증류를 교대로 반복한다. 그런데 저자들이 SDPO와 OEL로 실험한 결과, 사이클이 반복될수록 배포 성능이 붕괴했고, 같은 과제와 같은 PI를 고정해 두고 측정한 PI 조건부 성공률도 함께 떨어졌다(그림 1). 반복 자기증류가 지속적 향상을 보장하지 않는다는 뜻이다.

어떻게 동작하나

저자들은 두 질문으로 원인을 좁힌다. 첫째, 어떤 상호작용 스텝을 증류에 우선해야 하는가. PI가 교사의 예측을 가장 크게 바꾸는 스텝이 PI 조건부 행동을 옮기는 데 특히 유용한 감독을 준다는 가설을 세우고, 이를 PI 민감도로 정량화한다. 같은 스텝에서 PI가 있을 때와 없을 때의 교사 출력 분포 사이 Jensen-Shannon divergence를 토큰 평균한 값이다. 둘째, 학생이 다음 사이클의 교사가 되면 무슨 일이 일어나는가. 갱신된 모델은 배포 시 PI 없이 행동하는 역할과 다음 사이클에서 PI 조건부 감독을 제공하는 역할을 겸하는데, 기본 목적함수(식 2)는 PI 없는 쪽만 훈련하고 PI 조건부 행동을 명시적으로 보존하지 않는다. 실제로 SDPO와 OEL 모두 사이클이 갈수록 PI 조건부 성공률이 하락했다.

무엇과 다른가

ReSAIL은 이 두 문제를 겨냥한 플러그인 증강이다. 첫 모듈 TBSD(Trajectory-Balanced Selective Distillation)는 SGS(Sensitivity-Guided Selection)로 배치 전체에서 교사의 PI 민감도가 가장 높은 상위 ρ 비율의 스텝만 남긴다(선택 개수 K_ρ = ceil(ρ|U|)). 이어 TLB(Trajectory Loss Balancing)로 선택된 스텝의 손실을 궤적별로 먼저 평균 낸 뒤 배치 크기로 나눠, 선택 스텝이 많은 궤적이 총 가중치를 독식하지 않게 만든다. 선택 스텝을 가진 각 궤적은 1/|B|의 총 손실 계수를 받고 나머지는 0을 기여한다.

어떻게 쓰나

둘째 모듈 PR(Privileged Retention)은 학생의 특권 뷰 출력 분포를 동결된 교사의 특권 뷰 분포 쪽으로 KL 정규화한다. 선택된 스텝뿐 아니라 선택되지 않은 스텝까지 U 전체를 대상으로 하며, TBSD와 같은 궤적 단위 축약을 쓴다. 최종 목적함수는 L = L_sel + λ·L_ret (λ ≥ 0)이고, 매 업데이트마다 교사의 민감도 점수와 선택 집합을 다시 계산하되 역전파 동안에는 고정한다.

전제와 한계

실험은 ALFWorld(ID/OOD)와 TextCraft, 그리고 AITZ에서 이뤄졌다. 텍스트 과제에는 Qwen3-4B와 Qwen3-8B를 thinking 모드 비활성으로, AITZ에는 Qwen3-VL-4B-Instruct를 썼다. 베이스라인은 ReAct, RFT, offline GRPO, EPD, offline SDPO, OEL이다. 텍스트 과제는 30 업데이트씩 3 사이클을 돌린다. 결과적으로 SDPO+ReSAIL은 최종 사이클 성공률을 부모 방법 대비 7.0~26.1%p, OEL+ReSAIL은 20.3~37.0%p 끌어올렸고, 6개 모델-벤치마크 설정에서 평균 절대 이득 22.5%p를 기록했다. ALFWorld OOD의 Qwen3-8B에서 SDPO+ReSAIL은 75.3%, OEL+ReSAIL은 78.4%로 RFT 63.8%, GRPO 62.2%, EPD 46.6%를 앞선다. 또 OEL은 6개 설정 전부에서 1사이클 성능보다 낮게 끝났고 SDPO는 5개 설정에서 그랬는데, ReSAIL을 붙인 쪽은 모든 사이클에서 부모를 앞서고 세 사이클 내내 평균 성공률이 비감소했다. 부모 대비 격차는 1사이클에서 3사이클로 가면서 SDPO가 6.8%p에서 18.3%p로, OEL이 5.0%p에서 26.6%p로 커진다.

절제 실험은 두 모듈의 역할이 시계열적으로 다르다는 것을 보여준다. SGS만으로도 1사이클 성능이 OEL 대비 ID +11.5%p, OOD +14.4%p로 가장 좋았지만, TLB를 더한 TBSD 구성도 1사이클보다 낮게 끝난다. PR을 추가해야 2·3 사이클에서 최고 성능이 나오며, 3사이클에서 TBSD를 17.7%p와 21.6%p 앞선다. PR 단독 대비로도 9.9%p와 13.3%p 우수하다. 같은 ρ=0.05에서 무작위 선택 대비 상위 선택은 1사이클 성공률을 12.5%p와 11.5%p 올렸고 하위 선택은 무작위보다 나빴다. 보존 방식 비교에서는 특권 뷰 보존이 3사이클에서 ID 74.2%, OOD 67.2%로 최고였다. PI 조건부 성공률은 보존이 없으면 61.5%에서 44.8%로 떨어지지만 PR을 쓰면 58.9%에서 70.3%로 오른다. 기본 하이퍼파라미터는 ρ=0.05, λ=0.5이며, 상위 1%·5%·25% 선택이 전부 ρ=1(전체 사용)보다 나았고 λ는 0에서 0.5까지 올릴 때 좋아지다 1에서 떨어진다. 비용 측면에서 SGS는 학생 최적화 비용을 약 74% 줄이고 전체 학습 루프 비용을 4.33에서 4.08 GPU-hours로(약 6%) 낮추면서 1사이클 성능을 올린다. TLB 추가는 4.17, 전체 ReSAIL은 5.32 GPU-hours로 OEL의 1.23배다. AITZ에서는 SGS를 오프라인 데이터 필터로만 적용해 전역 상위 80% 스텝을 훈련 전에 고정했을 때 OEL+SGS가 65.95%로 OEL 64.89%보다 1.06%p 높았다.

개발자 관점에서 이 논문이 직접 쓸모 있는 지점은 배포 환경을 훈련 중 다시 방문할 수 없고, 이미 수집된 배포 궤적만으로 반복 자기증류를 돌리는 파이프라인이다. ReSAIL은 SDPO나 OEL 위에 얹는 플러그인 형태라 기존 학습 루프를 크게 바꾸지 않고 두 가지를 추가할 수 있다. 하나는 교사의 두 뷰(일반 뷰·특권 뷰) 출력 분포 차이로 스텝을 점수화해 상위 일부만 증류에 쓰는 것, 다른 하나는 학생의 특권 뷰를 동결 교사 쪽으로 정규화해 다음 사이클의 감독 품질을 유지하는 것이다. 운영 시에는 배포 성공률만 모니터링하면 붕괴를 놓칠 수 있으므로 PI 조건부 성공률을 별도로 추적해야 하고, 민감도 점수 계산을 위한 교사 두 뷰 forward 비용과 ρ·λ 민감도를 자기 워크로드에서 확인해야 한다. 전체 구성은 OEL 대비 학습 비용이 1.23배로 늘어나므로, 선택만 적용하는 저비용 개선과 보존까지 포함하는 완전 구성 중 어느 쪽이 필요한지 먼저 판단하는 편이 좋다.

저자들이 밝힌 전제와 한계도 분명하다. 훈련은 추가 환경 상호작용 없이 고정된 데이터셋으로만 수행되며, 저자들은 배포 환경을 훈련 중 재방문할 수 없는 더 제한적인 설정을 다룬다고 명시한다. 교사 궤적을 추가로 수집해야 하는 Chen et al. (2026a)의 접근과 대비되는 지점이다. PI는 훈련 중에만 쓰이고 배포 시 정책 입력에서는 제외된다. 또한 완전한 ReSAIL 구성은 OEL의 1.23배 학습 비용을 요구하며, AITZ에서의 SGS 효과는 1.06%p로 텍스트 과제에서의 이득에 비해 작다.