작은 어드바이저가 실행을 바꾸는 교정만 골라 학습해 프런티어 LLM을 개선한다
AdviSD: Learning to Advise Frontier LLMs via Targeted Multi-Turn Self-Distillation
무엇인가
프런티어 언어모델은 보통 API로만 제공되어 사용자가 가중치를 바꿀 수 없다. 이때 작은 학습 가능 어드바이저가 상호작용을 관찰하고, 고정된 실행자(executor)가 다음에 무엇을 해야 할지 자연어 조언으로 외부에서 유도한다. 어드바이저는 완료된 에피소드의 보상으로 강화학습할 수 있지만, 에피소드 보상은 어느 결정이 달라야 했는지, 어떻게 달라야 했는지를 알려주지 않는다. 완료된 상호작용에는 실행자 응답, 도구 결과, 과제 검사 같은 더 구체적인 증거가 남아 있고, 이를 조건으로 한 자기증류가 개별 조언 결정을 감독할 수 있다. 문제는 어드바이저의 조언이 다른 모델을 통해 작동한다는 점이다. 그럴듯한 교정이라도 실행자의 행동을 바꾸지 않을 수 있는데, 그런 교정에서 학습해도 공유 파라미터를 통해 다른 맥락의 조언 결정에 영향을 준다.
어떻게 동작하나
논문은 먼저 교사 적합과 실행 개선이 다르다는 것을 정리한다. Lemma 1은 역KL 하강이 값 기울기 참조 분포를 향하면 α∇J_h를 따르지만 실제 피드백 조건 교사를 향하면 α∇J_h − e_h를 따른다는 것을 보이며, 잔차 e_h가 값 상승을 강화할 수도 반대할 수도 있다고 말한다. 조언이 실행에 영향을 주지 않는 둔감한 prefix에서는 ∇J_h = 0이라 토큰 확률을 바꿔도 국소 목적함수는 개선되지 않지만, 교사 적합은 공유 파라미터를 통해 다른 곳의 조언을 바꿀 수 있다. 이어서 민감한 상황과 둔감한 상황이 하나의 log-odds 파라미터 θ를 공유하는 단순화 모델에서, 유지된 교정의 혼합이 학습 한계를 정한다는 것을 보인다. 그래디언트는 g(θ) = B(θ)p(1−p)[θ − μ(θ)]로, B는 감독이 주어지는 노출 빈도, μ는 유지된 교사 목표의 평균이다. 학습은 θ* = μ(θ*) ∈ (ℓ_I, ℓ_S)에서 멈추며, 둔감한 교정을 민감한 교정보다 덜 남기면(r_I/r_S 감소) θ*와 기대 성공 J(θ*)가 모두 증가한다. 반대로 두 유형을 같은 비율로 희석하면 한계는 변하지 않는다. 보상학습을 함께 쓰는 경우에도 선택적 유지가 더 높은 균형에 도달한다는 정리(Theorem 2)가 따라오고, 무작위로 같은 비율만 버리는 것은 증류만 쓸 때 한계를 바꾸지 않는다는 따름정리(Corollary 1)가 matched-count 무작위 대조군의 필요성을 만든다.
무엇과 다른가
AdviSD는 교정을 제안하는 단계와 어디서 학습할지 고르는 단계를 분리한다. 반성(reflection) 단계에서 반사기는 실행자 응답, 도구 결과, 검사를 보고 에피소드당 최대 5개(b_refl = 5)의 조언 결정에 교정 피드백을 붙인다. 선택 단계는 기록된 실행자 응답 y_k를 두 문맥에서 채점한다. C+는 발행한 조언을 포함하고 C−는 포함하지 않으며, 둘 다 어드바이저 문맥이 아니라 실행자에게 보낸 요청에서 구성된다. 사전 업데이트 어드바이저가 같은 응답의 각 토큰 로그확률을 두 문맥에서 계산하고 그 차이의 평균 c_k를 구한다. |c_k|가 크다는 것은 발행한 조언이 기록된 응답에 대한 예측을 크게 바꿨다는 뜻이며, 이 값을 감독할 결정을 고르는 신호로 쓴다. 실행자 우도나 추가 실행자 롤아웃이 필요 없다. 임계값은 학습 전 파일럿 롤아웃에서 다른 과제의 조언(donor advice)을 끼워 넣어 만든 대조 크기 분포의 0.95 분위수로 정하고 학습 중 고정한다. 원래 무조언(abstention) 결정은 조언이 없어 두 문맥이 같으므로 c_k = 0이 되어 채점을 우회해 포함시키는데, 반성이 놓친 조언을 표시한 경우를 살리기 위해서다. 선택된 결정에서는 국소 실행 증거, 관련 검사, 에피소드 점수, 반성 피드백을 앞에 붙인 사전 업데이트 어드바이저가 교사가 되고, 원래 문맥만 보는 학생이 원래 샘플링된 조언 토큰 위에서 역KL로 교사를 맞춘다. 두 분포는 사전 업데이트 학생의 top-K 토큰으로 재정규화하고, GRPO 이점은 그대로 둔 채 λ_s로 가중해 기본 손실에 더한다. 반성과 채점은 학습에만 쓰이고, 배포 시 어드바이저는 매 실행자 턴 전에 조언할지 무조언할지 결정한다.
어떻게 쓰나
실험은 Qwen3-8B 어드바이저를 Gemini 3.7 Flash와 Claude Sonnet 4.6 두 고정 실행자에 대해 BFCL-v3와 EnvScaler에서 각각 학습한다. 테스트 세트는 BFCL 320개 과제(4개 범주 각 80개)와 EnvScaler 200개 과제로 고정했고, 학습 방법마다 독립 학습 3회를 돌려 검증에서 고른 체크포인트를 테스트에서 4번 평가해 평균한 값을 보고한다. AdviSD는 advisor-GRPO보다 BFCL-v3에서 4.2~6.4%p, EnvScaler에서 3.9~5.1점 높았고, 두 실행자 모두에서 최고 집계를 기록했다. 학습하지 않은 Qwen3-8B 조언은 standalone 실행보다 네 범주 평균을 모두 떨어뜨렸지만, AdviSD 학습 후에는 Claude 실행자의 Missing Parameter를 제외한 모든 비교에서 프런티어 어드바이저를 앞섰다. 선택 규칙의 가치를 확인하는 절제 실험에서 AdviSD는 matched-count 무작위 선택보다 2.5~4.9점, no gating보다 3.2~5.1점 높았고, 두 대조군끼리의 차이는 최대 0.9점에 그쳤다. 낮은 대조값을 우선하는 역게이트는 두 벤치마크 모두에서 GRPO보다 낮았다. 무조언 우회를 제거하면 0.6~1.7점 떨어졌다. 성공한 형제 롤아웃을 피드백으로 쓰는 SDPO·DistIL 변형은 집계에서 GRPO보다 뒤졌는데, 저자들은 이를 궤적 수준 피드백이 다중 턴 상호작용 내내 똑같이 유용하지는 않다는 근거로 해석한다.
전제와 한계
재학습 없이 ACEBench, ToolHop, τ²-bench, RoTBench로 전이한 결과도 보고된다. AdviSD는 두 실행자 모두에서 4개 벤치마크 매크로 평균 1위이며, standalone 실행보다 Gemini에서 2.7점, Claude에서 3.6점 높은 반면 GRPO의 격차는 1점 미만이다. 18개 비교 중 17개에서 단독 또는 공동 최고 평균을 냈다. 반면 BFCL에 최적화한 GEPA 프롬프트는 평가된 모든 구성요소에서 standalone 실행 아래로 떨어졌다. 예외도 있다. Claude의 ACEBench 다단계 과제에서 AdviSD는 standalone과 GRPO에 1.7%p 뒤졌고, τ²-bench telecom에서 학습 전 Gemini 어드바이저는 standalone보다 7.9%p 낮았지만 AdviSD는 소폭 앞섰다. 실행자 버전과 모델 패밀리를 바꿔도 AdviSD가 4개 전이 비교 모두에서 앞서고 전이된 GRPO보다 3.1%p 높았지만, 실행자 전용으로 학습한 점수보다는 낮아 전이가 전용 학습을 대체하지는 못한다. BFCL-v3 검증에서 AdviSD는 업데이트 20 시점부터 앞서기 시작해 후반에는 GRPO를 약 4%p 앞선다.
실무 관점에서 이 논문은 API로만 접근하는 프런티어 모델을 파인튜닝 없이 개선하려는 에이전트 파이프라인에 직접 적용된다. 핵심 메시지는 학습량을 줄이는 것과 학습할 교정을 고르는 것이 다르다는 점이다. 무작위로 감독을 줄인 대조군이 AdviSD의 이득을 회복하지 못했고, 낮은 대조값을 우선하면 보상학습만도 못했다. 선택 신호가 기록된 실행자 응답만으로 계산되어 실행자 우도나 추가 롤아웃이 필요 없다는 점도 비용 면에서 유리하다. 다만 임계값 캘리브레이션을 위해 학습 과제 파일럿 롤아웃과 다른 과제의 조언이 필요하고, 실행자별 학습이 전이보다 낫다는 결과는 실행자마다 별도 학습 비용을 감수해야 함을 뜻한다.
한계도 분명하다. 이론은 교사 선호와 실행자 행동이 학습 중 고정되고 성공확률이 0과 1 사이인 단순화된 두 교사 모델에 기반하며, AdviSD가 실제로 쓰는 것은 이론의 유형 기반 유지가 아니라 예측 대조 크기라는 관측 가능한 대리 신호다. 무게이팅보다 낫다는 사실만으로 특정 교정을 고르는 것이 도움이 된다는 증명이 되지는 않아서 저자들은 matched-count 무작위 대조군을 둔다. 전이 실험에서도 실행자 전용 학습을 대체하지 못하고, 일부 벤치마크 구성요소에서는 standalone이나 GRPO보다 낮다. 저자들은 부록 E에서 이론적 범위, 예측 점수의 성격, 평가 한계를 논의한다고 밝히고 있다.