파라미터 이웃 탐색으로 수학 추론 자기증류의 감독을 늘린다
Better Supervision Is Nearby: Neighborhood On-Policy Self-Distillation
무엇인가
On-policy self-distillation(OPSD)은 참조 해답을 본 특권 교사(privileged teacher)가 학생이 샘플링한 프리픽스를 감독하는 방식으로 수학 추론 모델을 학습시킨다. 이 논문이 지적하는 문제는 표준 OPSD가 모든 상태에서 하나의 고정된 파라미터 설정만 사용한다는 점이다. 저자들은 같은 참조 문맥 아래에서도 국소적 파라미터 섭동(local parameter perturbation)이 서로 상보적인, 참조에 정렬된 보정을 드러낸다고 관찰한다. 즉 감독 신호가 하나의 교사 설정에 묶여 있을 필요가 없다는 것이 출발점이다.
어떻게 동작하나
관찰의 핵심은 이런 보정이 참조 위치마다 서로 다른 전문가에게서 나온다는 것이다. 저자들에 따르면 이 전문가들의 풀은 섭동 없는 특권 교사보다 더 많은 참조 위치를 커버한다. Neighborhood OPSD(N-OPSD)는 이 보정들을 학생이 실제로 방문한 상태에서의 감독으로 전환하는 방법이다.
무엇과 다른가
오프라인 단계에서는 greedy selection으로 작고 고정된 전문가 풀(compact pool of frozen experts)을 구축한다. 각 위치에서 풀의 현재 최고 성능을 넘어서는, 필터링된 참조 토큰 이득(filtered reference-token gains)을 보상하는 방식으로 전문가를 고른다. 여기서 저자들이 강조하는 관찰이 하나 있다. 가장 높은 피크를 가진 전문가가 반드시 최선의 학습 타깃이 되지는 않는다는 것이다.
어떻게 쓰나
그래서 온라인 라우팅은 앵커 방향(anchor direction)과 그 지지 수준(level of support)을 분리한다. MaxPeak이 앵커 토큰을 선택하고, quantile selection이 top 토큰이 그 앵커와 일치하는 전문가들 중에서 선택한다. 학생은 OPSD에서 물려받은 clipped forward-KL 목적함수를 통해 선택된 전문가의 전체 다음 토큰 분포(full next-token distribution)를 학습한다.
전제와 한계
실험은 AIME 2024, AIME 2025, HMMT February 2025 세 벤치마크에서 수행됐다. 방법별로 3회 독립 실행을 했고, 세 벤치마크 평균(Average@12) 기준으로 Neighborhood OPSD는 OPSD 대비 Qwen3-1.7B에서 2.75점, 4B에서 1.67점, 8B에서 1.94점을 개선했다. 저자들은 학생 프리픽스 이어쓰기(student-prefix continuations) 실험이 전문가 풀을 선택에 사용된 참조 궤적 너머로도 쓸 수 있음을 지지한다고 밝힌다. 또한 matched ablation이 filtered reference-token gains를 선택 기준으로 쓰는 것을 뒷받침하고, 풀 내부의 중복(overlap)을 고려하고 상태별로 라우팅하면 학생 정확도가 더 올라간다고 보고한다. 추론 시에는 증류된 학생만 사용한다.
개발자 관점에서 이 논문의 실용적 함의는 교사 신호의 다양화가 별도 추론 비용 없이 학습 정확도를 올리는 수단이 될 수 있다는 점이다. 추론 단계에서는 학생 모델 하나만 배포하면 되므로 서빙 파이프라인은 그대로 두고, 학습 단계에서만 파라미터 섭동으로 만든 전문가 풀과 라우팅 로직을 추가하는 구조다. 다만 풀 구축이 오프라인 선택 절차이므로 학습 전에 참조 해답과 위치별 이득을 계산하는 비용이 들고, 라우팅 규칙(MaxPeak 앵커 선택과 quantile 기반 전문가 선택)을 자체 파이프라인에 맞게 구현·검증해야 한다. 도입 전에는 개선폭이 모델 크기별로 1.67~2.75점으로 달랐다는 점을 감안해, 자신이 쓰는 모델 크기와 벤치마크에서 같은 이득이 나오는지부터 확인하는 편이 좋다.
제공된 원문 범위에서는 저자들이 별도의 한계 절에서 밝힌 내용이 확인되지 않는다. 다만 방법 자체가 전제하는 조건은 분명하다. 전문가 풀은 참조 해답에 기반해 오프라인에서 선택되어 고정되고, 라우팅은 학생이 방문한 상태에서 이루어지므로 학습 파이프라인에 전문가 풀 유지와 라우팅 비용이 추가된다. 또한 보고된 개선폭은 세 개의 수학 경시 벤치마크와 세 가지 Qwen3 크기에서 측정된 것으로, 다른 도메인이나 다른 모델 계열로의 일반화는 이 범위에서 입증되지 않았다.