SCOUT는 학생이 생성한 접두사에 교사를 적응시켜 온폴리시 증류를 개선한다
On the Off-Policy Teacher in On-Policy Distillation
무엇인가
온폴리시 증류(OPD)는 학생이 자기 정책으로 궤적을 생성하고, 그 위에서 더 강한 교사가 토큰 단위의 조밀한 감독을 제공하는 후학습 패러다임이다. 문제는 이 과정에 근본적 비대칭이 있다는 점이다. 샘플링된 궤적은 학생에게는 온폴리시지만 교사에게는 오프폴리시다. 교사는 보통 자기 정책이 만든 접두사에서 이어쓰도록 최적화되어 있는데, OPD에서는 학생이 만든 접두사를 감독해야 한다. 저자들은 중간 추론 단계의 차이와 오류가 누적되면서 학생 접두사가 교사 정책 아래에서는 점점 가능성이 낮은 문맥이 되고, 결국 교사의 토큰 수준 지도가 신뢰를 잃는다고 본다. 기존 연구들은 교사를 고정한 채 감독을 어디까지 쓸지, 어떤 신호를 쓸지를 조정하는 데 집중했지만, 이 논문은 교사 자체를 학생 유도 분포에 적응시키는 축을 새로 연다.
어떻게 동작하나
저자들은 먼저 이 현상을 실측한다. AIME 2025의 각 문제에 대해 학생(Qwen3-1.7B, 비사고 모드)이 4개의 완전한 응답을 생성하고, 이를 10%에서 90%까지의 접두사 비율로 잘라낸 뒤 각 접두사에서 교사(Qwen3-4B-Instruct-2507)가 4개의 독립적 연속을 샘플링해 최종 정답 정확도를 평균한다. 두 모델의 최대 응답 길이는 16,384 토큰으로, 교사가 불완전한 학생 접두사에서 회복할 생성 예산은 충분하다. 결과적으로 학생 접두사가 길어질수록 교사의 연속 정확도는 떨어졌고, 생성된 연속의 토큰 길이 통계는 길이 부족이 원인이 아님을 보여줬다. 또한 교사가 자기 접두사에 조건화됐을 때의 다음 토큰 엔트로피는 궤적이 길어질수록 감소하는 반면, 학생 접두사에 조건화됐을 때는 증가한 뒤 높게 유지되어 두 곡선 사이에 지속적인 간극이 생겼다.
무엇과 다른가
제안 방법 SCOUT(Student-COnditioned Updates of the Teacher)는 학생 쪽 OPD 업데이트는 그대로 두고, 같은 학생 궤적에서 뽑은 접두사로 교사를 주기적으로 재학습시키는 공동학습 프레임워크다. 구체적으로 분할점 k를 골라 학생 접두사 p^S = y^S_{1:k}를 정의하고, 프롬프트와 p^S에 조건화해 교사가 K개의 연속 z_i^T ~ π_φ(·|x, p^S)를 샘플링한다. 각 응답에 검증 가능한 결과 보상(verifiable outcome reward)을 부여하고 GRPO로 교사를 업데이트하되, 그래디언트는 교사가 생성한 연속 토큰에만 적용한다. 갱신된 교사는 다시 동기화되어 이후 OPD 업데이트의 감독을 맡는다. 학생 정책이 훈련 내내 변하므로 교사도 주기적으로 갱신해야 하는데, 계산 효율을 위해 OPD f스텝마다 한 번 교사를 업데이트한다. 또 긴 학생 접두사일수록 교사가 이어쓰기 어렵다는 관찰에 따라, 훈련이 진행되면서 학생 접두사 비율을 선형으로 늘려 짧은 접두사부터 시작해 점차 길고 어려운 구간에 노출시킨다.
어떻게 쓰나
실험은 수학 추론 3개 조합과 코드 생성 1개 조합에서 이뤄졌다. 수학은 Qwen3-8B-DAPO(DAPO-MATH로 GRPO 3에폭 학습) → Qwen3-1.7B, Qwen3-4B-Instruct-2507 → Qwen3-1.7B, Skywork-OR1-Math-7B → DeepSeek-R1-Distill-Qwen-1.5B이며 학습 데이터는 OpenR1-Math-46K-8192다. 코드는 Qwen3-4B-Instruct-2507 → Qwen3-1.7B에 DeepCoder의 TACO-Verified-7.5K 부분집합을 쓴다. 비교 대상은 교사를 고정한 표준 OPD, 결과 기반 GRPO, ESR(접두사 4096 절단), Prune-OPD, Relay-OPD다. 평가는 AIME 2024·2025, AMC 2023, HMMT 2025년 2월, OlympiadBench, MATH-500과 코드의 LiveCodeBench v5, HumanEval+, MBPP에서 이뤄졌고, 각 방법을 3개 시드로 독립 학습하고 벤치마크별로 4~32회 평가해 평균과 표준편차를 보고한다. SCOUT는 4B 교사에서 평균 51.4, 8B 교사에서 51.6으로 표준 OPD보다 각각 2.2점, 2.6점 높았고 두 설정 모두 6개 벤치마크에서 최고 또는 공동 최고였다. 코드 생성에서는 평균 56.6에서 59.7로 3.1점 올랐으며, Relay-OPD는 수학에서는 경쟁력이 있었지만 코드에서 12.1로 떨어졌다(생성에 문법 오류가 잦았다). Skywork/DeepSeek 조합에서는 SCOUT가 53.6으로 OPD보다 1.2점 높았고, 이 설정에서 GRPO는 학습 중 붕괴했으며 Prune-OPD는 표준 OPD보다 크게 뒤처졌다.
전제와 한계
분석은 세 갈래다. 첫째, 교사 적응이 실제로 학생 접두사 성능을 올리는가. 훈련이 진행될수록 연속 정확도 곡선이 위로 이동했고, 특히 학생 접두사를 초기 학생 것이나 이후 학생 것으로 고정해 비교해도 학습된 교사가 모든 접두사 길이에서 더 높은 정확도를 보여, 개선이 더 강해진 학생 접두사 덕분이 아니라 교사 자체의 향상임을 확인했다. 학생 접두사에 대한 교사 엔트로피도 후반 위치에서 크게 감소해 자기 응답과의 간극이 줄었다. 둘째, 이득이 단순한 추가 교사 학습이 아니라 학생 접두사 조건화에서 오는가. 원래 문제에서 시작한 롤아웃으로 같은 GRPO 목적을 적용한 OPD + Teacher GRPO 통제군은 4B 수학에서 표준 OPD보다 오히려 약간 낮았고 4B 코드와 8B 수학에서는 소폭 개선에 그쳤지만, SCOUT는 세 설정 모두에서 최고였다. 셋째, 교사 업데이트 주기 f를 1, 5, 10으로 두면 Avg@6이 각각 51.3, 52.5, 51.5로 비슷했지만 f=20으로 너무 성기면 표준 OPD 수준으로 떨어졌고, 저자들은 f=10을 기본값으로 쓴다. 같은 데이터로 OPD를 3에폭(계산량을 SCOUT 1에폭과 맞춤) 학습시켜도 OPD는 초반 이후 정체한 반면 SCOUT는 계속 개선됐다. 또한 TrOPD의 손실 수준 기법인 OPTR과 SCOUT를 결합하면 수학에서 2.5점, 코드에서 1.2점이 추가로 올라 두 접근이 상보적임을 보였다.
개발자 관점에서 이 논문이 주는 실무적 시사점은 분명하다. 온폴리시 증류 파이프라인을 돌릴 때 교사를 완전히 고정해 두면, 학생이 자기만의 추론 습관과 오류 패턴을 만들어갈수록 교사의 토큰 수준 감독 품질이 후반부에서 떨어진다. 접두사 절단이나 신뢰도 기반 마스킹 같은 기존 처방은 교사를 그대로 둔 채 감독을 덜 쓰는 방향이라 정보 손실이 따른다. SCOUT는 교사 쪽에 검증 가능한 보상이 있는 과제(수학 정답, 코드 테스트 통과)라면 비교적 단순하게 붙일 수 있는 대안을 제시한다. 다만 교사 업데이트는 별도 롤아웃과 RL 스텝을 요구하는 추가 연산이며, 검증 가능한 결과 보상이 없는 개방형 과제에는 그대로 적용하기 어렵다는 전제가 깔려 있다.
한계와 전제도 짚어둘 만하다. 저자들은 OPD를 3에폭 더 학습시킨 비교가 같은 학습 데이터를 재사용하기 때문에 새로운 데이터로 얻을 수 있는 추가 이득까지 배제하지는 못한다고 명시한다. 교사 업데이트 주기 f=20에서 이득이 사라진다는 결과는 학생이 빠르게 변하는 초반에는 교사 적응이 더 자주 필요할 수 있음을 시사한다. 또한 교사 적응은 OPD에서 신뢰할 수 없는 감독이 생기는 원인 중 하나만 다루며, 손실 수준 기법과 결합했을 때 추가 이득이 난다는 점 자체가 단일 해법이 아니라는 뜻이다. 제시된 원문에는 별도의 한계 절이 없어, 위 내용은 본문의 통제 실험과 비교 조건에서 확인되는 범위다.