온폴리시 증류는 새 특징을 만드는 대신 기존 특징을 재가중한다
Understanding On-Policy Distillation: A Mechanistic Interpretability Perspective via Sparse Crosscoders
무엇인가
온폴리시 증류(OPD)는 추론 모델의 사후 학습 표준 기법으로 자리 잡았다. Qwen3, MiMo-V2-Flash, GLM-5, Kimi K3 같은 모델들이 채택했고, 더 강한 교사 모델의 지식을 학생에게 전달한다고 흔히 믿어진다. 그런데 근거는 엇갈린다. OPD가 학생을 개선하지 못하거나 오히려 성능을 떨어뜨리는 경우가 있고, 주로 샘플링 효율을 높일 뿐 학생의 능력 경계를 확장하지는 못한다는 관측도 있다. 기존 분석은 토큰 확률, 정확도, 학습 신호 같은 학생의 출력만 봤기 때문에 내부 표현에서 무엇이 바뀌는지는 드러나지 않았다. 이 논문은 그 질문을 학생의 내부 표현에서 직접 다룬다.
어떻게 동작하나
도구는 희소 크로스코더다. 여러 모델의 활성값을 하나의 특징 사전으로 함께 인코딩하고, 각 모델은 자기 디코더로 복원한다. 특징 하나는 토큰마다 하나의 활성값을 갖지만 모델마다 별도의 디코더 방향을 갖기 때문에, 어떤 특징이 어느 모델에 속하는지를 디코더 노름 비중으로 측정할 수 있다. 이것이 모델 귀속 점수(MAS)다. 모델 M개가 똑같이 쓰는 특징은 각 모델에서 1/M의 값을 갖고, 한 모델의 MAS가 0.5를 넘으면 그 모델이 특징을 지배한다고 본다. 문제는 표준 크로스코더 분석이 모델별 특징은 찾아내도, 한 모델이 자기 특징을 어떻게 쓰는지가 훈련으로 어떻게 바뀌는지는 알려주지 못한다는 점이다. 세 모델이 하나의 활성값 집합으로 인코딩되기 때문이다. 디코더 귀속은 특징 방향이 거의 겹치는 OPD 전후 학생을 구분하지 못하고, 학생 슬롯 하나만 비워 읽는 방식도 신뢰할 수 없다. 두 학생의 활성값 차이는 노름의 7~12%에 불과해서, 훈련이 두 인코더의 합은 정해도 차이는 무작위 초기화 근처에 머물기 때문이다.
무엇과 다른가
그래서 제안하는 것이 스왑 리드아웃이다. 어떤 체크포인트를 읽을 때 그 활성값을 학생 슬롯 두 곳에 모두 넣고 교사 슬롯은 고정한다. 학생 활성값은 훈련 전 학생의 평균 노름으로 다시 스케일하는데, 추론 임계값이 잔차 스트림의 크기에 민감하기 때문이다. 두 학생 슬롯에 같은 값이 들어가면 정해지지 않던 인코더 차이가 상쇄되고, 크로스코더는 사실상 그 학생의 희소 오토인코더처럼 동작한다. 인코더는 두 학생 인코더의 합이 되고, 편향은 토큰마다 교사가 정해준다. 어떤 특징이 발화하면 그것은 학생 디코더가 그 체크포인트의 활성값을 복원하는 데 쓰는 특징, 즉 그 체크포인트가 실제로 사용하는 특징이다. 같은 입력에 대해 훈련 전후를 읽으면 특징마다 네 가지 결과가 나온다. 둘 다에서 발화하지 않거나, 둘 다에서 발화하되 세기가 다르거나, 발화를 시작하거나, 멈추는 경우다. 이 리드아웃은 크로스코더가 한 번도 본 적 없는 체크포인트도 훈련된 것만큼 잘 복원한다. 특징 통계는 모든 모델에 대해 같은 300만 개 홀드아웃 토큰에서 계산한다.
어떻게 쓰나
실험은 세 가지 OPD 설정이다. 학생은 모두 DeepSeek-R1-Distill-Qwen-1.5B이고, 교사는 JustRL-DeepSeek-1.5B, Skywork-OR1-Math-7B, DeepSeek-R1-Distill-Qwen-7B다. DAPO-Math-17k로 같은 하이퍼파라미터의 바닐라 OPD 레시피를 적용하고, AIME 2024, AIME 2025, AMC 2023에서 평가한다. 결과는 일관된다. 세 설정 모두 OPD 학생이 지배하는 특징이 하나도 없고 MAS 분포가 기저 학생과 겹친다. 훈련 전에 10번 이상 발화한 특징이 훈련 후 사라지거나 그 반대인 경우도 없다. 자주 쓰이는 특징의 98.2%, 99.6%, 99.4%가 발화율이 20% 안쪽에서만 변한다. 교사 고유 특징도 넘어오지 않는다. JustRL 교사는 지배하는 특징이 없고, Skywork와 R1-7B 교사는 각각 42개와 30개를 지배한다. 만약 OPD가 이 특징을 전달했다면 학생의 MAS가 올라가야 하는데, 두 설정 모두 훈련 전후 모두 0.19로 같고 어떤 특징도 MAS가 0.015 이상 변하지 않는다.
전제와 한계
그럼 무엇이 바뀌는가. OPD가 학생을 가장 많이 바꾸는 지점의 특징들은 Wait, Hmm, So 같은 단어에서 발화한다. 추론 흔적이 다음 행동을 결정하는 자리다. JustRL에서 Wait 특징은 OPD 후 35% 덜 발화하고, So/Therefore 특징은 35% 덜, maybe/perhaps 특징은 42% 더 발화한다. 교사에서도 각각 34% 덜, 36% 덜, 52% 더로 같은 방향이다. 이런 결정 토큰 특징은 전체 특징의 0.4%에 불과하지만 발화율 변화가 가장 큰 50개 중 JustRL에서 12%, Skywork에서 4%를 차지한다. R1-7B에서는 상위 50개 중 하나도 결정 토큰에서 발화하지 않는다. 결정 토큰에서 학생은 평균 토큰보다 10~44% 더 많은 활성 특징을 교체하고, 교사와 학생의 다음 토큰 분포 사이 KL 발산은 평균의 3.0~3.6배(JustRL), 2.1~2.8배(Skywork), 1.5~1.7배(R1-7B)에 달한다. R1-7B에서는 OPD가 학생을 거의 움직이지 않는다. 다음 토큰 분포의 KL이 평균 0.008로 JustRL의 0.085의 10분의 1 수준이다.
OPD 앞에 흔히 붙는 SFT 워밍업에도 같은 분석을 적용한다. Simple-OPD 설정을 따라 Qwen3-1.7B-Base를 Qwen3-4B-Base-GRPO에서 증류하고, OPD 전에 교사 자신의 롤아웃으로 워밍업한다. 워밍업은 특징을 만들지 않는다. 훈련 전후 학생 두 모델 크로스코더에서 모든 특징의 NRN이 1/2 근처를 유지한다. 교사 특징도 가져오지 않는다. 교사의 NRN 평균은 워밍업 전후 모두 0.42이고, 0.8을 넘는 교사 고유 특징 수는 24개에서 25개로 거의 같다. 삼자 크로스코더에서도 교사가 지배하는 특징은 19개에서 17개로 줄 뿐이다. 대신 워밍업은 공유 특징을 재가중한다. 워밍업의 변화를 OPD의 변화에 최소제곱으로 맞추면 기울기 0.46으로, OPD 방향을 따라 절반쯤 미리 움직인다. OPD가 가장 많이 올리는 50개 특징의 88%, 가장 많이 내리는 50개의 92%가 워밍업에서도 같은 방향으로 움직인다. OPD가 올리는 50개는 워밍업이 9.3% 올리고 OPD가 17.3% 올리며, 워밍업 후 OPD가 4.5%포인트를 더한다. 내리는 쪽은 워밍업 11.1%, OPD 20.6%, 추가 7.2%포인트다. 워밍업 변화를 무작위 방향으로 회전시키면 이런 정렬이 사라진다(기울기 -0.03). 워밍업 변화의 절반 이상(제곱 노름의 56%, 웹 텍스트의 깨진 문자에서 발화하는 특징 하나를 포함하면 77%)은 OPD 방향 밖에 있고, 이 부분은 이후 OPD를 거쳐도 남는다(특징 간 스피어만 0.69, 무작위 회전은 0.00). 여기에는 대화 형식, 추론 스타일, 수학 표기법 관련 특징들이 포함된다. 워밍업 후 OPD를 하면 교사 이점의 46%를 회복하지만 직접 OPD는 30%에 그친다.
이 재가중이 워밍업 이득의 원인인지 직접 개입으로 확인한다. 가중치는 건드리지 않고, 워밍업 전후 학생의 스왑 코드 차이를 크로스코더 학생 디코더로 복원해 직접 증류 학생의 잔차 스트림에 더하거나, 워밍업 후 증류 학생에서 뺀다. 더하면 직접 증류 학생의 avg@8이 18.6%에서 21.3%로 올라 워밍업 학생의 21.9%에 근접하고, 빼면 워밍업 학생이 19.2%로 떨어져 직접 OPD 수준에 가까워진다. 변화량은 각각 +2.7%포인트와 -2.7%포인트이고 95% 부트스트랩 구간이 0을 포함하지 않는다. 특징 정체성을 뒤섞은 대조군은 재가중을 거의 그대로 두면서도 직접 증류 학생을 돕지도, 워밍업 학생을 해치지도 않는다. 이득은 어떤 공유 특징이 재가중되는지에 달려 있다.
개발자 관점에서 이 결과는 OPD를 쓸 때 기대치를 조정하게 한다. OPD가 학생이 이미 교사와 공유하는 특징을 재가중하는 것이라면, 샘플링 효율은 좋아져도 능력 경계는 넓어지지 않고, 학생과 교사의 사고 패턴이 호환될 때만 작동한다는 행동 수준 관측이 설명된다. 실무에서는 교사-학생 조합의 호환성과 워밍업 여부를 먼저 점검하고, Wait나 So 같은 결정 토큰에서 분포가 얼마나 어긋나는지를 보는 것이 유용하다. 논문이 밝힌 전제와 한계도 분명하다. 워밍업에 대한 결론은 OPD가 훈련할 바로 그 과제, 같은 문제의 수학 추론에서 그 교사의 롤아웃을 모방하는 워밍업에 한정되며, 별도의 더 강한 모델이 쓴 해답으로 SFT하는 일반적인 경우와는 다르다. 실제로 Shi 등(2026)의 SFT는 새 특징을 도입했지만 이 워밍업은 그렇지 않았다. 분석은 중간 층의 잔차 스트림 활성값, 추론 텍스트와 일반 텍스트를 섞은 데이터로 훈련한 크로스코더에 기반한다는 점도 전제다.