토크나이저가 다른 증류에서 넓은 정렬보다 믿을 만한 감독이 낫다
Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability
무엇인가
온폴리시 증류(OPD)는 학생 모델이 스스로 생성한 응답에 교사 모델의 피드백을 붙여 학습하는 방식이다. 문제는 교사와 학생의 토크나이저가 다를 때 발생한다. 같은 텍스트가 서로 다른 토큰 경계로 쪼개지고, 다음 토큰 분포가 서로 다른 어휘 집합 위에 정의된다. 그래서 토크나이저 교차 OPD는 시퀀스 수준 정렬과 어휘 수준 정렬을 동시에 맞춰야 한다. 최근 연구들은 순위 기반 분포 매칭, 학습된 매핑, 바이트 수준 인터페이스, 다중 토큰 스팬 그룹화 등으로 이 정렬 범위(coverage)를 넓혀 왔다. 이 논문은 그 확장이 실제 학습에 값을 하는지, 그리고 엄격한 1대1 정렬만으로도 쓸 만한 감독이 얼마나 남는지를 묻는다.
어떻게 동작하나
제안 방법은 먼저 응답을 두 토크나이저로 각각 토큰화하고, 양쪽이 공유하는 경계로 구간을 나눈다. 각 구간에서 학생 토큰 그룹과 교사 토큰 그룹을 짝지으면, 양쪽 모두 토큰이 하나뿐인 구간이 strict 1대1 그룹이고 나머지가 mismatch 그룹이다. strict 위치에서는 두 모델의 분포를 공유 어휘 위로 제한하고 재정규화한 뒤 reverse KL을 적용한다. 여기에 더해 mismatch 그룹의 관측 토큰 경로 확률에 로그 확률 MSE 손실을 걸고 가중치 λ로 조절한다. λ가 양수이면 구조적 감독 커버리지가 100%가 되므로, 커버리지를 완전히 채우는 것이 이득인지 직접 시험할 수 있다. 또 하나의 축은 공유 어휘 전체 대신 학생 분포 기준 top-k 부분집합으로 KL의 지원(support)을 좁히는 것이다.
무엇과 다른가
실험은 세 개의 이종 교사-학생 쌍에서 이뤄졌다. Qwen2.5-7B-Instruct에서 Llama-3.2-3B-Instruct로, Granite-4.1-8B에서 Phi-4-mini-instruct로, Granite-4.1-8B에서 Qwen2.5-7B-Base로 가는 조합이다. 학습 데이터는 DAPO-Math-17K의 수학 프롬프트 1만 개와 CodeForces 코드 프롬프트 1만 개를 합친 2만 개다. 평가는 MATH500, GSM8K, AIME-2024/2025/2026, AMC23, Minerva-Math(수학은 문제당 32개 샘플 mean@32)와 HumanEval, MBPP, LiveCodeBench(코드는 mean@8)에서 이뤄졌다. 핵심 관찰은 정적 어휘 Jaccard 겹침이 39.49~64.87%에 불과한데도, 학생이 생성한 토큰의 85.57~96.98%, 교사 토큰의 82.82~97.26%가 strict 1대1 그룹에 속한다는 것이다. 런당 5만 1,200개 응답을 모아 측정했고, 학습 구간을 세 창으로 나눠도 학생 커버리지 변동은 최대 1.43%포인트, 교사는 3.75%포인트에 그쳤다.
어떻게 쓰나
커버리지를 완전히 채우는 것이 정말 이득인지는 λ 스윕으로 확인했다. λ를 0, 0.25, 0.5, 0.75, 1.0, 1.25, 1.5로 바꿔 세 쌍에 적용한 결과, 양수 가중치를 준 18개 설정 전부가 각자의 strict 기준선보다 full 평균 정확도가 0.27~1.20%포인트 낮았다. 세 쌍 모두 λ=0에서 최고 수학·코드 평균을 기록했고, λ가 커질수록 정확도가 완만히 내려가는 추세가 나타났다. 즉 스팬 로그 확률 MSE로 감독을 100%까지 채우면 오히려 성능이 떨어진다.
전제와 한계
그렇다면 남은 감독을 얼마나 좁혀도 되는지가 문제다. 증류 전 학생이 생성한 응답에서 측정하면, 공유 어휘 전체가 교사 확률 질량의 99.69~99.90%, 학생 질량의 98.99~99.81%를 담고 있었다. 학생 분포만 보고 고른 top-16 부분집합도 교사 질량 93.54% 이상, 학생 질량 94.55% 이상을 유지했다. 부분집합을 16개에서 128개로 늘려도 교사 기준 최대 3.44%포인트, 학생 기준 2.70%포인트밖에 늘지 않았다. 실제 학습에서도 top-16은 미증류 학생 대비 strict full이 얻은 full 평균 개선폭의 96% 이상을 그대로 유지했다. ULD, Extended ULD, GOLD, SimCT 네 베이스라인과 비교하면 세 쌍 모두에서 strict full과 두 축소 변형이 수학·full 평균에서 앞섰고, top-16은 가장 강한 대안보다 full 평균이 0.51~1.05%포인트 높았다. 235B 교사에서 8B 학생으로 가는 추가 실험과 ALFWorld 과제에서도 top-16이 평가된 증류 방법 중 최고 점수를 냈다.
왜 스팬 감독이 해로운지는 그래디언트 진단으로 설명한다. strict 손실만으로 학습한 체크포인트(스텝 0, 20, 60, 100)에서 두 손실의 그래디언트 코사인을 재보면, Qwen→Llama와 Granite→Phi에서는 거의 0에 가깝고 Granite→Qwen은 초반에 음의 일치를 보이다가 0으로 접근한다. 같은 목적함수 안에서 strict 손실에 기여하는 위치를 둘로 쪼갠 대조군 코사인은 학습이 진행되며 낮아지긴 해도 모든 체크포인트에서 이 값보다 항상 높았다. 게다가 스팬 대 strict 그래디언트 노름 비율은 세 쌍 모두 측정 구간에서 계속 커졌다. 방향은 어긋나는데 크기는 커지는 신호가 고정 가중치로 더해지니, 정확도 하락이 설명된다는 것이 저자들의 해석이다.
개발자 관점에서 이 논문이 주는 실무 지침은 두 가지다. 첫째, 토크나이저가 다른 모델로 증류할 때 정적 어휘 겹침만 보고 감독 커버리지를 걱정할 필요가 없다. 실제 학생 궤적에서는 strict 1대1 정렬이 대부분의 위치를 덮고, 공유 어휘가 확률 질량의 거의 전부를 담는다. 둘째, 공유 어휘 전체를 쓰는 대신 학생 분포 기준 top-16 정도로 지원을 좁히면 계산 비용을 줄이면서 성능 손실 없이, 오히려 기존 교차 토크나이저 베이스라인보다 나은 결과를 얻을 수 있다. 반대로 mismatch 구간을 스팬 손실로 억지로 메우는 선택은 피하는 편이 좋다. 다만 top-k를 쓸 때는 반드시 학생 분포로 후보를 고르고, 그 부분집합이 교사 질량도 함께 담는지 확률 질량을 측정해 확인해야 한다.
저자들이 밝힌 전제와 한계도 분명하다. 실험은 세 쌍의 모델 조합과 수학·코드 두 도메인에 한정되며, 비교한 교차 토크나이저 베이스라인들은 모두 KDFlow 프레임워크 위에 구현돼 그 구현 방식에 결과가 의존한다. 그래디언트 진단은 상관관계 수준의 설명이며, 스팬 감독이 정확도를 떨어뜨리는 인과 기제를 증명한 것은 아니다. 또한 저자들은 사용한 데이터셋이 공식 출처에서 익명화된 것이지만 사회적으로 유해한 표현이 전혀 없다고 보장할 수는 없다고 명시했다. 논문은 결론에서 정렬 커버리지 극대화에서 감독 신뢰성(supervision reliability) 우선으로 관점을 옮기자고 제안한다.