EOS 토큰 불일치가 온폴리시 증류의 응답 길이 팽창을 만든다

When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation

HF Daily2609.20511

Yuxiao Yang, Tianrun Yu, Shangzhe Li2026-09-17조회 4

무엇인가

이 논문은 온폴리시 증류(OPD)에서 학생 응답이 지나치게 길어지고 생성 예산을 소진하는 길이 팽창 문제를 다룬다. OPD는 학생이 스스로 생성한 롤아웃에 대해 교사가 토큰 수준의 조밀한 감독을 주는 방식으로, 강한 포스트트레이닝 모델의 행동을 더 작은 모델로 옮기는 데 쓰인다. 저자들은 Qwen3, Llama, Gemma의 base student와 post-trained teacher 조합에서 같은 현상을 관찰하고, 그 직접 원인 중 하나로 종료 토큰 불일치를 지목한다. 핵심은 학생과 교사가 같은 의미의 정지 결정을 서로 다른 EOS 토큰으로 표현할 수 있다는 점이다. 선언된 정지 집합이 같아도 학습된 정지 확률이 다른 토큰에 실릴 수 있다. sampled-token OPD에서는 교사가 학생이 샘플한 토큰만 평가하므로, 학생이 자기 EOS를 샘플했는데 교사가 다른 EOS를 선호하면 A_t = log π_E(y_t|s_t) - log π_θ(y_t|s_t)가 음수가 되어 학생의 종료 행동이 억제된다. 교사가 선호하는 EOS는 학생이 거의 샘플하지 않아 직접 감독을 받기 어렵다. 그 결과 학생의 종료 확률이 붕괴하고 응답 길이가 늘어난다.

어떻게 동작하나

저자들은 종료 처리 전략 네 가지를 비교한다. Fix 1은 디코딩 정지 집합만 맞추는 방식으로, 롤아웃 중 두 EOS 토큰을 모두 정지 토큰으로 등록하되 OPD 목적함수와 토큰 확률은 바꾸지 않는다. Fix 2는 교사 쪽 EOS 매핑으로, 교사가 모든 종료 동등 토큰에 둔 확률 질량을 학생이 기본 지원하는 정규 EOS 토큰 e*로 합한다. 즉 π~E(e*|s_t) = Σ_{e in E_EOS} π_E(e|s_t)로 두고 다른 EOS 확률은 수치 안정성을 위해 무시할 정도로만 남긴다. 학생 분포는 그대로 두고 롤아웃은 e*에서만 끝난다. Fix 3은 의미적 EOS 클래스로, 모든 EOS 토큰을 하나의 의미 행동 stop으로 취급한다. π_bar(stop|s_t) = Σ_{e in E_EOS} π(e|s_t)로 정의하고 비EOS 토큰은 그대로 둔다. 샘플 토큰이 EOS면 y_bar_t = stop으로 바꾸고, A_t = log π_bar^E(y_bar_t|s_t) - log π_bar_θ(y_bar_t|s_t), g_t = A_t ∇θ log π_bar_θ(y_bar_t|s_t)를 적용한다. EOS 샘플은 전체 종료 확률로 감독되고, 모든 EOS 토큰은 롤아웃에서 유효한 정지 토큰으로 등록된다. Fix 4는 정규 단일 EOS 행동 공간으로, 교사 EOS 질량을 e*로 매핑하고 학생 샘플링 분포에서 다른 EOS 토큰을 제거해 재정규화한다. 같은 재정규화 분포를 actor 로그확률 계산에 쓰고 롤아웃은 e*에서만 끝난다. 저자들은 알려진 Qwen3 불일치에는 Fix 2가 가장 단순하고, 정규 표면 토큰을 지정할 필요가 없는 Fix 3을 교차 모델 실험의 기본으로 채택한다.

무엇과 다른가

실험 설정은 다음과 같다. 주 실험은 Qwen3-1.7B-Base를 학생, Qwen3-4B non-thinking을 교사로 두고 네 가지 종료 처리 전략 전체를 비교한다. 교차 모델 검증에는 Llama-3.2-3B Base와 Instruct, Gemma-3-4B PT와 IT를 쓴다. 학습 단계별 분석에는 K2-Horizon-7B의 pretraining, midtraining, supervised fine-tuning, 최종 post-trained 체크포인트를 사용하고, 최종 체크포인트를 교사로 고정한 뒤 이전 단계들에서 학생을 초기화한다. 모든 모델은 DAPO-Math-17K로 학습한다. 기본 프롬프트는 최종 답을 boxed{}로 감싸는 TTRL 템플릿이고, 추가로 DAPO 템플릿과 문제만 주는 raw-question 템플릿을 비교한다. 지표는 평균 응답 길이, 생성 길이 예산에 도달한 응답 비율인 clipping ratio, AMC23, AIME24, AIME25에서 문제당 16개 응답을 샘플해 정확도를 평균한 Avg@16, 그리고 주어진 프리픽스에서 EOS 집합 전체의 확률 합인 총 정지 질량 qπ(h) = Σ_{e in E_EOS} π(e|h)다. 학습은 최대 1,024 프롬프트 토큰과 7,168 응답 토큰을 허용하고, 독립 체크포인트 평가는 최대 8,192 생성 토큰을 허용한다. 제공된 본문에는 Avg@16의 구체적 정확도 값이나 표의 숫자가 제시되지 않아, 성능 개선폭을 수치로 확인할 수는 없다.

어떻게 쓰나

Qwen3 진단 결과는 명확하다. vanilla OPD는 학습이 진행될수록 응답 길이와 clipping을 키우고 많은 롤아웃이 생성 예산을 소진한다. Qwen3 base 체크포인트는 <|endoftext|>를 EOS로 선언하지만, post-trained 체크포인트는 <|im_end|>도 대화 종료 토큰으로 인식한다. 같은 롤아웃 종료 프리픽스에서 base 학생은 종료 확률 대부분을 <|endoftext|>에 두고, 교사는 <|im_end|>를 선호한다. 학생은 교사가 선호하는 <|im_end|>에 터미널 상태 근처에서 약 10^-11의 매우 작은 확률만 준다. 학생의 기본 EOS 확률은 학습 초기 약 0.8에서 거의 0으로 떨어진다. Fix 1은 vanilla OPD와 거의 같은 길이와 clipping 궤적을 따라가며 실패를 제거하지 못한다. 반면 Fix 2, Fix 3, Fix 4는 확률 수준에서 종료를 정렬하고 서로 비슷하게 동작한다. 응답 길이와 clipping이 교사 참조선에 훨씬 가깝게 유지되고, 학생의 기본 종료 확률도 더 이상 붕괴하지 않는다. 이 비교는 디코딩 정지 집합을 늘리는 것만으로는 부족하고, 증류 신호에서 종료 의미를 확률 수준으로 맞춰야 한다는 점을 분리해 보여준다.

전제와 한계

교차 모델 결과에서도 의미적 EOS 보정은 Qwen3, Llama 3.2, Gemma 3 모두에서 vanilla OPD 대비 응답 길이와 clipping을 크게 줄인다. Qwen3와 Gemma 3는 각 교사 참조 길이에 비교적 가깝게 접근하고, Llama 3.2는 더 큰 잔여 격차를 남긴다. 특히 Gemma 3 PT와 IT는 이미 <eos>와 <end_of_turn>이라는 같은 정지 토큰을 선언하지만, 학생은 주로 <eos>에, 교사는 <end_of_turn>에 정지 확률을 둔다. 의미적 보정은 학생이 교사의 표면 토큰을 그대로 채택하지 않고도 안정적인 종료를 회복하게 한다. K2-Horizon 단계별 분석에서는 토큰 ID와 선언된 정지 집합이 단계마다 그대로다. pretrained 학생은 주로 <|ifm|endoftext|>를, 최종 post-trained 교사는 <|ifm|im_end|>를 선호한다. 이 선호 이동은 midtraining에서 상당 부분 일어나고 SFT 단계에서는 최종 교사와 이미 가까워진다. Pretrain-to-Final 실행에서는 학생이 교사 선호 토큰에 이미 무시할 수 없는 확률을 주기 때문에 vanilla OPD가 표면 종료 형태를 전이할 수 있다. 그러나 그 뒤에도 정지 실패가 다시 나타난다. 교사 선호 종료 형태를 학습한 뒤 종료 확률이 다시 감소하고 응답 길이가 생성 예산 쪽으로 커진다. 의미적 EOS 보정을 적용한 실행에서도 Phase 3로 표시된 후반부 재팽창이 나타나며, 종료 확률이 0에 가까워지고 거의 모든 롤아웃이 생성 예산에 도달한다. vanilla에서는 이 전환이 비교적 갑작스럽고 보정 실행에서는 더 점진적이다. 표면 종료 토큰 정체만으로는 이 후반 붕괴를 설명할 수 없다.

템플릿과 채점기 효과도 보고된다. 교차 템플릿 평가는 관측 응답 길이를 줄일 수 있고, 특히 DAPO로 학습한 모델을 TTRL 템플릿으로 평가할 때 그 효과가 가장 분명하다. OPD의 성능 이득은 심한 길이 팽창에도 유지될 수 있으며, 특히 TTRL 평가에서 그렇다. 정확도에 대한 겉보기 효과는 채점기에도 의존한다. DAPO 스타일 평가는 길고 중복된 연속 생성에 더 민감하다. 따라서 길이 팽창이 추론 능력의 상응하는 손실을 반드시 뜻하지는 않는다. 개발자 관점에서는 OPD 파이프라인에서 base student와 post-trained teacher를 붙일 때 디코딩 정지 집합만 맞추고 끝내면 안 된다. 토크나이저와 EOS 토큰, 선언된 정지 집합, 학습된 정지 확률 분포, 총 정지 질량, clipping ratio, 기본 EOS 확률을 함께 확인해야 한다. 두 모델이 다른 EOS 관례를 쓰거나 같은 정지 집합 안에서 다른 EOS를 선호하면, 교사 쪽 EOS 매핑이나 의미적 EOS 집계를 확률 수준에서 적용하는 것이 좋다. 저자들은 종료 처리 보정과 평가 프로토콜을 포함한 구현을 https://uncsciml.github.io/opd-eos-website 에 공개했다.

저자들이 밝힌 한계는 분명하다. 종료 토큰 불일치는 길이 팽창의 중요하지만 완전한 설명은 아니다. 실험은 단일 턴 수학 추론에 한정된다. 의미적 EOS 클래스의 동등성은 멀티턴이나 에이전트 설정에서 성립하지 않을 수 있다. 그런 설정에서는 특수 토큰이 메시지 완료, 어시스턴트 턴 종료, 문서 종료, 도구 호출 핸드오프를 구분할 수 있다. base-to-post-trained 페어링도 그대로 옮겨지지 않는다. 공정한 비교에는 크기가 다른 두 post-trained 모델이 필요하고 이는 상당히 다른 실험 설계다. 기능적으로 다른 이벤트를 서로 교환 가능한 정렬 대상으로 취급하면 정지 행동만 고치는 것이 아니라 상호작용 제어 흐름을 바꿀 수 있다. 프롬프트 템플릿 분석도 Qwen3에서 세 템플릿과 두 채점기로 제한되며, 교차 모델 증거가 템플릿 효과의 일반화를 입증하지는 않는다. 후반 K2-Horizon 붕괴와 모델 패밀리별 회복 동역학의 차이는 EOS 불일치로 돌리지 않고 future work로 남긴다. 또한 전체 어휘 OPD는 계산 비용 때문에 평가하지 않고 sampled-token OPD에 한정한다. 선언된 정지 집합 불일치가 없는 설정에서도 길이 팽창이 보고된 바 있어, 남은 메커니즘을 규명하는 일이 중요하다고 말한다.

관련 논문