약한 모델 롤아웃으로 온폴리시 증류에 부정 신호를 넣는다
On-Policy Distillation with Negative-Policy Rollouts
무엇인가
온폴리시 증류(OPD)는 학생 모델이 스스로 생성한 롤아웃에 대해 더 강한 교사 모델로부터 토큰 단위 지도를 받는 후학습 기법이다. 토큰별 신호는 R_t = log π*(y_t|x,y<t) − log π_θ(y_t|x,y<t)로 정의되며 학생을 교사 분포 쪽으로 밀어 넣는다. 문제는 이 신호가 오직 '따라야 할 방향'만 준다는 점이다. 교사와 학생의 분포가 크게 겹치지 않으면 긍정 지도만으로는 학습 신호가 부족해진다. DPO가 거부된 응답을 함께 쓰고 그 부정 샘플을 종종 더 약한 모델에서 뽑는다는 점에 착안해, 저자들은 교사 지도를 건드리지 않고도 OPD에 부정 신호를 넣을 수 있는지 묻는다.
어떻게 동작하나
제안 방법은 Negative-Policy OPD(NP-OPD)다. 핵심은 보상식이 아니라 롤아웃 단계를 바꾸는 것이다. 각 배치에서 궤적을 학생 정책 π_θ에서 1−α 비율로, 별도의 부정 정책 π_n에서 α 비율로 샘플링한다(식 6). 부정 정책은 학생이 훈련 중 멀어져야 할 대상으로, 주 설정에서는 학생과 같은 모델 계열에서 파라미터 수가 더 작고 추론 성능이 더 낮은 모델을 쓴다. 두 롤아웃 모두에 기존 OPD의 토큰 단위 증류 신호를 그대로 적용한다(식 7). α=0이면 기존 OPD, α=1이면 부정 정책 롤아웃만 쓰는 셈이다. 보상 설계를 건드리지 않기 때문에 ExOPD, OPD² 같은 최신 OPD 변형과도 결합할 수 있다.
무엇과 다른가
논문은 이 설계가 왜 부정 신호가 되는지 수식으로 설명한다. OPD와 NP-OPD의 t번째 토큰 기여도 차이는 α[Π π_n(y_i) − Π π_θ(y_i)] R_t ∇log π_θ로 정리된다(식 10). 즉 부정 정책이 생성한 궤적의 학습 기여도가 α에 비례해 커진다. 여기에 KL(π_n‖π*) > KL(π_n‖π_θ)라는 전제를 두면, 부정 정책이 뽑은 토큰의 기대 OPD 보상은 −KL(π_n‖π*) + KL(π_n‖π_θ) < 0이 된다(식 12). 부정 정책 토큰이 평균적으로 억제된다는 뜻이다. 다만 이는 통계적 억제이며, 부정 정책이 뽑았더라도 교사가 선호하는 토큰은 여전히 강화된다. 보상 방향을 뒤집는 게 아니라 OPD의 원래 학습 역학을 보존한 채 부정 정책 쪽 토큰의 억제를 집중시키는 구조다.
어떻게 쓰나
실험은 학생 모델로 Qwen3-1.7B/4B/8B를 쓰고 thinking과 non-thinking 두 모드를 모두 다룬다. 교사는 1.7B thinking에 Qwen3-8B, 4B/8B thinking에 Qwen3-30B-A3B-Thinking, non-thinking에는 각각 Qwen3-4B-Instruct와 Qwen3-30B-A3B-Instruct를 쓴다. 부정 정책은 학생보다 작은 Qwen3-0.6B/1.7B/4B이며, Gemma-4-E4B-it 학생에 Gemma-4-12B-it 교사, Gemma-4-E2B-it 부정 정책 조합도 실험했다. 학습 데이터는 Math, Science, Code를 1:1:1로 섞은 3만 문항이고 배치 256, 학습률 5e-6, 최대 롤아웃 16k 토큰, 100 스텝이다. α는 0, 0.25, 0.5, 0.75, 1.0으로 바꿔가며 비교했다. non-thinking 모드에서 Qwen3-1.7B는 α=1.0일 때 수학 평균 48.3에서 56.3, 코드 27.2에서 31.1, 과학 37.2에서 41.5로 올랐다. Qwen3-4B는 수학 62.2에서 70.5, 코드 40.2에서 51.1, 과학 47.8에서 51.2로 개선됐고 AIME, HMMT25, LCBv5, RGAlgo에서 특히 큰 향상을 보였다. thinking 모드에서 Qwen3-1.7B는 OPD 대비 1.98점, OPD² 대비 1.76점 올랐고 ExOPD와는 비슷한 수준을 유지했다. Qwen3-4B는 OPD 1.11점, ExOPD 1.86점, OPD² 2.10점이 올랐다. Gemma-4-E4B는 수학 63.0에서 66.4, 과학 49.1에서 49.8로 좋아졌지만 코드는 54.9에서 55.2로 베이스 모델의 56.5에는 미치지 못했다.
전제와 한계
저자들은 두 지표로 메커니즘을 검증한다. NSP(negative-policy suppression precision)는 확률이 크게 줄어든 토큰 중 부정 정책이 교사보다 선호한 토큰의 비율이다. NP-OPD는 온폴리시 롤아웃만 쓴 OPD보다 NSP가 높았고, NSP는 평균 정확도와 강하게 상관했다. 학생보다 큰 롤아웃 모델(교사 포함)을 쓰면 NSP가 낮아졌고 성능도 OPD를 넘지 못했다. NOR(negative-policy overlap reduction)은 교사 상위 토큰과 부정 정책 상위 토큰의 확률 변화 차이다. NP-OPD의 평균 NOR은 0.019로 OPD의 0.005보다 컸고, 교사 롤아웃을 쓰면 −0.030으로 오히려 반대 방향이었다. 효율 측면에서 부정 정책 롤아웃은 미리 생성해 재사용할 수 있다. Qwen3-1.7B, 8×H100 한 노드에서 thinking 모드 α=1 기준 학습 시간이 9시간 19분에서 3시간 34분으로 줄었다(롤아웃 사전 생성 시간 제외).
논문은 최근 OPD 변형들에 대한 새로운 해석도 내놓는다. ExOPD는 교사의 베이스 모델을 참조 모델로 삼고, OPD²는 교사와 그 사전학습 베이스 모델의 차이를 명시적으로 쓴다. 이들 방법은 온폴리시 롤아웃만으로도 표준 OPD보다 높은 NSP를 보였는데, 이는 이들이 이미 암묵적 부정 신호의 이득을 보고 있을 가능성을 시사한다. NP-OPD는 여기에 더해 NSP를 추가로 끌어올린다. 한편 학생 롤아웃을 온도 1.5로 올리거나, 초등학생 수준으로 풀라는 페르소나 프롬프트를 넣거나, 레이어 3개를 떼는 식으로 열화시켜 부정 롤아웃을 합성하는 실험도 했다. 온도 스케일링은 0.9점, 페르소나는 1.0점으로 표준 온폴리시 롤아웃보다 나았지만, 별도 저성능 정책을 쓰는 3.4점에는 크게 못 미쳤다.
실무적으로 이 방법은 기존 OPD 파이프라인에 롤아웃 소스 하나를 추가하는 변경이다. 보상 함수나 손실식을 손댈 필요가 없어 ExOPD, OPD² 같은 변형 위에 얹을 수 있고, 부정 정책 롤아웃을 미리 생성해 두면 학습 시간도 줄어든다. 다만 부정 정책은 학생보다 확실히 약해야 한다. 이론 전제가 KL(π_n‖π*) > KL(π_n‖π_θ)이고, 실험에서도 학생보다 강한 롤아웃 모델은 NSP가 낮아 성능 이득이 사라졌다. α 값도 0.25부터 1.0까지 스윕해 자기 모델과 데이터에 맞는 지점을 찾아야 한다.
저자가 밝힌 전제와 한계는 다음과 같다. 첫째, 부정 정책이 학생보다 성능이 낮다는 가정에 이론 전개가 의존한다. 둘째, NOR은 분포 겹침의 절대적 감소가 아니라 교사 상위 토큰 대비 상대적 확률 이동을 측정한 값이다. 셋째, Gemma 코드 벤치마크에서는 OPD와 NP-OPD 모두 베이스 모델 성능을 밑돌았다. 넷째, 학생 롤아웃을 단순 열화시켜 부정 롤아웃을 대체하는 방식은 별도 부정 정책만큼 효과적이지 않았다. 실험 규모도 3만 문항, 100 스텝으로 제한되어 있다는 점을 감안해야 한다.