온폴리시 증류는 새 사실을 못 넣고 기존 지식 조합 능력만 키운다
On-Policy Distillation Teaches New Skills but Not New Knowledge
무엇인가
온폴리시 증류(on-policy distillation, OPD)는 학생 모델이 스스로 생성한 롤아웃 위에서 교사의 다음 토큰 분포를 따라가도록 학습하는 기법으로, Gemini와 Qwen 같은 최신 후처리 파이프라인에 들어가 있다. 문제는 벤치마크 점수가 올라간다는 사실만으로는 학생이 무엇을 배웠는지 알 수 없다는 점이다. 다단계 추론의 정답에는 도메인 사실의 회상과 중간 결과의 조합이 함께 필요하기 때문에, 점수 상승이 새 사실 지식의 획득인지 기존 지식을 다루는 조합 능력의 향상인지 구분되지 않는다. 이 논문은 그 둘을 분리해 측정한다.
어떻게 동작하나
저자들은 사실 지식과 조합 능력을 독립적으로 통제하는 합성 환경을 만든다. 사실 지식은 무작위 룩업 테이블 T_k: {0,…,9}² → {0,…,9}로 구현한다. 각 테이블은 100개 항목을 가지며, 항목을 균등·독립적으로 샘플링해 대수적 규칙이 전혀 없게 만들었다. 따라서 다른 항목에서 답을 유추할 수 없고, 특정 매핑을 학습해야만 정답을 낼 수 있다. 질의는 네 자리 수 a, b에 대해 자리마다 독립적으로 테이블을 적용하는 방식(a∘_k b)이고, 프롬프트에는 테이블이 주어지지 않는다. 총 25개 사실을 20개 초기 사실과 5개 홀드아웃 사실로 나눈다. 조합 능력은 같은 사실과 같은 연산 수를 쓰되 구조만 다른 순차 체인과 분기 트리로 측정한다. 체인은 직전 단계의 결과를 바로 다음 단계에 넘기지만, 트리는 떨어진 분기의 중간 결과를 기억했다가 나중에 올바른 순서로 결합해야 한다. 본 실험의 각 질의는 8개 입력에 대한 7개 연산으로 구성되고, 완성문에는 단계별 실행 흔적과 최종 답이 포함된다.
무엇과 다른가
학생 S0는 초기 사실과 순차 체인만으로 파인튜닝해 만든다. S0는 초기 사실 회상과 체인 실행은 안정적이지만 홀드아웃 사실과 분기 트리에서는 거의 0에 가까운 성능을 보인다. 여기서 S0를 출발점으로 세 명의 교사를 만든다. T_f는 홀드아웃 사실을 추가로 학습하고, T_s는 초기 사실만으로 분기 트리를 학습하며, T_fs는 둘 다 학습한다. 추가 지식도 추가 기술도 없는 S0 자체를 대조 교사 T_∅로 둔다. 이렇게 해서 홀드아웃 사실 노출과 분기 트리 노출을 교차하는 2×2 요인 설계가 만들어진다. 증류 손실은 학생이 샘플링한 완성문 y에 대해 각 위치에서 교사의 다음 토큰 분포와 학생 분포 사이의 토큰 단위 reverse KL을 최소화하는 형태이며, 그래디언트는 학생 쪽으로만 흐른다.
어떻게 쓰나
세 계열 네 모델(Qwen3-0.6B, Qwen3-4B, Gemma-2-2B, OLMo3-7B)에서 결과는 일관된 비대칭을 보인다. T_s에서 증류한 학생은 교사만 본 트리 구조에서 80.96%, 학습에 전혀 없던 미지의 트리 구조에서 79.10%의 그리디 정확도를 기록했다. 같은 미지 구조에서 T_∅ 대조군은 0.72%였다. 두 테스트 모두 S0가 이미 아는 사실만 사용하므로, 이 향상은 새 지식이 아니라 기존 지식을 조직하고 결합하는 능력의 변화다. 반대로 T_f에서 증류한 학생은 홀드아웃 사실에 대한 단일 단계 질의에서 평균 13.12%(대조군 0.03%)에 그쳤고, 모든 단계가 홀드아웃 사실인 다단계 체인에서는 0.54%로 떨어졌다. Gemma-2-2B는 단일 단계에서 32.95%까지 올라 아키텍처에 따라 사실 회상이 개선될 여지가 있음을 보였지만, 체인에서는 역시 무너졌다. 샘플링 예산을 늘린 Pass@32에서도 격차는 유지됐다. T_s 학생은 미지 트리에서 평균 88.11%인 반면, T_f 학생은 단일 단계 15.74%, 체인 2.58%였다.
전제와 한계
저자들은 이 비대칭의 원인을 증류 레시피의 두 축으로 분해한다. 하나는 학습 접두사(prefix)의 출처로, 교사 시연을 쓰는 오프라인 방식과 학생 롤아웃을 쓰는 온폴리시 방식이 있다. 다른 하나는 발산 목적함수로, 학생 분포 기준으로 오차를 재는 mode-seeking reverse KL과 교사 분포 기준으로 재는 mean-covering forward KL이 있다. 두 축을 교차한 2×2 실험에서 사실 전이는 거의 전적으로 발산 목적함수가 결정했다. 학생 접두사 조건에서 reverse KL을 forward KL로 바꾸면 단일 단계 정확도가 Qwen3-4B에서 10.95%에서 54.10%로, Gemma-2-2B에서 32.95%에서 94.10%로 뛰었다. 교사 접두사 조건에서도 forward KL은 54.05%, 93.00%로 비슷했다. 즉 새 사실을 배우는 데 학생 롤아웃은 별 이점이 없다. 이유는 reverse KL이 학생이 이미 어느 정도 확률을 주는 토큰의 오차만 벌하기 때문이다. 학생이 모르는 사실에는 정답 토큰 확률이 거의 0이라 벌점도 거의 0이 된다. 반면 조합 능력은 학생 롤아웃이 좌우했다. 두 KL 방향 모두에서 학생 접두사 학습이 정답 참조 완성문의 NLL을 낮췄다. Qwen3-4B는 reverse KL에서 2.40비트에서 1.77비트로, forward KL에서 2.13비트에서 1.15비트로, Gemma-2-2B는 28.13비트에서 25.65비트로, 17.40비트에서 13.65비트로 줄었다.
실제 자연어에서도 같은 패턴이 나온다. Qwen3-4B-Base를 Tulu-3-SFT로 파인튜닝해 S0를 만들고, 2026년에 공개된 사실 지식 809문항(RealTimeQA, SealQA, FreshQA, WikiBigEdit 편집 문서)으로 지식 교사 T_K를, 경쟁 수학 201문항(MathArena, NuminaMath-CoT)으로 추론 교사 T_R을 학습시켰다. S0의 그리디 정확도는 Knowledge-2026 11.25%, Math-2026 17.41%였다. reverse KL OPD 후 사실 지식은 11.25%에서 9.64%로 오히려 소폭 하락했고, 교사 T_K가 같은 세트에서 84.55%를 기록한 것과 대비된다. 수학 추론은 17.41%에서 23.88%로 6.47%포인트 올랐고, 증류에 쓰지 않은 문제로도 일반화됐다. 교차 전이는 없었다. T_R에서 증류해도 사실 회상은 10.75%로 S0 수준이었고, T_K에서 증류하면 수학이 19.40%에 그쳤다.
생성 흔적을 들여다보면 실패의 모양이 다르다. 홀드아웃 사실 체인에서 reverse KL로 증류한 학생은 단계별 형식을 한 번도 깨지 않지만 각 단계의 룩업 값이 틀린다(예: 8135 대신 0135). 반대로 forward KL로 사실만 배운 학생은 모든 사실을 정확히 회상하면서도 트리를 좌에서 우로 편 체인처럼 평탄화해 분기 의존성을 무시한다. 지식 실패는 값이 틀리고, 기술 실패는 순서가 틀린다. LoRA 업데이트를 비교한 분석에서는 두 능력이 거의 직교하는 파라미터 부분공간을 차지했다. T_f와 T_s 업데이트의 코사인 유사도는 0.004에서 0.046 사이였고, 같은 과제에서 발산 목적함수만 바꾼 경우에는 0.64에서 0.82로 방향이 크게 겹쳤다. 깊이 분포도 갈린다. Qwen3-4B에서 T_f 업데이트는 최종 어휘 예측이 만들어지는 35층을 정점으로 뒤쪽 층에 몰리고, T_s 업데이트는 3층과 11층을 정점으로 앞·중간 층에 집중된다. 대안 목적함수도 실험했다. forward KL과 reverse KL을 토큰별 시그모이드 가중으로 섞는 ToDi가 사실 회상 64.3%, 미지 트리 86.4%로 forward KL보다 각각 10.2%포인트, 10.0%포인트 높았고, GKD(Jensen–Shannon, β=0.5)와 EOPD는 비대칭을 그대로 유지했다.
실무적으로 이 결과는 OPD를 어디에 쓸지에 대한 판단 기준을 준다. 도메인 추론, 툴 호출 순서, 다단계 계획처럼 이미 모델이 아는 지식을 조합하는 능력을 끌어올리는 데는 reverse KL OPD가 잘 맞는다. 반면 학습 컷오프 이후의 사실, 사내 규정, 신규 API 스펙처럼 파라미터에 새로 심어야 하는 지식이 목표라면 reverse KL OPD는 사실상 효과가 없고, forward KL 계열이나 ToDi 같은 혼합 목적함수를 검토해야 한다. 또한 사실 전이와 추론 전이는 서로 전이되지 않으므로, 하나의 증류 런으로 두 목표를 동시에 노리는 계획은 지표를 따로 분리해 검증해야 한다. 평가할 때도 단일 정확도 대신 홀드아웃 사실 질의와 미지 추론 구조를 각각 측정하는 편이 낫다.
원문은 별도의 한계 절을 두지 않았지만 설계상 전제는 분명하다. 합성 실험의 사실은 대수적 규칙이 없는 무작위 룩업 테이블이라 자연어 지식의 구조와 다르고, 교사는 학생과 같은 베이스 아키텍처와 초기화를 공유한다. 실제 벤치마크 검증은 Qwen3-4B-Base 한 모델에서만 이뤄졌고, 지식 교사 T_K의 84.55%는 자신이 파인튜닝된 바로 그 809문항에서 측정된 값이다. 또한 저자들이 제시한 결론은 reverse KL 기반 표준 OPD에 대한 것이며, forward KL이나 ToDi 같은 혼합 목적함수는 사실 전이를 상당 부분 회복한다는 점도 함께 기억해야 한다.