검증된 궤적에만 증류하는 OASIS가 자기증류의 스케일 한계를 넘는다
Overcoming Scaling Limits in On-Policy Self-Distillation for LLM Reasoning
무엇인가
온폴리시 자기증류(OPSD)는 하나의 모델을 학생과 교사 두 역할로 쓴다. 학생은 문제만 받고 자기 궤적을 샘플링하며, 교사는 같은 문제에 참조 해설(reference solution)을 추가로 받은 상태에서 학생이 지나간 각 토큰 위치의 다음 토큰 분포를 평가한다. 학생은 그 분포를 순방향 KL로 따라가도록 학습된다. 시퀀스 수준 증류의 분포 불일치를 줄이면서 토큰 수준의 촘촘한 감독을 유지하고, 수학 추론에서는 강화학습보다 토큰 효율이 좋다는 것이 알려져 있었다. 이 논문이 파고든 두 가지 미해결 지점은 첫째, 문제마다 작성된 해설이 있어야 한다는 적용 범위 제약, 둘째, 교사 신호의 어떤 요소가 실제로 학습에 중요한지 불분명하다는 점이다.
어떻게 동작하나
저자들은 OPSD의 두 역할을 분리한다. 궤적(scaffold)은 어느 접두사에 감독을 줄지 정하고, 문맥(context)은 그 접두사에서 교사가 어떤 목표 분포를 낼지 정한다. 표준 OPSD는 검증되지 않은 학생 롤아웃에 감독을 걸면서 교사에게는 정답 해설을 문맥으로 준다. 학습 로그를 보면 Qwen3-1.7B와 4B에서 각각 롤아웃의 28.3%, 30.6%만 정답에 도달하고 62.0%, 64.4%는 토큰 상한까지 가서 답을 내지 못한다. 즉 71.7%, 69.4%의 롤아웃이 검증된 답 없이 끝나는데도, OPSD 업데이트의 약 70%가 이런 미검증 궤적에 실린다. 100 스텝 동안 롤아웃은 길어지는데 검증 비율은 1.7B에서 0.333→0.229, 4B에서 0.394→0.218로 오히려 떨어진다.
무엇과 다른가
교사의 우위는 실패한 궤적에 집중된다. 롤아웃을 잘라 같은 접두사에서 이어쓰게 하는 복구 실험에서, 1.7B 기준 틀린 답으로 끝난 접두사에서 정답 문맥 교사는 77% 확률로 정답을 복구한 반면 학생 자신은 37%였다(Δ=+0.40). 빈 참조와 무관한 참조는 각각 37%, 32%로 개선이 없었으니 이 우위는 특권 정보에서 나온다. 반대로 이미 정답으로 끝난 궤적에서는 격차가 1.7B에서 +0.04, 4B에서 +0.02로 작다. 이론적으로도 학생이 볼 수 없는 문맥 R에 의존하는 교사 분포는 학생이 맞출 수 없고, 순방향 KL의 최적해는 문맥 평균 분포가 되며 최소 손실값은 조건부 상호정보량 I(A;R|Z)와 같다(Proposition 1). 이 격차는 스케일과 함께 줄어든다. 실패 접두사에서 Δ는 +0.40에서 +0.17로, 참조 내용이 KL 격차에서 차지하는 비중은 1.7B의 29.6%에서 4B의 17.3%로 떨어진다. 그런데도 OPSD는 미검증 궤적에 계속 감독을 쏟고, 베이스 모델 대비 이득은 1.7B 3.05점, 4B 1.98점, 8B 0.14점으로 무너진다. 별개 문제로, 손실의 엔트리별 KL 클리핑(κ=0.05)은 검증 궤적에서 양의 KL 질량 97%, 실패 궤적에서 94%를 제거하며 토큰의 29~32%에 영향을 준다.
어떻게 쓰나
OASIS는 OPSD 목적함수를 그대로 두고 감독 대상만 바꾼다. 문제마다 K개 롤아웃을 샘플링해 최종 답을 검증하고, 검증된 롤아웃이 하나도 없는 문제는 신호를 내지 않는다. 검증된 롤아웃 중에서는 가장 짧은 것을 궤적으로 고른다. 길이는 검증된 것들 사이의 선택 기준일 뿐이고, 검증 자체가 그 문제가 감독에 기여할지를 결정한다. 교사 문맥은 같은 문제의 다른 롤아웃, 보통 학생 자신의 미검증 시도 중 가장 짧은 것으로 대체한다. 모든 롤아웃이 검증된 경우에만 다른 검증 롤아웃을 쓰고, 궤적을 자기 자신의 문맥으로 쓰지는 않는다. 검증된 궤적에서는 교사가 문맥에 둔감하다는 측정(학생 자신의 실패 시도가 정답 문맥 교사와 총변동거리 0.065, 무관한 참조 0.056, 빈 참조 0.051)에 기대를 건 설계다. 결과적으로 OASIS는 작성된 해설 없이 문제당 최종 정답 라벨만 요구한다. 검증된 궤적은 학습 목표가 아니라 어디에 감독할지를 정하는 필터이며, 목표는 여전히 교사 분포다.
전제와 한계
실험은 Qwen3-1.7B, 4B, 8B에서 OpenThoughts 수학 서브셋으로 학습하고 AIME 2024, AIME 2025, HMMT 2025를 Avg@12로 평가했다. OASIS는 OPSD 대비 평균 0.59점(1.7B), 1.86점(4B), 3.05점(8B)을 앞선다. 1.7B 차이는 30문제에서 샘플링 변동으로 나올 수 있는 범위라 단독으로는 결론적이지 않다고 저자들은 밝힌다. 베이스 모델 대비로는 3.64, 3.84, 3.19점을 얻어 스케일이 커져도 이득이 유지되는 반면, OPSD는 3.05→1.98→0.14로 줄었다. 같은 검증기와 정답 라벨을 쓰지만 스칼라 보상만 최적화하는 GRPO는 베이스 대비 0.60, 0.60, 0.23점에 그쳤고, 작성된 해설로 지도학습한 SFT는 세 스케일 모두 베이스 모델과 같거나 낮았다. 별도 설정의 Table 4에서는 OASIS가 4B에서 63.70으로 OPSD 63.60, AVSD 62.90을, 8B에서 65.83으로 64.80, 64.03을 기록했다.
비용 구조는 맞바꿈이다. Table 4 설정에서 베이스라인은 해설이 딸린 문제 12,800개를 학습하지만 OASIS는 6,400개만 보고 그중 절반가량(검증된 것)에만 학습하며, 해설 대신 문제당 최종 정답만 쓴다. 대신 문제마다 8개 롤아웃을 뽑아 51,200개를 생성한다. 1.7B, K=8, 100스텝 기준 OASIS는 43.5M 토큰을 생성하지만 감독하는 토큰은 1.98M으로 OPSD의 2.76M보다 적다. 문제의 절반가량이 마스킹되고 검증된 궤적이 더 짧기 때문이다(603 대 859 토큰). 학습 거동에서도 1.7B의 OASIS는 검증 롤아웃 비율 0.314(OPSD 0.283), 학생 엔트로피 0.49(OPSD 0.70)를 유지하고 교사와의 top-1 일치율이 0.931로 남는 반면 OPSD는 0.932에서 0.888로 떨어진다.
실무적으로 이 논문이 주는 신호는 명확하다. 최종 정답만 검증 가능하고 해설은 없는 데이터(단위 테스트가 있는 코드, 정답이 있는 수학 문제 등)에서, 검증된 자기 궤적에만 토큰 수준 증류를 걸고 교사 문맥을 자기 시도로 대체하는 것이 스케일이 커질수록 유리하다. 다만 검증기가 완벽하지 않다는 전제를 확인해야 한다. 저자들도 미검증 롤아웃을 "반드시 틀린 해"가 아니라 "정답으로 검증되지 않은 궤적"으로 부른다. 또한 롤아웃 생성이 병목이면 K=4로 비용을 절반으로 줄이는 절제 실험이 부록에 있다.
한계는 저자들이 직접 밝힌다. 연구 범위가 경시대회 수학과 단일 모델 패밀리(Qwen3)에 한정되고, 생성 비용이 더 높으며, 4B와 8B 결과는 단일 학습 실행이다. 4B에서는 학습 후반부에 OASIS도 교사 일치율이 0.853까지 흘러가고 토큰 절반가량에 클리핑이 걸리는데, 클리핑이 원인일 수 있다고 본다. 다음 단계로 값싼 결과 검증은 있지만 해설이 없는 코드(단위 테스트) 영역으로 이 기준을 확장하는 것을 제안한다.