3비트 미만 추론 붕괴 원인은 배포 경로 온폴리시 증류가 다루는 노출 편향이다
Train Where the Quantized Model Goes: On-Policy Distillation for Low-Bit Reasoning
무엇인가
이 논문은 3비트 미만으로 가중치를 압축한 대형 언어 모델이 왜 단답형 지식은 지키면서도 수학·코드 같은 긴 추론에서 무너지는지를 다룬다. 4비트 이상에서는 학습 후 양자화(PTQ)만으로도 성능이 대체로 유지되지만, 3비트 아래에서는 양자화 오차를 보정하기 어려워져 양자화 인지 학습(QAT)이나 양자화 인지 증류(QAD)가 필요하다. 문제는 QAD가 지시 따르기와 단답형 성능은 상당 부분 되살리면서도, 답을 스스로 길게 생성해야 하는 과제에서는 회복이 거의 일어나지 않는다는 점이다. 저자들은 4개 모델, 2개 비트 폭에서 QAD 체크포인트가 QA9 단답형 벤치마크에서는 BF16 성능의 평균 86%를 유지하지만 GSM8K 56%, MBPP 59%, MATH-500 27%, AMC23 16%로 떨어진다는 것을 보인다. 회복 격차는 모델이 스스로 생성해야 하는 토큰 수가 늘어날수록 커진다. BF16 기준 생성 길이가 GSM8K·MBPP에서 약 130토큰인데 MATH-500은 약 410토큰, AMC23은 약 3,200토큰이다.
어떻게 동작하나
저자들은 이 격차의 원인을 양자화가 증폭시킨 노출 편향(quantization-amplified exposure bias)으로 진단한다. QAD는 고정된 코퍼스에서 가져온 접두사 위에서 교사와 학생의 다음 토큰 분포를 맞추도록 학습한다. 그러나 배포 시점의 학생은 자기 이전 예측에 조건을 걸고 생성한다. 양자화는 매 스텝 다음 토큰 분포를 흔들고, 선택된 토큰이 한 번 달라지면 이후 모든 예측의 문맥이 바뀐다. 그 대안이 틀린 답이 아니어도 학습 때 다뤄본 궤적을 벗어나게 만들고, 편차가 시퀀스를 따라 누적된다. 정밀도가 낮을수록 교란이 커지고 생성이 길수록 누적될 기회가 많아진다. 실제로 Qwen3-0.6B의 W2.79 QAD 체크포인트를 MATH-500 200문항에서 그리디 생성으로 측정하면 95%가 디코딩 예산을 소진하고(BF16은 27%), 70%의 출력이 8-gram 반복으로 끝난다(BF16은 12%). GSM8K에서는 예산 소진이 32% 대 5%, 반복률이 30% 대 2%로 격차가 더 작다. 즉 산술 능력이 사라진 것이 아니라 긴 궤적을 유지하고 끝맺는 능력이 사라진 것이다.
무엇과 다른가
제안 방법은 두 단계다. 먼저 QAD로 안정적인 저비트 초기화를 만들고, 그 위에 온폴리시 증류(OPD) 단계를 얹는다. OPD에서 학생은 배포에 쓰이는 양자화 순전파 경로를 통해 직접 완성을 샘플링하고, 동결된 BF16 교사가 그 학생이 만든 접두사 위에서 토큰 수준 피드백을 준다. 교사 강제 손실 L_TF가 고정 코퍼스의 응답 접두사 y_<t 위에서 KL(π_T || π_θ)를 최소화하는 것과 달리, 학생 강제 손실 L_SF는 프롬프트 x에서 학생이 샘플링한 ŷ의 접두사 위에서 역방향 KL(π_θ || π_T)을 최소화한다. 역방향 KL을 쓰는 이유는 학생 샘플만으로 추정할 수 있고, 학생이 선호하지만 교사가 낮게 평가하는 지속을 벌점으로 만들기 때문이다. 여기에 과제 검증기 보상을 결합한다. 수학은 최종 답 정답 여부, 코드는 테스트 실행 성공 여부로 보상을 주고, 같은 프롬프트의 다른 완성들과 비교한 그룹 상대 어드밴티지 Â를 쓴다. 최종 목적함수는 L_OPD = -E[Σ Â log π_θ] + β E[Σ log(π_θ/π_T)] 형태로, 첫 항이 검증된 해에 도달하는 완성을 장려하고 두 번째 항이 토큰 수준 교사 지도를 담당한다. β는 모든 실험에서 1로 고정해 설정별 튜닝을 하지 않았다.
어떻게 쓰나
실험은 Qwen3-0.6B, 1.7B, 4B와 Falcon3-1B-Instruct 네 모델에서 유효 비트 2.79와 1.88 두 폭으로 수행한다. 가중치 그룹의 50%(2.79비트) 또는 12.5%(1.88비트)를 4비트로, 나머지를 1.58비트로 할당하고, 임베딩과 출력 헤드 가중치는 4비트, 활성값은 8비트를 쓴다. 모든 OPD 실행은 보고된 QAD 체크포인트에서 출발하며, 수학 단계 뒤에 코드 단계가 이어지는 2단계 일정을 따른다. 학습은 verl, 생성은 vLLM으로 하고 논싱킹 모드, 온도 1을 사용한다. 한 스텝 안에서 BF16 마스터 가중치가 업데이트를 받고 롤아웃은 배포용 양자화 경로를 통과한다. 학생은 자기 자신의 BF16 대응 모델을 동결 교사로 삼고, Qwen3-0.6B만 예외로 Qwen3-1.7B를 교사로 쓴다. 학습률은 3e-6, Falcon3 코드 단계만 1e-6이며 20스텝마다 체크포인트를 저장해 검증 지표로 선택한다.
전제와 한계
결과는 뚜렷하다. QAD 위에 OPD를 얹으면 MATH-500의 평균 BF16 유지율이 35.3%에서 69.7%로 두 배가 되고, GSM8K 유지율은 62.7%에서 85.0%로 오르며, HumanEval 평균 유지율은 66%에서 91%로 뛴다. 6개 Qwen3 구성에서 GSM8K 정확도는 8.41~47.23%포인트 개선된다. 2.79비트 Qwen3-1.7B는 MBPP가 35.3%에서 52.0%로, HumanEval이 41.5%에서 59.1%로 올라 BF16의 54.0%, 67.1%에 근접한다. 단답형 능력도 유지되어 QA9 평균 유지율은 88.1%에서 92.1%로 오히려 높아진다. OPD의 기여는 정밀도가 낮을수록 커진다. Qwen3-4B에서 RTN 대비 전체 GSM8K 회복분 중 OPD 몫이 2.79비트에서 11%였는데 1.88비트에서는 73%로 뛴다. 1.88비트 Qwen3-4B에서 OPD는 GSM8K를 17.36%에서 64.59%로, MBPP를 11.6%에서 48.7%로 끌어올린다. 행동 지표도 함께 회복된다. Qwen3-0.6B W2.79의 MATH-500에서 반복률은 70%에서 17%(BF16 12%), 예산 소진은 95%에서 53%로 줄고 정확도는 10.4%에서 24.2%(BF16 27.2%)로 오른다. GSM8K에서는 반복률 30%에서 2%, 예산 소진 32%에서 5%로 BF16 기준치와 같아진다.
비용 효율도 강조된다. 동일한 시작 체크포인트에서 OPD는 계속된 교사 강제 QAD보다 1000 옵티마이저 스텝당 GSM8K 점수를 최대 42배 더 많이 얻는다. 학습 로그 기준으로 Qwen3-4B 1.88비트에서 OPD 단계는 57 GPU-시간을 쓰고 QAD는 820 GPU-시간을 썼으며, Falcon3-1B 2.79비트에서는 11 대 253 GPU-시간으로 QAD 초기화보다 약 14~23배 적은 비용으로 복구를 마친다. 양자화 베이스라인과의 비교에서도 2.79비트에서 가장 강한 베이스라인인 Q-Palette가 QA9 93%, MBPP 89%를 유지하면서 MATH-500에서는 58%로 떨어지는 반면 OPD는 84%를 유지한다. 다른 베이스라인들은 MATH-500에서 33~58%에 머물고 59%를 넘지 못한다. 2비트 아래에서는 PTQ·QAT 베이스라인들이 MBPP와 HumanEval에서 전부 0점, GSM8K 유지율 최대 9%로 추론을 아예 생성하지 못하는데 QA9는 67~80%를 지킨다. EdgeRazor QAD가 생성 벤치마크를 0에서 끌어올리고, OPD가 그 위에서 각 벤치마크를 1.6~2.9배로 키워 GSM8K 64%, MBPP 77%에 도달한다. 소거 실험에서는 동일한 시작 체크포인트, 코퍼스, 수학에서 코드로 이어지는 일정, 스텝 예산을 맞춘 비교에서 OPD가 계속된 QAD를 16개 비교 전부에서 이겼다. Qwen3-1.7B 2.79비트에서 MATH-500은 45.6% 대 23.2%로 거의 두 배이고 GSM8K는 9.70%포인트 앞선다. 반대로 QAD 수학 단계를 2배, 3배로 늘려도 벤치마크 성능은 사실상 더 오르지 않는다.
실무적으로 이 논문은 저비트 배포 파이프라인을 두 단계로 나눠 설계하라는 제안으로 읽힌다. 먼저 QAD로 저비트 정책을 쓸 만한 수준까지 초기화하고, 그 다음 배포에 실제로 쓰는 양자화 순전파 경로로 롤아웃을 돌리면서 교사 감독과 검증기 보상을 함께 주는 짧은 OPD 단계를 붙이는 구성이다. 수백 스텝 규모의 추가 학습으로 긴 추론을 되살릴 수 있다는 점, 그리고 단답형 지식 유지율을 해치지 않는다는 점이 핵심이다. 다만 검증기가 필요한 만큼 수학은 최종 답 정답 여부, 코드는 테스트 실행이라는 자동 검증 신호를 만들 수 있는 과제에 적용 범위가 제한된다. 또한 롤아웃이 배포 경로를 통과해야 하므로 학습 인프라가 양자화 순전파와 BF16 교사 추론을 동시에 감당해야 한다.
저자들이 명시한 전제도 분명하다. OPD는 QAD 체크포인트에서 출발해야 한다. 이 폭의 라운드-투-니어스트 모델은 샘플링할 만한 출력이 없고 보상을 부트스트랩할 대상도 없기 때문에, QAD가 정책 생존성을 만들고 OPD가 궤적 제어를 복구하는 식으로 역할을 나눈다. 교사 선택에도 제약이 있어 학생마다 자기 BF16 대응 모델을 교사로 쓰고 Qwen3-0.6B만 Qwen3-1.7B를 쓴다. β=1로 고정해 두 항의 균형을 설정별로 조정하지 않았고, 평가는 논싱킹 모드·온도 1 조건에서 이뤄졌다. 학습률, 스텝 예산, 체크포인트 선택 규칙 같은 하이퍼파라미터는 특정 설정에 맞춰져 있으므로 다른 모델이나 데이터로 옮길 때 재검증이 필요하다. 논문이 다룬 범위는 2.79비트와 1.88비트 두 폭이며, 그보다 더 공격적인 비트 폭이나 다른 도메인의 장문 추론에서도 같은 회복이 보장된다는 주장은 원문에 없다.
관련 논문
- 합성곱 텐서 레이아웃 재배열로 마이크로스케일링 양자화의 이중 연산과 메모리 이동을 줄이는 MicroQonvMicroQonv는 합성곱 층의 순전파·역전파에 마이크로스케일링 양자화를 결합해 텐서를 한 번만 양자화하고, im2col 이전에 활성값을 양자화해 메모리 이동을 줄인다. YOLO 계열 검출 모델과 엣지 지속학습에서 최대 7.53배 메모리 절감과 정확도 향상을 보고한다.
- UECR-GRPO는 GRPO와 온폴리시 증류를 엔트로피보정 크레딧배분으로 통합한다검증기 보상과 교사 모델 신호를 하나의 GRPO 업데이트 안에서 응답·토큰 수준으로 결합한 UECR-GRPO를 제안한다. 교사 엔트로피로 불확실한 지도를 감쇠하고 응답별 제로섬 투영으로 총 과제 크레딧을 보존한다.