선호 증류에서 더 작은 모델이 더 나은 거부 응답을 만든다

Smaller Models, Better Rejects: Preference Distillation Scaling

HF Daily2609.38987

Rui Cai, Wenhui Zhu, Xiwen Chen2026-09-30조회 3

무엇인가

선호 증류(preference distillation)의 흔한 관행은 교사 모델의 응답을 선호(preferred)로, 학생 모델이 스스로 생성한 응답을 거부(rejected)로 두는 것이다. 이 관행에는 두 가지 가정이 깔려 있다. 첫째, 학생 자신의 실패가 가장 유용한 부정 샘플이라는 것. 둘째, 거부 응답은 최소한 학생과 같은 크기의 모델에서 나와야 하므로 학생이 커질수록 생성 비용이 커진다는 것. 논문은 이 두 가정이 모두 성립하지 않는다고 주장한다. 7B부터 72B까지의 Qwen2.5 학생 모델 전 구간에서, 학생보다 파라미터가 엄격히 적은 고정(frozen) 베이스 모델이 만든 거부가 학생 자신의 거부보다 추론 연산은 적게 쓰면서 더 강한 학생을 만든다. 이 현상은 코드 생성과 수학 추론 두 과제에서, 그리고 시퀀스 수준 지식 증류(SeqKD) 전후 모두에서 관찰된다.

어떻게 동작하나

저자들은 이 결과를 설명하기 위해 거부 소스 선택을 역방향 데이터 설계 문제로 재정의한다. DPO 초기화 지점 주변에서 정책을 선형화한 특징 모델을 세우고, 각 거부 소스를 두 좌표로 요약한다. 전이 질량 a_Q는 그 소스가 초기 업데이트를 효용 방향으로 얼마나 움직이는지를, 역효과 비율 c_Q는 그 움직임 중 잘못된 방향을 가리키는 비율을 나타낸다. 순 전이는 κ_Q = a_Q(1-2c_Q)다. 이로부터 유한 지평 전이 한계 G_H(Q) ≥ K_H·a_Q(1-2c_Q) - E_H (K_H = βτ_H‖u‖/2, E_H는 O(τ_H²)인 드리프트·곡률 항)를 유도하고, 목표 이득 ε에 대해 c_Q < 1/2이면서 a_Q가 충분히 큰 '유리 영역'을 정의한다. 역효과 비율이 크면 더 큰 전이 질량이 필요하다는 맞교환 관계가 나온다.

무엇과 다른가

이 분석은 세 가지 개입으로 이어진다. 첫째, 소스 혼합이다. 순 전이가 혼합 가중치에 대해 아핀(affine)이므로 작은 모델의 비중을 늘릴수록 효용이 오를 것이라고 예측한다. 둘째, 프롬프트 재배정과 어휘 순열이다. 거부 텍스트를 다른 프롬프트에 붙이거나 코드 토큰 순서를 섞어도, 프롬프트 쌍에 묶이지 않은 과제 구조 성분이 전이를 나른다면 길이만 맞춘 무의미 문자열(gibberish)보다 나아야 한다. 셋째, 참조 우도 기반 재선택이다. 후보 뱅크 안에서 길이 정규화된 참조 점수 s_j를 표준화하고 q_γ(j) ∝ exp(-γ·s̃_j)로 뽑는데, γ>0은 참조에서 밀어내고 γ<0은 끌어당긴다. 참조 우도가 높은 후보가 대비 효과를 덜 준다면 밀어내기가 순 전이를 높인다.

어떻게 쓰나

실험은 SODA의 2단계 파이프라인을 따른다. Qwen2.5 학생이 실행 검증된 교사 응답으로 SeqKD를 거친 뒤, 분리된 선호 데이터셋에서 DPO를 수행한다. 학생 규모별로 프롬프트, 선호 응답, SeqKD 초기화, 목적 함수, 최적화 예산, 평가 프로토콜을 모두 고정하고 거부 구성만 바꾼다. 코드 라인은 KoDCode를 쓰고, SeqKD는 실행 검증된 GPT-4o 응답이 붙은 75,752개 프롬프트로, DPO는 분리된 24,248개 프롬프트로 학습한다. 모든 거부는 최소 하나의 단위 테스트를 실패해 오답으로 검증된다. 평가는 5,000개 홀드아웃 KoDCode 문제와 BigCodeBench-Complete, BigCodeBench-Instruct, HumanEval, MBPP이며 주 지표는 4회 샘플링 평균 실행 성공률 avg@4다. 수학 라인은 OpenR1-Math-220k의 검증기 통과 DeepSeek-R1 궤적을 쓰고 MATH-500과 2024·2025 AIME에서 avg@4를 잰다.

전제와 한계

규모 실험에서 모든 더 작은 베이스 구성이 두 Self 구성(바닐라 Self, SeqKD 이후 Self)을 코드 avg@4에서 앞선다. 예를 들어 Qwen2.5-3B-Instruct가 만든 거부는 14B 학생의 avg@4를 바닐라 Self 대비 코드 생성에서 3.1점, 수학 추론에서 1.9점 올린다. 비용도 싸다. 파라미터 수와 출력 길이로 추정한 생성 연산은 같은 학생 규모의 바닐라 Self 대비 0.9%~50.1%로, 2.0배에서 108.3배 절감에 해당한다. 혼합 실험에서는 Llama-1B 베이스 거부 비중을 0%에서 100%로 올리자 14B 학생의 코드 avg@4가 59.73%에서 63.28%로 상승했고, Qwen2.5-3B 혼합도 59.58%에서 62.63%로 같은 순서를 따랐다. 재배정 실험에서 프롬프트를 바꿔 붙인 베이스 거부는 모든 학생 규모에서 gibberish를 앞섰고, 7B 학생에서 최대 1.28점 이득을 냈다. 토큰 순서·문법·프롬프트 대응을 모두 파괴한 어휘 순열조차 모든 규모에서 gibberish를 앞섰으며 14B에서 최대 0.73점을 더했다. 참조 우도 실험에서는 참조 우도가 높을수록 avg@4가 낮아지는 관계가 모든 규모에서 나타났고 7B에서 피어슨 상관 -0.97로 가장 강했다. 동일 후보 뱅크에서 재선택만 바꾼 통제 실험에서도 밀어내기(Repelled)가 모든 소스에서 가장 강한 결과를 냈고, 1.5B 소스에서는 63.14%로 끌어당기기(Attracted)의 61.88%를 1.26점 앞섰다.

실무적으로 이 논문은 거부 응답 생성을 학생 모델 규모에 맞춰 확장할 필요가 없다는 근거를 준다. 작은 고정 모델을 거부 생성기로 쓰면 GPU 비용을 크게 줄이면서도 DPO 단계의 성능을 올릴 수 있다. 다만 그대로 복사해 쓰기 전에 확인할 것이 있다. 거부는 과제 구조를 보존해야 하고(코드 토큰 분포 같은 도메인 특징), DPO 참조 정책과의 결합은 낮아야 한다. 후보 뱅크를 만들 수 있다면 참조 우도가 낮은 쪽을 고르는 재선택이 추가 이득을 준다. 또한 어떤 작은 모델이 최적인지는 학생 규모와 과제에 따라 달라지고, Llama 베이스 소스도 최고의 Qwen2.5 소스와 경쟁력이 있었다는 점을 감안해 소스 선택은 실측으로 정해야 한다.

한계도 분명하다. 이론적 분석은 DPO 초기화 주변의 선형화 특징 모델에 기반하며, 유계 특징 같은 정칙 조건과 작은 스텝 크기 가정에 의존한다. 전이 질량과 역효과 비율은 직접 관측할 수 없어서, 저자들은 세 가지 구성 연산을 그 좌표의 대리물로 쓴다. 거부 필드, 보상 마진, 우도 궤적, RC-DPO 같은 최적화 진단 지표들은 작은 베이스가 Self보다 낫다는 순서를 재현하지 못했다. 프롬프트 대응을 복원했을 때의 추가 효과는 학생과 소스에 따라 달라진다. 검증은 코드 생성과 수학 추론 두 과제, Qwen2.5 계열 학생 7B~72B 범위에 한정된다.