LLM 증류는 보정과 학습을 결합해 타깃 보상 없이 교사 편향을 걷어낸다.

Coupled Calibration and Learning: Mitigating Teacher Bias in LLM Distillation without Target-Domain Reward Feedback

arXiv2609.17474v1

Haichen Hu2026-09-15조회 4

무엇인가

이 논문이 다루는 문제는 LLM 증류에서 교사의 체계적 편향이 학생에게 그대로 전이되는 현상이다. 강한 교사의 출력을 그대로 모방하면 유용한 지식뿐 아니라 교사의 오류까지 함께 옮겨간다. 저자들이 특히 주목하는 상황은 공변량 이동(covariate shift)이다. 소스 문항에서는 성능이 좋은 교사라도 타깃 문항에서 얼마나 믿을 만한지 알 수 없고, 더 근본적으로 타깃 도메인에는 보상 피드백이 없다. 논문의 설정은 명확하다. 소스 데이터셋 D_src = {x_i}에는 정확한 검증기가 붙어 있어 임의의 답변 a에 대해 R(x_i, a)를 돌려주지만, 타깃 데이터셋 D_tar = {x~_j}에는 프롬프트만 있고 R(x~_j, a)는 학습 중 절대 조회되지 않는다. 타깃 도메인 보상 모델을 새로 만드는 데는 전문가 루브릭, 라벨링된 답변, 채점 기준 검증이 필요해 비용이 크다는 것이 저자들의 동기다. 그래서 던지는 질문은 이것이다. 소스 문항의 보상 피드백만으로, 편향된 교사로부터 타깃에서 준최적인 학생을 증류할 수 있는가.

어떻게 동작하나

모델 설정은 자기회귀 생성을 유한 지평 토큰 수준 마르코프 결정 과정 M = (S, A, P, R, H)으로 형식화한다. 상태는 프롬프트와 지금까지 생성한 토큰 접두이고, 정책은 합법 토큰에만 확률을 부여한다. 정책 클래스는 선형-소프트맥스 형태로, 교사·보정용 특징 사상 φ(차원 D)와 학생용 φ_stu(차원 d)를 쓴다. 학습 목표는 J_{λ,m}(π) = (1/m) Σ_j E_{a~π}[ R(x~_j, a) − λ Σ_h log( π(a_h|·) / π_pre(a_h|·) ) ]로, 보상 항과 사전학습 참조 정책으로부터의 이탈을 벌점으로 주는 KL 항으로 이루어진다. 성능 기준은 무제약 최적 정책 π*_λ가 아니라 학생 클래스 안에서 이 목표를 최대화하는 오라클 학생 θ†_{λ,m}이다. 학생 클래스가 무제약 최적해를 표현하지 못할 수 있다는 점을 처음부터 인정한 벤치마크다. 전이를 가능하게 하는 핵심 가정은 실현가능성(Assumption 3.2)이다. 소스와 타깃 프롬프트의 모든 합법 비종단 접두 상태에서 π*_λ(a|s) = π_{w*_λ}(a|s)를 만족하는 단일 보정 모수 w*_λ ∈ W가 존재한다는 것, 즉 두 도메인이 같은 최적 보정 계수를 공유한다는 구조를 요구한다. 밀도비 가정 대신 이 공유 구조를 쓴다는 점이 이 논문의 특징이다.

무엇과 다른가

제안 방법인 CCL(Coupled Calibration and Learning)은 교사 보정과 학생 업데이트를 토큰 수준 분기(token-level branching)로 묶는다. 한 번의 반복은 다음 순서로 진행된다. 먼저 소스 보상 피드백을 사용해 교사를 보정하고, 그 다음 보정된 교사를 사용해 타깃 문항에서 학생을 학습시킨다. 갱신된 학생은 다시 다음 보정 단계에 정보를 주어, 교사 보정과 학생 학습이 훈련 내내 함께 움직인다. 이때 사용하는 목적함수는 타깃 증류 비용 C_w(θ) = (λ/m) Σ_j KL( π_stu,θ(·|x~_j) || π_w(·|x~_j) )이며, 이 값은 학생과 보정된 정책의 우도만으로 계산되고 고정된 타깃 프롬프트에 대한 학생 롤아웃으로 추정할 수 있다. 실현가능성 가정 아래 argmax_θ J_{λ,m}(π_stu,θ) = argmin_θ C_{w*_λ}(θ)라는 항등식이 성립하는데, 이것이 보정의 역할을 명시적으로 만든다. 참 보정 모수에 도달하면 증류 목표가 정확히 정규화된 오라클 학생을 가리키게 된다. 학생 업데이트 자체는 미니배치 투영 경사로 만든 제안과 균일하게 샘플링한 후보 중에서, 새 타깃 롤아웃으로 평가해 더 나은 쪽을 고르는 방식이다.

어떻게 쓰나

이론적 결과의 핵심은 정리 5.1이다. CCL이 반환한 학생의 오라클 학생에 대한 기대 평균 KL 발산이 반복 횟수에 대해 다항 속도(polynomial rate)로 0에 수렴한다. 증명은 세 가지를 정량화한다. 오라클 근처에서의 투영 학생 경사 업데이트 진행량, 고정된 근최적 영역 밖에서의 탐색을 통한 진행, 그리고 교사 보정 오차와 유한 롤아웃 추정 오차의 통제다. 저자들은 초과 참 비용에 대해 명시적인 1/4 지수를 제시하지만, 이를 오라클 정책과의 KL로 변환하는 단계에서는 모델 의존적인 Łojasiewicz 지수를 사용한다고 밝힌다. 즉 수렴 보장은 있으나 상수와 지수의 구체적 크기는 국소 기하에 달려 있다.

전제와 한계

논문의 또 다른 축은 직접 매칭과의 분리(separation)다. 정리 6.2는 정규화된 직접 매칭(Algorithm 2)이 오라클 학생에 대해 0에서 떨어진 KL을 유지한다는 것을 보인다. 구체적으로 기대 평균 KL은 (κ_SM/2d) [ √d(1−α)/(4λ) − G_SM/(μ_SM √(T+1)) ]²_+ 이상이고, 반복 수가 T ≥ ⌈64λ²dG_SM² / ((1+λ)²κ_SM²(1−α)²)⌉ 이상이면 기대 평균 KL이 최소 κ_SM(1−α)²/(128λ²)로 하한이 잡힌다. 중요한 것은 이 하한이 교사가 모든 학생 정책보다 높은 정규화 타깃 보상을 달성하는 경우에도 성립한다는 점이다. 명제 6.1은 J_{λ,m}(π_tea) > J_{λ,m}(π_stu,θ†)임을 확인한다. 교사가 학생보다 낫다는 사실만으로는 직접 모방이 오라클 학생을 복원하지 못하며, 교사를 보정하는 절차가 필요하다는 논지다.

실험 부분에 대해 분명히 해 둘 것이 있다. 이 논문에는 실제 LLM을 돌린 실험이나 데이터셋 수치가 제시되지 않는다. 6절의 소위 실험은 이진 판정 과제를 해석적으로 구성한 이론적 예시다. 답변 공간은 (0,EOS), (1,EOS), (null,EOS) 세 가지이고, 후보 답변이 맞으면 1점, 틀리거나 기권하면 0점을 준다. 이 설정에서 오라클 학생 모수는 θ†_{λ,m} = (1/(4λ))1_d로 Θ 내부에 있고, 교사 모수는 w_tea = α√2/λ · u_1로 잡힌다. 학생 클래스는 무제약 최적 정책을 표현하지 못한다. 저자들은 코드와 수학 추론 과제에서 사전학습 LLM으로 실제 롤아웃 예산, 보상 평가 비용, 소스-타깃 이동을 평가하는 계산 실험을 향후 과제로 명시적으로 남겨 두었다.

개발자 관점에서 이 논문이 쓸모 있는 지점은 명확하다. 타깃 도메인용 보상 모델이나 검증기를 새로 만드는 비용이 부담스럽고, 소스 도메인에만 신뢰할 수 있는 평가기가 있는 상황, 예컨대 사내 벤치마크가 잘 갖춰진 도메인에서 다른 도메인으로 모델을 옮길 때다. 이때 교사 출력을 그대로 따라 하는 직접 증류가 왜 타깃에서 특정 오류를 고착시키는지, 그리고 소스 피드백으로 교사를 반복 보정하면서 타깃에서 학생을 학습시키는 루프가 어떤 조건에서 그 오류를 없앨 수 있는지에 대한 이론적 근거를 제공한다. 실무에 적용하려면 먼저 소스와 타깃이 같은 최적 보정 계수를 공유한다는 실현가능성 가정이 성립하는지, 선형-소프트맥스 특징 사상이 그 구조를 담을 수 있는지, 매 반복 보정에 드는 비용과 타깃 롤아웃 예산을 감당할 수 있는지를 확인해야 한다.

저자들이 밝힌 전제와 한계는 다음과 같다. 분석은 실현가능성 가정 3.2와 오라클 학생의 유일성을 요구하는 가정 3.3 위에 서 있다. 학생 클래스의 미스페시피케이션은 허용하지만 보정 클래스에는 실현가능성을 요구한다. 수렴 상수는 국소 기하와 고정된 근최적 영역을 탐색할 확률에 의존하며, 이들에 대한 명시적 상한을 유도하는 것은 미해결 과제다. 또한 알고리즘이 매 반복마다 보정 모수와 학생을 함께 갱신하는데, 보정을 덜 자주 하고 그 사이에 학생을 여러 번 업데이트하는 스케줄이 오라클 수렴을 유지하면서 보정 비용을 줄일 수 있는지, 상대적 갱신 빈도가 수렴 속도에 어떻게 영향을 주는지는 열린 문제로 남겨 두었다. 마지막으로 실제 사전학습 LLM에서의 계산 실험이 아직 없다는 점을 저자들 스스로 향후 과제의 첫 번째로 꼽는다.