LLM 판사는 기준 선택 토큰만 골라 증류해야 일반화된다
Training LLM Judges from Language Feedback via Position-Selective Self-Distillation
무엇인가
LLM을 심사자(judge)로, 또는 다운스트림 학습의 보상 모델로 훈련하는 일은 현대 포스트트레이닝의 핵심 부품이다. 논문은 판정이 두 축, 즉 어떤 평가 기준을 부르고 어떻게 가중하는지를 뜻하는 기준 선택(criterion choice)과 그 기준을 얼마나 엄격하게 적용하는지를 뜻하는 적용 엄격성(application rigor)으로 갈린다고 본다. 수학·코딩처럼 결정적 기준이 명확한 객관적 과제에서는 적용 엄격성이 판정을 좌우하지만, 채팅 도움성처럼 결정적 기준이 미묘하고 다면적인 주관적 과제에서는 기준의 선택과 가중이 판정을 좌우한다. 문제는 지배적 접근인 결과 지도 RL(GRPO, Dr.GRPO, DAPO)이 롤아웃의 모든 토큰에 최종 판정 정답 여부라는 단일 스칼라만 부여한다는 점이다. 기준 선택 토큰에 별도 크레딧이 가지 않고, 선호 라벨을 만들 때 주석자가 이미 적어 둔 선호 근거(rationale) 같은 자연어 피드백은 쓰이지 않는다. 게다가 결과 지도 RL은 학습 중 정책 엔트로피를 낮춰 판사가 탐색하는 기준의 풀 자체를 좁힌다.
어떻게 동작하나
제안 방법은 자기증류(Self-Distillation, SD)다. 같은 모델을 두 역할로 쓴다. 학생은 프롬프트만 조건으로 받고, 교사는 여기에 선호 근거 z를 추가로 조건으로 받는다. z는 추론 시점에 학생에게 주어지지 않는 특권 정보(privileged context)다. 손실은 온폴리시 역방향 KL SD 목적식으로, 각 토큰 위치에서 학생 분포와 stop-gradient를 건 교사 분포 사이의 전체 어휘 합 KL을 평균한다. 판정 수준 보상과 달리 이 목적식은 기준을 선택하는 위치를 포함한 모든 위치에서 피드백 조건부 교사 분포를 전달한다.
무엇과 다른가
논문의 핵심 분석은 위치마다 신호 가치가 다르다는 관찰이다. 위치별 엔트로피 시프트를 학생 분포 엔트로피에서 피드백 조건부 교사 분포 엔트로피를 뺀 값으로 정의한다. 양수(ΔH가 큰 양수)는 교사가 특정 피드백 정합 기준 표현에 확률을 집중하는 맥락 예리화(context sharpening)이고, 음수(큰 음수)는 교사가 여러 피드백 정합 대안에 확률을 퍼뜨리는 맥락 확산(context spreading)이다. 저자들은 예리화는 특정 기준 표현의 암기를, 확산은 대안들을 보존함으로써 기준에 대한 의미적 이해를 촉진한다고 해석한다. HelpSteer3-Preference 검증 롤아웃 102개, 응답 위치 104,046개(Qwen3-30B-A3B-Instruct-2507, code·general·STEM 각 34개)를 분석한 결과 위치별 역방향 KL은 ΔH와 U자 관계를 보였고, ΔH 기준 하위 30%·중간 40%·상위 30%로 나누면 양쪽 꼬리가 중간보다 약 20~28배 큰 위치별 KL을 담았다. GPT-5.5로 주석한 결과 기준 선택 span은 응답 토큰의 16.7%인데 전체 역방향 KL 질량의 44.4%를 차지했고(토큰당 약 4.0배), 기준명 위치는 토큰의 0.4%로 KL 질량의 11.1%를 차지하며 평균 |ΔH|가 다른 위치보다 5.7배 컸고 94.8%가 양 극단 30% 꼬리에 몰렸다. Qwen3-Embedding-8B 코사인 유사도로 측정하면 예리화 위치에서 교사 top-1 기준명의 결정적 기준 유사도는 0.713으로 통제 조건 0.647보다 높았고(짝지은 차이 +0.066, 95% CI [0.033, 0.100]), 확산 위치에서 top-10 후보 평균 유사도는 0.646 대 0.610이었다(차이 +0.037, 95% CI [0.022, 0.051]).
어떻게 쓰나
이 비대칭에 착안한 처방이 위치 마스킹이다. 생성 단위로 위치를 ΔH 순위로 정렬해 상위 ρ 비율을 마스킹하고 하위 1−ρ 비율만 남긴다. 마스크는 계산 그래프에서 분리된다. ρ=0이 순수 SD다. 저자들은 이 마스킹이 더 넓은 기준 레퍼토리를 보존한다고 본다. RM-Bench, RewardBench v2, HelpSteer3-Preference 검증에서 각 300개 판정에 대해 판사가 제시·사용한 평가 기준을 추출하고 Qwen3-Embedding-8B로 임베딩한 뒤 완전연결 응집 클러스터링을 적용했을 때, SD+mask는 모든 임계값에서 순수 SD보다 많은 기준 클러스터를 불러냈고 그 차이는 코사인 임계값 0.65에서 4개, 0.85에서 26개였다.
전제와 한계
실험은 Qwen3-4B-Instruct-2507과 Qwen3-30B-A3B-Instruct-2507을 판사로 학습한다. 훈련 데이터는 HelpSteer3-Preference를 정제한 것으로, multilingual·무승부 행 제거, 내용 해시 기반 분할 내 중복 제거(정제 후에도 약 35%가 바이트 동일 중복), 분할 간 중복 제거(검증 1,553행 중 약 918행이 훈련 행과 바이트 동일해 누출 위험)를 순서대로 적용했다. 언어 피드백은 주로 1~2문장 선호 근거를 쓰고, 별도로 Claude Opus 4.8로 생성한 평균 2,062자(근거보다 약 7.7배 긴) 루브릭 결과도 부록에 보고한다. 평가는 훈련 데이터에 대해 분포 밖(OOD)인 RM-Bench와 RewardBench v2다. 비교 대상은 Dr.GRPO, 순수 SD(ρ=0), SD+mask(ρ=0.7)이며, 프롬프팅 기준선(DeepSeek-R1, Claude-Sonnet-4)과 학습된 보상 모델 기준선(Think-RM-8B, RM-R1-DeepSeek-Distilled-Qwen-7B/32B, Llama-3.3-Nemotron-Super-49B-GenRM, RationaleRM-30B)도 함께 놓았다. 객관적 하위 과제에서는 Dr.GRPO가 대등하거나 앞선다. 30B에서 RM-Bench Math는 95.59(Dr.GRPO) 대 94.45(SD)/95.63(SD+mask), RewardBench v2 Math는 87.43 대 81.42/84.15였다. 반대로 주관적 하위 과제에서는 SD 계열이 Dr.GRPO를 2~9%포인트 앞선다. 30B Chat 74.07 대 76.74/80.53, 30B Factuality 71.79 대 78.53/79.16, 30B Focus 80.00 대 86.26/85.66, 4B Chat 68.91 대 75.71/77.95, 4B Factuality 62.74 대 68.42/70.74, 4B Focus 75.76 대 80.20/77.78이다. 전체 평균은 4B에서 77.70→79.04, 30B에서 80.17→82.50으로 SD+mask가 순수 SD를 일관되게 앞선다(30B RM-Bench Code 76.56→80.07, 30B Chat 76.74→80.53, 30B RewardBench v2 Precise IF 40.62→48.75). 30B SD+mask 판사는 RM-R1-DeepSeek-Distilled-Qwen-32B, Llama-3.3-Nemotron-Super-49B-GenRM, RationaleRM-30B를 전체 정확도에서 앞서고 Claude-Sonnet-4와 비슷한 수준이다.
판사를 보상 선택기로 쓸 때의 하류 효용도 확인한다. Arena-Hard-v2의 주관적 창작 프롬프트마다 GLM-4.5-Air가 8개 응답을 생성하고, 8강 토너먼트식 반복 쌍대 비교로 최종 응답을 고른 뒤 Claude Sonnet 5가 창작 글쓰기 승률을 평가했다. SD+mask 판사는 Dr.GRPO 판사보다 7.6%포인트, 순수 SD보다 2.0%포인트 높은 승률을 냈다. 마스크 비율 ρ를 {0, 0.3, 0.5, 0.7}로 훑으면 30B 전체 평균이 80.17→80.63→80.68→82.50으로 ρ=0.7이 가장 좋았고 4B도 같은 패턴이었다. 선택기 소거 실험에서는 방향 반전(하위 ΔH 마스킹), |ΔH| 양꼬리 유지, 무작위 마스킹, 학생 엔트로피 마스킹, 교사 엔트로피 마스킹 다섯 통제 모두를 ρ=0.7에서 앞섰다. 즉 이득은 단순히 감독 위치 수를 줄인 데서 오는 것이 아니고, 부호 있는 엔트로피 시프트로 위치를 고르는 데서 온다.
실무 관점에서 이 논문이 주는 시사점은 두 가지다. 첫째, 이미 선호 라벨과 함께 근거 텍스트를 갖고 있다면 그 텍스트를 버리지 말고 교사 조건으로 쓰는 온폴리시 증류가 GRPO보다 주관적 판정에서 유리할 수 있다. 둘째, 증류 손실을 모든 위치에 균일하게 걸지 말고 위치별 엔트로피 시프트의 하위 꼬리만 남기는 것이 OOD 일반화에 도움이 된다는 것이다. 다만 이 방법은 별도의 교사 모델이 필요 없고 같은 모델을 두 번 조건화하는 구조이므로, 학습 파이프라인에 프롬프트에 피드백을 붙인 추가 포워드 패스와 위치별 엔트로피 계산 비용이 든다는 점을 감안해야 한다. 또한 판정 정확도만이 아니라 실제 보상 선택 품질(토너먼트 승률)로 검증하는 것이 좋다.
저자들이 밝힌 한계는 두 가지다. 첫째, 방법이 피드백 품질에 의존한다. 피드백이 결정적 기준을 짚지 못하거나 일반적인 조언에 그치면 엔트로피 시프트 마스킹이 유용한 감독을 보장하지 못한다. 둘째, 자기증류 자체의 알려진 문제, 즉 긴 사고 사슬 추론 모델에서의 환각과 학습 불안정성을 명시적으로 다루지 않는다. 이 논문은 효율적인 판사 추론을 위해 인스트럭션 튜닝된 모델에 초점을 맞췄고, 긴 사고 사슬 추론 모델로의 확장은 향후 과제로 남긴다.