저비용 결정 전용 판정 모델, 확신하면 수용하고 불확실하면 상위 LLM으로 넘겨 99% 정확도를 유지하다
JEV-as-a-Judge: Accept When Confident, Escalate When Unsure
무엇인가
이 논문은 LLM-as-a-judge가 대규모 평가에서 겪는 두 문제, 즉 추론 비용과 신뢰도 보정 문제를 다룬다. 저자들은 결정만 내리는 판정기가 값싼 1차 패스가 될 수 있는지, 그리고 어떤 입력을 더 강한 LLM 판정으로 넘겨야 하는지 묻는다. 평가 대상은 생성 산문의 쌍대 순위, 근거가 주어진 단일 답변 평가, 최종 객관식·수치 답변 판정이며, 스타일과 답변 형식 통제도 포함한다. 판정 비용은 응답과 모델 개정이 반복될수록 시스템 개발·운영 비용의 일부가 되고, 자기보고 확신은 과신할 수 있으므로, 자동 평가기는 신뢰할 수 있는 불확실성 신호가 필요하다는 것이 문제 설정이다.
어떻게 동작하나
제안 방법의 핵심은 TypeSafe JEV라는 호스팅 서비스다. JEV는 구조화된 상태, 자연어 지시, 허용된 출력 타입을 받고, Choice는 지정 라벨에 대한 확률을, Noul은 yes 확률을, Score는 순서 있는 루브릭 수준 확률을 반환한다. 주 실험은 요청당 하나의 Choice 질문을 보낸다. 수집 시점 JEV 1.13.0은 입력 100만 토큰당 0.042달러이고 출력은 무료다. JEV는 분포 통계인 네이티브 신뢰도도 반환하는데, 최대 라벨 확률과의 스피어만 상관이 RewardBench 0.971, JudgeBench 0.999, HaluEval 0.948이므로 논문은 q=max_k p_k를 신뢰도 플롯, 오류 탐지, 디퍼럴에 사용한다. 비교 대상은 17개 구성으로, JEV와 GPT-4.1 mini, 4.1, 5.2, 5.4, 5.6 Sol, 6 Astra, Groq의 GPT-OSS 120B와 Qwen3.6/3.8 27B, Claude Sonnet 5, Gemini 3 Flash/3.1 Pro 등 13개 호스팅 판정기와 4개 로컬 베이스라인이다. 생성형 판정기는 JEV와 같은 지시와 상태를 받고 근거 없이 결정과 라벨 확률을 말로 추정하게 하며, 현대 보상모델 베이스라인으로 Skywork-Reward-V2-Qwen3-8B를 둔다. 측정은 정확도, 기존 라벨의 macro-F1, 다중 클래스 Brier, 클리핑 NLL, 10빈 ECE, 오류 탐지 AUROC(1-q를 점수로 사용)를 쓰고, 스키마·라벨·확률 정규화·판정-argmax 일관성을 통과하지 못한 출력은 정확도에서 오류로 계산한다.
무엇과 다른가
공개 벤치마크는 RewardBench 400쌍(chat, difficult chat, safety, reasoning 각 100), JudgeBench의 GPT-4o 분할 350쌍, HaluEval 240개 근거 기반 판정이며, 기존 다중턴 실험의 150개 저장 답변, GSM8K 통제 108개, 합성 근거 통제 64개도 쓴다. 642개 파일럿은 추론 전에 동결했고, 670개 확장은 파일럿 정확도를 보기 전에 동결했지만 다중 모델 비교는 탐색적이다. 일반 선호와 근거 기반 사실성에서 JEV는 RewardBench 92.2%로 GPT-6 93.5%에 1.25%p 뒤졌고(95% 클러스터 구간 -3.8~1.5), HaluEval에서는 87.5%로 GPT-6 86.7%를 0.83%p 앞섰다(구간 -1.25~2.92). 블라인드 인간 판정은 라벨보다 GPT-6에 더 우호적이어서 RewardBench 불일치 29개 중 17개를 GPT-6, 5개를 JEV 편으로 보았고(7개 판단 불가), 인간 판정 차이는 -3.0%p(-5.3~-0.8)였다. HaluEval 불일치 10개 중 8개도 GPT-6 편이었다(-2.5%p, -5.0~-0.4). 두 판정기가 모두 놓친 HaluEval 26개 중 24개는 근거가 지지하지 않는 라벨이었고, 이를 교정하면 JEV 95.8%, GPT-6 98.3%가 된다. 어려운 정답성에서는 JudgeBench가 판정기를 갈라 JEV 78.6% 대 GPT-5.6/GPT-6 93.1%로 -14.6%p(-18.9~-10.3)였고, 추론 68.4% 대 95.9%(n=98), 코딩 76.2% 대 97.6%(n=42), 지식 84.4% 대 90.9%(n=154)였다. 인간 판정도 GPT-6 편 57개, JEV 편 1개(11개 불가)로 -16.0%p(-20.0~-12.3)였고, 추론·코딩·수학에서 27대0, 9대0, 7대0이었다. Skywork는 RewardBench 94.0%, JudgeBench 71.1%로 PairRM의 68.0%, 54.3%보다 강한 보상모델 기준점을 제공한다. 기존 150개 답변에서는 JEV 94.0%, macro-F1 0.923, GPT-6 96.7%, 0.947이었고, 통제 과제는 대부분 포화되어 15개 구성 중 14개가 GSM8K 108/108, 근거 통제 64/64를 기록했다.
어떻게 쓰나
더 어려운 선택과 스타일에서는 한계가 선명하다. RewardBench 2 4지선다에서 JEV 73.0% 대 GPT-6 75.0%(-2.0%p, -12.0~8.0)였고, RM-Bench에서는 두 답변이 같은 스타일일 때 JEV 84.0%지만 거부된 답변이 더 장황하게 쓰인 경우 74.8%로 같은 출처 안에서 -9.2%p(-14.0~-4.8) 떨어졌다. GPT-6는 93.3%에서 94.6%로 오히려 +1.3%p(-1.9~4.2) 올랐고, 어려운 쌍에서 격차는 -19.8%p(-27.7~-12.7)였다. 정답 선택과 그럴듯한 오답 스타일 저항은 다른 능력이다. 답변 형식 실험에서도 JEV는 기존 150개 답변의 직접 판정 91.3%가 gold-blind 추출 방식에서 86.0%로 -5.3%p(-14.0~2.0) 변했고, GPT-4.1 mini는 87.3%에서 87.3%로 같았다. 40개 HaluEval 질문으로 내용을 고정하고 형식만 바꾸면 JEV 직접 일치도는 객관식 100.0%, 자유응답 92.5%로 -7.5%p(-11.7~-3.3)였다. 근거 없는 자연 산문에서는 JEV, GPT-4.1 mini, GPT-5.4가 문서 근거 요약 80개에서 71.2%, 62.5%, 72.5%를, 참조 없는 일반 응답 80개에서 52.5%, 53.8%, 55.0%를 기록해 거의 우연 수준이면서도 평균 최대 확률 0.90, 0.95, 0.96으로 자신만만했다. JEV의 Brier는 0.815, 오류 탐지 AUROC는 0.518, GPT-5.4의 Brier는 0.813이었다. 운영 비용은 JEV 중앙값 0.152초와 1,000건당 0.044달러로, GPT-4.1 mini의 0.548초·0.390달러, GPT-6의 1.885초·12.182달러보다 각각 약 9배, 277배 저렴했다. 참조나 근거가 있거나 평범한 선호 판정이면 JEV는 최강 판정기와 3%p 이내이면서 1~2 자릿수 낮은 비용이고, 1,000건당 1달러 미만 호스팅 판정기 중 JudgeBench에서 가장 정확하고 HaluEval에서 공동 최고, RewardBench에서 최고와 0.6%p 이내다. 반대로 다단계 유도 검증이나 장황한 오답 저항이 필요한 판정은 GPT-6와 9~20%p 벌어져 에스컬레이션이 정당화된다.
전제와 한계
안정성과 확률 품질도 측정한다. JEV는 48개 예시에서 96번 반복 요청에 결정을 바꾸지 않았고, 48개 바꿔쓰기 루브릭에서는 4개를 바꿨다. 후보 순서를 뒤집으면 RewardBench 결정의 3.25%, JudgeBench 결정의 11.14%가 바뀌었고, 양쪽 순서 모두 맞힌 정확도는 91.0%와 74.0%였다. JEV가 첫 위치를 고른 비율은 48.9%와 48.4%라 위치 선호는 아니며, JudgeBench 불일치 39쌍 중 14쌍은 항상 첫 번째, 25쌍은 항상 두 번째 결정이었다. 수집 창 사이에는 JudgeBench 결정 7개가 바뀌고 순정확도는 1개 항목만 움직였다. Brier 점수는 JEV가 RewardBench 0.111, JudgeBench 0.297, HaluEval 0.176이고 GPT-6가 0.104, 0.095, 0.245다. GPT-6는 어려운 비교에서 더 정확하고 더 잘 보정되지만, 그 강점이 근거 기반 불확실성으로 이어지지는 않아 HaluEval에서는 JEV 확률이 더 낫다. q>=0.9에서 JEV는 HaluEval 199개 중 10개 오류, GPT-6는 233개 중 28개 오류를 냈다. 오류 탐지 AUROC는 JEV 0.869, 0.745, 0.863이고 GPT-6 0.891, 0.907, 0.899다. 오류 순위와 보정은 별개라 GPT-6는 Brier가 더 나쁜 HaluEval에서도 오류 순위는 더 잘 매긴다. JudgeBench에서 JEV의 고확률 판정 138개 중 9개가 틀렸다. 파일럿 선택 세트에서 맞춘 온도 스케일링은 전이되지 않아, 확장에서 JEV NLL이 HaluEval 0.333에서 0.284로 좋아졌지만 JudgeBench 0.449에서 0.475, RewardBench 0.205에서 0.232로 나빠졌다. 적합 온도도 RewardBench는 0.65로 날카롭게, JudgeBench와 HaluEval은 2.15와 4.45로 부드럽게 만드는 방향이라 단일 온도는 맞지 않는다. 같은 인터페이스도 어긋나 48개 초기 감사에서 Choice와 Noul의 평균 확률 차이는 0.055, Noul 여집합 잔차 평균은 0.045, 하드 라벨 불일치는 1건이었다.
디퍼럴 실험은 신뢰도가 오류를 정렬하는지 본다. 990개 기본 순서 판정을 q로 나누면 정확도가 단조 증가해, q<0.6인 65개에서는 47.7%, [0.7,0.8) 85개에서는 76.5%, [0.95,0.99) 147개에서는 93.9%, q=1인 322개에서는 99.1%였다. 같은 항목에서 GPT-6는 78.5%에서 99.1%로만 움직여, GPT-6의 이점은 JEV가 불확실한 곳에 집중된다. JEV가 q>=0.9로 수용할 항목에서는 두 판정기가 거의 교환 가능하고(95.8% 대 96.5%, 인간 교정 라벨에서는 97.2% 대 98.5%), 에스컬레이션할 항목에서는 GPT-6가 15%p 앞선다(67.9% 대 82.6%). 단일 순서 캐스케이드에서 τ=0.9는 34%를 에스컬레이션하고 91.3%로 GPT-6 91.7%의 99.6%를 유지하며, GPT-6 비용의 47%(보수적 사용량 기준 44%), 1,000건당 약 6.3달러를 쓴다. 같은 34%를 무작위로 올리면 88.1%, 라벨을 아는 오라클은 94.4%라 q가 얻을 수 있는 이득의 절반을 잡는다. RewardBench에서는 캐스케이드가 GPT-6 단독을 94.0% 대 93.5%로 이기며 비용은 22%만 쓴다. JudgeBench는 JEV 평균 q가 0.81에 불과해 τ=0.9가 61%를 올리고 98.2%를 62% 비용에 유지하며, τ=0.95는 99.1%를 74% 비용에 유지한다. HaluEval은 라벨 기반 정확도가 어떤 임계값에서도 움직이지 않는데, 낮은 신뢰도 항목이 대부분 잘못 라벨링된 것이기 때문이고, 인간 교정 라벨에서는 τ=0.8이 11%를 올려 GPT-6의 98.3%를 13% 비용에 맞춘다. GPT-5.6을 폴백으로 쓰면 τ=0.9 캐스케이드가 91.9%를 약 3.4달러에 달성한다. 동결된 두 순서 정책은 p̄(A)=1/2[p1(A,B)+1-p1(B,A)]로 양쪽 순서의 정렬 확률을 평균하고, 정확한 동점은 절반 점수를 준다. 임계값은 96개 파일럿 선택 쌍(64 RewardBench, 32 JudgeBench)에서 폴백 정확도 2%p 이내로 커버리지를 최대화하도록 골랐고, 1단계 출력이 무효면 항상 디퍼한다. 임계값 0.9의 GPT-6 캐스케이드는 확장 510쌍 중 53.7%를 수용해 92.5% 대 93.1%를 기록하고 폴백 비용의 56.8%(보수적 62.2%)를 쓰며, 차이는 -0.59%p(-1.78~0.59)다. 다만 규칙이 항상 전이되지는 않아 GPT-5.6 정책은 임계값 0.7에서 81.0%를 수용하지만 2.35%p를 잃어 2%p 허용치를 넘고, τ=0.5 정책 세 개는 폴백 없이 순서 평균으로 붕괴한다. GPT-5.4의 보수적 비용 비율은 1.096으로 1을 넘는다. 신호가 약해지는 곳도 분명하다. RM-Bench 후속에서 q의 정확도 AUROC는 쉬운 쌍 0.918, 보통 쌍 0.902지만, 거부된 답변이 더 장황한 어려운 쌍에서는 0.770이고, JEV는 [0.9,0.95)로 점수한 쌍의 3분의 1, [0.95,0.99)의 15%에서 틀린다. 그런 쌍에서 τ=0.9 GPT-6 캐스케이드는 정확도의 96.5%만 유지하고(90.8% 대 94.2%), 98.7%에 도달하려면 τ=0.95와 58% 에스컬레이션이 필요하다. 보통 쌍에서는 τ=0.9가 이미 99.6%를 유지한다. 참조 없는 산문은 AUROC 0.518로 어떤 임계값도 돕지 못한다.
개발자에게 이 논문의 실무적 메시지는 명확하다. 평범한 선호, 근거 기반 사실성, 최종 답변 판정은 JEV 같은 결정 전용 판정기로 값싼 1차 패스를 만들고, 확신하는 판정은 수용하며 불확실한 판정만 더 강한 LLM으로 넘기는 캐스케이드가 유효하다. 다단계 유도 검증이나 장황한 오답 저항, 참조 없는 자연 산문 평가는 저비용 판정의 경계이므로 로컬 검증 없이 확장하면 안 된다. 저자들이 제시한 체크리스트는 선호 쌍을 양쪽 순서로 판정해 정렬 확률을 평균할 것, 에스컬레이션 임계값을 로컬 선택 세트에서 고르고 홀드아웃에서 다시 확인할 것, 무효 출력을 오류로 셀 것, 신뢰도를 인증서가 아니라 에스컬레이션 신호로 다룰 것, 스타일 적대적 쌍과 작업별 온도 스케일링을 검증할 것, 새 작업군에 적용하기 전에 작은 로컬 검증을 할 것이다. 한계도 크다. 이 연구는 하나의 독점 JEV 버전과 선택된 구성만 평가했고, 학습 중복과 벤치마크 오염은 알 수 없으며, 추론 노력·모델 크기·문맥 한계·나이·서빙 시스템이 달라 계산량을 맞춘 아키텍처 비교가 아니다. 결정 전용 프롬프트는 생성 설명, 설명 충실성, 확장된 숙고, 많은 채점 루브릭을 배제한다. 말로 표현한 확률과 네이티브 분포는 다른 메커니즘이고, 무효 판정은 정확도에서 오류로 세지만 확률 지표는 유효 출력에 조건화하므로 두 분모를 혼동하면 안 된다. 확장은 원래 연구를 본 뒤 수행되어 모든 다중 모델 분석이 탐색적이고, 인간 판정은 무작위 감사가 아니라 판정기 불일치로 선택된 183개 항목을 한 명의 저자가 모두 평가한 것이라 대규모 합의가 아니다. RewardBench 선호는 부분적으로 주관적이며(인간-LLM κ=0.29), 183개 최종 라벨 중 36개는 판단 불가다. 전문 직업 영역은 테스트되지 않았고, RewardBench 2와 RM-Bench 검사는 작은 균형 표본이며, Skywork는 하나의 현대 보상모델일 뿐이다. 지연 시간은 한 클라이언트 위치와 수집 창, 제공자 부하를 반영하고, 비용은 추정치이지 청구서가 아니며, 시뮬레이션한 캐스케이드 비용은 실제 캐스케이드 지연을 말해주지 않는다. 단일 순서 캐스케이드는 사후 분석이고 임계값을 평가 항목에서 읽었으며, 사전 지정 규칙을 시험한 것은 동결된 두 순서 정책뿐이다. 그럼에도 결론은 분명하다. 사용 가능한 판정, 올바른 결정, 신뢰할 수 있는 불확실성은 서로 다른 세 가지이며, 각각을 따로 확인해야 한다.