LLM 스코어러는 순위 품질이 같아도 순서가 바뀌면 다른 결정을 내린다

Equal Ranking Quality, Different Decisions: Measuring and Reducing Order Dependence in LLM Scorers

HF Daily2608.26762

Markus Frohmann, Mahdiyar Ali Akbar Alavi, Elizabeth Lingg2026-09-26

무엇인가

여러 후보 문서나 응답을 한 프롬프트에 넣고 각각에 점수를 매기는 방식(배치형 포인트와이즈 채점)은 지연시간을 줄이면서 후보별 점수를 유지하지만, 후보들이 같은 프롬프트를 공유하기 때문에 한 후보의 점수가 나머지 후보 구성과 위치에 조건화된다. 논문은 이를 presentation dependence라고 부른다. 문제는 이 점수가 순위 지표가 아니라 결정을 좌우한다는 점이다. 임계값은 어떤 문서를 검토 큐나 생성 컨텍스트에 남길지 정하고, 리더는 상위 몇 개에서 답을 만들며, 선호 모델의 점수는 학습에 들어갈 chosen/rejected 쌍을 고른다. 같은 질의, 같은 후보 집합이라면 순서를 바꿔도 같은 결정이 나와야 하지만 그렇지 않다. 재순위화에서 nDCG@10 차이가 0.010 이내인 다섯 개 학습 스코어러의 유지 집합(retained set)은 순서를 섞었을 때 쌍별 Jaccard가 0.66~0.84에 그쳤다. 즉 순위 품질이 같다는 것이 결정이 같다는 것을 의미하지 않는다. 순서를 고정하지 않은 상태에서 선호 모델의 최상위 선택이 맞는지는 10개 무작위 순열에서 질의의 65.4%에 불과했다.

어떻게 동작하나

논문은 스코어러 출력을 순서 주변값(order-marginal)과 순서 잔차(order residual)로 분해한다. f_B(x,π) = μ_B(x) + δ_B(x,π)이며, μ_B는 순열 불변 스코어러가 폭 B에서 내놓을 점수이고 δ_B는 입력 순서만 바뀌어도 변하는 나머지다. 순서 의존성 측정에는 Zeng 등의 지표를 순위 수준으로 각색한 τ-PSI를 쓴다. 각 인스턴스를 M=10개 무작위 순열로 채점해 유도된 순위들의 쌍별 Kendall 상관을 평균하고 (1-평균)/2를 취한다. 모든 순서가 같은 순위를 내면 0, 무상관이면 0.5, 역순이면 1이다. 프롬프트에서 순서 외에 흔들릴 수 있는 채널은 창 분할 규칙, 슬롯 마커, 점수를 뽑아내는 답변 골격 문구까지 네 가지인데, 논문은 순서를 제외한 나머지를 고정하고 순서 채널을 측정한다. τ-PSI는 이 세 가지에 조건부이므로, 골격 선택 자체가 수치의 일부라는 점도 저자들이 명시한다.

무엇과 다른가

제안 방법인 OC-SFT(순서 일관성 지도 미세조정)는 프롬프트 구성으로는 못 없애는 의존성을 가중치에서 줄인다. 먼저 점수 읽기 방식은 텍스트를 생성하지 않는다. 프롬프트에 채점 지시, 질의, [i]로 태그된 B개 후보를 넣고 후보마다 {0,1,2,3} 정수 등급 하나를 요청한 뒤, 고정된 답변 골격을 덧붙여 등급 토큰 위치를 미리 알고 그 위치의 확률분포를 네 토큰 위에서 재정규화한다. 기대 등급 E[g]=Σg·P(g)를 [0,1]로 정규화한 것이 점수이며, 한 번의 순전파로 B개 점수가 모두 나오고 생성 온도가 개입하지 않는다. 손실 함수는 두 항이다. 첫째는 첫 번째 뷰의 점수와 교사 목표의 제곱오차인 관련성 앵커, 둘째는 같은 창을 N개 순열로 채점해 얻은 뷰 평균으로부터의 분산, 즉 순서 분산 항이다. L = mean_d(s1(d)-ỹ(d))² + λ·(1/N)Σ_i mean_d(s_i(d)-s̄(d))². 두 번째 항은 학생 자신의 잔차 δ_B의 경험적 분산에 비례하므로 순서 불변성을 라벨이 아니라 학생 쪽에서 직접 겨냥한다. N=2를 쓰며, 관련성 앵커가 없으면 일관되지만 관련성 없는 스코어러로 붕괴하고 λ=0이면 단일 순서 증류와 같아진다. 순서 평균 증류가 교사 라벨에 T=10회 순열 평균을 미리 구워 넣는 것과 달리, OC-SFT는 교사 순전파 1회와 서빙 순열 1회로 끝난다.

어떻게 쓰나

실험은 세 과제에서 이뤄진다. 1차 설정인 구절 재순위화는 MS MARCO 상위 100개 후보를 B=20으로 학습하고, TREC DL 5개, BEIR 11개, 상용 법률 검색의 내부 컬렉션 2개를 합친 18개 컬렉션에서 평가한다. 다문서 QA는 HotpotQA distractor 설정(질문당 10개 지문, 정답 2개)으로 학습해 2WikiMultiHopQA와 MuSiQue로 제로샷 전이하고, 응답 순위화는 UltraFeedback 약 30.7K 프롬프트(후보 4개)로 학습해 RewardBench-2, Nectar, PPE MMLU-Pro, PPE-MATH, RM-Bench에서 평가한다. 기본 베이스는 Qwen3-4B이고 Qwen3, Gemma 4, Granite 4.1 계열의 1.7B~32B 밀집 모델 11개와 희소 MoE인 Gemma-4 26B-A4B, Qwen3-Reranker-4B를 대조군으로 쓴다. 학습은 전부 LoRA다.

전제와 한계

결과에서 순서 불안정성은 구절 재순위화 기준 단일 순서 증류의 0.209에서 OC-SFT의 0.083으로 떨어졌고, 유지 집합의 쌍별 중첩은 0.656에서 0.835로 올랐다. 리더 답변 뒤집힘률은 0.125로, 다른 순서 인지 목적함수 세 개의 0.149~0.164보다 낮다. 이 순서는 12개 베이스 전부에서 유지되며 희소 MoE에서도 그렇다. 학습이 겨냥하지 않은 섭동인 후보 풀 교체에서도 불안정성이 0.031로 단일 순서 증류의 0.099보다 낮았다. 반면 학습 전 프롬프트 수준의 수정은 결정을 개선하지 못했다. 라운드로빈 분할은 nDCG@10을 0.052 올렸지만 유지 집합 중첩, 판정 뒤집힘, 쌍 뒤집힘 어느 것도 측정 가능하게 바꾸지 못했고, 로짓 보정(CapCal)은 품질과 유지 집합 중첩 모두 개선하지 못했다. 순열 증강과 DebiasFirst는 τ-PSI 격차의 약 3분의 2를 닫지만 OC-SFT에 미치지 못하며, EMA 평균 교사는 71%를 닫는 대신 리더의 exact match를 0.023 잃는다. 서빙 시점 앙상블인 배치 자기일관성은 K=10 순열로도 세 소비자 중 둘에서 OC-SFT의 K=1에 도달하지 못했다. 순서 평균 증류는 교사 순전파 10회를 요구하면서 30K 라벨 질의에서 OC-SFT가 1K로 얻은 것보다 불안정했다. 공개 시스템 비교에서는 GPT-5.4가 nDCG@10에서 모든 학습 변형을 앞서지만 유지 집합 재현율은 OC-SFT보다 낮았고, 전용 재순위기 jina-reranker-v3는 유지 집합 F1에서 OC-SFT를 앞서면서 nDCG@10은 뒤졌으며 유지 집합 중첩은 0.667로 OC-SFT의 0.835보다 낮았다. 폭 효과도 과제별로 다르다. 학습 폭 B=20으로 서빙하면 B=1보다 다문서 QA에서 nDCG@10이 0.043 오르지만, 구절 관련성에서는 폭 효과가 0과 구분되지 않고 응답 순위화에서는 PPE 컬렉션에서 이득이 가장 크고 RM-Bench는 손해를 본다. 배치 교사 라벨은 포인트와이즈 라벨보다 B_train=1에서 0.029, B_train=20에서 0.010 nDCG@10 우세하며, B=20에서 배치는 질의당 지연시간을 45% 낮추면서 품질을 유지한다.

개발자 관점의 실무적 결론은 모델 선택 기준을 바꾸라는 것이다. 임계값 필터, 리더 컨텍스트, 선호쌍 생성에 스코어러를 쓰는 시스템이라면 nDCG@10 같은 순위 지표만으로 두 모델을 비교해서는 안 되고, 같은 후보 집합을 여러 순서로 채점해 임계값이 남기는 집합의 중첩도, 리더 답변이나 선택된 쌍이 얼마나 뒤집히는지를 함께 보고해야 한다. 논문은 안정성 지표가 쓰는 순열만으로 이 측정이 가능하다고 말한다. 또한 순서를 고정하는 것은 해결책이 아니다. 고정은 의존적인 출력 하나를 고르는 것일 뿐이고 1단계 순서가 일관되게 최선도 아니며, 프롬프트 수준의 어떤 수정도 순서 채널을 없애지 못했다. 추론 시점 평균은 질의마다 비용을 반복하지만 학습과 평균은 대체가 아니라 조합된다.

저자들이 밝힌 한계는 분명하다. OC-SFT는 불변성을 보장하지 않고 완화(attenuation)에 그친다. 패널티는 점수 분산을 제한할 뿐 제거하지 않으므로 동점 근처에서는 남은 분산이 순위를 움직일 수 있다. τ-PSI는 분할 규칙, 마커, 골격에 조건부이며, 골격 자리표시자 선택이 수치의 일부라는 점을 저자들도 인정한다. 평가에 포함된 법률 컬렉션 두 개는 상용이라 재현이 불가능해 18개 컬렉션 평균에 다른 사람이 채점할 수 없는 항목이 섞여 있고, GPT-5.4는 가중치와 학습 데이터를 볼 수 없고 제공자가 버전을 내릴 수 있어 재현성이 떨어진다. 이 인터페이스에서는 temperature와 top-p를 설정할 수 없어 제공자 기본값이 적용됐고, 바이트 단위로 동일한 프리픽스를 다시 채점해도 같은 값이 나오지 않는다고 명시한다.