멀티홉 RAG의 자신감 있는 오답을 검색 시점 특징만으로 줄이는 기권 프레임워크

Predictable Failure in Multi-Hop Retrieval: Score-Distributional Confidence Scoring and Abstention

arXiv2609.22056v1

Andre Bacellar2026-09-18조회 4

무엇인가

멀티홉 검색 실패는 질의 전체에 균일하게 퍼져 있지 않다. 이 논문은 실패가 구조적으로 예측 가능한 하위집단에 몰린다는 것을 두 개의 정리로 형식화하고, 그 구조를 이용해 검색 시점에 기권(abstention)하는 프레임워크 RegimeAbstain을 제안한다. 문제의식은 명확하다. RAG 파이프라인은 어떤 질의에도 답을 반환한다. top-k 패시지를 뽑아 언어모델에 넣고, 순위 리스트를 그대로 내놓는다. 넓은 질의 분포에서 재현율을 최대화하려는 목적에는 맞지만, 검색 품질이 이질적이고 높은 확신의 오류가 비쌀 때는 부적절하다. 멀티홉 QA가 정확히 그런 설정이다. 질의는 브리지 패시지와 답 패시지를 모두 검색해야 하는데, 시스템은 한쪽을 맞히고 다른 쪽을 놓치는 일이 잦다. 저자들의 LLM-judge 파이프라인에서 MuSiQue 테스트 질의의 39.5%가 top-5 안에 모든 gold 패시지를 담지 못한다. 그런데도 시스템은 낮은 확신을 표시하지 않고 랭킹 리스트를 반환하며, 하위 컴포넌트에 증거가 불완전하다는 신호를 주지 않는다. 저자들은 이런 시스템에 세 번째 행동, 즉 기권(⊥)이 있어야 한다고 주장한다.

어떻게 동작하나

논문이 새로 정의하는 지표는 Confident-Wrong-Answer Rate(CWAR)다. 신뢰도 점수 s(q)와 임계값 τ에 대해 확신 집합을 C_τ = {q : s(q) ≥ τ}로 두면, CWAR(τ) = |{q ∈ C_τ : y(q)=0}| / |C_τ| = 1 - Pr[y(q)=1 | s(q) ≥ τ]다. 여기서 y(q)는 모든 gold 패시지가 top-k에 들어갔는지를 나타내는 완전 성공 지표다. τ=0이면 모든 질의에 답하므로 CWAR(0) = 1 - ȳ, 즉 기저 실패율과 같다. τ를 올리면 커버리지 Cov(τ) = |C_τ|/|Q|가 줄어드는데, 좋은 신뢰도 점수라면 CWAR이 커버리지보다 빠르게 줄어야 한다. 정확도-커버리지 곡선의 면적인 AUC-AC가 모든 운용점에서의 성능을 요약한다. 이 위에 논문은 첫 번째 정리인 CWAR 환원 가능성(CWAR Reducibility)을 세운다. 베이즈 최적 점수를 s*(q) = P[y=1 | φ(q)]로 정의하면, AUC-AC(s*) > AUC-AC_random이 성립하는 것과 상호정보량 I(y; φ(q)) > 0인 것이 필요충분이다. 증명은 대우와 반복 기대법칙, Neyman-Pearson 보조정리로 구성된다. I=0이면 y와 φ가 독립이라 s*가 상수 ȳ가 되고 정확도-커버리지 곡선이 평평해진다. I>0이면 Var(s*)>0이고 E[s*]=ȳ이므로 ȳ보다 큰 양의 측도를 가진 질의 집합이 존재해, 그 위에서 임계값을 잡으면 확신 집합이 평균 이상 질의에 집중된다. 이 정리의 경험적 함의가 논문의 핵심 논지다. dense 파이프라인의 실패는 특징 공간에서 거의 균일하게 분포한다(MuSiQue Dense: AUC-AC 0.556 대 random 0.366으로 격차가 작다). 반면 LLM judge는 실패를 구조적으로 복잡한 질의에 몰아넣어 I(y; φ)를 키우고 실패를 더 예측 가능하게 만든다(MuSiQue PropH: AUC-AC 0.790 대 random 0.576으로 격차가 크다). 즉 CWAR이 높다고 환원 가능한 것이 아니다. dense 조건들이 기저 CWAR은 가장 높은데(62.1%, 58.3%) AUC-AC는 가장 약하다.

무엇과 다른가

두 번째 정리인 특징 regime 상보성(Feature Regime Complementarity)은 단일 ANN 점수 특징으로는 모든 실패 regime에서 최고 예측 성능을 낼 수 없음을 보인다. 지배적 특징이 데이터셋마다 다르다. MuSiQue에서는 질의 길이(query-len), HoVer에서는 hop-1 집중도(hop1-top3)다. 논문은 구성적 증인 쌍을 제시한다. leave-one-out ablation에서 query-len은 MuSiQue PropH에서 필요하고(ΔAUC = -0.012) HoVer Dense에서는 기여하지 않으며(-0.002, 노이즈 수준), hop1-top3는 HoVer Dense에서 필요하고(-0.026) MuSiQue PropH에서는 기여하지 않는다(-0.001). 엔트로피 특징(hop1-H, hop2-H)은 두 조건 모두에서 기여하지 않는다(ΔAUC ≥ 0). 이 정리는 9개 특징 전부의 보편성을 주장하지 않고, 상보적 구조가 존재한다는 것만 주장한다. 결론은 다중 특징 집계의 정당화다. 단일 특징만 쓰는 신뢰도 모델은 그 특징이 지배하지 못하는 regime에서 피할 수 있는 AUC-AC 손실을 감수하게 된다.

어떻게 쓰나

이 원리를 구현한 것이 RegimeAbstain이다. 핵심 구성 요소는 Retrieval Confidence Score(RCS)로, RCS(q) = σ(w^T φ(q) + b) 형태의 로지스틱 함수다. φ(q)는 검색 후 얻어지는 ANN 유사도 점수에서 계산되는 최대 9개 특징 벡터다. hop1-max는 최대 hop-1 점수, hop1-margin은 상위 2개 hop-1 패시지의 격차, hop1-top3는 상위 3개 hop-1 점수의 평균, hop1-H는 hop-1 점수 집합의 정규화 섀넌 엔트로피, hop1-lift는 상위 50개 평균 대비 최고 점수의 돌출도(s1 / 상위 50개 평균), hop2-max와 hop2-margin, hop2-H는 SVO로 추출한 N=3개의 브리지 질의를 임베딩해 얻은 hop-2 점수 분포에서 나온다. 마지막으로 query-len은 질문의 단어 수다. hop-2 점수를 쓸 수 없는 hop-1 전용 아키텍처에서는 φ6~φ8을 제거해 d=6이 된다. 중요한 점은 이 모든 특징이 추가 LLM 호출 없이 검색 시점에 이미 존재하는 점수만으로 계산되고, 1ms 미만이 걸린다는 것이다. 학습은 gold 라벨이 있는 홀드아웃 검증셋에서 이진 교차엔트로피를 경사하강법으로 최소화하며(허용 오차 10^-7), 특징은 z-score로 정규화하고 테스트 예측에는 검증셋 정규화 통계를 쓴다. 임계값 선택은 사용자가 CWAR 목표 γ를 지정하면 검증셋에서 τ를 스윕해 τ* = min{τ : CWAR(τ) ≤ γ}를 고른다. CWAR(τ)는 τ에 대해 단조 비증가이고 τ=0에서 1-ȳ, τ=1에서 0(확신 집합이 비어 있음)이므로 원하는 τ*는 어떤 γ ≥ 0에 대해서도 항상 존재한다.

전제와 한계

실험은 세 개의 멀티홉 벤치마크와 두 개의 검색 아키텍처, 총 다섯 개의 실패 regime에서 이뤄진다. 데이터셋은 MuSiQue(1000 질의, 486 tune / 514 test), 2WikiMultiHopQA(1000 질의, 509 / 491), HoVer(2000개의 SUPPORTED claim, 1007 / 993)다. 아키텍처는 두 가지다. Proposal H(LLM-judge)는 NV-Embed-v2 hop-1 ANN, N=3 SVO 확장 hop-2 질의, 20-candidate 풀, 3-way LLM judge, α=0.10을 쓰고 MuSiQue R@5 = 0.8138, 2Wiki R@5 = 0.9527, 완전 성공률 60.5%와 85.5%를 기록한다. Dense-only는 hop-1 top-5를 그대로 쓰고 LLM judge와 SVO 재순위가 없으며 완전 성공률이 MuSiQue 37.9%, 2Wiki 41.7%, HoVer 68.3%다. 비교 대상은 여덟 개의 신뢰도 신호다. Random, Entropy, Max-score, Margin, Lift, Query-len-inv, Temp-scaled, 그리고 같은 특징을 쓰는 2층 MLP(은닉 32-32)다. 여기에 hop-1 max-score를 비순응도로 쓰는 split-conformal 베이스라인도 별도로 평가한다. 지표는 테스트 분할의 AUC-AC(2000개 부트스트랩 95% 신뢰구간), 고정 커버리지(70%, 50%)에서의 CWAR과 정확도, 그리고 ECE(10개 등빈도 구간)와 Brier 점수다.

결과에서 RCS는 다섯 조건 전부에서 best 또는 co-best AUC-AC를 달성한다. MuSiQue LLM-judge에서 RCS는 AUC-AC 0.790으로 비학습 방법 중 최고인 Lift(0.776, +1.4pp)와 Temp-scaled(0.774, +1.6pp)를 앞선다. Entropy 단독은 0.743으로 Max-score 0.751보다도 뒤진다. 2WikiMultiHopQA에서는 RCS와 Query-len-inv가 0.947로 동률이고, entropy 0.849, random 0.841이다. entropy는 random 대비 +0.8pp밖에 못 얻는 반면 RCS는 +10.6pp를 얻는다. HoVer dense에서는 MLP 0.878과 RCS 0.873이 부트스트랩 신뢰구간에서 겹치고, 둘 다 비학습 방법을 최소 +3.4pp 앞선다. dense MuSiQue와 dense 2Wiki에서도 RCS와 MLP가 신뢰구간 내에 있으며, 2Wiki dense에서는 RCS가 0.649로 MLP 0.643을 앞선다. 운용점 수치가 실무적으로 중요하다. MuSiQue LLM-judge에서 50% 커버리지일 때 정확도 79.4%로, CWAR이 기저 39.5%에서 20.6%로 떨어진다(47.8% 상대 감소). 70% 커버리지에서는 정확도 75.1%(기저 대비 +14.6pp)이고 CWAR은 39.5%에서 24.9%로 줄어 37% 상대 감소다. 캘리브레이션은 ECE = 0.035로, RCS가 약 0.7인 질의 중 실제로 약 70%가 완전 성공한다는 뜻이다. Brier 점수는 0.183으로 다수 클래스 기준선 0.239보다 낫다. 전이 실험도 인상적이다. MuSiQue tune으로 학습한 모델을 2Wiki 테스트에 zero-shot으로 적용하면 AUC-AC 0.942로, 2Wiki in-domain 모델의 0.947과 0.5pp 차이밖에 나지 않는다. MuSiQue의 실패율이 2Wiki보다 2.8배 높은데도(39.5% 대 14.5%) 이 전이가 성립한다는 것이 regime 특징이 도메인 무관 구조를 담는다는 근거다. 특징 중요도는 데이터셋마다 갈린다. MuSiQue에서는 query-len이 가장 강하고(-1.2pp), HoVer에서는 hop1-top3가 지배한다(-2.6pp). MuSiQue에서 RCS는 query-len, hop1-lift, hop2-max에서 신호를 대부분 얻고 엔트로피 특징은 한계 정보를 전혀 더하지 않는다.

개발자 관점에서 이 논문이 주는 실용적 함의는 분명하다. 배포된 멀티홉 팩트 검증 시스템(HoVer dense, CWAR 31.7%)에서는 검증된 claim의 3분의 1 이상이 틀렸는데도 인터페이스상으로는 정답과 같은 신뢰도로 반환된다. 멀티홉 QA 시스템(MuSiQue PropH, CWAR 39.5%)에서는 답변의 거의 5분의 2가 불완전한 증거 위에 세워져 자신 있게 전달된다. RCS는 검색 시점에 이미 있는 ANN 점수만으로 1ms 미만에 계산되므로, 기존 검색 파이프라인을 건드리지 않고 질의 라우팅, 단계적 성능 저하, 휴먼 인 더 루프 에스컬레이션의 게이트로 붙일 수 있다. 기권 대신 재라우팅도 가능하다. 저자들의 rescue-judge 패스는 MuSiQue 테스트 실패 203개 중 27개를 회복하는데, RCS로 이 폴백을 트리거하면 80% 커버리지에서 플래그되는 약 20%의 질의에만 비용을 지불하면 된다. RegimeRouter와의 조합도 자연스럽다. RCS를 먼저 돌려 τ 미만이면 기권하거나 에스컬레이션하고, 그렇지 않으면 적절한 검색 파이프라인으로 라우팅한다. 모델 선택에 대해서도 저자들은 명확한 입장을 밝힌다. dense 조건에서 MLP가 동등한 성능을 내지만, 배포에는 RCS를 선호한다. 특징당 스칼라 가중치 하나로 해석 가능하고, 구조상 항상 캘리브레이션되며, 프로덕션에서 쓸 수 있는 작은 학습셋(486~1007개 질의)에서 과적합 위험이 낮기 때문이다.

한계와 전제도 저자들이 직접 밝힌다. 가장 중요한 것은 정리 1이 dense 파이프라인의 작은 절대 이득을 설명한다는 점이다. dense 파이프라인의 실패는 특징 공간에서 균일에 가까워 I(y; φ) ≈ 0이고, 이때는 어떤 복잡한 신뢰도 모델도 CWAR을 크게 줄일 수 없다. 실제로 dense MuSiQue의 최고 AUC-AC는 0.557로 PropH의 0.790에 크게 못 미친다. 정리 1은 LLM-judge 파이프라인에서 이득이 최대가 됨을 보장하는데, PropH 실패에서는 I(y; φ)가 높아 특징 정보를 온전히 활용할 수 있기 때문이다. 두 번째 전제는 특징 상보성 명제의 범위다. 이 명제는 9개 특징 전부의 보편성을 주장하지 않고, 상보적 구조가 존재한다는 것만 주장한다. 실제로 엔트로피 특징들은 두 조건 모두에서 기여하지 않는다. 또한 2Wiki에서 entropy가 실패하는 이유에 대한 분석도 한계와 연결된다. 2Wiki 실패의 상당수는 comparison 하위 유형에서 발생하는데, 브리지 패시지는 높은 확신으로 검색되어 hop-1 분포가 뾰족하고(낮은 엔트로피) 엔트로피는 이를 문제로 잡지 못한다. 두 번째 gold 패시지를 놓치는 진짜 원인은 브리지에서 SVO 확장으로 만든 질의가 약하다는 것이고, 이를 잡는 것은 hop2-max다. 즉 어떤 단일 신호도 모든 실패 모드를 덮지 못한다는 것이 이 논문의 출발점이자 한계다.