LLM 신뢰도 추정을 현재 추론이 아니라 과거 채점 경험에서 얻는 XConf 제안
Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents
무엇인가
이 논문은 LLM이 이미 낸 답이 맞을 확률, 즉 P(correct | task, output)을 보정해 추정하는 문제를 다룬다. 코드가 실제로 병합되고, 브라우저가 거래를 완료하고, 과학·의료 의사결정과 수 시간짜리 에이전트 작업이 돌아가는 상황에서 잘못된 출력은 실제 피해로 이어질 수 있다. 그래서 신뢰도는 무엇을 배포하고, 언제 사람에게 넘기고, 언제 재시도할지 결정하는 신호가 된다. 기존 추정기는 verbalized confidence처럼 모델이 방금 답을 되돌아보게 하거나, 토큰 확률을 채점하거나, 같은 과제를 재샘플링해 일치도를 재는 방식으로 현재 추론 과정만 읽는다. 저자들은 현재 추론만으로는 충분하지 않다고 주장한다. 빠진 것은 과거 경험이며, 인간 메타인지 연구에서 사람이 방금 한 추론의 재검토뿐 아니라 유사 과제에서 기억된 결과를 활용해 자신의 정확도를 판단한다는 점을 근거로 든다.
어떻게 동작하나
제안 방법 XConf는 모델의 누적 경험을 신뢰도 추정에 넣는다. 경험 은행 B에는 모델이 실제로 수행하고 채점된 과거 에피소드가 저장된다. 한 에피소드는 e=(x, ρ, a, r, v, y)로 표현되며, x는 과제, ρ는 추론 흔적이나 롤아웃, a는 출력, r은 채점 전에 쓴 짧은 자기 성찰, v는 그 끝에서 말한 신뢰도, y는 채점된 결과다. 저장 레코드는 과제, 모델의 성찰, 말한 신뢰도, 채점 결과, 그리고 채점이 도착한 뒤 한 번 작성하는 교훈으로 구성된다. 교훈은 은행에 격리되어 아직 채점되지 않은 해답을 성찰할 때 모델에게 보여주지 않는다. 사후 확신 편향이 지시만으로 제거되지 않기 때문이다. 은행은 별도 데이터 수집이 아니라 개발·평가·지연 피드백 배포 과정에서 어차피 채점될 에피소드의 부산물이며, 임베딩은 오프라인에서 분할 상환된다. 레코드의 다섯 필드는 객관식 답, 프로그램, 30단계 롤아웃을 모두 같은 형식으로 담는다. 테스트 시점에는 현재 에피소드 이전에 채점된 것만 보이며, 추정기는 c_hat = f(x, ρ, a, r, v; B)로 정의되고 목표는 P(y=1 | x, a)다. 기존의 trace-intrinsic 추정기 c_hat = g(x, ρ, a)와 달리 B를 검색으로 참조한다.
무엇과 다른가
XConf는 같은 경험 은행을 두 번 읽는다. Recall은 통계적으로 읽는다. 각 에피소드는 F(e)=[φ(x); v]로 키가 되며, φ는 고정된 기성 임베더다. 유사도는 은행의 채점된 에피소드로 적합한 정답성 감독 재조정 공간에서 측정된다. Recall은 가장 가까운 k=50개 에피소드를 검색해 Recall(e)=1/k Σ y_j를 계산한다. 즉 비슷한 과제에서 비슷한 신뢰도를 말했을 때 실제로 맞춘 비율이다. 은행이 희박하면 추정은 실패하지 않고 해당 신뢰도에서의 모델 기본 성공률 쪽으로 완화된다. Reflect는 검색된 에피소드를 짧은 문맥 카드로 렌더링해 모델에게 보여준다. 카드에는 과제 요약, 당시 말한 신뢰도, 결과, 교훈이 들어간다. 현재 과제와 자신의 성찰, 카드를 본 모델은 먼저 기록이 드러내는 반복 실패 모드를 이름 붙이고, 그다음 자신의 트랙 레코드에 비추어 보정된 신뢰도를 다시 말한다. Reflect는 과제를 다시 푸는 프롬프트가 아니다. 최종 추정은 두 읽기를 평균해 Confidence(e)=1/2(Recall(e)+Reflect(e))로 만든다.
어떻게 쓰나
실험은 추론, 코딩, 멀티모달 QA, 상호작용 에이전트를 아우르는 9개 벤치마크와 세 계열의 네 모델에서 이뤄졌다. 모델은 Gemini 2.5 Flash, Gemini 3.5 Flash, Claude Sonnet 4.6, 오픈웨이트 Qwen3.5-397B이고, 모든 모델에 gemini-embedding-001 하나를 고정 임베더로 쓴다. 비교 대상은 verbalized confidence, 10샘플 self-consistency, discrete semantic entropy, 토큰 확률을 노출하는 플랫폼의 P(True), 에이전트용 단일 롤아웃 verbalized와 LLM judge, Platt·isotonic·histogram 보정, 여러 conformal 방법, 학습된 verifier다. 평가는 AUROC, ECE, AURC를 보고하고 5겹 회전으로 경험이 진짜 사전 경험만 포함하도록 했다. 핵심 결과로 XConf는 24개 모델-데이터셋 비교 중 23개에서 10샘플 self-consistency를 이기거나 동등했고, SC@10 대비 21승 2무 1패였다. 생성 비용은 10분의 1이고 ECE는 전반적으로 더 낮았으며 MMLU-Pro에서는 3배에서 8배 낮았다. MMMU-Pro에서는 .779–.833 대 .756–.769로 모든 열에서 앞섰고 ECE는 2배에서 5배 낮았다. LiveCodeBench에서는 SC@10이 코드 유사도로 적응해도 .742–.804에 그쳐 XConf보다 .06–.13 AUROC 낮았고 ECE는 4배에서 20배, 생성 비용은 10배였다. 에이전트에서는 ScienceWorld, AppWorld, SWE-bench Verified의 12개 모델-도메인 셀에서 최고이거나 동등했다. AppWorld에서 verbalized는 네 모델 평균 .72였지만 검색된 경험은 .86에 도달했고, SWE-bench Verified에서는 적응된 verifier가 .595–.806으로 XConf의 .775–.846보다 낮았다. ALFWorld와 WebShop은 실패가 궤적에 너무 잘 드러나 내성적 베이스라인이 포화해 메인 표에서 제외됐다.
전제와 한계
경험이 쌓일수록 보정이 좋아진다. 은행을 100개 에피소드에서 전체 풀로 늘리면 세 에이전트 도메인 모두 AUROC가 상승했고, AppWorld와 Claude Sonnet 4.6 조합에서는 .628에서 .810으로 올랐다. MMLU-Pro는 1만 2천 에피소드에서 평탄해지지만 BBEH와 에이전트 도메인은 전체 풀에서도 아직 상승 중이었다. 엄격한 실시간 순서로 은행을 쌓아도 같은 곡선이 나왔다. 선택적 예측에서는 신뢰도가 가장 낮은 10%를 보류하면 전달된 정확도가 36개 셀 평균 4.8포인트 올랐고 모든 셀이 이득을 봤다. LiveCodeBench와 Claude Sonnet 4.6에서는 5.4포인트, AppWorld와 Gemini 3.5 Flash에서는 8.7포인트로 .805에서 .892가 됐다. 가장 확신하는 십분위는 .98 정확도로 verbalized의 .90, SC@10의 .87보다 높았다. 가장 덜 확신하는 십분위는 .28 정확도였고, 하위 5분의 1이 전체 오류의 .50을 담아 verbalized의 .45보다 많이 잡았다.
분석은 경험 은행의 성질을 더 보여준다. 서로 다른 벤치마크의 은행을 정리 없이 합쳐도 다섯 구성에서 AUROC 변화가 최대 .01에 그쳤다. 같은 종류의 데이터셋 전이는 잘 되어 R2E-Gym 은행이 SWE-bench를 자체 은행과 비슷하게 보정했고(.720–.734 대 .726), 두 은행을 합치면 어느 한쪽보다 +.022에서 +.053 좋아졌다. 반면 다른 모델의 기록은 여섯 데이터셋 중 다섯에서 .03–.06 AUROC를 잃었고, 과제 계열을 넘는 전이는 중앙값 .08 손실, 최악은 코드였다. 검색 키에서는 말한 신뢰도가 가장 중요했다. 무작위 이웃은 24개 추론 셀 평균 AUROC .494로 우연 수준, 의미 검색은 .732, 전체 레시피는 .833이었다. 말한 신뢰도를 빼면 추론에서 .08, 에이전트에서 .12 AUROC가 줄었다. 난이도 통제 실험에서 다른 세 모델의 같은 질문 성공률을 고정하고 같은 점수 질문끼리만 비교해도 XConf는 정답과 오답을 .79 AUROC로 분리했고 36개 셀 중 35개에서 우연 이상이었으며 verbalized보다 .05, 에이전트에서는 .06 앞섰다. 모델 크기를 Qwen3.5 397B, 27B, 9B, 4B로 줄이면 과제 정확도는 급락하지만 추정은 거의 움직이지 않았고, 통계적 Recall은 크기에 거의 불변이며 verbal Reflect만 27B 아래에서 나빠졌다. 채점 라벨은 부정확해도 견디지만 모델 자기 판단은 안 된다. 금 라벨과 .91만 일치하는 약하지만 독립적인 LLM judge로 바꿔도 가치 대부분이 남아 10샘플 self-consistency와 AUROC에서 동등하면서 비용은 5분의 1이었다. 자기 판단 라벨은 은행이 잡아야 할 자신만만한 오답에서 정확히 틀려, 결과 라벨이 전혀 없는 은행보다 낮은 점수를 냈다.
개발자에게 이 논문은 신뢰도를 운영 결정에 쓰려는 시스템에서 현재 추론만 보는 대신 채점된 과거 에피소드를 자산으로 축적하라는 제안이다. 특히 코드와 에이전트처럼 재샘플링 투표가 비현실적이거나 불가능한 작업에서 한 번의 답 생성과 짧은 Reflect 호출로 보정 오차를 낮추고, 가장 낮은 10%를 보류해 전달 정확도를 올리는 방식이 유용하다. 도입하려면 과제, 성찰, 말한 신뢰도, 결과, 교훈을 저장하는 은행과 독립적인 채점 신호가 필요하고, 검색 키와 임베더를 고정해도 되는지 확인해야 한다. 모델이 계속 개선되면 경험이 행위자에 묶여 있으므로 오래된 에피소드가 사실상 다른 모델의 기록이 될 수 있어 망각이나 재보정 전략도 필요하다. 저자들이 밝힌 한계는 분명하다. 투표 가능한 짧은 사실 조회, 예컨대 SimpleQA류에서는 self-consistency가 여전히 더 강한 판별기이며 메인 표의 유일한 패배도 그런 셀에 있다. 이 논문의 주장은 모든 곳에서 우월하다는 것이 아니라 투표가 갈 수 없는 곳에서의 폭과 비용이다. 또한 검색 방식, 은행 구축과 망각, 재사용 가능한 실패 스키마로의 통합, 더 날카로운 성찰 유도, 모델이 회피하지 않고 재보정하도록 기록을 읽히는 방법은 모두 열린 설계 선택이다. 자기 진화 메모리와의 결합은 아직 검증되지 않았고, 자기 개선 행위자는 비정상적이어서 능력 성장에 맞춰 보정 기억도 잊어야 할 수 있다. 외부 채점이 필요하다는 점은 결함이 아니라 인간 신뢰도도 객관적 결과 피드백에 대해서만 보정된다는 메타인지의 성질로 설명된다.