LLM 평가에 캘리브레이션을 1급 지표로 넣어야 하는 이유

Calibration as a First-Class Criterion in LLM Evaluation

HF Daily2609.26489

Mario Sanz-Guerrero, Katharina von der Wense2026-09-22조회 6

무엇인가

이 논문은 새 기법을 제안하는 실험 논문이 아니라 LLM 평가 관행을 바꾸자고 주장하는 포지션 페이퍼다. 저자들이 문제로 삼는 것은 캘리브레이션 측정 기법의 부재가 아니라 채택의 부재다. 캘리브레이션이란 모델이 표현하거나 암묵적으로 드러내는 신뢰도와 실제 정답 여부가 얼마나 일치하는지를 뜻한다. 정확도나 F1은 "모델이 정답을 냈는가"만 답할 뿐, 배포 단계에서 필요한 "이 출력을 믿어도 되는가"에는 답하지 않는다. 90%를 맞히는 두 모델이라도 신뢰도가 실제 정답률을 따라가는 모델은 나머지 10%의 오류를 표시해 주지만, 그렇지 않은 모델은 오답과 정답이 똑같이 보인다. 저자들은 최근 주요 모델 패밀리의 공개 기술 보고서와 모델 카드를 검토해 이 간극을 보여준다. GPT-5.5, Claude Sonnet 4.6, Gemini 3.5 Flash, DeepSeek V3.2, Llama 3, Qwen3, Gemma 3, GPT-OSS, OLMo 3 모두 수십 개의 역량·안전 벤치마크 점수는 보고하지만 캘리브레이션은 어디에도 보고하지 않는다. 예외는 GPT-4 기술 보고서로, RLHF가 캘리브레이션에 미치는 영향을 문서화했지만 이후 릴리스는 이 관행을 이어가지 않았다. 저자들은 이 검토가 완전한 서베이가 아니라 패턴을 보여주기 위한 예시임을 명시한다.

어떻게 동작하나

캘리브레이션의 정의는 이렇다. 어떤 예측기가 신뢰도 p로 내린 예측들 중 실제로 p 비율이 정답이면 그 예측기는 캘리브레이션되어 있다. 이는 모집단 수준의 속성이며 정확도와는 별개다. 측정에는 예시마다 두 가지 입력이 필요하다. 신뢰도 점수와 정답 판정이다. 정답 판정은 보통 과제에서 바로 나오지만 신뢰도는 LLM이 최소 세 가지 방식으로 표현하기 때문에 간단하지 않다. 첫째 토큰·시퀀스 확률로, 자기회귀 모델의 시퀀스 확률을 길이로 정규화한 값이 고전적 분류기 신뢰도의 자연스러운 확장이며 구조적으로 항상 존재하는 유일한 신호다. 둘째 "80% 확신한다"처럼 말로 표현하는 verbalized confidence다. 셋째 헤지, 답변 거부, 의심 표현 같은 행동 신호다. 저자들은 이 셋이 서로 대체 가능하지 않다고 강조한다. 토큰 확률은 잘 맞는데 말로 표현한 신뢰도는 엉망일 수 있고 그 반대도 가능하다. 배포 환경에서 사용자와 하위 구성요소가 실제로 보는 것은 내부 소프트맥스 확률이 아니라 생성된 텍스트이므로, 평가는 어느 신호를 측정하는지 명시해야 한다. 또한 입력 자체의 모호함에서 오는 줄일 수 없는 aleatoric 불확실성과 지식 부족에서 오는 epistemic 불확실성을 구분해야 한다. 표준 지표는 둘을 같이 취급하지만 실제 대응은 다르다. 전자에는 답변 회피가, 후자에는 검색이나 추가 학습이 맞다.

무엇과 다른가

캘리브레이션 실패가 문제를 일으키는 지점은 세 곳이다. 첫째 고위험 도메인의 인간-AI 상호작용이다. 사용자는 모델이 자신 있어 보이는 정도에 따라 신뢰를 조정하는데, 법률 분야 평가에서는 존재하지 않는 판례 인용과 조작된 판결문이 완전한 확신을 담아 제시되었고, 의료 질의응답에서는 환각 임상 사실과 잘못된 약 용량이 빈번한 실패 유형으로 남아 있다. 위험한 것은 실수 자체가 아니라 실수할 때 경고가 없다는 점이다. 반대로 모든 답변에 헤지를 붙이는 것도 신호를 없애는 캘리브레이션 실패다. 둘째 에이전트·추론 시스템이다. 플래너, 검색기, 실행기가 연결된 파이프라인에서 신뢰도는 행동할지, 사용자에게 물을지, 멈출지를 결정하는 신호인데 한 구성요소가 과신하면 그 오류가 다음 단계로 그대로 전파된다. 사고 사슬을 생성하는 추론 모델에서는 초반의 과신한 오류가 최종 답을 망가뜨리므로 최종 답만 측정하면 내부 오류를 놓친다. 셋째 연구 파이프라인 자체다. LLM-as-a-judge는 심사 모델이 캘리브레이션되지 않으면 순위와 승률, 보고된 개선폭이 편향되고, 합성 데이터 생성은 확신에 찬 오류를 만들어 다음 학습 라운드가 그것을 학습하며, 능동 학습과 데이터 필터링, 불확실성 기반 검색은 신뢰도 점수로 예시를 고르기 때문에 잘못된 데이터를 선택하게 된다. 저자들은 캘리브레이션이 악화되는 구조적 이유도 짚는다. 우리는 측정하는 것만 최적화하는데 캘리브레이션은 측정하지 않는다. 베이스 모델은 객관식 과제에서 비교적 잘 캘리브레이션되어 있지만 정확도가 오르는 상황에서도 instruction tuning과 RLHF가 캘리브레이션을 해친다. 대화 형식 자체도 영향을 준다. 같은 답이라도 사용자가 준 답보다 자기 출력으로 제시된 답에 모델이 유의하게 더 확신한다. RLHF는 사용자 신념에 맞춰 신뢰도를 조정하는 아첨(sycophancy)을 늘릴 수 있다. 또한 대부분의 벤치마크는 "모르겠다"고 말하는 것과 틀린 답에 똑같이 0점을 주기 때문에 무작정 찍는 것이 회피하는 것보다 항상 유리하고, 이는 환각을 직접적으로 보상한다.

어떻게 쓰나

논문은 새 지표를 만들 필요가 없다고 본다. 표준 캘리브레이션 지표는 모두 예시당 신뢰도 점수와 정답 레이블 두 입력만 요구하며, 수식 자체는 분류든 생성이든 달라지지 않는다. ECE는 예측을 M개 신뢰도 구간으로 나눠 구간 정확도와 구간 신뢰도의 가중 평균 격차를 보고하고, 같은 구간으로 신뢰도 대비 정확도를 그린 신뢰도 다이어그램을 얻는다. 다만 ECE는 구간 선택에 민감하고 통계적으로 편향되어 있으며 고정된 클래스 집합 위의 단일 수치 신뢰도를 가정한다. Brier score는 확률 예측의 평균제곱오차로, 데이터셋 전체 정확도만 예측해도 0에 가까워지는 ECE와 달리 적절한 채점 규칙(proper scoring rule)이라 확률이 실제 빈도와 일치할 때만 최소화된다. 그러나 이산적 결과를 가정하므로 자유 형식 텍스트에는 정답/오답 이진 라벨로 단순화해야 한다. AUROC는 무작위로 뽑은 정답 예측이 오답 예측보다 높은 신뢰도를 받을 확률로, 신뢰도 값 자체가 아니라 순위만 보기 때문에 모든 신뢰도를 같은 양만큼 부풀린 모델도 값이 그대로다. 즉 캘리브레이션이 아니라 분리 능력을 측정한다. 저자들에 따르면 객관식, 단답형, 수학, 코드 생성처럼 정답 판정이 이진이거나 표준 임계값으로 이진화될 수 있는 과제에서는 기존 지표가 바로 작동한다. 실제로 앞서 검토한 기술 보고서들의 벤치마크가 대부분 여기에 해당한다. 문제는 여러 답이 정답일 수 있는 자유 형식 생성으로, 측정할 단일 정답 시퀀스가 없어 신뢰도와 정답 둘 다 정의하기 어렵다.

전제와 한계

제안은 두 갈래다. 지금 할 수 있는 일과 연구가 필요한 일이다. 각 하위 분야는 주 지표와 캘리브레이션 점수를 짝지어야 한다. 기계번역의 BLEU·COMET, 요약의 ROUGE, 정보 추출의 F1, 명령 수행의 승률, QA의 정확도 옆에 캘리브레이션 열을 추가하는 것이다. 합리적인 신뢰도 신호를 고르고 그 분야가 이미 쓰는 정답 기준을 재사용해 결과 표에 열 하나를 더하면 된다. 기계번역에는 참조 없이 번역 품질을 예측하는 품질 추정(quality estimation)이 이미 효과적인 신뢰도 신호로 존재하지만 BLEU와 함께 보고되는 일은 드물다. 저자들은 이것이 어려워서가 아니라 관행 때문이라고 말한다. 구체적 제안은 두 가지다. 모든 벤치마크 결과에 주 점수와 함께 캘리브레이션 점수를 넣고 주요 리더보드에 열을 추가할 것, 그리고 심사자가 이런 보고의 부재를 기본 학습 설정을 빠뜨린 것과 같은 방법론적 결함으로 취급할 것. Kalai 등이 제안한, 확신에 차서 틀리는 것이 "모르겠다"보다 더 큰 점수 손해를 보도록 벤치마크 채점을 바꾸는 아이디어도 이와 양립한다. 자유 형식 생성은 표면 표현이 아니라 의미로 응답을 묶는 것에서 출발할 수 있지만 표준화와 과제 간 성능 분석은 미해결이다. 저자들은 이 연구가 단순 과제의 보고 규범 정착과 병행해 진행되어야 하며 규범 도입을 미뤄서는 안 된다고 강조한다. 또한 사용자가 실제로 읽는 것은 말로 표현된 신뢰도이므로 이를 독립적인 평가 대상으로 삼아 표준 프롬프트 형식과 일관된 채점법, 내부적으로 아는 것과 실제로 말하는 것을 구분하는 분석이 필요하다고 본다. 마지막으로 캘리브레이션이 "언제 믿을까"에 답한다면 "왜 믿을 수 있나"에 답하는 attribution도 같은 채택 문제를 겪을 것이므로 성숙해지면 표준 보고 항목이 되어야 한다고 덧붙인다.

실무 관점에서 이 논문이 요구하는 것은 새 라이브러리가 아니라 체크리스트다. 모델을 배포하거나 에이전트 파이프라인을 구성할 때, LLM-as-a-judge로 평가 파이프라인을 돌릴 때, 합성 데이터를 만들어 재학습에 넣을 때, 능동 학습이나 불확실성 기반 검색으로 데이터를 고를 때마다 신뢰도 점수가 실제 정답률과 맞는지 먼저 확인해야 한다. 특히 사용자에게 보이는 것은 로그프롭이 아니라 텍스트이므로 내부 토큰 확률의 캘리브레이션과 말로 표현된 신뢰도의 캘리브레이션을 따로 봐야 한다. 벤치마크를 만들거나 리더보드를 운영한다면 정답 판정이 이진인 과제에서는 캘리브레이션 열을 바로 추가할 수 있다. 자유 형식 생성에서는 아직 표준이 없으므로, 어떤 신뢰도 신호를 썼고 정답을 어떻게 판정했는지 최소한 명시해야 한다.

이 논문에는 새로운 실험이나 수치가 없다. 저자들 스스로 포지션 페이퍼라고 밝히며 주장은 기존 문헌의 결과 위에 세워져 있다. 본문에 등장하는 수치는 인용된 선행 연구의 것이고, 이 논문이 직접 만든 벤치마크 결과나 베이스라인 비교는 제시되지 않는다. 모델 기술 보고서 검토 역시 완전한 서베이가 아니라 패턴을 보여주기 위한 예시이며 개별 사례를 놓쳤을 수 있다고 명시한다. 가장 큰 한계는 자유 형식 생성용 캘리브레이션에 합의된 정의가 아직 없다는 점이다. 그래서 구체적인 보고 제안은 지표가 이미 확립된 과제에 한정했고, 개방형 생성용 지표 개발은 향후 필수 연구 영역으로 남겨 두었다.

관련 논문