의료 LLM의 정답과 일관성은 설명 충실성을 보장하지 않는다
Right Answer, Wrong Reason: Accuracy, Consistency, and Consensus Are Misleading Indicators of LLM Faithfulness in Clinical Decision Support
무엇인가
임상 의사결정 지원에 LLM을 붙일 때 흔히 정답률을 안전 신호로 삼는다. 이 논문은 그 가정을 정면으로 문제 삼는다. 의료 LLM이 시험 문제에서 높은 정확도를 내더라도, 답과 함께 제시된 설명이 실제로 결정을 이끈 개념을 이름 붙였다는 보장은 없다는 것이다. 정답은 맞지만 이유는 틀릴 수 있다는 이 간극을 저자들은 충실성 격차라고 부르고, 이를 직접 해석 가능한 세 가지 경량 지표로 측정하자고 제안한다.
어떻게 동작하나
제안하는 지표는 세 가지다. Explanation Stability Index(ESI)는 같은 질의를 반복했을 때 추론이 얼마나 일관되게 유지되는지를 잰다. Causal Faithfulness Score(CFS)는 모델이 근거로 인용한 개념을 실제로 제거(ablation)했을 때 예측이 흔들리는지를 보는 것으로, 인용된 개념이 정말로 예측을 떠받치고 있는지 시험한다. Perturbation Stability Score(PSS)는 의미를 보존하는 바꿔쓰기(paraphrase)에 대해 출력이 얼마나 견고한지를 측정한다. 세 지표 모두 모델 내부에 접근하지 않고 출력만으로 계산할 수 있도록 설계된 경량 도구라는 점이 특징이다.
무엇과 다른가
평가는 6개 LLM을 150개 MedQA-USMLE 문항에 적용해 총 900건의 모델-문항 관측을 모으는 방식으로 이뤄졌다.
어떻게 쓰나
결과는 정확도 중심 지표에 불편한 신호를 준다. 모델이 인용한 임상 개념 가운데 인과적으로 필수적이었던 것은 23.3%에 그쳤다. 정답을 낸 경우의 CFS가 오답보다 오히려 낮았고(0.212 대 0.398), 답의 일관성은 CFS를 부정적으로 예측했다(Spearman r = -0.466). 모델 쌍이 답에는 합의하면서도 인용한 추론 개념은 8.8%만 공유하는 경우도 있었다. 저자들은 이 결과가 정확도·일관성·합의가 임상 의사결정 지원에서 불완전한 안전 신호임을 보여준다고 정리한다.
전제와 한계
실무 관점에서 이 논문은 의료처럼 규제 민감한 도메인에 LLM을 얹을 때 평가 파이프라인을 어디에 둬야 하는지 알려준다. 정답률 벤치마크, 자기일관성 투표, 다중 모델 합의는 서로 다른 각도에서 유용하지만, 설명이 실제 결정 근거인지까지 대신 확인해주지는 않는다. 인용 개념을 하나씩 제거해 출력 변화를 보는 반사실적 테스트나 의미 보존 패러프레이즈에 대한 민감도 측정을 배포 전 점검 항목으로 넣는 편이 낫다. 특히 정답률이 높다는 사실이 설명의 인과적 충실성을 보증하지 않으며, 오히려 정답에서 CFS가 더 낮았다는 관찰은 정답만 검증하는 회귀 테스트의 사각지대를 시사한다.
저자들이 명시한 한계도 분명하다. 제시된 증거는 기계적(mechanistic)이 아니라 행동적(behavioral)이다. 개념 제거 테스트는 출력의 반사실적 민감도를 재는 것이지 모델 내부 회로를 들여다보는 것이 아니므로, 인과성 주장은 관측된 입출력 수준에 머문다.