언어모델의 불확실성이 언제 어디서 생기는지 드러내는 U-Space

U-Space: Uncovering When and Why Uncertainty Arises in Language Models

HF Daily2610.09087

Tobias Braun, Nils Loose, Alexander Herzog2026-10-06

무엇인가

대형 언어모델이 고위험 의사결정에 쓰이면서 "이 답 하나를 얼마나 믿을 수 있는가"가 핵심 질문이 됐다. 모델은 틀린 결론도 유창한 설명과 권위 있는 어조로 제시하기 때문에, 언제 사람에게 넘겨야 하는지 판단하기 어렵다. 기존 불확실성 정량화는 반복 생성이나 별도로 학습된 구성요소를 요구하는 경우가 많고, 스칼라 하나로 압축된 추정값은 불확실성이 응답의 어디에서 생겼고 추론 중 어떻게 변했는지 알려주지 않는다. 게다가 최근 연구들은 생성 길이 자체가 정답 여부와 강하게 연관된다는 점을 보여, 추정기의 예측력 중 얼마가 불확실성 고유 정보이고 얼마가 길이 신호인지 구분해야 한다는 문제가 제기됐다.

어떻게 동작하나

논문은 기계적 해석가능성(mechanistic interpretability)에서 출발해 U-Space라는 잔차 스트림의 저차원 부분공간을 제안한다. 먼저 불확실성과 확실성을 표현하는 의미적 앵커(anchor) 단어 집합을 네 범주 — 모호성(ambiguity), 불완전성(incompleteness), 상충하는 증거(conflicting evidence), 일반적 불확실성(general uncertainty) — 로 나눈다. 각 앵커의 어휘 방향을 사전 계산된 평균 야코비안을 통해 잔차 공간으로 되돌리고(g = (W_U diag(γ) J̄_ℓ)ᵀ e_a), 범주별로 불확실성 극과 확실성 극의 중심을 각각 구해 빼서 양극성 방향 b를 만든다. 이 방향들을 모아 정규직교화한 U = B(BᵀB)^(-1/2)의 열들이 U-Space 기저다. 과제 예시, 정답 레이블, 학습 파라미터가 전혀 필요 없고, 앵커 집합만 바꾸면 다른 의미 속성에도 같은 구성이 적용된다.

무엇과 다른가

읽어내는 장치가 U-Lens다. 각 추론 토큰의 정규화된 은닉 상태를 기저에 투영해 α_t = Uᵀ norm(h_t) ∈ ℝ^C를 얻고, 이를 softplus로 양의 원뿔(positive cone)에 사영한 벡터의 길이를 원뿔 정렬도 A_cone으로 쓴다. 이 값은 어느 한 범주의 음의 정렬이 다른 범주의 양의 정렬을 상쇄하지 못하게 설계돼, 범주들을 서로 대안적이면서 동시 발생 가능한 불확실성 원천으로 취급한다. 최종 점수는 추론이 끝나는 end-of-thinking 토큰에서의 원뿔 정렬도에, 추론 구간 전체의 평균 예측 엔트로피 H̄(r)을 곱한 S(r) = A_cone(h_eot)·H̄(r)이다. 엔트로피를 합이 아니라 평균으로 쓴 이유는 합산 엔트로피가 추론 길이에 기계적으로 비례하기 때문이며, 곱셈 결합은 별도의 상대 스케일 피팅을 요구하지 않는다. 저자들은 이를 1차(분포적) 불확실성과 2차(언어화 가능한) 불확실성을 함께 조작화한 첫 추정기라고 주장한다.

어떻게 쓰나

실험은 Gemma 4(31B-it), Qwen3.5(27B), Magistral 1.1(Small-2507) 세 추론 모델과 MMLU-Pro, Omni-MATH, SuperGPQA, TriviaQA 네 벤치마크에서 벤치마크별 1,000개 층화 표본으로 수행했다. 신호는 네트워크 깊이의 2/3 지점(각 40, 42, 27층)에서 뽑는다. 비교 대상은 생성 길이, MSP, 예측 엔트로피, 최대 엔트로피, Mean NLL, Self-Certainty, DeepConf 같은 단일 생성 기반 방법과, P(True), TokUR(5회 추가 패스), Semantic Entropy(10개 샘플), SentenceSAR, 그리고 정답 레이블로 학습한 유일한 지도 베이스라인 Feature-Gaps다.

전제와 한계

길이 교란의 크기가 수치로 드러난다. 조정 없는 평가에서 생성 길이만으로 AUROC 68.6%가 나와 지도학습 Feature-Gaps(68.8%)에 거의 맞먹고 5회 패스 TokUR에 1.0점 뒤진다. 그런데 토큰 수 10분위 구간 안에서 지표를 다시 계산하는 길이 통제 평가에서 생성 길이는 AUROC 52.4%로 떨어지고 여러 기존 추정기도 함께 하락한다. P(True), TokUR, SentenceSAR는 9개 비교 중 8개에서 예측 엔트로피보다 낮아졌고, Semantic Entropy는 모델 평균에서 0.1점 앞서는 데 그쳤다. 반면 U-Lens는 1.8점만 하락하며 가장 강한 예측기로 남았다. 길이 통제 조건에서 U-Lens는 9개 모델-지표 비교를 모두 석권했고, 최강 베이스라인 대비 AUROC를 Gemma 4에서 2.2점, Qwen3.5에서 1.9점, Magistral 1.1에서 4.7점 개선했다. AUPRC는 0.8~4.2점, AURC는 0.4~2.5점 개선됐다. 흥미롭게도 예측 엔트로피와 A_cone 중 어느 쪽이 강한지는 모델마다 달랐지만, 둘을 곱한 U-Lens는 세 모델 모두에서 두 구성요소보다 일관되게 나았다.

해석가능성도 실험으로 확인한다. 토큰별 읽기는 네 범주를 꼭짓점으로 하는 3차원 심플렉스 위의 경로로 표현되는데, 셰익스피어가 남긴 말을 다루는 한 답에서 모델은 불완전성으로 시작해 'play'에서 모호성으로, 햄릿의 사랑과 오필리아에 대한 잔혹함을 함께 긍정하는 지점에서 상충하는 증거로, 마지막 'her'에서 일반적 불확실성으로 이동했다. 나아가 잔차 상태에 범주 방향을 λ·‖h‖만큼 더하는 활성 조향(steering)으로 인과관계를 검증했는데, 모호성 방향을 추론 중에 주입하면 모델이 쉬운 질문에서도 확신을 잃는다. 이는 U-Space 방향이 단순 상관이 아니라 행동을 형성하는 표상임을 보여준다.

실무적으로 이 방법은 추가 생성 없이 한 번의 추론 패스에서 토큰 단위 불확실성 지도와 스칼라 점수를 동시에 얻는다는 점이 핵심이다. 다만 저자들은 윤리 성명에서 이 판독기가 보정된 안전 탐지기가 아니며 고위험 상황에서 독립적 검증을 대체해서는 안 된다고 명시한다. 같은 방향으로의 개입이 모델의 확신 자체를 바꿀 수 있으므로 배포 시 신뢰성과 오용 가능성을 함께 평가해야 한다. 또한 네 범주 분류체계가 완전하지 않다는 점, 사전 계산된 야코비안이 없는 모델은 비지도 프롬프트로 추정해야 한다는 점, 층 선택을 모델·데이터셋별 튜닝 없이 2/3 지점으로 고정했다는 점이 전제로 남는다.