PHRBench가 환각 이후 추론을 행동 단위로 분해한다
PHRBench: A Behavioral Evaluation of Post-Hallucination Reasoning in LLMs
무엇인가
이 논문이 푸는 문제는 "환각이 이미 문맥에 들어간 뒤"의 일이다. LLM 출력이 검색 시스템, 도구 호출 파이프라인, 자율 에이전트, 다단계 생성 워크플로에서 재사용되면 한 단계의 환각이 다음 단계 추론의 전제가 된다. 기존 PHR(Post-Hallucination Reasoning) 연구인 HIVE 등은 최종 결과 변화와 집계된 추론 역학만 봤고, 개별 응답이 환각 전제를 어떻게 처리하는지는 구분하지 못했다. 저자들이 지적하는 핵심은 같은 정답도 전혀 다른 행동에서 나올 수 있다는 점이다. 환각의 의미를 그대로 받아들이고도 정답에 도달할 수 있고, 전제를 해소하지 않은 채 우회할 수도 있으며, 명시적으로 오류를 찾아 고칠 수도 있다. 최종 정답 여부는 이 네 가지(순응, 회피, 성공적 교정, 교정 실패)를 뭉뚱그린다.
어떻게 동작하나
PHRBench의 구성은 이렇다. Chemistry, Biomedicine, Physics, Code Generation 4개 도메인에서 MoleculeNet-BBBP, ChemBench, MedMCQA, MMLU, SciQ, GPQA, HumanEval, MBPP 8개 벤치마크로부터 460개 기반 문항을 모은다. 각 문항에 사실에 부합하는 truthful 증강 1개와, 정답을 누설하지 않으면서 단일 의미 변이만 가한 hallucinated 증강 여러 개를 붙여 460 + 3900 = 4820개 인스턴스를 만든다. 환각 증강은 세 형태다. 도메인 원리 위반을 뜻하는 Rule Contradiction, 과제 관련 조건을 잘못 보고하는 State Distortion, 시대에 뒤진 과학 이론을 끌어오는 Pseudoscientific Entanglement. 평가는 결과 지표인 Accuracy와 추론 궤적 지표 네 가지로 나뉜다. Output Length(생성 토큰 수), Uncertainty Index(토큰 확률 분포의 평균 엔트로피), Belief Update Frequency(연속 추론 단계 사이 next-token 분포의 KL 발산이 임계값 τ를 넘는 비율), Branching Complexity(대안 경로를 시사하는 어휘 단서 빈도를 응답 길이로 정규화한 값)다.
무엇과 다른가
행동 분류가 이 논문의 중심이다. 각 추론 궤적을 최종 정답과 무관하게 Hallucination Compliance(전제 수용), Hallucination Avoidance(전제 우회), Heuristic Correction(전제를 식별해 교정)으로 나누고, 그중 교정을 수행하면서 최종적으로 정답에 도달한 경우를 insightful trajectory로 정의한다. 실험은 독점·오픈소스 18개 모델에 대해 temperature 0.7, 프롬프트당 10회 독립 샘플링으로 수행했다.
어떻게 쓰나
첫 번째 결과는 스케일링의 역설이다. 환각 문맥은 모든 모델에서 정확도를 떨어뜨리며 평균 하락폭은 7.7%p다. GPT-5.2가 16.9%p로 가장 크고 Gemini-2.5-Pro 12.1%p, Gemini-2.0-Flash 11.1%p가 뒤를 잇는다. 독점 모델 평균 하락(11.0%)이 오픈소스(6.1%)보다 크다. 더 중요한 건 규모가 커질수록 하락폭이 커진다는 점이다. Qwen2.5를 1.5B에서 72B로 키우면 기준 정확도는 27.6%p 오르지만, 환각 문맥에서의 하락폭은 8.0%p로 두 배가 된다. 도메인별로는 Chemistry의 평균 유지율이 가장 낮고 Physics가 상대적으로 강건하다. 증강 유형별로는 State Distortion이 가장 큰 하락을 유발한 반면 Pseudoscientific Entanglement는 기준 정확도의 약 98%를 유지했다. 저자들은 이를 "강한 모델 함정(strong-model trap)"이라 부른다. 추론 능력이 크다고 강건성이 보장되지 않는다는 것이다.
전제와 한계
두 번째 결과는 추론 활동의 증폭과 교정의 희소성이다. 큰 모델일수록 OL, BUF, BC가 일관되게 커진다. Qwen2.5 1.5B→72B에서 OL은 truthful에서 161.3, hallucinated에서 145.7 늘고, BUF는 0.323과 0.409, BC는 1.439와 1.402 증가한다. 모델 간 상관도 OL·BUF·BC가 각각 피어슨 0.908, 0.977, 0.856으로 강하게 동행하는 반면 UI는 일관된 스케일링 패턴을 보이지 않는다. 정작 Heuristic Correction은 18개 모델 전반에서 드물지만 스케일과 함께 꾸준히 늘어난다. Qwen2.5 1.5B→72B에서 교정이 18.90% 증가한다. 다만 insightful trajectory는 더 희소해서 18개 중 11개 모델이 응답의 10% 미만에서만 생성했고, 최고는 Qwen3-235B-A22B의 24.91%다. 교정 행동과 정답 도달 사이의 이 간극이 논문이 강조하는 지점이다.
세 번째 결과는 성공적 복구의 추론적 서명이다. Heuristic Correction은 Hallucination Compliance보다 평균 약 30단어 더 길고 BUF가 0.31 높다. Hallucination Avoidance는 대신 branching complexity가 가장 높다. 결정적으로 insightful 궤적의 평균 BUF는 0.63인데 비insightful 궤적은 0.18에 그친다. 정성 사례 분석에서는 관련 지식을 갖고도 주입된 전제에 눌려 오답으로 가는 궤적과, 충돌하는 전제를 명시적으로 거부하고 이후 추론을 정답 쪽으로 재조정하는 궤적이 대비된다. 지식 보유만으로는 부족하고, 충돌 감지가 실제 믿음 갱신으로 이어져야 한다는 해석이다.
네 번째 결과는 사전 예측 가능성이다. 저자들은 프롬프트 구조와 환각-과제 의미를 기술하는 24개 특징(Total Prompt Length, Candidate Count, Domain-Rule Violation, Error Locality, Applicability Mismatch 등)을 외부 LLM으로 추출하고 XGBRegressor를 학습시켰다. 결과는 AUROC 0.847, 정확도 0.863이다. SHAP 분석에서 Total Prompt Length가 전역 기여도의 20.7%로 가장 강한 단일 예측 변수이고, 환각 증강 특유의 의미 특징인 Domain-Rule Violation 7.4%, Error Locality 7.2%가 뒤를 잇는다. 특징 간 상호작용은 대부분 0.01 미만이며 최대치도 Total Prompt Length와 Question Length 사이의 0.020에 불과해, 구조적 특징과 의미적 특징이 서로 보완적인 신호를 준다고 해석한다.
개발자 관점에서 실용적 함의는 세 가지다. 첫째, 다단계 파이프라인에서 상류 검증만 강화하는 것으로는 부족하다. 하류 모델이 오염된 문맥을 만났을 때 실제로 교정하는지는 별도로 측정해야 하며, 정답률 하나로는 순응·회피·교정을 구분할 수 없다. 둘째, 프롬프트의 구조적·의미적 특징만으로 복구 가능성을 AUROC 0.847 수준에서 사전 예측할 수 있다는 것은, 생성 전에 재검증이나 라우팅을 트리거하는 저비용 게이트를 만들 여지가 있다는 뜻이다. 셋째, 모델을 키우는 선택이 이 문제에서는 양가적이다. 기준 성능은 오르지만 환각 문맥에 대한 취약성도 함께 커지고, 교정 시도는 늘어도 정답 도달로 이어지는 비율은 여전히 낮다.
한계와 전제는 이렇다. 원문 발췌분에는 별도의 Limitations 절이 포함되어 있지 않지만, 설계에서 드러나는 제약은 분명하다. 환각 증강은 문항당 단일 의미 변이만 가하므로 실제 파이프라인에서 누적·중첩되는 환각을 재현하지 못한다. 기반 문항이 460개, 평가 모델이 18개로 규모가 제한적이며, 24개 프롬프트 특징 추출을 외부 LLM에 의존하므로 그 추출기의 편향이 예측 성능에 섞일 수 있다. BUF는 KL 발산 임계값 τ, BC는 사전 정의된 어휘 단서 집합에 의존하는데 본문은 이 값들의 민감도를 보고하지 않는다. 또한 insightful trajectory의 정의가 최종 정답 일치에 묶여 있어, 교정은 했지만 정답에 이르지 못한 경우를 성공에서 제외한다.