자기 질문 사슬 프롬프트는 LLM의 답 보류 시점을 정해 선택적 위험을 제어한다.

When Should LLMs Abstain? Chain-of-Self-Questioning for Selective Risk Control

arXiv2609.17516v1

Ali Şenol2026-09-15조회 4

무엇인가

대규모 언어모델은 근거가 약한 질문에도 유창한 답을 내놓는다. 이 논문이 겨냥하는 문제는 정확도 자체가 아니라 커밋(commitment)의 시점이다. 대부분의 질의응답 평가는 답을 강제하는 방식으로 커밋을 보상하기 때문에, 모든 문항을 찍는 모델도 그럴듯한 총점을 얻을 수 있고 답할 수 있는 질문과 근거가 없는 질문을 구분하지 못한다. 선택적 예측(selective prediction) 관점은 일부 입력을 거부함으로써 실제로 답한 입력에서의 위험을 낮추자는 것이고, 이를 LLM에 적용하려면 답변 정확도와 함께 커버리지, 잘못 커밋한 비율을 같이 보고해야 한다. 의료·법률·금융·공공행정처럼 결과가 큰 영역에서는 확신에 찬 무근거 답보다 명시적 보류가 더 유용할 수 있다. CoT 프롬프팅은 추론을 개선하지만 답할지 말지를 스스로 결정하게 만들지는 않으며, 검색 증강이나 사후 검증은 추가 인프라가 필요하거나 이미 후보 답이 생성된 뒤에 개입한다. CoSQ는 답을 생성하기 전에 커밋할 것인가라는 더 좁고 보완적인 문제를 다룬다.

어떻게 동작하나

CoSQ(Chain-of-Self-Questioning)는 모델에 독립적인 3단계 프롬프트 프레임워크다. 먼저 모델이 질문에 답하기 위해 필요한 정보 단위 I(q) = {i1, ..., im}를 식별하고, 각 단위에 0과 1 사이의 신뢰도 s_j를 부여한 다음, 결정 규칙이 커밋 허용 여부를 판정한다. 대표 구성인 Grounded-CoSQ는 단위 점수의 평균 s̄(q) = (1/m) Σ_j s_j 를 게이트 점수로 쓰고 s̄(q) ≥ τ이면 답하고 아니면 보류한다. 게이트를 통과하면 채택된 정보 단위만 최종 프롬프트에 넘겨 간결한 답을 요구하므로, 명시적으로 거부된 전제에서 최종 답이 생성될 가능성을 줄인다. 임계값은 τ ∈ {0.50, 0.60, 0.70, 0.80, 0.90} 전체를 평가한 뒤 보수적 운영점을 고른다. Critical-CoSQ는 정보 단위를 critical과 supporting으로 라벨링해 critical 단위만 게이트에 참여시킴으로써 지지 세부사항 개수가 결과를 좌우하는 기계적 효과를 줄인다. Adaptive-CoSQ는 세 검사를 동시에 적용하는데, 전체 평균 s̄ ≥ τ, critical 평균 s̄_c ≥ 0.65, critical 최소값 s_{c,min} ≥ 0.40이며 τ만 스윕하고 나머지 두 검사는 고정한다. 수용된 뒤에는 신뢰도 0.40 이상인 claim만 답변 단계로 넘기고, s̄ ≥ 0.75면 confident 모드, 아니면 cautious 모드로 답을 생성한 다음 모순 검사를 해서 모순이 발견되면 보류한다. 모든 임계값과 검사는 집계 전에 미리 고정됐고, 베이스라인은 Direct 프롬프트와 CoT 프롬프트이며 어떤 방법도 태스크 특화 파인튜닝이나 모델 로짓 접근을 받지 않는다.

무엇과 다른가

실험은 TruthfulQA 다지선다 validation 817문항을 주 벤치마크로 삼고, 원본 캐시의 고정 위치 구조를 없애기 위해 옵션 순서를 seed 1002로 결정론적으로 균형화한 뒤 11개 모델 패밀리, 17개 조건에서 평가했다. 지표는 커밋한 답 중 정답 비율 AA = C/(C+W), 커밋 비율 Coverage = (C+W)/N, 전체 문항 대비 잘못 커밋한 비율 HR = W/N, 보류 비율 AR = A/N, 전체 정확도 C/N이며, R_answered = W/(C+W) = 1 - AA이고 파싱 가능한 출력에서는 HR = Coverage × (1 - AA)가 성립한다. CoSQ의 명시적 보류는 별도 결과로 AA 분모에 들어가지 않고, Direct와 CoT는 설계상 커버리지 100%인 강제 선택 베이스라인이며 형식이 깨진 응답은 보류로 재분류하지 않고 보수적으로 오답 처리한다. 보조 실험으로 Natural Questions Short-Answer 300문항을 5개 모델에서 평가했는데, 개방형 생성과 의미 기반 채점을 쓰기 때문에 주 결과와 수치를 직접 합치지 않고 수렴적 증거로만 보고한다.

어떻게 쓰나

결과에서 CoT는 AA 86.9%, 무조건부 잘못 커밋 비율 13.1%로 Direct 베이스라인을 개선하지 못했다. τ = 0.90의 Grounded-CoSQ는 HR을 8.9%로 낮추고 AA를 89.7%로 올리면서 문항의 87.6%에 답했다. 이는 HR 4.22%포인트 절대 감소이자 32.1% 상대 감소이고, AA는 2.87%포인트 올랐으며 12.3%의 질문이 보류로 돌아갔다. 같은 임계값에서 Critical-CoSQ는 커버리지 88.6%, HR 9.2%(3.96%포인트 감소), AA 2.73%포인트 증가를, Adaptive-CoSQ는 AA 89.6%, 커버리지 86.5%, HR 8.9%(4.24%포인트 감소), AA 2.75%포인트 증가를 기록했다. 15개 선택적 구성 전부가 CoT보다 낮은 평균 HR과 높은 평균 AA를 보였고, 이 방향성은 11개 모델 모두와 평가한 모든 임계값에서 유지됐다. 모델별 HR 감소 폭은 Grounded-CoSQ 1.84~9.79%포인트, Critical-CoSQ 1.71~10.28%포인트, Adaptive-CoSQ 2.45~8.94%포인트였고 DeepSeek Flash가 Grounded-CoSQ에서 0.177에서 0.080으로 가장 큰 절대 감소를 보였다. 짝지은 모델 수준 분석에서 Grounded-CoSQ의 평균 HR 감소는 0.0422(95% 부트스트랩 구간 [0.0272, 0.0595]), AA 증가는 0.0287([0.0177, 0.0418])이었고 단측 Wilcoxon 검정 p = 0.00049로 11개 모델 차이 모두 가설 방향과 일치했다. 보류의 성격도 분석했는데, Grounded-CoSQ는 모델당 평균 100.5문항을 보류하고 그중 31.3%가 CoT가 틀린 문항과 겹쳤으며 나머지는 CoT가 맞힌 문항을 놓친 것으로, 이는 채점 오류가 아니라 자동 서비스 폭의 축소를 정량화한 운영 특성이다. NQ-Short에서는 CoT의 HR 0.412가 Grounded-CoSQ에서 0.274로 떨어지고 커버리지 0.830, AA는 0.588에서 0.670으로 올랐으며, Critical-CoSQ는 커버리지 0.895에 HR 0.325, Adaptive-CoSQ는 커버리지 0.867에 HR 0.300이었다. 형식 감사에서는 강제 선택 베이스라인 출력 8,987개 중 8,936개(99.43%)가 정확히 하나의 선택 라벨을 포함했고, 형식을 어긴 Direct 51개와 CoT 51개는 오답으로 채점됐다.

전제와 한계

개발자 관점에서 이 논문의 실용적 메시지는 답변 정확도만으로 LLM을 평가하면 안 된다는 것이다. CoSQ는 파인튜닝이나 로짓 접근 없이 프롬프트만으로 블랙박스·호스팅 모델에 얹을 수 있고, 임계값 τ를 배포 시점의 제어 손잡이로 써서 리스크-커버리지 프론티어 위에서 운영점을 고를 수 있다. 무근거 커밋의 비용이 보류나 사람 검토 비용보다 큰 시스템이라면 τ = 0.90의 Grounded-CoSQ가 균형점이 되고, 자동 응답 범위를 넓게 유지하고 싶으면 Critical-CoSQ, 평균 잘못 커밋 비율을 최소화하고 싶으면 Adaptive-CoSQ가 후보가 된다. 도입 전에 확인할 것은 세 가지다. 첫째, 자체 도메인 데이터에서 AA와 커버리지를 항상 함께 측정해야 한다. AA만 보면 커버리지 100%인 강제 선택 베이스라인과 공정하게 비교할 수 없고, HR = Coverage × (1 - AA) 관계를 통해 두 지표가 어떻게 맞물리는지 봐야 한다. 둘째, 보류가 정답을 놓친 비율(lost value)을 함께 집계해 자동화 범위 축소를 감수할 만한지 판단해야 한다. 셋째, 정보 단위 추출과 신뢰도 평가가 답변 생성 앞에 붙기 때문에 호출 수와 토큰 비용이 늘어난다는 점을 비용 예산에 반영해야 한다.

저자가 명시한 한계도 분명하다. 신뢰도는 답을 생성하는 같은 모델에서 끌어낸 값이므로 독립적인 확률 추정이 아니고 보정이 어긋나 있을 수 있으며, 임계값은 문자 그대로의 확률이 아니라 경험적 운영점이다. 모델 패널이 엔드포인트 식별자와 호스팅 모델 이름을 쓰기 때문에 제공자가 가중치나 서빙 동작을 바꿔도 불변 리비전이 드러나지 않을 수 있다. CoSQ는 질문을 분해하고 정보 단위를 평가하는 만큼 추론 호출과 토큰 비용이 추가되므로, 오답의 기대 비용이 충분히 높을 때만 정당화된다. TruthfulQA-MC가 주 벤치마크이고 NQ-Short는 더 작은 보조 평가여서 두 데이터셋이 상보적 증거를 주더라도 폭넓은 배포 타당성을 주장하려면 더 큰 다도메인 평가가 필요하며, 데이터셋과 도메인 사이의 임계값 전이 문제는 미해결로 남아 있다. 또한 모델별 프롬프트 최적화 대신 공통 프롬프트 프로토콜을 썼기 때문에 비교 가능성은 높지만 일부 모델의 성능을 남겨두었을 수 있고, 패러프레이즈나 지시 순서, 다른 신뢰도 표현 방식은 검증하지 않았으며 보류 품질과 답변 유용성에 대한 인간 평가도 다음 과제다. 논문은 CoSQ가 사실 정확성을 보장하지 않으며 고위험 영역에 배포하려면 도메인별 검증과 근거 접근, 인간 감독이 필요하다고 못 박는다.