LLM의 내부를 보지 않고 질문과 국소 검사만으로 그 주장을 인증할 수 있는 조건

Human-LLM Deliberation as Interactive Proof: Conditions for Verifiability Without Transparency

arXiv2609.24895v1

Baotong Zhang2026-09-21조회 2

무엇인가

LLM이 사용자가 스스로 구성할 수 없는 논증을 내놓았을 때, 사용자는 그 주장을 받아들일 근거를 어떻게 확보하는가. 이 논문은 이 문제를 대화형 증명(interactive proof)의 틀로 모델링한다. 내부 탐색이 무제한인 증명자와 자원이 제한된 인간 검증자 사이의 작업 분담을 상정하고, LLM의 내부 상태나 생성 과정을 재구성하지 않고도 인증에 도달할 수 있는 조건을 따진다. 배경에는 자기설명이 실제 답 생성 과정을 따라가지 못할 수 있고, chain-of-thought가 편향의 영향을 누락할 수 있으며, 프롬프트만으로 하는 자기수정이 일반 과제에서 견고하게 입증되지 않았다는 선행연구 결과가 있다. 저자들이 말하는 '투명성 없는 검증가능성'은 바로 이 지점, 즉 내부를 열지 않고 인증하는 것이다.

어떻게 동작하나

프로토콜은 고정된 명제 s와 진리값 사상 v: S → {⊤, ⊥}, 참인 명제의 언어 L 위에서 정의된다. 증명자 P는 사적 상태 θ를 가진 전략 Q: H × Θ → X로, 내부 탐색은 무제한이지만 메시지는 형식과 길이 제한을 지켜야 한다. 검증자 V는 다항시간 전략으로, 정보 상태 i와 도전 공간 C(h, i), 도전 선택 정책 π_V, 그리고 U: H × I × X → {Accept, Reject, Challenge}인 결정 함수를 가진다. 첫 도전-응답 라운드는 필수이고, 정해진 검토 지평 T 안에 결론에 이르지 못하면 보수적으로 Reject를 출력한다. 형식 위반이나 길이 초과 메시지는 즉시 Reject로 처리되고 진단 증거로 인정되지 않는다. 검증자는 증명자에게 보이지 않는 로컬 상태 υ에 검사 결과와 인증서 값을 기록하며, 이 상태를 근거로 다음 도전을 고른다.

무엇과 다른가

수용 규칙은 통과한 검사가 증거로 누적되어 정해진 임계값에 도달하는 방식이다. 저자들은 test supermartingale과 e-process, Ville 부등식을 적용해 누적 증거를 다룬다. 핵심 정리는 적응적 증명자에 대한 anytime-valid 건전성으로, 거짓 주장을 언젠가 수용할 확률이 선택한 오류 수준 이하로 억제된다는 것이다. 다만 이는 과제가 거짓 통과 상한 q와 인간 검사 오류 상한 c_i를 제공하고, 그 상한이 모든 관련 이력 이후에도 유효할 때 성립한다. 유한 지평 완전성은 여기에 정직한 응답의 적절성 상한과 충분한 진단적 진전이라는 조건을 더 요구한다. 검사를 늘리면 수용 근거는 강해지지만 매 라운드마다 적절한 응답과 신뢰할 수 있는 인간 노력이 추가로 필요하다. 부록 D는 매 라운드 일정 확률을 참조 검사에 예약해, 적응적 후속 질문을 섞는 동안에도 진단 보장을 유지하는 방법을 제시한다.

어떻게 쓰나

논문은 검증자의 노력 예산, 인지 부하, 전문성, 피로가 인증 가능 영역을 결정한다고 본다. Proposition 15는 동일한 자원 예산에서 주어진 상한이 특정 국소 검사 시퀀스는 인증하면서 특정 전역 검사는 인증하지 못하는 조건을 제시한다. 검사를 잘게 쪼개면 각 단계는 쉬워지지만, 라운드마다 추가 응답과 검사가 필요해 오류 기회가 늘어난다. 흥미로운 결론은 전역 검사기가 정확히 실행될 경우 더 낮은 거짓 통과 상한을 가질 수 있음에도, 인간이 그것을 충분히 신뢰성 있게 수행하지 못하면 인증 목적에는 오히려 덜 유용할 수 있다는 점이다.

전제와 한계

실험은 LLM만 사용한 시뮬레이션으로, Prover-Verifier Deliberation(PVD)을 기반으로 하며 수정 없이 수용된 경우를 ANC(Accept + No Change)로 표시한다. GPQA에서는 일부 모델 쌍에서 수정 없이 수용된 답이 나머지보다 더 정확했다. 기만 전략 스트레스 테스트는 198개 문항, 피로 한계 T = 12로 두 가지 전략(naïve, strategic)을 시험했는데, 운영 규칙은 naïve 186/198(93.9%)과 strategic 180/198(90.9%)을 거부했다. 수용된 사례는 모두 원래의 오답을 유지했고 답 변경 기록이 0건이어서, naïve의 12건과 strategic의 18건 모두 오답 ANC였다. strategic의 fool rate가 3.0%p 높았지만 정확한 짝지은 McNemar 검정에서 p = 0.307로 두 조건을 구분하지 못했고, 조건당 확률적 실행이 1회뿐이라 프롬프트 효과를 식별하지 못한다. HLE는 513개 객관식 문항을 세 개의 증명자-검증자 쌍에 적용했으며, Sonnet/Haiku 쌍의 ANC 갭 점추정치는 음수(구간은 0 포함)였고 GPT/Gemini 쌍은 양수였다. 저자들은 이 수치들이 형식적 건전성을 입증하지도, 5절의 단일 라운드 q 모수를 추정하지도 않는다고 명시한다.

개발자 관점에서 이 논문이 주는 실무 지침은 명확하다. LLM 답변을 그대로 신뢰하는 대신, 각 검사가 실제로 오류를 노출할 수 있는지(진단 보장), 사용자가 그 검사를 올바르게 수행할 수 있는지(실행 신뢰성), 그리고 라운드를 늘리는 것이 인지 부하를 줄이는지 아니면 오류 기회만 늘리는지를 함께 따져야 한다. 특히 어떤 검사가 오류를 잡아낼 확률의 평균값은 이 보장에 쓸 수 없고, 적응적으로 질문을 바꾸는 증명자에 대해서도 모든 이력 이후에 유효한 상한이어야 한다. 예산이 부족하면 Reject를 출력하는 것이 정직한 결과이며, 단순히 대화를 길게 늘린다고 인증 가능한 검토가 되지는 않는다. 논문의 예시에서 행렬곱 검사는 주어진 신뢰성 상한 아래 예산 내에 임계값에 도달하지만, 회의 일정 충돌 감사는 가용 라운드보다 더 많은 라운드를 요구한다.

한계도 분명하다. 정리들은 주어진 진단·응답·실행 상한을 결합할 뿐, 자유 형식 대화에서 그 상한을 얻는 일반적 방법을 제공하지 않는다. 인간이 제안된 검사를 실제로 신뢰성 있게 수행할 수 있는지는 검증되지 않았고, LLM만 사용한 시뮬레이션은 인간 검증자 가정을 검증하지 못한다. 완전성은 정직한 응답 행동을 가정하며 정렬 문제를 해결하지 않는다. 프라이버시 측면의 영지식 성질도 부록 C에서 시뮬레이터 존재와 정지 접두사 일치를 가정한 조건부 결과일 뿐이다. 또한 형식화된 명제를 검사한 것이 원래의 자연어 주장을 충실히 대표하는지, 검색한 출처가 옳은지는 별개의 문제로 남는다. 선호 도출, 창작, 논쟁적 판단, 무제한 프로그램 동작, 증거를 구할 수 없는 주장은 대화의 이점은 있을 수 있으나 여기서 다룬 인증 보장의 범위 밖이다. Proposition 15의 비교도 실제 오류율의 순서가 아니라 주어진 상한이 무엇을 인증하는지의 차이라는 점을 저자들은 강조한다.