문서 내 AI 텍스트 스크리닝에서 검사 경로 전체의 오경보를 통제하는 두 가지 conformal 구성

Two Conformal Constructions for Adaptive Within-Document AI-Text Screening

arXiv2609.31547v1

Marco Mandap2026-09-25조회 2

무엇인가

이 논문은 AI 생성 텍스트를 스크리닝할 때 문서 전체를 다 보지 않고 앞부분(prefix)만 검사하거나, 검사 도중 다른 탐지기로 갈아타거나, 예산을 다 쓰기 전에 멈추는 상황을 다룬다. 문제는 이런 식으로 여러 번 들여다본 뒤 가장 의심스러운 결과를 골라 경보를 내면, 고정된 하나의 점수에 대한 보장이 전체 결정 경로를 정당화하지 못한다는 점이다. 저자들이 세운 목표는 문서 수준 교환가능성(사람 캘리브레이션 문서들과 새 null 문서가 교환 가능)만 가정하고, 토큰 간 의존성에는 아무 제약을 두지 않은 채, 허용된 임의의 행동에서 경보가 발생할 확률을 α 이하로 묶는 것이다. 이는 문서 하나에 대한 주변(marginal) 보장이며, 실현된 캘리브레이션 집합이나 문서 길이, 하위집단, 선택된 경로에 조건화된 보장이 아니고 여러 문서를 스크리닝할 때의 다중성도 통제하지 않는다.

어떻게 동작하나

공통 도구는 conformal 순위 보조정리다. 캘리브레이션 점수들과 테스트 점수를 비교해 R = 1 + Σ 1{Z_i ≥ Z_{m+1}}, p = R/(m+1)로 보수적 상위 꼬리 순위를 만든다. 보조 균등난수로 동점을 깨서 순위가 균등분포임을 보이고, 동점을 전부 세는 구현 순위는 그보다 크거나 같으므로 P(p ≤ u | D_dev) ≤ floor((m+1)u)/(m+1) ≤ u가 성립한다. 모든 점수가 동점이면 p = 1이 되어 α < 1에서는 캘리브레이션 문서가 아무리 많아도 경보가 나가지 않는다.

무엇과 다른가

Construction A는 개발 정보로 유한한 행동 패밀리 A = (k, j)를 미리 등록한다. k는 토큰 예산 b_k, j는 탐지기이고, 점수 S_a(X)는 앞 min(b_k, L)개 토큰에서 계산하며 실패 시 −∞로 두어 p_a = 1이 되게 한다. 각 행동의 순위 p_a(X) = (1 + Σ 1{S_a(H_i) ≥ S_a(X)})/(m+1)를 만들고, 가중치 w_a ≥ 0 (Σw_a ≤ 1)와 α_a = α w_a를 점수를 보기 전에 고정한다. 배포 시에는 관측된 점수나 순위로 실행 부분집합과 순서를 자유롭게 골라도 되고, 실행된 행동이 p_a ≤ α_a를 만족하면 경보한다. Theorem 4.1은 이것이 고정 패밀리에 대한 합집합 상계(Bonferroni)임을 보여 어떤 측정 가능한 선택 규칙에 대해서도 통제가 유지된다고 주장한다. 단 Remark 4.2는 순위를 본 뒤 가중치를 정하면 깨진다는 반례를 든다. 균등한 p값 두 개에 가중치를 몰아주면 오류가 1 − (1−α)² > α가 된다. Corollary 4.3은 기각에 필요한 캘리브레이션 수 m ≥ ceil(1/(α w_a)) − 1을 유도하며, 토큰 예산 4개 × 탐지기 3개로 12개 균등 행동을 두면 α = 0.01에서 m ≥ 1,199, α = 0.001에서 m ≥ 11,999가 필요하다고 계산한다.

어떻게 쓰나

Construction B는 오류 예산을 행동별로 쪼개지 않고 정책 전체를 하나의 스칼라로 캘리브레이션한다. 개발 정보로 라우트 생성기 π와 변환 g_a를 고정하고, 경보 정지를 끈 상태로 계획된 종단 행동까지 돌린 완전 경로 최대 M_π(X) = max_t g_{a_t(X)}{S_{a_t(X)}(X)}를 캘리브레이션 문서들에서 계산한다. 배포에서는 이 경로의 앞부분만 실행하는데, 부분 최대 M_{π,t}(X) ≤ M_π(X)이므로 p^path_t(X) ≥ p^full(X)이고, 따라서 {∃t ≤ ρ : p^path_t ≤ α} ⊆ {p^full ≤ α}가 성립한다. Theorem 5.1은 이 포함관계로 오류 예산을 나누지 않고 조기 종료를 보호한다고 주장한다. Corollary 5.3의 필요 캘리브레이션 수는 m ≥ ceil(1/α) − 1로, α = 0.01에서 99, α = 0.001에서 999다. 실패한 행동은 −∞ 센티넬로 매핑되어 p = 1이 되고 경보 근거를 더하지 않는다. 캘리브레이션 재사용은 새 정책이 그 문서들로 선택되지 않았을 때만 유효하며, 캘리브레이션을 보고 정책을 튜닝하려면 새 독립 캘리브레이션이 필요하다.

전제와 한계

이 논문은 이론 논문으로, 탐지기 실험이나 계산 절감을 전혀 보고하지 않는다. 원문에 나오는 수치는 순위 해상도 요구량과 보조 정리들의 상수뿐이다. 위의 m 값들 외에, 감사(audit) 관련으로는 Clopper–Pearson 상한 U_{1−γ} = 1 − γ^{1/N_0}를 제시하고 γ = 0.05에서 U_{0.95} < 0.001을 만족하려면 N_0 ≥ 2,995가 필요하다고 계산한다. 독립 가정 아래 Hoeffding 예산 n ≥ (2/Δ²) max{log(1/α), log(1/β)}, 분포 이동 시 P(alert) ≤ min{1, α + TV(P_0, P̃_0)}, 오라클 항등식 inf{E_Pn φ + E_Qn(1−φ)} = 1 − TV(P_n, Q_n)도 함께 제시된다. 저자들은 이 수치들이 '순위 격자에서 기각이 가능함'을 뜻할 뿐 검출력이나 유용한 데이터 양을 보장하지 않는다고 명시한다.

개발자 관점에서 이 논문은 여러 prefix 길이와 여러 탐지기를 조합해 가장 의심스러운 결과를 고르는 파이프라인이 사실상 다중 비교라는 점을 정면으로 다룬다. Construction A는 행동 패밀리와 가중치를 사전 등록하고 합집합 상계로, Construction B는 정책 전체를 하나의 스칼라로 캘리브레이션해 조기 종료를 허용한다. 구현 시 확인할 것은 네 가지다. 가중치나 라우트 생성기를 캘리브레이션·테스트 점수를 본 뒤 바꾸지 말 것, 캘리브레이션 문서 수가 순위 해상도 요구량을 넘는지 확인할 것, 실패를 −∞로 매핑해 p = 1로 처리할 것, 그리고 이 보장이 문서 하나 단위라는 점이다. 여러 문서를 스크리닝하거나 한 문서를 여러 정책으로 재실행할 때의 FWER/FDR은 별도 회계가 필요하다. 또한 경보는 'AI 저작'의 사후확률이 아니라 사람 참조 분포로부터의 이탈을 뜻하고, 비기각은 무혐의가 아니라 증거 불충분 상태로 남는다.

저자들이 밝힌 한계는 분명하다. 토큰 독립을 가정하지 않는 대신 문서 수준 교환가능성과 개발/캘리브레이션 분리라는 전제가 필요하고, 순위 해상도 요구량은 검출력 있는 데이터 양과 다른 문제다. 분포 이동 하한은 캘리브레이션에 대해 평균낸 것이지 실현된 캘리브레이션 집합마다 α를 보장하는 것이 아니며(Example 6.4), 하위집단별 보장도 없다. 적대적 선택, 혼합 저작, 배포 전역 다중성은 미해결로 남는다. 무엇보다 두 구성 모두 e-process를 만들지 않으며, 순위를 곱하는 것(1/U의 기대값이 무한이라는 예시)이나 무제한 optional continuation을 정당화하지 않는다고 못 박는다. 검출력과 계산 절감은 동반 실증 연구가 답해야 할 문제로 남겨져 있다.