IdeaLens는 문장이 아니라 아이디어의 출처를 판별한다
IdeaLens: Detecting AI Ideas in Long-form Writing
무엇인가
이 논문이 푸는 문제는 '누가 문장을 썼는가'(prose provenance)가 아니라 '누가 아이디어를 냈는가'(idea provenance)다. 서론은 2026년 8월 Pangram이 억만장자 투자자 Stanley Druckenmiller의 WSJ 기고문을 100% AI 생성으로 표시했고, 그가 "물론 AI를 썼다"고 답했으며, WSJ 논설면 편집장 Paul Gigot은 문제는 그 기고문이 "저자의 원래 논증을 반영하는가"이고 "그의 진짜 의견이라는 걸 의심할 사람이 없다"고 옹호했다는 사례를 든다. Pangram 같은 검출기는 문장 작성자만 답하지만, Gigot의 변호와 새로 등장하는 AI 사용 정책들은 아이디어 출처를 요구한다는 것이다. 논문은 이 기고문의 아이디어를 AI 생성으로 판정한다고 밝히며, P(AI) 98.3% 대 결정 임계값 86.3%라는 수치를 제시하되 이것은 모델 예측일 뿐 작성 과정의 직접 증거는 아니라고 못박는다. 같은 문서 안에서 아이디어 출처와 문장 출처는 다를 수 있다는 것이 핵심 전제다.
어떻게 동작하나
방법의 핵심은 분류기의 입력을 바꾸는 것이다. 인지적 쓰기 과정 모델을 따라 '아이가가 말하기로 결정한 것'(주장, 사건, 구성)을 아이디어로 정의하고, 문서를 담화 역할(discourse role)과 그 역할이 어떻게 구현됐는지에 대한 짧은 요약 설명을 짝지은 항목들의 순서 있는 목록, 즉 개요(outline)로 표현한다. 개요 추출은 세 단계 자동화로 이뤄진다. 먼저 TopicGPT 프레임워크를 변형해 GPT-5.6 Sol에게 8개 포맷별 기본 역할을 제안하게 하고 200개 문서에 라벨링하며 새 역할을 발명하게 한 뒤 중복 제거·가지치기로 역할 집합을 만든다(논픽션의 경우 42개 역할). 다음으로 Gemini 3.7 Flash와 Gemini 3.1 Pro에게 해당 포맷의 역할 집합과 소수 예시를 주고 문서의 아이디어 개요를 순서대로 추출한다. 마지막으로 Gemini 3.1 Pro로 개요를 패러프레이즈해 원문 표현이 스타일 단서로 새는 것을 막는다. 이 패러프레이즈로 사람이 쓴 문서의 개요 텍스트 중 Pangram 4가 사람 것으로 라벨링하는 비율이 8.5%에서 0.3%로 떨어지고, 의미는 보존돼 원래 개요와 코사인 유사도 0.93(무관한 개요는 0.39), 원문과는 0.76(무관한 문서는 0.26)을 유지한다. 패러프레이즈는 학습에만 쓰고 추론 시에는 패러프레이즈하지 않은 개요를 넣는다. 학습 데이터는 FineWeb에서 뽑은 100만 문서를 Pangram 3.3.2 라벨로 은닉 실버 라벨링한 WildOutlines(학습 약 842k, 검증 약 30k, 캘리브레이션 약 80k, 테스트 약 50k)이고, 코퍼스 구축 비용은 약 6만 6400달러다. 백본은 Nemotron-3.5-Lightning-30B-A3B이며 LoRA로 1에폭 파인튜닝한다. 같은 백본·문서·라벨을 쓰되 원문 텍스트를 입력받는 대조 모델 ProseLens를 함께 학습시켜, 두 모델의 행동 차이가 곧 개요 표현의 효과라는 통제 실험을 만든다. 임계값은 사람 문서만 있는 캘리브레이션 분할에서 1% 거짓양성률(FPR) 목표로 설정한다.
무엇과 다른가
가장 직접적인 실험은 IdeaShift다. 도메인 내 테스트셋에서 뽑은 500개 시드 문서에 대해 GPT-5.6 Sol이 점점 상세해지는 5단계 프롬프트를 만들고(레벨 0은 주제만, 레벨 5는 추출된 전체 개요), 각 프롬프트로 새 문서를 생성한다. 사람 시드에서 IdeaLens의 AI 판정률은 레벨 0의 94.9%에서 레벨 5의 6.8%로 떨어지는 반면 ProseLens와 Pangram 4는 86~100%를 유지한다(전체 사람 개요 문서에서 각각 86.5%, 92.4%). AI가 만든 계획에서는 IdeaLens가 모든 레벨에서 96% 이상을 AI로 판정한다. 판정률이 가장 크게 떨어지는 지점은 구조 정보를 넘어 내용이 담기기 시작하는 레벨 3과 4 사이다. 반대 방향은 새 데이터셋 TwiceTold로 확인한다. GPT-5.6 Sol이 만든 500단어 이야기의 개요만 주고 17명의 컴퓨터과학 대학원생·교수가 대면으로 처음부터 쓴 이야기 50편에서 IdeaLens는 68%(95% 신뢰구간 54~79%)를 AI로 판정했고, ProseLens는 0%, Pangram 4는 8%였다. AI 원본 이야기는 IdeaLens 96%, ProseLens와 Pangram은 100%를 잡았다. IdeaLens가 사람으로 잘못 판정한 16건 중 12건은 추측성·판타지 요소가 들어간 이야기였다.
어떻게 쓰나
공유 출처(완전 사람 또는 완전 AI) 문서를 다루는 19개 평가에서 IdeaLens는 FPR 0.6%에서 AI 문서의 91.1%를 검출해, 기존 최강 오픈웨이트 검출기 EditLens-3B의 81.8%(FPR 0.2%)를 앞선다. 원문 텍스트로 학습한 ProseLens는 98.9%(FPR 0.7%)로 상용 Pangram 4의 97.3%(FPR 0.3%)에 필적한다. 22개 벤치마크 51개 평가 분할을 집계하면 IdeaLens는 공유 출처 95.3%, 혼합 출처 81.3%를 기록한 유일한 검출기이고, ProseLens(99.1%/25.4%)와 Pangram 4(98.5%/25.9%)는 혼합 출처에서 무너진다. AI가 사람 글을 다듬거나 바꿔쓴 12개 벤치마크에서 IdeaLens는 94.7%를 사람으로 라벨링한 반면 ProseLens는 50.7%, Pangram 4는 43.8%였다. GEDE에서 LLM이 사소한 교정을 한 사람 에세이를 AI로 판정한 비율은 IdeaLens 0.5% 대 Pangram 4 54.6%, ProseLens 45.8%였고, 내용을 보존한 재작성에서는 2.6% 대 94.3%, 77.1%였다. HART의 LLM 패러프레이즈에서는 4.9% 대 42.8%, 44.5%, Academic Integrity 데이터셋의 초록 생성 과제에서는 8.2% 대 96.4%, 83.9%였다. ChatGPT 이전 C4 문서 1만 건에서 IdeaLens의 FPR은 0.01%다. 영어로만 학습했지만 24개 언어 IdeaShift-X에서 레벨 0 문서 95.3%를 AI로, 레벨 5 문서는 0.7%만 AI로 판정했고, 24개 언어의 ChatGPT 이전 사람 문서 1만 건에서 FPR은 0.1%였다. 휴머나이즈·적대적 공격에서는 검출률이 평균 6.4포인트 떨어져 Pangram의 4.9와 ProseLens의 10.6 사이에 있다.
전제와 한계
저자들은 IdeaLens의 9만 건 항목 수준 예측을 분석해 사람과 AI 아이디어의 체계적 차이를 정리한다. IdeaLens는 검증에 필요한 맥락 없이 숫자나 방법을 인용하거나 증거가 뒷받침하는 것보다 더 많이 주장하는 아이디어를 더 AI답다고 채점하고, 독자가 찾아볼 수 있는 구체적 출처를 제시하거나 단점과 미해결 문제를 논하는 아이디어를 더 사람답다고 채점한다.
개발자 관점에서 이 논문이 바꾸는 것은 검출기의 입력 설계다. 문체·어휘·문장 구조 같은 표면 특징에 의존하는 검출기는 사람이 아이디어를 주고 AI가 문장을 쓴 문서를 AI로 오탐하고, 반대로 AI 아이디어를 사람이 자기 문장으로 쓴 문서를 놓친다. 코드 리뷰나 기술 문서, 정책 문서에서 '이 설계 결정을 누가 했는가'를 따져야 하는 상황이라면 문체 검출 결과만으로 판단하면 안 되고, 아이디어 출처 신호를 별도로 봐야 한다는 근거가 여기 있다. 다만 이 논문의 판정도 확률적 예측이며 작성 과정의 증거가 아니라는 점, 그리고 아이디어가 AI에서 왔다는 판정이 곧 표절이나 규정 위반을 뜻하지는 않는다는 점을 함께 봐야 한다.
한계와 전제는 저자들이 여러 곳에서 밝힌다. 학습 라벨은 Pangram 3.3.2의 문체 라벨을 아이디어 라벨로 가정한 은닉 실버 라벨이고, 이 가정은 문서의 아이디어와 문장이 같은 출처에서 왔을 때만 성립한다. Pangram이 혼합(mixed)으로 라벨링한 문서는 아이디어 출처가 불분명하다는 이유로 버렸다. TwiceTold는 50편, 작성자 17명 규모로 작고 작성자가 컴퓨터과학 대학원생·교수로 한정되며, 크라우드소싱을 피한 대신 표본 다양성이 제한된다. DIPPER 패러프레이즈 공격이 들어간 GEDE에서는 검출률이 77.6%로 ProseLens 97.1%, Pangram 4 95.1%에 뒤지는데, 저자들은 이 공격이 문체뿐 아니라 내용까지 바꾸기 때문이라고 추정한다. IdeaLens-ModernBERT 변형은 파라미터 0.4B로 FPR 1.5%에서 79.1%를 검출해 30B 백본보다 약하다. 또한 논문이 제시한 Druckenmiller 기고문 판정은 어디까지나 모델 예측이며 실제 작성 과정의 직접 증거가 아니라고 저자들이 명시한다.