웹의 AI 생성 텍스트는 데이터가 부족할 때만 사전학습에 이득이다

How Much Is an AI Token Worth? Scaling Laws for Wild AI-Generated Web Text

arXiv2609.40295v1

Jenna Russell2026-09-30조회 3

무엇인가

이 논문은 웹에 자연스럽게 쌓인 AI 생성 텍스트, 즉 저자들이 "wild AI text"라고 부르는 데이터가 언어 모델 사전학습에 어떤 영향을 주는지 측정하고 이를 예측하는 스케일링 법칙을 세운다. Wild AI 텍스트는 합성 데이터나 모델 붕괴 실험과 다르다. 여러 모델이 사람과 검색엔진을 위해 쓴 글이고, 라벨 없이 인간 텍스트와 섞여 사전학습 코퍼스에 들어오며, 품질이 들쭉날쭉하다. 저자들이 FineWeb v1.4.0 필터를 통과한 2026년 6월 웹 데이터를 Pangram으로 라벨링한 결과 27.5%의 토큰이 AI 생성으로 판정됐고, 8월에는 31.1%로 올랐다. 2021년 6월에는 0.1% 미만, 2024년 6월 10.1%, 2025년 6월 16.1%였다. 동시에 모델들은 Chinchilla 최적 예산인 파라미터당 20토큰을 훨씬 넘겨 학습된다. 논문이 든 예로 Qwen3-32B는 파라미터당 약 1,100토큰을 쓴다.

어떻게 동작하나

데이터 구축부터 구체적이다. 저자들은 FineWeb을 2025년 7월~2026년 6월 Common Crawl까지 확장해 9,604만 문서, 833.1억 토큰 규모의 WildAI 코퍼스를 만들었다. 먼저 EditLens Llama-3.2-3B로 2,800억 토큰 이상을 라벨링하고, 그중 확신도 높은 문서를 정확도가 더 높은 Pangram 3.3.2로 재검증해 최종적으로 인간 작성 5,891만 문서(421.9억 토큰)와 AI 생성 3,254만 문서(353.2억 토큰)를 분리했다. Pangram 3.3.2의 보고된 오탐률은 0.05%, 미탐률은 1.99%이며, 2021년 크롤링 문서 6만 건에서는 0.062%만 AI로 라벨링됐다. 주목할 점은 기존 품질 필터가 AI 텍스트를 오히려 선호한다는 것이다. 원시 Common Crawl 문서 1만 건을 추적한 결과 AI 생성 문서는 FineWeb 파이프라인을 인간 문서보다 2.3배(29.3% 대 12.8%), DCLM 전체 파이프라인을 9.8배(14.5% 대 1.5%) 자주 통과했다.

무엇과 다른가

실험은 800개 모델을 학습시켜 진행했다. 크기는 19.9M에서 973M 파라미터, 인간 토큰 기준 파라미터당 토큰 수는 2.9에서 87.5, 인간 토큰 대비 추가 AI 토큰 비율 r은 0에서 64까지다. 아키텍처는 nanochat을 쓴다. 평가는 C4를 인간 텍스트의 기준 데이터셋으로 삼고, Paloma(16개 소스 매크로 평균), 2022년 이전 FineWeb 홀드아웃(FW22), 2026년 FineWeb 홀드아웃(FW26, AI 비중 22.3%), FW26의 AI 분할과 인간 분할, 그리고 순수 AI 텍스트용 Cosmopedia를 사용했다.

어떻게 쓰나

핵심 관찰은 AI 토큰의 가치가 학습 예산에 따라 부호를 바꾼다는 것이다. 인간 텍스트가 부족한 모델(대략 파라미터당 10토큰 이하)에서는 AI 토큰을 추가하면 인간 텍스트 손실이 처음에는 낮아지지만, 더 넣을수록 이득이 포화되고 곧 해악으로 역전된다. Chinchilla 최적점인 파라미터당 20토큰 이상에서는 AI 토큰이 거의 즉시 손실을 올리며, 같은 수의 새 인간 토큰은 계속 손실을 낮춘다. 기존 법칙은 이를 예측하지 못한다. Chinchilla는 C4에서 새 인간 토큰 추가를 1.32×10⁻³의 paired error로 맞추지만 AI 토큰 추가는 4.32×10⁻³으로 틀린다. 대체 데이터 법칙인 Jain 등의 법칙은 8.00×10⁻³으로 Chinchilla보다도 나쁘다.

전제와 한계

제안하는 스케일링 법칙은 Chinchilla 골격 L = E + A/N^α + (B/D_eff^β)(1+H)를 유지하면서 두 항을 새로 붙인다. 이득 항은 유효 토큰을 D_eff = D_H(1+η·g(r)), g(r) = R*(1-e^{-r/R*}), R* = K·t^ρ (t = D_H/20N)로 정의해 AI 토큰이 늘수록 이득이 포화되게 하고, 첫 AI 토큰의 가치 η를 자유 파라미터로 둔다. 해악 항은 H = γ·t^u·n^v·[log(1+r) - r/(1+r)] (n = N/10⁸)로, 로그적으로 증가하며 r=1에서 한계 해악이 최대가 된다. r/(1+r)을 빼서 첫 AI 토큰의 초기 해악을 상쇄한다. AI 데이터가 없으면(r=0) 정확히 Chinchilla로 환원된다. 저자들은 이 법칙이 갖춰야 할 다섯 기준(토큰 가치의 유연성, 이득과 해악의 동시 표현, 해석 가능성, 유한한 첫 토큰 가치, AI 없을 때 Chinchilla 환원)을 명시하고 기존 법칙들을 이 기준으로 평가한다. 19.9M~268M 모델 726개로 피팅하고 477M·973M 모델 74개(최대 피팅 크기의 1.8배, 3.6배)로 검증했을 때, C4에서 paired error 0.83×10⁻³으로 기존 최고 법칙인 Shukor 등의 joint law(1.41×10⁻³)보다 41% 낮은 오차를 낸다.

실무 권고는 네 가지다. 첫째, 목표가 인간 텍스트라면 AI 텍스트를 필터링하라. 2026년 자연 AI 비율(22.3%)로 학습한 모델과 인간 부분집합만 쓴 동일 크기 모델을 비교했을 때, 대략 파라미터당 10~15토큰 이상(모델이 클수록 더 낮은 지점)에서는 데이터가 더 적은데도 인간 전용 모델의 C4 손실이 더 낮았다. 제안 법칙은 19쌍 중 18쌍에서 필터링 방향을 맞췄고(paired error 3.28×10⁻³), Chinchilla는 AI를 제거하면 손실이 오른다고 13쌍 모두에서 반대로 예측했다. 둘째, 데이터가 부족하면 AI 텍스트를 늘리기 전에 인간 텍스트를 반복하라. 파라미터당 20토큰에서 19.9M·35.8M 모델로 실험한 결과 인간 코퍼스를 1배 추가 반복했을 때 C4 손실이 AI 텍스트 추가보다 2.3% 낮았고, 8배 추가(총 9에폭) 후에는 격차가 6.3~6.4%로 벌어졌다. 셋째, 비용을 계산하라. 2026년 8월 AI 비율(31.1%)의 미필터 크롤링은 인간 부분집합 학습과 맞먹으려면 1.6배 컴퓨트가 필요하고, 논문의 예측대로 2027년 말 2.1배, 2028년 말(50.7% AI) 3.0배가 된다. C4 기준 손실을 최소화하는 AI 비율은 파라미터당 5토큰에서 37%지만 20토큰에서는 1.0%로 떨어진다. 반대로 목표가 AI 텍스트 자체라면 최적 AI 비율이 모든 예산에서 90%를 넘고, 첫 AI 토큰의 가치가 인간 토큰 20개 이상으로 평가된다. 넷째, 검증 손실을 인간 텍스트와 AI 텍스트로 나눠 보고하라. AI 텍스트가 더 예측하기 쉬워서, AI 비율 22.3%의 혼합 검증셋은 해로운 실행의 95.5%를 개선으로 보고한다. AI 텍스트를 추가한 553개 모델 전부가 AI 라벨 FW26 텍스트에서 손실을 낮췄지만, 44%는 인간 라벨 텍스트에서 손실을 올렸다. 부작용도 있다. 268M 모델에서 1,000단어당 AI 특유 표현이 AI 없을 때 0.16에서 r=1일 때 0.36, r=4일 때 0.54로 늘었고, r=2에서는 Pangram이 스토리를 AI로 판정하는 비율이 18.6%에서 37.2%로 두 배가 됐다.

저자들이 밝힌 한계는 분명하다. 법칙은 268M 파라미터까지 피팅하고 973M까지 테스트했을 뿐이라 더 큰 모델로의 외삽은 검증되지 않았다. 큰 모델은 훈련 데이터를 더 많이 암기하고 모델 생성 데이터에 더 크게 해를 입을 수 있지만, 반대로 AI 텍스트와 인간 텍스트를 서로 돕는 관련 과제로 학습할 가능성도 있다. 측정 대상은 다음 토큰 손실이며, 이 규모에서 AI 텍스트는 CORE 점수를 새 인간 텍스트만큼 올리지만 모든 모델이 의미 있는 성능을 낼 만큼 크지 않고 그 과제들이 애초에 AI 생성 텍스트가 최적화하도록 만들어진 것이다. 또한 영어 웹 텍스트, Pangram 라벨, 사전학습만 다룬다. 향후 과제로는 wild AI 텍스트를 필터링하고 표적 합성 데이터를 추가하는 것, AI 텍스트가 도움이 되는 도메인 찾기, 현재 모델 품질에 이미 미친 영향 측정, AI가 쓴 입력을 이해하되 그렇게 쓰지 않는 모델 학습(태깅이나 손실 마스킹)을 제시한다.