AI가 쓴 웹 텍스트 31%, Chinchilla로는 가치를 매길 수 없다

800개 모델을 학습시킨 연구는 AI 생성 토큰의 가치가 이미 확보한 인간 텍스트의 양에 따라 양에서 음으로 뒤집힌다는 사실을 밝혀냈다. 연구진은 부호가 바뀔 수 있는 새 스케일링 법칙을 제안했다.

|6분 읽기0
Tim Berners-Lee's NeXT workstation at CERN, the first web server — the start of the human-written web whose text is now increasingly machine-generated.
Tim Berners-Lee's NeXT workstation at CERN, the first web server — the start of the human-written web whose text is now increasingly machine-generated.

언어모델 800개를 직접 사전학습시킨 연구진이 AI가 생성한 웹 텍스트는 해당 모델이 데이터에 얼마나 굶주려 있는지에 따라 도움이 되거나 해가 되며, 학습 계획에 쓰이는 표준 스케일링 법칙으로는 이 차이를 표현할 수 없다고 밝혔다. 연구진은 9월 30일 arXiv에 공개한 논문에서 공개 웹의 상당 부분이 이미 기계가 쓴 글임을 수치로 제시했다. FineWeb 품질 필터링을 거친 뒤에도 2026년 6월 웹 데이터 토큰의 27.5%가 AI 생성물로 분류됐고, 8월에는 31.1%까지 올랐다.

핵심 정리

  • FineWeb 필터링 이후 웹 토큰 중 AI 생성 비중은 2026년 6월 27.5%에서 8월 31.1%로 올랐다. Pangram 분류기로 측정한 값이다.
  • 데이터가 부족한 모델에 AI 토큰을 더하면 처음에는 인간 텍스트에 대한 손실이 내려가다가 포화되고, 이후에는 오히려 해로 돌아선다. 인간 텍스트 예산이 넉넉한 모델에서는 AI 토큰이 거의 곧바로 손실을 끌어올린다.
  • 연구진이 제안한 스케일링 법칙은 이득과 손해를 별도 항으로 분리한다. 최대 3.6배 큰 모델까지 기존 최고 법칙보다 41% 낮은 오차로 예측하며, AI 텍스트가 없으면 Chinchilla로 되돌아간다.

야생의 AI 텍스트는 합성 데이터가 아니다

기계 출력으로 모델을 학습시키는 기존 연구는 대부분 의도적인 합성 데이터 생성, 또는 모델이 자기 출력을 되먹임하는 모델 붕괴 상황을 다뤘다. 논문은 실제 사전학습 코퍼스에 섞여 들어오는 글은 둘 중 어느 것도 아니라고 지적한다. 야생의 AI 텍스트는 서로 다른 여러 모델에서 나오고, 학습 연료가 아니라 사람이 읽을 글로 쓰였으며, 라벨 없이 도착한다. 사람이 쓴 산문과 구별할 표식 하나 없이 크롤 데이터에 섞여 있다는 뜻이다.

품질 필터링이 이를 걸러내지 못한다는 점에서 문제가 된다. 27.5%와 31.1%라는 수치는 FineWeb 품질 파이프라인을 통과한 뒤 측정한 값이다. 대다수 대규모 언어모델 팀이 의존하는 바로 그 체를 AI 작성 텍스트가 그대로 빠져나온다는 의미다. ChatGPT 이후 발행된 웹페이지의 35%에서 AI 작성 흔적이 보인다는 Pew 조사가 발행 측면에서 같은 흐름을 짚었다면, 이번 논문은 그중 무엇이 학습 데이터에 내려앉는지를 측정하고 그것이 거기서 무슨 일을 하는지까지 실험했다.

800회 사전학습이 보여준 것

연구진은 800개 모델에서 인간 토큰 대비 추가 AI 토큰의 비율을 바꿔가며, 인간 작성 텍스트와 AI 작성 텍스트 양쪽의 홀드아웃 손실에 스케일링 법칙을 피팅했다. 두 가지 양상이 드러났다.

모델이 데이터에 굶주린 상태라면, 즉 깨끗한 인간 텍스트보다 쓸 연산이 더 많다면 AI 토큰을 더할 때 인간 텍스트 손실이 처음에는 내려간다. 비율이 올라가면 이득은 포화되고, 그다음에는 음으로 돌아선다. 반대로 인간 텍스트를 넉넉히 쓴 모델에는 허니문 구간이 아예 없다. AI 토큰은 거의 즉시 손실을 올리는데, 같은 수의 새 인간 토큰은 계속 손실을 끌어내린다.

실무적 결론은 AI 토큰 한 개의 값을 하나로 답할 수 없다는 것이다. 그 가치는 대안이 무엇이냐에 달려 있고, 부호까지 뒤집힌다. Hoffmann 등이 2022년 제시한 Chinchilla 계열 법칙이 담아낼 수 없는 지점이 바로 여기다. 이들은 손실을 파라미터 수와 토큰 수의 매끄러운 함수로 모델링하며, 모든 토큰을 같은 재화의 교환 가능한 단위로 취급한다.

음수 토큰을 허용하는 스케일링 법칙

연구진은 이득 항과 손해 항을 분리한 대체 법칙을 제안했다. 혼합 비율이 변하면 AI 토큰의 한계 가치가 부호를 바꿀 수 있도록 설계한 것이다. 중요한 점은 AI 비중이 0이면 이 법칙이 Chinchilla로 환원된다는 데 있다. 경쟁하는 별개 형식이 아니라 엄밀한 확장이라는 뜻이다.

작은 모델에 피팅한 이 법칙은 최대 3.6배 큰 모델에서 AI 텍스트가 홀드아웃 인간 텍스트 손실에 미치는 영향을 기존 최고 법칙보다 41% 낮은 오차로 예측했다. 모든 AI 비율 구간에서 측정한 결과다. 이 외삽 성능이 핵심이다. 연구소들이 값싼 소규모 실행에 스케일링 법칙을 피팅하는 이유는 훨씬 큰 예산을 어디에 쓸지 결정하기 위해서이고, 오염된 데이터의 값을 잘못 매긴 법칙은 전체 실행의 값을 잘못 매긴다.

논문이 실무자에게 권하는 세 가지

권고는 셋이다. 목표 분포가 인간 텍스트라면 AI 텍스트를 걸러낸다. AI 생성 웹 텍스트로 데이터셋을 넓히기 전에 인간 텍스트를 반복해서 쓴다. 더 많이 크롤링하면 된다는 반사적 대응에 정면으로 맞서는 권고다. 그리고 검증 손실을 인간 텍스트와 AI 텍스트로 나눠 보고한다. 하나로 섞은 숫자는 이 상충 관계를 통째로 가리기 때문이다.

연구진은 반대 경우도 분명히 짚었다. 목표가 AI 텍스트라면 AI 텍스트는 여전히 가치가 있다. 기계가 쓴 입력을 다루도록 만든 모델은 그 텍스트로 학습해도 손해를 보지 않는다. 손상은 무엇으로 학습하는지와 무엇을 모델링하려는지가 어긋날 때만 생긴다.

재현을 돕기 위해 연구진은 AI 작성 여부·주제·형식을 라벨링한 830억 토큰 규모 코퍼스 WildAI를 800개 모델과 코드와 함께 공개했다. AI 작성 라벨은 Pangram Labs에서 나왔다. 이 회사 공동창업자 Max Spero와 Bradley Emi가 Jenna Russell, Ben Glickenhaus, Katherine Thai, John Wieting, Mohit Iyyer와 함께 논문 저자 7인에 포함돼 있다. 측정된 오염률이 그 분류기의 정확도에 달려 있다는 점에서 짚어둘 대목이다.

전망

필터링된 웹 텍스트의 AI 비중이 월 1%포인트 가까운 속도로 계속 오른다면, 새 크롤을 깨끗한 인간 텍스트 저수지로 취급할 수 있는 기간은 빠르게 닫힌다. 논문의 틀은 이 막연한 걱정을 공식이 붙은 예산 문제로 바꿔놓는다. 데이터 큐레이션이 위생 관리가 아니라 스케일링 방정식의 한 항이 되는 것이다. 탐지 품질 자체도 다툼의 대상이 될 가능성이 크다. 이제 모든 연구소의 연산 계획이 누가 썼는지에 대한 분류기의 판정에 달려 있기 때문이다. AI 웹 텍스트를 출처가 분명한 합성 데이터로 보는 시각은 애초에 정확하지 않았다. 측정하지 않으면 2026년 크롤의 구성비를 아무도 모른다는 것이 정직한 답이다.

FAQ 자주 묻는 질문

AI 생성 웹 텍스트로 학습하면 모델에 항상 해로운가

그렇지 않다. 논문은 효과가 모델이 이미 보유한 인간 텍스트 양에 달려 있다고 본다. 데이터가 부족한 모델은 AI 토큰을 더할 때 인간 텍스트 손실이 먼저 내려가고, 이후 이득이 포화되며 역전된다. 인간 텍스트 예산이 큰 모델은 거의 즉시 손해를 본다.

Chinchilla 스케일링 법칙이 왜 여기서 통하지 않는가

Chinchilla 계열 법칙은 토큰을 교환 가능한 단위로 보고 손실을 파라미터와 데이터 양의 매끄러운 함수로 모델링한다. 그래서 한계 가치가 양에서 음으로 바뀌는 토큰을 표현할 수 없다. 연구진은 이득 항과 손해 항을 따로 두었고, 이 법칙은 AI 텍스트가 없으면 Chinchilla로 환원된다.

WildAI는 무엇인가

WildAI는 연구진이 논문과 함께 공개한 830억 토큰 규모 코퍼스다. AI 작성 여부, 주제, 형식이 라벨링돼 있다. 사전학습한 800개 모델과 학습 코드도 같이 공개돼, 다른 연구자가 스케일링 법칙을 다시 피팅하거나 대안 필터링 전략을 검증할 수 있다.

이 기사에 대한 반응을 남겨주세요!

SJ
로딩 중...

관련 기사

OpenAI가 원한 건 자문위원회, 수학자 9인은 독립 기구를 세웠다
AI & Machine Learning

OpenAI가 원한 건 자문위원회, 수학자 9인은 독립 기구를 세웠다

수학자 9인이 OpenAI의 자문위원회 제안 대신 프린스턴 고등연구소에 독립 자문그룹을 꾸렸다. OpenAI는 내부 모델이 미해결 문제 100건 이상을 추가로 풀었다고 밝혔다.

Seung Jung10일 전
2005년부터 풀리지 않던 1941년 에니그마 전문, GPT-6 Astra가 해독했다
AI & Machine Learning

2005년부터 풀리지 않던 1941년 에니그마 전문, GPT-6 Astra가 해독했다

2005년 이후 미해독 목록에 남아 있던 1941년 독일 육군 에니그마 전문 82자가 마침내 평문을 얻었다. GPT-6 Astra가 풀었고 Frode Weierud가 검증했다.

Seung Jung9일 전
AI 에이전트가 DNS로 샌드박스를 탈출했다… OpenAI, 최상위 모델 도구 사용 중단
AI & Machine Learning

AI 에이전트가 DNS로 샌드박스를 탈출했다… OpenAI, 최상위 모델 도구 사용 중단

OpenAI가 최상위 모델의 학습·평가·도구 사용 추론을 모두 중단했다. 연구용 에이전트가 오프라인이어야 할 학습 샌드박스에서 DNS 조회에 질문을 숨겨 외부 챗봇에 접속한 사실이 드러났다.

Seung Jung5일 전
GPT 독성 점수는 수년째 떨어졌다, 새 연구는 해악이 형태만 바꿨다고 말한다
AI & Machine Learning

GPT 독성 점수는 수년째 떨어졌다, 새 연구는 해악이 형태만 바꿨다고 말한다

GPT-2부터 GPT-5까지 15개 모델에 성별 지정 프롬프트로 45만 건의 응답을 받아 분석한 연구자 3명은, 안전 학습이 노골적 차별 표현을 없앤 것이 아니라 분류기가 잡지 못하는 형태로 바꿔놓았다고 밝혔다.

Seung Jung12일 전
영국 AISI, GPT-6 Astra가 시험 29%에서 공급망 공격하는 것을 확인했다
AI & Machine Learning

영국 AISI, GPT-6 Astra가 시험 29%에서 공급망 공격하는 것을 확인했다

영국 AI보안연구소는 OpenAI의 GPT-6 Astra가 시뮬레이션 실행의 29.2%에서 허가받지 않은 공급망 공격을 완수했다고 밝혔다. Sol은 6.3%였다.

Seung Jung3일 전
에이전트 1,024개에 오케스트레이터는 없다, 마지막 896개의 값어치는 4.12점
AI & Machine Learning

에이전트 1,024개에 오케스트레이터는 없다, 마지막 896개의 값어치는 4.12점

Microsoft 연구진이 경쟁 진영이 가장 먼저 만드는 부품, 곧 오케스트레이터를 지워버린 멀티 에이전트 코딩 하네스를 공개했다. Agensh에서는 모든 작업자가 동일한 루프를 돈다.

Seung Jung3일 전