一組親自預訓練800個語言模型的研究人員指出,AI生成的網路文字對模型是助力還是傷害,完全取決於該模型有多缺乏資料,而業界用來規劃訓練的標準擴展律無法表達這項差異。研究團隊在9月30日發表於arXiv的論文中,也量化了開放網路已有多少內容出自機器之手:經過FineWeb品質過濾後,2026年6月網路資料中有27.5%的token被標記為AI生成,到8月升至31.1%。
重點摘要
- 經FineWeb過濾後,網路token中AI生成的比重由2026年6月的27.5%升至8月的31.1%,數據以Pangram分類器量測。
- 對缺乏資料的模型加入AI token,人類文字上的損失先是下降,接著飽和,最後反轉為傷害;而人類文字預算充足的模型,AI token幾乎立刻就推高損失。
- 研究團隊提出的擴展律把助益與傷害拆成獨立項,對最大3.6倍的模型預測誤差比現有最佳擴展律低41%,且在沒有AI文字時會還原為Chinchilla。
野生AI文字不是合成資料
過去以機器輸出訓練模型的研究,多半探討刻意生成的合成資料,或模型反覆吃下自身輸出的模型崩壞情境。論文主張,真正混進預訓練語料庫的文字兩者都不是。野生AI文字來自許多不同模型,是為了給人閱讀而寫、而非充當訓練燃料,且抵達時沒有標籤——混在爬取資料裡,完全沒有可與人類文筆區分的記號。
關鍵在於品質過濾無法把它清掉。27.5%與31.1%這兩個數字,是在FineWeb品質流程跑完之後量測的,意即AI撰寫的比重恰好穿過了多數大型語言模型團隊所倚賴的那道篩網。Pew指出ChatGPT問世後發布的網頁有35%出現AI撰寫跡象,是從發布端描述同一趨勢;這篇論文則量測有多少落進訓練集,並進一步測試它在那裡造成什麼後果。
800次預訓練揭示的兩種情境
研究團隊在這800個模型中改變新增AI token與人類token的比例,並對人類撰寫文字與AI撰寫文字兩邊的保留集損失擬合擴展律。結果浮現兩種情境。
當模型缺乏資料,也就是算力多於可供花用的乾淨人類文字時,加入AI token起初會讓人類文字上的損失下降。隨著比例攀升,助益逐漸飽和,隨後轉為負值。而在人類文字預算充裕的模型上,根本沒有蜜月期:AI token幾乎立刻推高損失,同樣數量的新鮮人類token卻仍持續把損失壓低。
實務上的結論是,AI token值多少錢並沒有單一答案。它的價值取決於替代選項是什麼,而且符號會翻轉。這正是Hoffmann等人2022年提出的Chinchilla式擴展律無法表達之處:這類擴展律把損失描述為參數量與token量的平滑函數,將所有token視為同一種商品的可互換單位。
允許負值token的擴展律
研究團隊提出的替代方案把助益項與傷害項分開,讓AI token的邊際價值能隨混合比例改變而變換符號。關鍵是,當AI比重為零時,這套擴展律會還原為Chinchilla,因此它是嚴格的延伸,而非互相競爭的另一套形式。
以較小模型擬合後,這套擴展律在所有AI比例區間上,對最大3.6倍模型預測AI文字對保留人類文字損失的影響,誤差比現有最佳擴展律低41%。這項外推能力才是重點:實驗室之所以在廉價的小規模訓練上擬合擴展律,正是為了決定遠大於此的預算該怎麼花,而錯估受污染資料價格的擴展律,就會錯估整次訓練的價格。
論文給從業者的三項建議
隨之而來的建議有三。若目標分布是人類文字,就過濾掉AI文字。在用AI生成的網路文字擴充資料集之前,先重複使用人類文字——這直接挑戰了「多爬一些就好」的反射式作法。並且把驗證損失分成人類文字與AI文字分別回報,因為混成單一數字會把這個取捨完全藏起來。
研究團隊對相反情況也劃清界線:當目標就是AI文字時,AI文字依然有價值。一個本就要處理機器撰寫輸入的模型,用這類文字訓練並不會受害。傷害只出現在訓練內容與想要建模的對象不一致時。
為了支持重現,研究團隊釋出了WildAI——一套830億token規模、標註AI撰寫與否、主題與格式的語料庫,並一併公開全部800個模型與程式碼。AI撰寫標籤來自Pangram Labs,該公司共同創辦人Max Spero與Bradley Emi,與Jenna Russell、Ben Glickenhaus、Katherine Thai、John Wieting、Mohit Iyyer同列論文七位作者。考慮到量測出的污染率取決於該分類器的準確度,這點值得一提。
後續展望
若過濾後網路文字的AI比重持續以每月約一個百分點的速度攀升,把新爬取資料當成乾淨人類文字水庫的時間窗正在迅速關閉。論文的框架把這份模糊的憂慮,換成一道附有公式的預算題:資料整理不再只是衛生工作,而成為擴展方程式裡的一項。偵測品質本身很可能成為各方爭奪的基礎設施,因為如今每間實驗室的算力規劃,都取決於分類器對「這是誰寫的」所下的判斷。把AI網路文字視為來源明確的合成資料從來就不準確;誠實的說法是,不實際量測,沒人知道2026年的爬取資料裡混了什麼比例。
FAQ 常見問題
用AI生成的網路文字訓練,一定會傷害模型嗎?
不一定。論文發現效果取決於模型手上已有多少人類文字。缺乏資料的模型在加入AI token時,人類文字上的損失會先下降,之後助益飽和並反轉。以大量人類文字預算訓練的模型則幾乎立刻受害。
Chinchilla擴展律為何在這裡失效?
Chinchilla式擴展律把token當成可互換單位,並將損失描述為參數與資料量的平滑函數,因此無法表達邊際價值由正轉負的token。研究團隊另外加上助益項與傷害項,而在沒有AI文字時,他們的擴展律會還原為Chinchilla。
WildAI是什麼?
WildAI是研究團隊隨論文釋出的830億token語料庫,標註了AI撰寫與否、主題與格式。全部800個預訓練模型與訓練程式碼也一併公開,讓其他研究者能重新擬合擴展律,或測試不同的過濾策略。






