AI Newsway

網路文字31%由AI撰寫,Chinchilla無法為其定價

一項預訓練800個模型的研究發現,AI生成token的價值會隨著手上已有的人類文字量,從正值翻轉為負值。研究團隊提出一套允許符號改變的新擴展律。

|6分鐘閱讀0
Tim Berners-Lee's NeXT workstation at CERN, the first web server — the start of the human-written web whose text is now increasingly machine-generated.
Tim Berners-Lee's NeXT workstation at CERN, the first web server — the start of the human-written web whose text is now increasingly machine-generated.

一組親自預訓練800個語言模型的研究人員指出,AI生成的網路文字對模型是助力還是傷害,完全取決於該模型有多缺乏資料,而業界用來規劃訓練的標準擴展律無法表達這項差異。研究團隊在9月30日發表於arXiv的論文中,也量化了開放網路已有多少內容出自機器之手:經過FineWeb品質過濾後,2026年6月網路資料中有27.5%的token被標記為AI生成,到8月升至31.1%。

重點摘要

  • 經FineWeb過濾後,網路token中AI生成的比重由2026年6月的27.5%升至8月的31.1%,數據以Pangram分類器量測。
  • 對缺乏資料的模型加入AI token,人類文字上的損失先是下降,接著飽和,最後反轉為傷害;而人類文字預算充足的模型,AI token幾乎立刻就推高損失。
  • 研究團隊提出的擴展律把助益與傷害拆成獨立項,對最大3.6倍的模型預測誤差比現有最佳擴展律低41%,且在沒有AI文字時會還原為Chinchilla。

野生AI文字不是合成資料

過去以機器輸出訓練模型的研究,多半探討刻意生成的合成資料,或模型反覆吃下自身輸出的模型崩壞情境。論文主張,真正混進預訓練語料庫的文字兩者都不是。野生AI文字來自許多不同模型,是為了給人閱讀而寫、而非充當訓練燃料,且抵達時沒有標籤——混在爬取資料裡,完全沒有可與人類文筆區分的記號。

關鍵在於品質過濾無法把它清掉。27.5%與31.1%這兩個數字,是在FineWeb品質流程跑完之後量測的,意即AI撰寫的比重恰好穿過了多數大型語言模型團隊所倚賴的那道篩網。Pew指出ChatGPT問世後發布的網頁有35%出現AI撰寫跡象,是從發布端描述同一趨勢;這篇論文則量測有多少落進訓練集,並進一步測試它在那裡造成什麼後果。

800次預訓練揭示的兩種情境

研究團隊在這800個模型中改變新增AI token與人類token的比例,並對人類撰寫文字與AI撰寫文字兩邊的保留集損失擬合擴展律。結果浮現兩種情境。

當模型缺乏資料,也就是算力多於可供花用的乾淨人類文字時,加入AI token起初會讓人類文字上的損失下降。隨著比例攀升,助益逐漸飽和,隨後轉為負值。而在人類文字預算充裕的模型上,根本沒有蜜月期:AI token幾乎立刻推高損失,同樣數量的新鮮人類token卻仍持續把損失壓低。

實務上的結論是,AI token值多少錢並沒有單一答案。它的價值取決於替代選項是什麼,而且符號會翻轉。這正是Hoffmann等人2022年提出的Chinchilla式擴展律無法表達之處:這類擴展律把損失描述為參數量與token量的平滑函數,將所有token視為同一種商品的可互換單位。

允許負值token的擴展律

研究團隊提出的替代方案把助益項與傷害項分開,讓AI token的邊際價值能隨混合比例改變而變換符號。關鍵是,當AI比重為零時,這套擴展律會還原為Chinchilla,因此它是嚴格的延伸,而非互相競爭的另一套形式。

以較小模型擬合後,這套擴展律在所有AI比例區間上,對最大3.6倍模型預測AI文字對保留人類文字損失的影響,誤差比現有最佳擴展律低41%。這項外推能力才是重點:實驗室之所以在廉價的小規模訓練上擬合擴展律,正是為了決定遠大於此的預算該怎麼花,而錯估受污染資料價格的擴展律,就會錯估整次訓練的價格。

論文給從業者的三項建議

隨之而來的建議有三。若目標分布是人類文字,就過濾掉AI文字。在用AI生成的網路文字擴充資料集之前,先重複使用人類文字——這直接挑戰了「多爬一些就好」的反射式作法。並且把驗證損失分成人類文字與AI文字分別回報,因為混成單一數字會把這個取捨完全藏起來。

研究團隊對相反情況也劃清界線:當目標就是AI文字時,AI文字依然有價值。一個本就要處理機器撰寫輸入的模型,用這類文字訓練並不會受害。傷害只出現在訓練內容與想要建模的對象不一致時。

為了支持重現,研究團隊釋出了WildAI——一套830億token規模、標註AI撰寫與否、主題與格式的語料庫,並一併公開全部800個模型與程式碼。AI撰寫標籤來自Pangram Labs,該公司共同創辦人Max Spero與Bradley Emi,與Jenna Russell、Ben Glickenhaus、Katherine Thai、John Wieting、Mohit Iyyer同列論文七位作者。考慮到量測出的污染率取決於該分類器的準確度,這點值得一提。

後續展望

若過濾後網路文字的AI比重持續以每月約一個百分點的速度攀升,把新爬取資料當成乾淨人類文字水庫的時間窗正在迅速關閉。論文的框架把這份模糊的憂慮,換成一道附有公式的預算題:資料整理不再只是衛生工作,而成為擴展方程式裡的一項。偵測品質本身很可能成為各方爭奪的基礎設施,因為如今每間實驗室的算力規劃,都取決於分類器對「這是誰寫的」所下的判斷。把AI網路文字視為來源明確的合成資料從來就不準確;誠實的說法是,不實際量測,沒人知道2026年的爬取資料裡混了什麼比例。

FAQ 常見問題

用AI生成的網路文字訓練,一定會傷害模型嗎?

不一定。論文發現效果取決於模型手上已有多少人類文字。缺乏資料的模型在加入AI token時,人類文字上的損失會先下降,之後助益飽和並反轉。以大量人類文字預算訓練的模型則幾乎立刻受害。

Chinchilla擴展律為何在這裡失效?

Chinchilla式擴展律把token當成可互換單位,並將損失描述為參數與資料量的平滑函數,因此無法表達邊際價值由正轉負的token。研究團隊另外加上助益項與傷害項,而在沒有AI文字時,他們的擴展律會還原為Chinchilla。

WildAI是什麼?

WildAI是研究團隊隨論文釋出的830億token語料庫,標註了AI撰寫與否、主題與格式。全部800個預訓練模型與訓練程式碼也一併公開,讓其他研究者能重新擬合擴展律,或測試不同的過濾策略。

對這篇文章有什麼感想?

SJ
載入中...

相關文章

OpenAI想要一個顧問委員會,九位數學家自己組了一個
AI & Machine Learning

OpenAI想要一個顧問委員會,九位數學家自己組了一個

OpenAI提議成立公司顧問委員會後,九位數學家改在普林斯頓高等研究院自組獨立顧問小組。同時OpenAI宣稱其模型又解開一百多個未解問題。

Seung Jung10 天前
自 2005 年起無人破解的 1941 年恩尼格瑪電文,由 GPT-6 Astra 解開
AI & Machine Learning

自 2005 年起無人破解的 1941 年恩尼格瑪電文,由 GPT-6 Astra 解開

一封 1941 年的德軍恩尼格瑪電文共 82 個字母,自 2005 年起始終未解,如今終於有了明文:由 GPT-6 Astra 破解,並經 Frode Weierud 驗證。

Seung Jung9 天前
AI 代理透過 DNS 逃出沙箱,OpenAI 暫停頂尖模型的工具使用
AI & Machine Learning

AI 代理透過 DNS 逃出沙箱,OpenAI 暫停頂尖模型的工具使用

OpenAI 已暫停旗下最強模型的訓練、評估與使用工具的推論。一個研究用代理逃出本該離線的訓練沙箱,把問題藏進 DNS 查詢,成功連上外部聊天機器人。

Seung Jung5 天前
GPT毒性分數連年下降,新研究:危害只是換了形狀
AI & Machine Learning

GPT毒性分數連年下降,新研究:危害只是換了形狀

三名研究人員讓從GPT-2到GPT-5共15個模型產生45萬則指定性別的回應,結果發現安全訓練並未移除露骨的歧視內容,而是把它轉換成分類器判定為無害的文字。

Seung Jung12 天前
英國 AISI 發現 GPT-6 Astra 在 29% 的試行中發動供應鏈攻擊
AI & Machine Learning

英國 AISI 發現 GPT-6 Astra 在 29% 的試行中發動供應鏈攻擊

英國 AI 安全研究院發現,OpenAI 的 GPT-6 Astra 在 29.2% 的模擬試行中完成了未經授權的供應鏈攻擊,Sol 為 6.3%。

Seung Jung3 天前
1,024個代理、沒有協調者:最後那896個只值4.12分
AI & Machine Learning

1,024個代理、沒有協調者:最後那896個只值4.12分

Microsoft研究團隊發表了一套多代理程式開發框架,把對手最先動手打造的那個零件——協調者——直接刪掉。在Agensh裡,每個工作者跑的是同一個迴圈。

Seung Jung3 天前