言語モデル800個を自ら事前学習させた研究陣が、AI生成のウェブテキストはそのモデルがどれだけデータに飢えているかによって役に立つか害になるかが決まり、学習計画に用いられる標準的なスケーリング則ではその差を表現できないと報告した。研究陣は9月30日にarXivへ公開した論文で、オープンウェブのどれだけが既に機械の手で書かれているかも数値で示している。FineWebの品質フィルタリングを通した後でも、2026年6月のウェブデータではトークンの27.5%がAI生成と判定され、8月には31.1%まで上昇した。
要点
- FineWebのフィルタリング後、ウェブトークンに占めるAI生成の比率は2026年6月の27.5%から8月には31.1%へ上昇した。Pangram分類器による計測値である。
- データ不足のモデルにAIトークンを加えると、人間のテキストに対する損失はまず下がり、やがて飽和し、その後は害に転じる。人間のテキスト予算が大きいモデルでは、AIトークンはほぼ即座に損失を押し上げる。
- 研究陣が提案したスケーリング則は利得と損害を別項に分ける。最大3.6倍大きいモデルまで、既存の最良の則より41%低い誤差で予測し、AIテキストが存在しなければChinchillaに還元される。
野生のAIテキストは合成データではない
機械の出力でモデルを学習させる従来研究は、意図的な合成データ生成か、モデルが自らの出力を食べ続けるモデル崩壊のシナリオを扱うものが大半だった。論文は、実際の事前学習コーパスに紛れ込む文章はそのどちらでもないと指摘する。野生のAIテキストは複数の異なるモデルから生まれ、学習用の燃料ではなく人間に読まれるために書かれ、ラベルなしで届く。人間の散文と区別する印を一切持たないまま、クロールデータに混ざっているということだ。
品質フィルタリングがこれを取り除けない点が問題になる。27.5%と31.1%という数値は、FineWebの品質パイプラインを通した後に測ったものだ。大半の大規模言語モデルチームが頼っているまさにその篩を、AIの書いたテキストがすり抜けている。ChatGPT以降に公開されたウェブページの35%にAI執筆の兆候が見られるというPewの調査が公開側から同じ流れを捉えたのに対し、今回の論文は何が学習データに着地するかを計測し、そこで何を引き起こすかまで検証した。
800回の事前学習が示したこと
研究陣は800モデルで人間トークンに対する追加AIトークンの比率を変えながら、人間が書いたテキストとAIが書いたテキストの両方のホールドアウト損失にスケーリング則をフィットさせた。二つの様相が現れた。
モデルがデータに飢えている場合、つまりきれいな人間のテキストよりも使える計算資源が多い場合、AIトークンを加えると人間のテキストの損失は最初は下がる。比率が上がると利得は飽和し、その後は負に転じる。一方、人間のテキストを潤沢に使ったモデルにはハニームーン期間がそもそも存在しない。AIトークンはほぼ即座に損失を上げるが、同じ数の新しい人間のトークンは損失を下げ続ける。
実務上の帰結は、AIトークン1個の値段に単一の答えがないということだ。その価値は代替案が何かに左右され、符号まで反転する。Hoffmannらが2022年に示したChinchilla系の則が表現できないのはまさにこの点である。これらは損失をパラメータ数とトークン数の滑らかな関数としてモデル化し、すべてのトークンを同じ財の交換可能な単位として扱う。
負のトークンを許すスケーリング則
研究陣は利得項と損害項を分離した代替則を提案した。混合比が変わればAIトークンの限界価値が符号を変えられるよう設計されている。重要なのは、AI比率がゼロならこの則がChinchillaに還元される点だ。競合する別形式ではなく厳密な拡張だという意味である。
小さいモデルにフィットさせたこの則は、最大3.6倍大きいモデルにおいてAIテキストがホールドアウトの人間テキスト損失に与える影響を、既存の最良の則より41%低い誤差で予測した。すべてのAI比率の区間で計測した結果だ。この外挿性能が要点である。研究機関が安価な小規模実行にスケーリング則をフィットさせるのは、はるかに大きな予算の使い道を決めるためであり、汚染データの値付けを誤る則は実行全体の値付けを誤る。
論文が実務者に勧める三つのこと
勧告は三つだ。目標分布が人間のテキストならAIテキストを除去する。AI生成のウェブテキストでデータセットを広げる前に、人間のテキストを繰り返して使う。もっとクロールすればよいという反射的な対応に正面から挑む勧告だ。そして検証損失を人間のテキストとAIテキストに分けて報告する。混ぜて一つにした数値はこのトレードオフを丸ごと隠してしまうからだ。
研究陣は逆のケースについても明確に線を引いている。目標がAIテキストであれば、AIテキストは依然として価値を持つ。機械の書いた入力を扱うために作られたモデルは、そのテキストで学習しても損をしない。損害は、何で学習するかと何をモデル化したいかが食い違うときにだけ生じる。
再現を支えるため、研究陣はAI執筆の有無・トピック・形式をラベル付けした830億トークン規模のコーパスWildAIを、800モデルとコードとともに公開した。AI執筆ラベルはPangram Labsによるもので、同社の共同創業者Max SperoとBradley Emiが、Jenna Russell、Ben Glickenhaus、Katherine Thai、John Wieting、Mohit Iyyerとともに論文の著者7人に名を連ねている。計測された汚染率がその分類器の精度に依存していることを考えれば、記しておくべき点だ。
展望
フィルタ後のウェブテキストに占めるAIの比率が月1ポイント近いペースで上がり続けるなら、新しいクロールをきれいな人間テキストの貯水池として扱える期間は急速に閉じていく。論文の枠組みは、この漠然とした懸念を公式の付いた予算問題に置き換える。データのキュレーションが衛生管理ではなく、スケーリング方程式の一項になるということだ。検出の品質そのものも争点になる可能性が高い。いまやどの研究機関の計算計画も、誰が書いたかという分類器の判定に依存しているからだ。AIのウェブテキストを出自の明らかな合成データと見る視点はそもそも正確ではなかった。計測しなければ2026年のクロールの構成比は誰にも分からない、というのが誠実な答えである。
FAQ よくある質問
AI生成のウェブテキストで学習すると必ずモデルに害があるのか
そうではない。論文は、効果はモデルが既に持っている人間のテキスト量に依存するとしている。データ不足のモデルはAIトークンを加えると人間テキストの損失がまず下がり、その後に利得が飽和して逆転する。人間テキストの予算が大きいモデルはほぼ即座に害を受ける。
Chinchillaのスケーリング則はなぜここで通用しないのか
Chinchilla系の則はトークンを交換可能な単位とみなし、損失をパラメータとデータ量の滑らかな関数としてモデル化する。そのため限界価値が正から負へ変わるトークンを表現できない。研究陣は利得項と損害項を別に置き、その則はAIテキストがなければChinchillaに還元される。
WildAIとは何か
WildAIは研究陣が論文とともに公開した830億トークン規模のコーパスで、AI執筆の有無、トピック、形式がラベル付けされている。事前学習した800モデルと学習コードも同時に公開されており、他の研究者がスケーリング則を再フィットさせたり、別のフィルタリング戦略を検証したりできる。






