ウェブテキストの31%はAI生成、Chinchillaではその価値を測れない

800モデルを事前学習させた研究で、AI生成トークンの価値は手元にある人間のテキスト量によって正から負へ反転することが判明した。研究陣は符号が変わりうる新しいスケーリング則を提案している。

|6分で読める0
Tim Berners-Lee's NeXT workstation at CERN, the first web server — the start of the human-written web whose text is now increasingly machine-generated.
Tim Berners-Lee's NeXT workstation at CERN, the first web server — the start of the human-written web whose text is now increasingly machine-generated.

言語モデル800個を自ら事前学習させた研究陣が、AI生成のウェブテキストはそのモデルがどれだけデータに飢えているかによって役に立つか害になるかが決まり、学習計画に用いられる標準的なスケーリング則ではその差を表現できないと報告した。研究陣は9月30日にarXivへ公開した論文で、オープンウェブのどれだけが既に機械の手で書かれているかも数値で示している。FineWebの品質フィルタリングを通した後でも、2026年6月のウェブデータではトークンの27.5%がAI生成と判定され、8月には31.1%まで上昇した。

要点

  • FineWebのフィルタリング後、ウェブトークンに占めるAI生成の比率は2026年6月の27.5%から8月には31.1%へ上昇した。Pangram分類器による計測値である。
  • データ不足のモデルにAIトークンを加えると、人間のテキストに対する損失はまず下がり、やがて飽和し、その後は害に転じる。人間のテキスト予算が大きいモデルでは、AIトークンはほぼ即座に損失を押し上げる。
  • 研究陣が提案したスケーリング則は利得と損害を別項に分ける。最大3.6倍大きいモデルまで、既存の最良の則より41%低い誤差で予測し、AIテキストが存在しなければChinchillaに還元される。

野生のAIテキストは合成データではない

機械の出力でモデルを学習させる従来研究は、意図的な合成データ生成か、モデルが自らの出力を食べ続けるモデル崩壊のシナリオを扱うものが大半だった。論文は、実際の事前学習コーパスに紛れ込む文章はそのどちらでもないと指摘する。野生のAIテキストは複数の異なるモデルから生まれ、学習用の燃料ではなく人間に読まれるために書かれ、ラベルなしで届く。人間の散文と区別する印を一切持たないまま、クロールデータに混ざっているということだ。

品質フィルタリングがこれを取り除けない点が問題になる。27.5%と31.1%という数値は、FineWebの品質パイプラインを通した後に測ったものだ。大半の大規模言語モデルチームが頼っているまさにその篩を、AIの書いたテキストがすり抜けている。ChatGPT以降に公開されたウェブページの35%にAI執筆の兆候が見られるというPewの調査が公開側から同じ流れを捉えたのに対し、今回の論文は何が学習データに着地するかを計測し、そこで何を引き起こすかまで検証した。

800回の事前学習が示したこと

研究陣は800モデルで人間トークンに対する追加AIトークンの比率を変えながら、人間が書いたテキストとAIが書いたテキストの両方のホールドアウト損失にスケーリング則をフィットさせた。二つの様相が現れた。

モデルがデータに飢えている場合、つまりきれいな人間のテキストよりも使える計算資源が多い場合、AIトークンを加えると人間のテキストの損失は最初は下がる。比率が上がると利得は飽和し、その後は負に転じる。一方、人間のテキストを潤沢に使ったモデルにはハニームーン期間がそもそも存在しない。AIトークンはほぼ即座に損失を上げるが、同じ数の新しい人間のトークンは損失を下げ続ける。

実務上の帰結は、AIトークン1個の値段に単一の答えがないということだ。その価値は代替案が何かに左右され、符号まで反転する。Hoffmannらが2022年に示したChinchilla系の則が表現できないのはまさにこの点である。これらは損失をパラメータ数とトークン数の滑らかな関数としてモデル化し、すべてのトークンを同じ財の交換可能な単位として扱う。

負のトークンを許すスケーリング則

研究陣は利得項と損害項を分離した代替則を提案した。混合比が変わればAIトークンの限界価値が符号を変えられるよう設計されている。重要なのは、AI比率がゼロならこの則がChinchillaに還元される点だ。競合する別形式ではなく厳密な拡張だという意味である。

小さいモデルにフィットさせたこの則は、最大3.6倍大きいモデルにおいてAIテキストがホールドアウトの人間テキスト損失に与える影響を、既存の最良の則より41%低い誤差で予測した。すべてのAI比率の区間で計測した結果だ。この外挿性能が要点である。研究機関が安価な小規模実行にスケーリング則をフィットさせるのは、はるかに大きな予算の使い道を決めるためであり、汚染データの値付けを誤る則は実行全体の値付けを誤る。

論文が実務者に勧める三つのこと

勧告は三つだ。目標分布が人間のテキストならAIテキストを除去する。AI生成のウェブテキストでデータセットを広げる前に、人間のテキストを繰り返して使う。もっとクロールすればよいという反射的な対応に正面から挑む勧告だ。そして検証損失を人間のテキストとAIテキストに分けて報告する。混ぜて一つにした数値はこのトレードオフを丸ごと隠してしまうからだ。

研究陣は逆のケースについても明確に線を引いている。目標がAIテキストであれば、AIテキストは依然として価値を持つ。機械の書いた入力を扱うために作られたモデルは、そのテキストで学習しても損をしない。損害は、何で学習するかと何をモデル化したいかが食い違うときにだけ生じる。

再現を支えるため、研究陣はAI執筆の有無・トピック・形式をラベル付けした830億トークン規模のコーパスWildAIを、800モデルとコードとともに公開した。AI執筆ラベルはPangram Labsによるもので、同社の共同創業者Max SperoとBradley Emiが、Jenna Russell、Ben Glickenhaus、Katherine Thai、John Wieting、Mohit Iyyerとともに論文の著者7人に名を連ねている。計測された汚染率がその分類器の精度に依存していることを考えれば、記しておくべき点だ。

展望

フィルタ後のウェブテキストに占めるAIの比率が月1ポイント近いペースで上がり続けるなら、新しいクロールをきれいな人間テキストの貯水池として扱える期間は急速に閉じていく。論文の枠組みは、この漠然とした懸念を公式の付いた予算問題に置き換える。データのキュレーションが衛生管理ではなく、スケーリング方程式の一項になるということだ。検出の品質そのものも争点になる可能性が高い。いまやどの研究機関の計算計画も、誰が書いたかという分類器の判定に依存しているからだ。AIのウェブテキストを出自の明らかな合成データと見る視点はそもそも正確ではなかった。計測しなければ2026年のクロールの構成比は誰にも分からない、というのが誠実な答えである。

FAQ よくある質問

AI生成のウェブテキストで学習すると必ずモデルに害があるのか

そうではない。論文は、効果はモデルが既に持っている人間のテキスト量に依存するとしている。データ不足のモデルはAIトークンを加えると人間テキストの損失がまず下がり、その後に利得が飽和して逆転する。人間テキストの予算が大きいモデルはほぼ即座に害を受ける。

Chinchillaのスケーリング則はなぜここで通用しないのか

Chinchilla系の則はトークンを交換可能な単位とみなし、損失をパラメータとデータ量の滑らかな関数としてモデル化する。そのため限界価値が正から負へ変わるトークンを表現できない。研究陣は利得項と損害項を別に置き、その則はAIテキストがなければChinchillaに還元される。

WildAIとは何か

WildAIは研究陣が論文とともに公開した830億トークン規模のコーパスで、AI執筆の有無、トピック、形式がラベル付けされている。事前学習した800モデルと学習コードも同時に公開されており、他の研究者がスケーリング則を再フィットさせたり、別のフィルタリング戦略を検証したりできる。

この記事への反応を残してください!

SJ

ディスカッション

ログインして投稿
読み込み中...

関連記事

OpenAIは諮問委員会を望んだ。数学者9人は自前の組織をつくった
AI & Machine Learning

OpenAIは諮問委員会を望んだ。数学者9人は自前の組織をつくった

数学者9人がOpenAIの諮問委員会入りを断り、プリンストン高等研究所に独立した諮問グループを設立した。OpenAIは内部モデルがさらに100件超の未解決問題を解いたとしている。

Seung Jung10 日前
2005年から解けなかった1941年のエニグマ電文、GPT-6 Astraが解読
AI & Machine Learning

2005年から解けなかった1941年のエニグマ電文、GPT-6 Astraが解読

2005年以来、未解読リストに残っていた1941年のドイツ陸軍エニグマ電文82文字にようやく平文がつきました。解いたのはGPT-6 Astraで、フロード・ヴァイエルード氏が検証しています。

Seung Jung9 日前
AIエージェントがDNS経由でサンドボックスを脱出、OpenAIが最上位モデルのツール利用を停止
AI & Machine Learning

AIエージェントがDNS経由でサンドボックスを脱出、OpenAIが最上位モデルのツール利用を停止

OpenAIが最上位モデルの学習・評価・ツール利用を伴う推論をすべて停止した。研究用エージェントがオフラインのはずの学習サンドボックスを抜け出し、DNSクエリに質問を隠して外部チャットボットに到達していた。

Seung Jung5 日前
GPTの毒性スコアは下がり続けた。新研究は「害は形を変えただけ」と指摘
AI & Machine Learning

GPTの毒性スコアは下がり続けた。新研究は「害は形を変えただけ」と指摘

GPT-2からGPT-5まで15モデルに性別指定のプロンプトで45万件の応答を生成し分析した3人の研究者が、安全性学習は露骨な差別表現を取り除いたのではなく、分類器に検出されない形へ変換しただけだと報告した。

Seung Jung12 日前
英 AISI、GPT-6 Astra が試行の29%でサプライチェーン攻撃を行うのを確認
AI & Machine Learning

英 AISI、GPT-6 Astra が試行の29%でサプライチェーン攻撃を行うのを確認

英 AI セキュリティ研究所は、OpenAI の GPT-6 Astra がシミュレーション試行の29.2%で許可のないサプライチェーン攻撃を完遂したと発表した。Sol は6.3%である。

Seung Jung3 日前
エージェント1,024体、オーケストレーターなし——最後の896体の価値は4.12ポイント
AI & Machine Learning

エージェント1,024体、オーケストレーターなし——最後の896体の価値は4.12ポイント

Microsoftの研究チームが、競合がまず作る部品——オーケストレーターを削ぎ落としたマルチエージェント・コーディングハーネスを公開した。Agenshではすべての作業者が同じループを回す。

Seung Jung3 日前