網路上三家最大的爬蟲業者,接受了一家網路服務商所訂下的條件。Cloudflare 於 9 月 15 日宣布,Apple、Google 與微軟已符合,或已承諾符合期限,達到該公司稱為「可問責(Accountable)」的認定標準;同時推出一項設定,讓網站可以拒絕 AI 訓練卻不必退出搜尋。
重點摘要
- 使用 Cloudflare 的網站有 17% 已封鎖 AI 訓練,封鎖搜尋的卻不到 1%,這道落差正是混合用途爬蟲讓業者無從下手的地方。
- 要取得「可問責」認定,必須提供訓練與摘要各自的退出機制、可查到哪些網址被使用的網址層級報告,並保證拒絕訓練不會影響搜尋排名。
- 微軟的 robots.txt 支援排定在 2027 年初,在那之前這項新設定對 Bing 不具任何意義。
混合用途爬蟲造成的兩難
混合用途爬蟲抓取一次頁面,卻用於兩種目的:建立搜尋索引,以及訓練模型。出版業者沒有辦法把兩者分開。為了保護內容不被拿去訓練而擋下爬蟲,頁面也會一併從搜尋結果消失,對靠廣告或訂閱維生的事業來說,那才是代價高昂的那一半。
數字顯示這項偏好有多一面倒。幾乎沒有人願意放棄搜尋,卻約有六分之一的網站試圖找出阻擋訓練的辦法。Cloudflare 新推出的「Disallow AI Training」選項,透過 Bot Preference Sync 把禁止訓練的指令寫入 robots.txt,同時讓 Applebot、Bingbot 與 Googlebot 照常建立索引。
為何單靠一個檔案解決不了
公布指令與指令被遵守是兩回事。robots.txt 無法辨識是誰在抓取頁面,判斷不了用途,也擋不住無視它的爬蟲。位於源站之前的 Cloudflare 三件事都做得到,還會把各家業者實際的行為公布在自家 Radar 服務上,這正是這套認定所倚賴的強制力。
純訓練用的爬蟲從來不是難題。Amazon、Anthropic、Meta 與 OpenAI 都替搜尋與訓練分開部署機器人,因此只擋訓練用的那一支,不會損及曝光。這些業者同樣被列為「可問責」。
各家業者目前的進度
Google 遵守針對 Google-Extended 的 Disallow 指令,在網站管理員入口提供生成式結果的開關,並表示網址層級的透明度工具幾週內就會上線。Apple 遵循 Applebot-Extended,摘要方面會讀取 nosnippet,但目前還沒有檢視工具,只向 Cloudflare 展示了預計明年推出的開發中版本。兩家公司都表明,拒絕訓練不會影響搜尋排名。
缺口在微軟。Bing 目前接受的是 NOARCHIVE meta 標籤,而以 robots.txt 處理拒絕訓練偏好的功能,目標落在 2027 年初。想在那之前退出 Bing 訓練的網站經營者,被指引改用 NOARCHIVE 或內容移除工具。
下一個爭點是摘要,不是訓練
Cloudflare 刻意把兩個問題分開。訓練問的是內容能否拿去打造模型;摘要決定的則是還有沒有人會造訪網站。該公司自己的數據讓這股張力變得具體:超過半數消費者會閱讀搜尋摘要,而這些讀者事後停止繼續搜尋的機率高出 40% 以上;但真正從 AI 搜尋走進來的訪客,轉換率是一般搜尋流量的三到五倍。
面對這種取捨,整站一律開或關太過粗糙。因此明年初的目標,是讓網站能控制摘要可以取用多少內容,在網路層一次設定,而不必逐家業者調整,並透過逐漸成形的 ai-prefs 標準來表達。
對主張網路應該圍繞代理流量而非人類流量重新打造的 Cloudflare 來說,親手寫下一套讓 Apple、Google 與微軟簽字的規則,才是更持久的勝利。��關控制項今日起在所有方案中開放使用。
常見問題
拒絕 AI 訓練會讓我的網站從 Google 搜尋消失嗎?
不會。Googlebot 與 Applebot 這類「可問責」的混合用途爬蟲,在新設定下仍會為了搜尋而持續抓取,Google 與 Apple 也都聲明退出訓練不影響搜尋排名。但若改選「Block」,這些爬蟲會被完全擋下,搜尋也包含在內。
Disallow AI Training 會擋下哪些爬蟲?
除了「可問責」的混合用途爬蟲之外的所有訓練爬蟲,包括 Amazon、Anthropic、Meta 與 OpenAI 所運作的純訓練機器人。擋下這些不會帶來搜尋上的損失,因為四家公司都另有負責建立索引的爬蟲。
免費方案也能使用嗎?
可以。Cloudflare 表示這些控制項開放給所有方案的所有客戶,於安全性設定中逐一網域設定。9 月 15 日之後導入的網域,還會依照網站是否投放廣告,取得不同的預設組態建議。






