生成式 AI 業者大量抓取公開網頁訓練模型,卻可能減少使用者直接造訪,衝擊依賴廣告、訂閱與導流的內容網站。由於 Googlebot 等「混合用途」爬蟲同時服務搜尋索引與 AI 訓練,網站過去若封鎖訓練用途,也可能犧牲搜尋排名與曝光,迫使出版商在內容控制和流量之間取捨。
Cloudflare 於 2026 年 9 月 15 日上線「Disallow AI Training」。啟用後,Apple、Google、Microsoft 爬蟲可供搜尋索引,但須拒絕訓練;訓練爬蟲遭封鎖。廣告網站預設允許搜尋、拒絕訓練,並封鎖廣告頁面 AI 代理。公司稱,17% 網站限制訓練,封鎖搜尋者不到 1%。
全部報導
2 篇原始報導馬克翻舊帳
這個事件的歷史脈絡Cloudflare推出WebMCP預覽 讓AI代理直接存取網站功能
WebMCP 是讓網站在瀏覽器內向 AI 代理公開結構化工具的新興標準,Chrome 146 已提供實驗性支援。相較解析頁面、模擬點擊或爬取內容,代理可直接呼叫搜尋、表單與交易等功能,提高任務可靠性,也讓網站保留流量、介面及使用者工作階段的控制權。
Cloudflare 於 2026 年 8 月 6 日推出 WebMCP 開發者預覽。網域管理者可在 Cloudflare Dashboard 一鍵啟用,由邊緣端透過 HTMLRewriter 注入橋接程式,無須修改來源站。預覽首波提供 2 組預設開啟的工具包:Content Credentials 與 Site MCP Server,均在訪客瀏覽器內執行。
Cloudflare 推出 AI 代理程式動態沙箱
Cloudflare Workers 是在全球邊緣網路執行 JavaScript 等程式碼的無伺服器平台。隨著 AI 代理程式能自行產生並呼叫程式碼,預先部署模式更難兼顧即時性與權限隔離;Dynamic Worker Loader 可將不受信任的 AI 輸出置於獨立 V8 環境,降低波及主應用與外部系統的風險。
截至 2026 年 8 月 4 日,Cloudflare 已向 Workers 付費方案用戶開放 Dynamic Worker Loader,開發者可在執行期間載入新 Worker,並以毫秒等級啟動的 V8 隔離執行 AI 即時生成程式碼。平台可封鎖外部網路、攔截請求及注入綁定,並已整合 Code Mode;Cloudflare 未公布額外收費金額。
Cloudflare 推出全新 /crawl API 助力 AI 與 RAG 資料爬取
Cloudflare 長期協助網站阻擋惡意爬蟲,如今進一步提供合規的內容擷取工具。2025 年 7 月推出的 /crawl API,可簡化 AI 訓練資料集與 RAG 知識庫建置,減少開發者自行處理網頁導覽、內容清理及格式轉換的成本。
最新推出的 /crawl API 目前處於 Open Beta,開發者僅需 1 次 API 呼叫即可爬取整個網站,並將頁面轉為 Markdown;也能透過 Workers AI 依指定結構輸出 JSON。服務另支援增量更新,讓 RAG 管道只擷取新增或變更內容,提高資料更新效率。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。