Cloudflare 長期協助網站阻擋惡意爬蟲,如今進一步提供合規的內容擷取工具。2025 年 7 月推出的 /crawl API,可簡化 AI 訓練資料集與 RAG 知識庫建置,減少開發者自行處理網頁導覽、內容清理及格式轉換的成本。
最新推出的 /crawl API 目前處於 Open Beta,開發者僅需 1 次 API 呼叫即可爬取整個網站,並將頁面轉為 Markdown;也能透過 Workers AI 依指定結構輸出 JSON。服務另支援增量更新,讓 RAG 管道只擷取新增或變更內容,提高資料更新效率。
全部報導
1 篇原始報導馬克翻舊帳
這個事件的歷史脈絡在這之後
Cloudflare推新功能 網站可封鎖AI訓練且保留搜尋曝光
生成式 AI 業者大量抓取公開網頁訓練模型,卻可能減少使用者直接造訪,衝擊依賴廣告、訂閱與導流的內容網站。由於 Googlebot 等「混合用途」爬蟲同時服務搜尋索引與 AI 訓練,網站過去若封鎖訓練用途,也可能犧牲搜尋排名與曝光,迫使出版商在內容控制和流量之間取捨。
Cloudflare 於 2026 年 9 月 15 日上線「Disallow AI Training」。啟用後,Apple、Google、Microsoft 爬蟲可供搜尋索引,但須拒絕訓練;訓練爬蟲遭封鎖。廣告網站預設允許搜尋、拒絕訓練,並封鎖廣告頁面 AI 代理。公司稱,17% 網站限制訓練,封鎖搜尋者不到 1%。
訂閱馬克雷達週報
每週五,本週最強訊號送進收件匣。隨時一鍵退訂。