Cloudflare 將搜尋發現與 AI 訓練控制分離

紙雕全球網際網路交換節點將搜尋發現流量與受保護的訓練資料路徑分開

Cloudflare 於 2026 年 9 月 15 日宣布進一步細分 AI 流量管理,將搜尋、訓練與使用者指令型代理視為不同的策略維度。新的「禁止 AI 訓練」選項,目的在於允許混合用途爬蟲繼續執行傳統搜尋索引,同時傳達網站內容不得用於模型訓練的偏好。

對獲授權的網頁採集、市場研究、廣告驗證與代理營運團隊而言,這不是繞過限制的新方法,而是要求讓任務用途可識別、可稽核。住宅代理或輪換代理只改變網路出口,不能把訓練任務變成搜尋任務,也不會自動產生權限或覆蓋發布者的明確選擇。

9 月 15 日有哪些實際變化

Cloudflare 現在將自動化流量分成三個主要行為:

  • 搜尋:建立索引,並可能把發現流量帶回發布者頁面;
  • 訓練:為模型訓練或微調收集材料;
  • 代理:依照具體使用者指令即時存取頁面。

Cloudflare 表示,通用「阻止」設定現在會套用到同時承擔搜尋功能的混合用途爬蟲,因此可能影響搜尋能見度。若發布者希望保留搜尋抓取但拒絕訓練使用,應選擇更精確的「禁止 AI 訓練」。

該公司也提出「Accountable」責任標識,用來辨識提供或承諾提供發布者控制、透明報告,以及搜尋與訓練影響分離機制的營運方。Cloudflare 將 Apple、Google 與 Microsoft 列為符合此框架的混合用途爬蟲營運方,但各家的實作細節與時程並不完全相同。

代理團隊為何需要調整

只依網域、User-Agent 或出口 IP 分類採集任務已經不夠。同一個爬蟲身分可能承擔多種用途,同一個 URL 也可能允許搜尋發現、拒絕訓練並限制即時代理存取。

請求進入代理池之前,應附加清楚的內部用途標籤,例如搜尋量測、授權研究、廣告驗證、使用者指令存取或模型訓練。不同用途應使用獨立佇列並分別記錄。若一項任務同時存在多個用途,在確認合規路徑前,應採用最嚴格的適用規則。

可搭配代理與目標端限流診斷,判斷失敗來自網路路線,或是目標網站有意執行的策略。

同時稽核 robots 與實際執行

robots 檔案表達偏好,邊緣規則負責實際執行。兩者應作為相關證據共同保存,而不能互相取代。稽核記錄至少應包含:

  1. 對目前 User-Agent 回傳的 robots 規則;
  2. 頁面層級指令與發布者條款;
  3. 邊緣回應、挑戰頁或阻止結果;
  4. 任務聲明的真實用途;
  5. 使用直連、資料中心代理或住宅代理;
  6. 觀察時間、區域與策略版本。

訓練請求遭拒後,不應更換住宅 IP 重試。那只改變來源位址,可能把清楚的拒絕變成規避行為。正確做法是暫停任務、保存證據,並取得授權或改用發布者支援的資料路徑。

讓搜尋量測可重現

搜尋可用性量測應使用獨立實驗組,不與訓練或大量採集任務共用 Cookie、工作階段識別碼或重試佇列。User-Agent、請求標頭、地點與時序要維持足夠穩定,才能比較結果。平台控制發生變化後,先執行少量合成測試,再恢復正式流量。

對 IPv4 與 IPv6 混合路線,可參考全球 IPv6 就緒工作流程,避免將位址族切換誤判為策略變化。

營運檢查清單

  • 每個自動化任務都有唯一且記錄完整的主要用途;
  • 混合用途任務採用最嚴格的適用規則;
  • 搜尋、訓練與代理流量使用獨立佇列和憑證;
  • robots、頁面中繼資料與邊緣回應共同歸檔;
  • 代理輪換不會重試明確的策略拒絕;
  • 必須經過代理時已停用直連回退;
  • 速率、並行數與重試預算保持保守;
  • 策略測試只使用授權目標與合成資料;
  • Global、北美、歐洲與 APAC 結果分開報告;
  • 策略變化在恢復正式流量前完成複核。

常見問題

「禁止 AI 訓練」會阻止搜尋抓取嗎?

Cloudflare 將其定位為保留搜尋發現、同時表達禁止訓練偏好的選項。獨立的「阻止」選項可能完全停止混合用途爬蟲,並影響搜尋能見度。

住宅代理能讓訓練爬蟲變成搜尋爬蟲嗎?

不能。網路來源與任務用途是兩回事,代理不會改變意圖、身分義務或授權狀態。

請求遭阻止後是否應更換 IP 重試?

不應。明確拒絕應立即停止任務,先檢查設定與授權,再使用發布者支援的方式存取。

更新後應該量測哪些指標?

依用途、User-Agent、區域、位址族與策略版本統計允許、拒絕、挑戰及模糊結果,關注合規且有效的結果,而不是原始請求量。

合規說明

只對獲授權的服務與資料執行爬蟲和代理測試。遵守 robots 控制、合約條款、速率限制、隱私義務與地區法律。不得透過輪換位址、修改請求標頭或瀏覽器自動化規避明確限制。

內部來源記錄:Cloudflare《Have it both ways: stay discoverable in search while disallowing AI training》,2026 年 9 月 15 日。