第一網第一網
第一網編輯部

Cloudflare 設定 AI 機器人存取權限教學與企業內容保護策略

Cloudflare 設定 AI 機器人存取權限教學與企業內容保護策略

現在您可以直接在 Cloudflare 的「安全性」設定中,一鍵阻斷所有已知的 AI 爬蟲(如 GPTBot、ClaudeBot)或針對特定模型進行差異化授權。對於擔心原創內容被無償抓取作為訓練資料、或想節省非必要頻寬成本的企業,建議立即開啟「AI 機器人阻斷」功能,後續再依據是否需要 AI 搜尋引擎帶入流量來微調 WAF 規則。

進入 Cloudflare 後台一鍵關閉 AI 爬蟲存取權

要限制 AI 機器人抓取網站內容,最快的方法是使用 Cloudflare 內建的「AI 機器人阻斷(AI Scrapers and Crawlers)」開關。這項功能會自動識別並封鎖那些已被證實專門用於訓練大型語言模型(LLM)的爬蟲,而不會影響一般的 Google 或 Bing 搜尋引擎索引。

  • 操作步驟:登入 Cloudflare 控制台 > 選擇您的網域 > 點選左側選單「安全性(Security)」 > 「機器人(Bots)」 > 將「AI 機器人阻斷」切換為「開啟」。
  • 生效範圍:此功能主要攔截 OpenAI、Anthropic、Common Crawl 等機構的爬蟲。這些爬蟲通常會在 User-Agent 中標明身份,Cloudflare 會根據其行為特徵與來源 IP 進行精準封鎖。
  • 與 Robots.txt 的差異:傳統的 robots.txt 只是「請求」爬蟲不要抓取,不具備強制性;Cloudflare 的阻斷是在邊緣設備(Edge)直接切斷連線,爬蟲根本無法接觸到您的伺服器,能實質節省主機資源。

區分搜尋型與訓練型 AI 以決定不同的開放權限

並非所有 AI 爬蟲對網站都有害。目前的 AI 工具分為「純訓練型」與「搜尋引用型」,兩者對網站流量的貢獻截然不同。企業主應根據下表準則,評估是否要全面封鎖或是採取部分開放策略:

爬蟲類型代表性機器人對企業的價值建議處置方式
純訓練型GPTBot, CCBot, Claude-Web無。僅將您的內容拿去訓練,不會導流回網站。直接阻斷。避免內容產權被無償占用。
搜尋引用型SearchGPT, PerplexityBot, Bingbot高。AI 在回答問題時會附上您的網站連結,帶來點擊。保持開啟。確保品牌在 AI 搜尋結果中出現。
一般索引型Googlebot, YandexBot極高。維持傳統搜尋引擎排名(SEO)的基礎。絕對禁止封鎖。否則網站會從搜尋結果消失。

如果您的網站擁有大量獨家研究報告、付費內容或具備高智慧財產價值的文字,建議採取「預設全阻斷」策略,再針對特定的搜尋型 AI 手動放行。

使用 WAF 規則針對特定 AI 供應商進行差異化控管

若「一鍵阻斷」功能過於粗糙,無法滿足「想擋 OpenAI 但想留給 Perplexity」的需求,則應透過 Cloudflare 的 WAF(網頁應用程式防火牆)自定義規則進行精確控管。這需要使用 Cloudflare 提供的機器人標籤(Bot Tags)來撰寫邏輯。

具體設定方法:進入「安全性」 > 「WAF」 > 「建立規則」。在表達式中,您可以使用 cf.client.bot 來判斷是否為機器人,並結合 cf.bot_tag 來篩選特定對象。例如,如果您想攔截 GPTBot 但允許其他所有 AI 爬蟲,規則邏輯應設定為:(http.user_agent contains "GPTBot") 然後動作選擇「阻斷(Block)」。

進階過濾建議:針對那些不遵守標準 User-Agent 宣告的惡意爬蟲,建議開啟「機器人分數(Bot Score)」過濾。將分數低於 30 的請求(通常是自動化程式)導向託管挑戰(Managed Challenge),這能有效過濾掉偽裝成一般瀏覽器的採集程式,而不影響真實用戶訪問。

評估阻斷 AI 爬蟲對網站流量與伺服器負載的實質代價

決定是否阻斷 AI 爬蟲前,必須衡量「流量流失」與「成本節省」之間的取捨。這不是一個單純的技術問題,而是商務決策。以下是兩個關鍵判斷指標:

  • 頻寬與伺服器成本:如果您的網站圖片極多或內容龐大,AI 爬蟲頻繁的「全站掃描」會造成顯著的頻寬費用。查看 Cloudflare 的「分析」面板,若發現「未驗證的機器人」流量占比超過 30%,阻斷 AI 爬蟲能立即降低 10%-20% 的伺服器負載。
  • AI 引用流量(AI Referral):觀察您的 Google Analytics 或網站日誌。若來自 openai.com 或 perplexity.ai 的參照網址流量(Referral Traffic)正在成長,代表您的內容在 AI 搜尋中具有競爭力。此時若全面阻斷,等於放棄了新一代的流量入口。

對於大多數台灣中小企業而言,若非經營內容媒體或數據庫,AI 爬蟲帶來的負擔通常大於收益。最務實的做法是先開啟阻斷,觀察一週後的流量變化,若發現業務詢問量(Leads)下降,再考慮針對特定的搜尋型機器人放寬限制。

請立即檢查 Cloudflare 的「安全性事件」紀錄,確認過去 24 小時內有哪些 AI 爬蟲頻繁存取您的 API 或高價值頁面。若發現單一 IP 來源在短時間內產生數千次請求,這通常是競爭對手或數據商在抓取您的價格表或客戶案例,此時應優先啟動 WAF 速率限制(Rate Limiting)規則,而非僅僅依賴 AI 阻斷開關。

Cloudflare 設定 AI 機器人存取權限教學與企業內容保護策略 | 第一網