網站防爬蟲實戰指南:從 robots.txt 到 Cloudflare Bot 管理,2026 最新防護策略

你的網站流量超過一半是機器人,而高達 72% 的 AI 爬蟲不遵守 robots.txt。這篇實戰指南教你從免費的 Cloudflare Bot Fight Mode、Turnstile,到進階的 Bot Score 與 JA4 指紋辨識,並破解 2026 年 9 月 AI 爬蟲新規定的「搜尋除名陷阱」。

  • Dennis
  • 6 分鐘閱讀
網站防爬蟲實戰指南:從 robots.txt 到 Cloudflare Bot 管理,2026 最新防護策略

網站防爬蟲的核心結論:先分清「誰」在爬,再決定「怎麼」擋——用 robots.txt 表達意願、用 Cloudflare 免費方案擋掉明顯的機器人、用速率限制保護 API,最後才考慮付費的 Bot 管理。千萬別為了擋 AI 訓練,把 Googlebot 一起封了,那會讓你的網站從搜尋結果消失。

現代網站的流量結構已經徹底反轉:自動化機器人流量早就超過人類流量,而且越來越多的機器人配備 AI,能假裝成真人、自己解驗證碼、模仿人類操作模式。更驚人的是,研究顯示高達 72% 的 AI 爬蟲根本不理會 robots.txt。如果你還在以為「放個 robots.txt 就安全了」,這篇文章會給你完整的實戰答案。

第一線防禦:robots.txt 與它的極限

robots.txt 依然是標準起手式——對 Googlebot 這類守規矩的搜尋引擎機器人有效,雙方能維持互利關係(你給內容、它給流量)。但對 AI 爬蟲(GPTBot、ClaudeBot、PerplexityBot 等)來說,它們的設計目標就是「大量抓取資料餵模型」,很多根本不鳥 robots.txt:

# robots.txt 範例:允許搜尋引擎、封鎖常見 AI 爬蟲
User-agent: Googlebot
Allow: /

User-agent: Bingbot
Allow: /

# AI 爬蟲
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: *
Disallow: /admin/

重點:robots.txt 是「君子協定」,攔得住守規矩的,攔不住惡意的。對不守規矩的爬蟲,需要在伺服器/CDN 層面強制執行。

免費方案:Cloudflare 就能做很多事

對多數小型網站與部落格,Cloudflare 免費版其實已經能擋掉大部分垃圾流量:

免費功能作用建議設定
Bot Fight Mode偵測常見自動化模式,對濫用流量丟運算挑戰(計算難題)免費版直接開啟,低風險資訊站適用
Turnstile輕量、注重隱私的人機驗證(不像 reCAPTCHA 要你認紅綠燈)掛在登入、表單、API 入口
速率限制(Rate Limiting)限制單一 IP/ASN 的請求頻率API 與登入頁必設
WAF 規則用路徑、header、來源國等條件攔截阻擋已知惡意來源

免費版開啟方式很簡單:Cloudflare Dashboard → Security → Bots → 打開 Bot Fight Mode。它會對疑似機器人的流量施加運算挑戰,真人幾乎無感,但對大量抓取的爬蟲很痛。

⚠️ 小提醒:Bot Fight Mode 是「無差別」挑戰,偶爾會誤傷一些合法的自動化工具(比如監控服務、預覽機器人)。如果你的網站靠 API 供第三方整合,請改用更精準的規則。

進階防禦:付費的 Bot Management 強在哪?

如果免費版不夠,Cloudflare Pro/Business 以上的 Super Bot Fight Mode(SBFM) 與企業版 Bot Management 提供更細的控制:

功能免費版Pro/BusinessEnterprise
Bot Fight Mode
Super Bot Fight Mode(可調敏感度、JS 偵測)
驗證過的合法機器人白名單(搜尋引擎等)部分
Bot Score(1-99 分)
JA4 TLS 指紋辨識
自訂規則(WAF + Workers 組合)有限

兩個殺手級功能值得認識:

  1. Bot Score:對每個請求給 1-99 分,低於 30 分通常就是機器人。你可以寫規則「登入頁對低分請求直接 Challenge,公開部落格放行」——不必對所有機器人一刀切。
  2. JA4 指紋辨識:看 TLS 握手特徵而非 User-Agent。IP 和 User-Agent 可以隨便改,但 TLS 指紋反映用戶端真實的協定實作,幾乎無法偽裝。2026 年 2 月一篇 arXiv 論文用 JA4 特徵訓練機器學習分類器,偵測壞機器人的準確率高達 98.6%(AUC 0.998),證明這是目前最強的反爬蟲訊號。

🚨 2026 年 9 月 15 日:Cloudflare 新預設的「搜尋除名陷阱」

這是最新、也最容易被忽略的變化。Cloudflare 將從 2026 年 9 月 15 日 起,把 AI 流量分三類處理:

類別新預設值
Training(AI 訓練)有廣告的頁面:預設封鎖
Agent(AI 代理)有廣告的頁面:預設封鎖
Search(搜尋)預設允許

邏輯很直白:頁面有廣告 = 需要真人眼球 = AI 訓練與 Agent 流量會取代這些注意力,所以封鎖;搜尋流量仍會把人帶進網站,所以放行。

陷阱在這裡:Googlebot、Applebot、BingBot 是「搜尋 + 訓練」的多用途爬蟲,而 Cloudflare 的規則是最嚴格的適用規則勝出——如果你用舊的「Block AI bots」設定,或在新介面選擇封鎖 Training,Googlebot 也會一起被封,你的網站會從 Google、Bing、Apple 搜尋結果中悄悄消失!

行動清單:9/15 前打開 Cloudflare Security 設定,明確選擇你對 Search / Agent / Training 三類流量的偏好,特別是決定要不要讓多用途搜尋爬蟲通過。什麼都不做,也是一種決定——而且可能是錯誤的決定。

新標準:ai.txt、llms.txt 與「用途授權」

2026 年,網站管理已經從「流量控制」升級成「資料權利管理」。除了 robots.txt,現在有更細緻的機器可讀標準:

檔案作用對象
robots.txt誰可以爬(User-agent 層級)所有爬蟲
llms.txt提供低雜訊的內容摘要,方便 LLM 正確引用你ChatGPT、Claude、Gemini 等
ai.txt用標籤宣告「用途」:No-Training(禁止訓練)、No-Inference(禁止即時回答)、Allow-RAG(允許引用你的 RAG)AI 服務
TDMRepW3C 標準,把用途授權寫進 HTTP header,歐盟有法律效力歐盟 AI 法案合規
# ai.txt 範例:允許引用、禁止訓練
User-agent: *
No-Training: true
No-Inference: false
Allow-RAG: true

法律面:歐盟 AI 法案第 53 條要求通用 AI 供應商遵守網站的機器可讀信號。也就是說,如果你設定了 No-Training,AI 公司必須遵守,否則違反歐盟法——不管你的資料是否公開。對想保護內容不被訓練、但希望被 AI 正確引用的網站,這套「用途授權」是 2026 年的最佳解。

小型網站(Hugo 靜態站)務實防護清單

如果你是部落客或小站長,別急著上企業方案。照這個順序做,90% 的收益來自前兩步:

flowchart TD
    A[開始] --> B{有用 Cloudflare 嗎?}
    B -->|否| C[申請免費版<br/>DNS 指向 Cloudflare]
    B -->|是| D[開啟 Bot Fight Mode<br/>+ 防火牆規則]
    C --> D
    D --> E{有 API 或登入頁嗎?}
    E -->|是| F[設速率限制<br/>+ Turnstile 驗證]
    E -->|否| G[設定 robots.txt<br/>+ ai.txt 用途授權]
    F --> G
    G --> H{流量被爬蟲塞爆?}
    H -->|是| I[升級 Super Bot Fight Mode<br/>或 Bot Management]
    H -->|否| J[每月檢查 Analytics<br/>觀察機器人比例]
    I --> J
  1. 申請 Cloudflare 免費版,把 DNS 指過去(順便拿免費 CDN + HTTPS)
  2. 開啟 Bot Fight Mode,幾分鐘搞定
  3. robots.txt 封鎖已知 AI 爬蟲(範例在上方),放上 ai.txt 宣告用途
  4. 有 API 就設速率限制 + Turnstile,保護登入與表單
  5. 9/15 前檢查 AI 流量設定,別誤封 Googlebot
  6. 用 Cloudflare Analytics 觀察機器人比例,真的有問題再考慮付費方案

結論

防爬蟲沒有銀彈:robots.txt 是禮貌、速率限制是紀律、Bot Score/JA4 是科技、用途授權是法律。2026 年的重點是——AI 爬蟲已經不是「要不要擋」的問題,而是「怎麼擋才不會誤傷搜尋流量與合法工具」。先從免費方案開始,邊觀察邊調整,才是務實的做法。

延伸閱讀:

參考來源:

📬 訂閱 most.tw 電子報

每週精選 AI 工具教學與技術乾貨,直接送到你的信箱。免費、隨時可退訂。