網站防爬蟲的核心結論:先分清「誰」在爬,再決定「怎麼」擋——用 robots.txt 表達意願、用 Cloudflare 免費方案擋掉明顯的機器人、用速率限制保護 API,最後才考慮付費的 Bot 管理。千萬別為了擋 AI 訓練,把 Googlebot 一起封了,那會讓你的網站從搜尋結果消失。
現代網站的流量結構已經徹底反轉:自動化機器人流量早就超過人類流量,而且越來越多的機器人配備 AI,能假裝成真人、自己解驗證碼、模仿人類操作模式。更驚人的是,研究顯示高達 72% 的 AI 爬蟲根本不理會 robots.txt。如果你還在以為「放個 robots.txt 就安全了」,這篇文章會給你完整的實戰答案。
第一線防禦:robots.txt 與它的極限
robots.txt 依然是標準起手式——對 Googlebot 這類守規矩的搜尋引擎機器人有效,雙方能維持互利關係(你給內容、它給流量)。但對 AI 爬蟲(GPTBot、ClaudeBot、PerplexityBot 等)來說,它們的設計目標就是「大量抓取資料餵模型」,很多根本不鳥 robots.txt:
# robots.txt 範例:允許搜尋引擎、封鎖常見 AI 爬蟲
User-agent: Googlebot
Allow: /
User-agent: Bingbot
Allow: /
# AI 爬蟲
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: *
Disallow: /admin/
重點:robots.txt 是「君子協定」,攔得住守規矩的,攔不住惡意的。對不守規矩的爬蟲,需要在伺服器/CDN 層面強制執行。
免費方案:Cloudflare 就能做很多事
對多數小型網站與部落格,Cloudflare 免費版其實已經能擋掉大部分垃圾流量:
| 免費功能 | 作用 | 建議設定 |
|---|---|---|
| Bot Fight Mode | 偵測常見自動化模式,對濫用流量丟運算挑戰(計算難題) | 免費版直接開啟,低風險資訊站適用 |
| Turnstile | 輕量、注重隱私的人機驗證(不像 reCAPTCHA 要你認紅綠燈) | 掛在登入、表單、API 入口 |
| 速率限制(Rate Limiting) | 限制單一 IP/ASN 的請求頻率 | API 與登入頁必設 |
| WAF 規則 | 用路徑、header、來源國等條件攔截 | 阻擋已知惡意來源 |
免費版開啟方式很簡單:Cloudflare Dashboard → Security → Bots → 打開 Bot Fight Mode。它會對疑似機器人的流量施加運算挑戰,真人幾乎無感,但對大量抓取的爬蟲很痛。
⚠️ 小提醒:Bot Fight Mode 是「無差別」挑戰,偶爾會誤傷一些合法的自動化工具(比如監控服務、預覽機器人)。如果你的網站靠 API 供第三方整合,請改用更精準的規則。
進階防禦:付費的 Bot Management 強在哪?
如果免費版不夠,Cloudflare Pro/Business 以上的 Super Bot Fight Mode(SBFM) 與企業版 Bot Management 提供更細的控制:
| 功能 | 免費版 | Pro/Business | Enterprise |
|---|---|---|---|
| Bot Fight Mode | ✅ | ✅ | ✅ |
| Super Bot Fight Mode(可調敏感度、JS 偵測) | ❌ | ✅ | ✅ |
| 驗證過的合法機器人白名單(搜尋引擎等) | 部分 | ✅ | ✅ |
| Bot Score(1-99 分) | ❌ | ❌ | ✅ |
| JA4 TLS 指紋辨識 | ❌ | ❌ | ✅ |
| 自訂規則(WAF + Workers 組合) | 有限 | ✅ | ✅ |
兩個殺手級功能值得認識:
- Bot Score:對每個請求給 1-99 分,低於 30 分通常就是機器人。你可以寫規則「登入頁對低分請求直接 Challenge,公開部落格放行」——不必對所有機器人一刀切。
- JA4 指紋辨識:看 TLS 握手特徵而非 User-Agent。IP 和 User-Agent 可以隨便改,但 TLS 指紋反映用戶端真實的協定實作,幾乎無法偽裝。2026 年 2 月一篇 arXiv 論文用 JA4 特徵訓練機器學習分類器,偵測壞機器人的準確率高達 98.6%(AUC 0.998),證明這是目前最強的反爬蟲訊號。
🚨 2026 年 9 月 15 日:Cloudflare 新預設的「搜尋除名陷阱」
這是最新、也最容易被忽略的變化。Cloudflare 將從 2026 年 9 月 15 日 起,把 AI 流量分三類處理:
| 類別 | 新預設值 |
|---|---|
| Training(AI 訓練) | 有廣告的頁面:預設封鎖 |
| Agent(AI 代理) | 有廣告的頁面:預設封鎖 |
| Search(搜尋) | 預設允許 |
邏輯很直白:頁面有廣告 = 需要真人眼球 = AI 訓練與 Agent 流量會取代這些注意力,所以封鎖;搜尋流量仍會把人帶進網站,所以放行。
陷阱在這裡:Googlebot、Applebot、BingBot 是「搜尋 + 訓練」的多用途爬蟲,而 Cloudflare 的規則是最嚴格的適用規則勝出——如果你用舊的「Block AI bots」設定,或在新介面選擇封鎖 Training,Googlebot 也會一起被封,你的網站會從 Google、Bing、Apple 搜尋結果中悄悄消失!
✅ 行動清單:9/15 前打開 Cloudflare Security 設定,明確選擇你對 Search / Agent / Training 三類流量的偏好,特別是決定要不要讓多用途搜尋爬蟲通過。什麼都不做,也是一種決定——而且可能是錯誤的決定。
新標準:ai.txt、llms.txt 與「用途授權」
2026 年,網站管理已經從「流量控制」升級成「資料權利管理」。除了 robots.txt,現在有更細緻的機器可讀標準:
| 檔案 | 作用 | 對象 |
|---|---|---|
| robots.txt | 誰可以爬(User-agent 層級) | 所有爬蟲 |
| llms.txt | 提供低雜訊的內容摘要,方便 LLM 正確引用你 | ChatGPT、Claude、Gemini 等 |
| ai.txt | 用標籤宣告「用途」:No-Training(禁止訓練)、No-Inference(禁止即時回答)、Allow-RAG(允許引用你的 RAG) | AI 服務 |
| TDMRep | W3C 標準,把用途授權寫進 HTTP header,歐盟有法律效力 | 歐盟 AI 法案合規 |
# ai.txt 範例:允許引用、禁止訓練
User-agent: *
No-Training: true
No-Inference: false
Allow-RAG: true
法律面:歐盟 AI 法案第 53 條要求通用 AI 供應商遵守網站的機器可讀信號。也就是說,如果你設定了 No-Training,AI 公司必須遵守,否則違反歐盟法——不管你的資料是否公開。對想保護內容不被訓練、但希望被 AI 正確引用的網站,這套「用途授權」是 2026 年的最佳解。
小型網站(Hugo 靜態站)務實防護清單
如果你是部落客或小站長,別急著上企業方案。照這個順序做,90% 的收益來自前兩步:
flowchart TD
A[開始] --> B{有用 Cloudflare 嗎?}
B -->|否| C[申請免費版<br/>DNS 指向 Cloudflare]
B -->|是| D[開啟 Bot Fight Mode<br/>+ 防火牆規則]
C --> D
D --> E{有 API 或登入頁嗎?}
E -->|是| F[設速率限制<br/>+ Turnstile 驗證]
E -->|否| G[設定 robots.txt<br/>+ ai.txt 用途授權]
F --> G
G --> H{流量被爬蟲塞爆?}
H -->|是| I[升級 Super Bot Fight Mode<br/>或 Bot Management]
H -->|否| J[每月檢查 Analytics<br/>觀察機器人比例]
I --> J- 申請 Cloudflare 免費版,把 DNS 指過去(順便拿免費 CDN + HTTPS)
- 開啟 Bot Fight Mode,幾分鐘搞定
- robots.txt 封鎖已知 AI 爬蟲(範例在上方),放上 ai.txt 宣告用途
- 有 API 就設速率限制 + Turnstile,保護登入與表單
- 9/15 前檢查 AI 流量設定,別誤封 Googlebot
- 用 Cloudflare Analytics 觀察機器人比例,真的有問題再考慮付費方案
結論
防爬蟲沒有銀彈:robots.txt 是禮貌、速率限制是紀律、Bot Score/JA4 是科技、用途授權是法律。2026 年的重點是——AI 爬蟲已經不是「要不要擋」的問題,而是「怎麼擋才不會誤傷搜尋流量與合法工具」。先從免費方案開始,邊觀察邊調整,才是務實的做法。
延伸閱讀:
- Python Playwright 爬蟲完整教學:安裝、定位器、等待機制與反偵測實戰(2026)(了解爬蟲怎麼寫,才知道怎麼防)
- 2026 SEO、GEO 與 AEO 完整策略指南(流量防護之外,別忘了內容被 AI 引用的策略)
- K8s 面臨的實際駭客攻擊手法:從真實資安事件看雲原生安全防護
- WordPress 創辦人質疑 Cloudflare EmDash 動機:雲端服務綑綁策略引發開源社群反彈
參考來源:
