封 AI 爬蟲卻把 Googlebot 一起擋掉?Cloudflare 新版 AI 流量控制的三個分類與一個期限
上個月寫過一篇文章,講 Cloudflare 網路上的 HTML 請求有 57.5% 來自機器人、真人只剩 42.5%(那篇在這)。當時的結論偏哲學:網站的讀者已經一半不是人,你要為誰設計。哲學歸哲學,實務上站長手上的工具只有一個很鈍的開關——Cloudflare 儀表板那顆「Block AI Bots」。它針對的主要是拿內容去訓練模型的爬蟲,但只有開和關兩個狀態,你沒得挑要擋哪一種。 7 月 1 日 Cloudflare 把這顆開關拆了。新版的 AI 流量控制把「AI bot」切成三種用途分開管,連免費方案都能用。更重要的是他們同時宣布:9 月 15 日起預設值要變,而且變法會讓「封鎖 AI 訓練」連 Googlebot 一起擋掉。如果你的站在 Cloudflare 後面、又開過 Block AI Bots,這篇讀完建議去檢查一下設定。 一鍵封鎖為什麼不夠用先講舊開關的問題在哪。 去年那顆「Block AI Bots」的假想敵很明確:拿你的內容去訓練模型、然後一滴流量都不回給你的訓練爬蟲。封它天經地義。但一年下來,「AI bot」這個詞涵蓋的東西越來越雜。有人問 ChatGPT...
Sitemap 卡「無法擷取」三個月?修了四輪 XML 都沒用,最後把它搬到 Cloudflare Worker 才過關
今天打開 Search Console,看到這一行: 1/sitemap.xml 2026年6月8日 2026年6月11日 成功 612 狀態「成功」,系統探索到的網頁 612。我盯著它看了幾秒,因為文章也累積到一些數量了,想著要讓Google搜尋能搜尋到,結果到現在,這一欄一直是紅色的「無法擷取」。整整三個月,Google 連我的 sitemap 都不願意讀,全站文章只有首頁被索引。 最後解決問題的那一步,跟 sitemap 的內容一點關係都沒有。這篇把整個排查過程寫下來,包含三次「修對了東西但沒解決問題」的彎路——如果你的 GitHub Pages 部落格也卡在這個狀態,也許可以少走幾步。 問題長什麼樣我的部落格是 Hexo 生成、部署在 GitHub Pages(kyosora.github.io)。三月中建站時把 sitemap.xml 提交到 Search Console,狀態顯示「無法擷取」(Couldn't fetch)。 當時想說剛建站,Google 需要時間。結果這個狀態凍結了快三個月,期間「已送出」日期一直停在 3 月 17 日,系統...






