要不要封鎖 AI 爬蟲,往往被當成技術題來問,但它其實不是。封鎖本身只是幾行設定,在 robots.txt 裡補幾條規則,或在網路層打開一條規則,十分鐘就結束了。真正難的地方在於決定你到底想不想這麼做,而這個決定完全屬於生意層面:你是在兩件事之間取捨,一邊是保護內容不被拿去訓練模型,另一邊是讓自己繼續出現在人們現在用來取代搜尋結果清單的那些答案裡。
網路上多數建議都是先選邊,然後只替自己那一邊辯護。誠實的講法是另一種:正確答案會隨商業模式而不同。一家靠頁面瀏覽量維生的媒體,跟一家靠詢價維生的服務公司,本來就應該得出完全相反的結論。如果兩者答案一樣,那才代表有人算錯了。
這筆交易一句話就講得完: 封鎖 AI 爬蟲可以擋下內容被吸收,但同時也擋下了你被引用的機會。如果你的營收取決於有人真的走進你的頁面,封鎖就是在保護你。如果你的營收取決於別人先知道你存在、再主動聯絡你,封鎖等於把你從這種認識越來越常發生的那個介面上抹掉。
Cloudflare 究竟改了什麼
預設值翻轉了。2025 年 7 月 1 日,Cloudflare 成為第一家預設封鎖 AI 爬蟲的大型基礎設施業者 ,從「不同意要自己出聲」的模式,改成「同意了才放行」的模式。新加入的網域在設定當下就會被問到,是否允許 AI 爬蟲抓取內容。對 AI 公司而言,過去沒有被拒絕就形同默許,現在則必須取得明確的許可。
這件事的影響遠遠超過 Cloudflare 自家客戶,因為相當大一部分的網路流量都會經過這張網。預設值不是法律,但在那種規模上生效的預設值,會重新畫出 AI 公司可以視為理所當然的界線。許多產業慣例的轉向,不是從規則開始,而是從預設設定開始。
搭配的工具叫做 AI Crawl Control ,所有方案都能使用,包括免費方案。它會列出哪些 AI 服務正在接觸你的內容,讓你逐一針對每個爬蟲設定放行或封鎖規則,也能看出某個爬蟲究竟有沒有遵守 robots.txt。最有價值的部分,是在你做任何決定之前先把這些流量看清楚,而絕大多數站長從來沒打開過這個畫面。爭論跑在前面,卻沒有人先確認到底是誰來、來了幾次。
Cloudflare 也推動爬蟲申報用途。因此你可以把正在訓練模型的機器人、為了即時回答而抓取頁面的機器人,以及為搜尋建立索引的機器人分開看待。這是三筆性質完全不同的交易:訓練可能只帶走而不回饋,即時回答有機會把你的名字放到讀者眼前,搜尋索引則可能真的送來一次造訪。而直到不久之前,這三者抵達時完全無法分辨,面對分辨不出的對象,連談條件的空間都沒有。
收費模式在 2026 年 7 月又變了一次
去年寫下的建議,正是在這一段變成錯的。
Pay Per Crawl 在 2025 年推出,是一個讓出版方按每次抓取向 AI 公司收費的市場。2026 年 7 月 1 日,Cloudflare 宣布這個模式不夠用,改採 Pay Per Use :付費的觸發點不再是機器人下載了一個頁面,而是你的內容在一則答案裡創造了價值。
看到那個數字,道理立刻就通了:AI 爬蟲流量中有超過 50% 是在重複抓取根本沒有變動的頁面。按抓取次數收費,大半是在替浪費開帳單。而在內容出現於答案時才收費,收的正是那件真正取代掉一次網站造訪的事情。付費的對象,終於和損失的形狀對得上。
現在仍屬早期。首批合作對象是 Ceramic.ai 與 You.com,對一家英國小公司而言,這還稱不上是一條寬闊的收入來源。把它當成市場前進的方向,而不是明年預算裡的一行數字,會比較實際。
另外還有一個值得寫進行事曆的期限。自 2026 年 9 月 15 日起,在帶有廣告的頁面上,用途混合的爬蟲將被預設封鎖,除非網站擁有者自行更動設定。如果你正在投放廣告,同時又倚賴 AI 帶來的推薦流量,那麼你什麼都不做,這條預設值也會落到你身上。
封鎖真正的代價
三件事,而且只有第一件顯而易見。
你會失去引用。 AI 的答案會點名列出來源。成為其中一個名字,等同於今天的搜尋首頁曝光,而被封鎖的爬蟲無法引用它沒有權限閱讀的東西。如果你已經決定要爭取能見度,那麼什麼才換得到一次引用,我們在生成式引擎最佳化指南 裡談過。
你會失去衡量的能力。 被封鎖的流量不會在報表裡呈現為損失,而是呈現為「什麼都沒有」,這和從來沒有過完全分不出來。很早就封鎖的網站往往說不出自己付出了多少代價,因為用來對照的那個反事實從未被記錄下來。量不出來的東西,事後連要不要改回去都無從判斷。
而且你其實沒有真的擋住訓練。 封鎖那些會自報身分、會尊重 robots.txt 的守規矩爬蟲,擋到的剛好就是願意守規矩的那一群。已經被吸收的內容仍然留在那裡,而無視 robots.txt 的抓取工具本來就不在射程之內。你調整的只是有禮貌的那一小部分的行為。
反過來說,如果一門生意的產品就是內容本身,封鎖確實是實實在在的保護。訂閱制媒體、靠賣研究報告維生的機構、圖庫都屬於這一類。對它們而言,一則概括內容的 AI 答案是銷售的直接替代品,而掛上一個來源名字,作為補償實在太輕。
怎麼決定要不要封鎖 AI 爬蟲
先問自己:一位訪客值多少錢,而他又是沿著哪一條路徑變成客戶的。
如果內容就是產品,那就封鎖。 付費牆後的報導、單篇販售的研究、你對外授權的參考資料都屬於此類。AI 答案直接和你的成交競爭。
如果內容是為別的東西做行銷,那就放行。 軟體服務公司、顧問公司、律師事務所、診所都是如此。你寫文章,是為了讓買家意識到你能解決他們的問題。在一則答案裡被點名,正是你原本就要花錢買的那份認知,而詢價依然得落到你手上。
如果你處在中間地帶,那就有選擇地放行。 逐一針對爬蟲設定規則,可以接受搜尋索引、同時拒絕訓練。既然用途現在需要申報,這就是一個站得住腳的折衷立場。
對大多數讀到這篇文章的公司來說,答案是放行。想封鎖的直覺是防禦性的,也完全可以理解,但它多半是在保護一批本身沒有獨立商業價值的內容,同時切斷了這些內容原本就是為了餵養的發現管道。守住的和丟掉的,位置剛好顛倒了。
從哪裡開始
在動任何設定之前,先看流量。AI Crawl Control 在任何方案下都會顯示哪些爬蟲正在造訪、頻率有多高。把這樣的資料累積一個月,一場立場之爭就會變成一道單純的算術題。
接著逐一針對爬蟲決定,而不是一刀切,並把決定連同日期一起寫下來,因為這個領域在 14 個月內已經變了兩次,而且還會再變。沒有寫下來,下次變動時就沒有人說得清當初是根據什麼前提做的判斷。
Mecanik 提供的技術 SEO 稽核 ,除了常規檢查項目之外,也會涵蓋 AI 爬蟲的存取狀況與引用曝光,設定的落地則由我們的網站開發 團隊執行。如果你排名不錯卻從來不出現在 AI 答案裡,爬蟲的存取權限就是第一個該排除的原因。
相關文章: AI SEO 代理商:服務內容與費用 、Google AI 模式對你網站流量的影響 、WordPress 被駭:惡意軟體清除與復原指南 、Cloudflare 網站速度:2026 最佳化指南 。
常見問題
我該不該在自己的網站上封鎖 AI 爬蟲? 這完全取決於你怎麼賺錢。如果內容本身就是產品,例如付費牆後的報導或單篇販售的研究,那就封鎖,因為 AI 的摘要會取代掉這筆銷售。如果內容是在為一項服務做行銷,那就放行,因為在答案裡被引用正是這篇內容本來要創造的認知,而詢價依然會落到你手上。
封鎖 AI 爬蟲能阻止我的內容被拿去訓練嗎? 只能擋下一部分。它擋住的是會自報身分、尊重 robots.txt 的守規矩爬蟲,也就是剛好願意遵守規則的那一群。已經被吸收的內容仍然留在那裡,而無視 robots.txt 的抓取工具從來就不受影響。你調整的是有禮貌的那部分爬蟲,不是全部。
Cloudflare AI Crawl Control 是什麼? 這是 Cloudflare 的一項功能,所有方案都能使用,包括免費方案。它讓你看到哪些 AI 服務正在存取你的網站,替個別爬蟲設定放行或封鎖規則,並追蹤每個爬蟲是否尊重 robots.txt。它同時支援按抓取次數計費。它最有用的地方,是在你做任何決定之前先把流量攤開來給你看。
取代 Cloudflare Pay Per Crawl 的是什麼? 是 2026 年 7 月 1 日公布的 Pay Per Use。它不再對 AI 公司按每次抓取頁面收費,而是在出版方的內容於一則答案中創造價值時付錢給對方。Cloudflare 的理由是,AI 爬蟲流量中有超過 50% 在重複抓取沒有變動的頁面,因此按抓取計費大半是在替浪費開帳單。首批合作對象是 Ceramic.ai 與 You.com。
2026 年 9 月 15 日會發生什麼事? Cloudflare 將開始在帶有廣告的頁面上預設封鎖用途混合的 AI 爬蟲,除非網站擁有者更動設定。用途混合指的是沒有把搜尋索引與訓練、代理流量分開的爬蟲。如果你正在投放廣告,又倚賴來自 AI 的推薦,那麼你不做任何動作,這條預設值也會適用於你。
評論