要不要屏蔽 AI 爬虫,通常被摆成一个技术问题,但它并不是。屏蔽本身只是几行配置,在 robots.txt 里加几条规则,或者在网络层打开一条规则,十分钟就能做完。真正难的是决定你到底想不想这么做,而这个决定完全属于生意范畴:你是在两件事之间做取舍,一边是保护内容不被拿去训练模型,另一边是继续出现在人们如今用来替代搜索结果列表的那些答案里。

网上大部分建议都是先站队,然后只替自己那一边说话。诚实的说法是另一种:正确答案随商业模式而变。一家靠页面浏览量吃饭的媒体,和一家靠询盘吃饭的服务公司,本来就应该得出完全相反的结论。如果两者的答案一样,那才是真的出了问题。

这笔交易一句话就能说完: 屏蔽 AI 爬虫可以阻止你的内容被抓取消化,但同时也阻止了你被引用。如果你的收入取决于有人真正落到你的页面上,屏蔽是在保护你。如果你的收入取决于别人知道你的存在、然后来联系你,屏蔽等于把你从这种发现越来越频繁发生的那个界面上抹掉。


Cloudflare 究竟改了什么

默认值翻转了。2025 年 7 月 1 日,Cloudflare 成为第一家默认屏蔽 AI 爬虫的大型基础设施服务商 ,从「不同意就要自己声明」的模式,转向「同意了才放行」的模式。新加入的域名在接入时就会被问到,是否允许 AI 爬虫抓取其内容。对 AI 公司来说,过去没有被拒绝就等于默许,现在必须拿到明确的许可才行。

这件事的意义远远超出 Cloudflare 自己的客户范围,因为相当大一部分网络流量都要经过这张网。默认值不是法律,但在那种规模上生效的默认值,会重新划定 AI 公司可以视为理所当然的边界。很多行业惯例的改变,不是从规则开始,而是从默认设置开始。

配套工具叫 AI Crawl Control ,所有套餐都能用,包括免费套餐。它会列出哪些 AI 服务正在接触你的内容,允许你按爬虫逐一设置放行或屏蔽规则,还能查看某个爬虫是否真的遵守 robots.txt。最有价值的一点,是让你在做任何决定之前先把这些流量看清楚,而绝大多数站长从来没有打开过这个页面。争论先跑在了前面,却没有人先去看究竟是谁在来、来了多少次。

Cloudflare 还推动爬虫申报用途。于是你可以把训练模型的机器人、为一次实时回答而抓取页面的机器人、以及为搜索建立索引的机器人区分开来。这是三笔性质完全不同的交易:训练可能只拿走而什么都不还,实时回答有机会把你的名字摆在读者眼前,搜索索引则可能真的送来一次访问。而直到不久前,这三者抵达时是无法分辨的,面对分辨不出的对方,你连谈条件的余地都没有。

收费模式在 2026 年 7 月又变了一次

去年写下的建议,正是在这里变成了错的。

Pay Per Crawl 于 2025 年推出,是一个让出版方按每次抓取向 AI 公司收费的市场。2026 年 7 月 1 日,Cloudflare 宣布这个模式不够用,转向了 Pay Per Use :付费的触发点不再是机器人下载了一个页面,而是你的内容在一条答案里创造了价值。

看到那个数字,道理立刻就通了:AI 爬虫流量中有超过 50% 是在重复抓取根本没有变化的页面。按抓取次数收费,大部分是在为浪费开账单。而当内容出现在答案里时才收费,收的正是那件真正顶替了一次网站访问的事情。付费对象终于和损失的形状对上了。

现在还很早。首批合作方是 Ceramic.ai 和 You.com,对一家英国小公司来说,这还谈不上是一条宽阔的收入通道。把它当成市场行进的方向,而不是明年预算里的一行数字,才比较妥当。

还有一个值得写进日程的期限。从 2026 年 9 月 15 日起,在带广告的页面上,用途混合的爬虫将被默认屏蔽,除非站点所有者主动改动设置。如果你在投放广告,同时又依赖 AI 带来的引荐流量,那么你什么都不做,这条默认设置也会落到你头上。

屏蔽真正的代价

三样,只有第一样是显而易见的。

你会失去引用。 AI 的答案会点名列出来源。成为其中一个名字,相当于今天的搜索首页曝光,而被屏蔽的爬虫无法引用它没有权限读取的东西。如果你已经决定要争取可见性,那么什么才能换来一次引用,我们在生成式引擎优化指南 里讲过。

你会失去度量。 被屏蔽的流量不会在报表里表现为损失,它表现为「什么都没有」,而这和从来没有过是分不清的。早早屏蔽的站点往往说不出自己付出了多少代价,因为用来做比较的那个反事实从未被记录下来。量不出来的东西,连事后要不要改回去都没法判断。

而且你其实并没有真的挡住训练。 屏蔽那些会自报身份、会尊重 robots.txt 的守规矩爬虫,恰好挡住的就是愿意守规矩的那一批。已经被抓走的内容仍然留在那里,而无视 robots.txt 的抓取工具本来就不在射程之内。你调整的,只是有礼貌的那一小部分的行为。

反过来看,如果一门生意的产品就是内容本身,屏蔽确实是真正的保护。订阅制媒体、靠卖报告为生的研究机构、图片素材库都属于这一类。对它们来说,一条概括了内容的 AI 答案是销售的直接替代品,而署上一个来源名字,作为补偿实在太轻。

怎么决定要不要屏蔽 AI 爬虫

先问自己:一位访客值多少钱,他又是沿着哪条路径变成客户的。

如果内容就是产品,那就屏蔽。 付费墙后的报道、按份出售的研究、你对外授权的参考数据,都属于这一类。AI 答案直接和你的成交竞争。

如果内容是为别的东西做营销,那就放行。 软件服务公司、咨询公司、律师事务所、诊所都是如此。你写文章,是为了让买家意识到你能解决他们的问题。在一条答案里被点名,正是你本来就要花钱去买的那份认知,而询盘依然必须落到你手上。

如果你处在中间地带,那就有选择地放行。 按爬虫逐一设置规则,可以接受搜索索引、同时拒绝训练。既然用途现在需要申报,这就是一个站得住脚的折中立场。

对大多数读到这篇文章的企业来说,答案是放行。想要屏蔽的本能是防御性的,也完全可以理解,但它多半是在保护一批本身没有独立商业价值的内容,同时切断了这些内容原本就是为了喂养的发现渠道。守住的和丢掉的,位置正好反了。

从哪里开始

在动任何设置之前,先看流量。AI Crawl Control 在任何套餐下都会显示哪些爬虫在来、来的频率有多高。把这样的数据攒够一个月,一场立场之争就会变成一道简单的算术题。

然后按爬虫逐个决定,而不是一刀切,并把决定连同日期一起写下来,因为这个领域在 14 个月里已经变了两次,而且还会再变。没有写下来,下次变动时就没人说得清当初是基于什么前提做的判断。

Mecanik 提供的技术 SEO 审计 ,除了常规检查项之外,还会覆盖 AI 爬虫的访问情况和引用曝光,配置落地则由我们的网站开发 团队完成。如果你排名不错却从来不出现在 AI 答案里,爬虫访问权限是第一件应该排除的事。


相关文章: AI SEO 代理机构:服务内容与费用谷歌 AI 模式对你网站流量的影响WordPress 被黑:恶意软件清除与恢复指南Cloudflare 网站速度:2026 优化指南


常见问题

我该不该在自己的网站上屏蔽 AI 爬虫? 这完全取决于你怎么赚钱。如果内容本身就是产品,比如付费墙后的报道或按份出售的研究,那就屏蔽,因为 AI 的摘要会替代掉这笔销售。如果内容是在为一项服务做营销,那就放行,因为在答案里被引用正是这篇内容本来要制造的认知,而询盘依然会落到你手上。

屏蔽 AI 爬虫能阻止我的内容被用于训练吗? 只能阻止一部分。它拦住的是会自报身份、尊重 robots.txt 的守规矩爬虫,也就是恰好愿意遵守规则的那一批。已经被抓走的内容仍然留在那里,而无视 robots.txt 的抓取工具从来就不受影响。你调整的是有礼貌的那部分爬虫,不是全部。

Cloudflare AI Crawl Control 是什么? 这是 Cloudflare 的一项功能,所有套餐都能用,包括免费套餐。它让你看到哪些 AI 服务正在访问你的站点,为单个爬虫设置放行或屏蔽规则,并跟踪每个爬虫是否尊重 robots.txt。它同时支持按抓取次数计费。它最有用的一点,是在你做任何决定之前先把流量摆给你看。

取代 Cloudflare Pay Per Crawl 的是什么? 是 2026 年 7 月 1 日公布的 Pay Per Use。它不再对 AI 公司按每次抓取页面收费,而是在出版方的内容于一条答案中创造价值时向其付费。Cloudflare 给出的理由是,AI 爬虫流量中有超过 50% 在重复抓取没有变化的页面,因此按抓取计费大部分是在为浪费开账单。首批合作方是 Ceramic.ai 和 You.com。

2026 年 9 月 15 日会发生什么? Cloudflare 将开始在带广告的页面上默认屏蔽用途混合的 AI 爬虫,除非站点所有者改动设置。用途混合指的是没有把搜索索引与训练、代理流量区分开的爬虫。如果你在投放广告,又依赖来自 AI 的引荐,那么你不做任何动作,这条默认设置也会适用于你。