llms.txt 现在到底有没有用?诚实的答案是:在可测量的范围内几乎没有用,而那些告诉你这个文件对 AI 可见性至关重要的人,通常是在向你推销东西。一边这样说,一边又建议你发布一份,这个立场并不舒服。所以这篇文章先把数字摆出来,然后再解释这条建议本身。

文件本身是个合理的主意。它是放在网站根目录下的一份 markdown 索引,告诉语言模型你发布了什么、内容在哪里,就像 robots.txt 告诉爬虫哪些内容可以抓取一样。想法没有问题。问题出在它原本要服务的那些公司身上,它们几乎没有采用。提出一份规范,和真正出现读取它的一方,完全是两回事。

服务器日志真正显示的情况: Ahrefs 对 137,000 个域名的分析发现,2026 年 5 月,97% 的 llms.txt 文件收到的请求为零。不是很少,是零。与此同时,采用量在一年内增长了 8.8 倍,这意味着这个文件被发布的速度,远远快于它被读取的速度。


数字,以及它们的来源

有两份数据值得了解,因为绝大多数讨论这个话题的文章一份都没有引用。

Originality.ai 在 2025 年 6 月到 2026 年 5 月之间持续跟踪了超过 300 万个网站。llms.txt 的出现数量从 4,088 个增加到 36,120 个,也就是 8.8 倍的增长;到 2026 年 5 月,大约有 38,980 个网站发布了相关格式之一。增长是真实的,但起点非常低。相对于数百万量级的样本,几万这个数字仍然只是很小的一部分。

随后 Ahrefs 分析了 137,000 个域名的服务器日志,确认在 2026 年 5 月,其中 97% 的文件没有收到任何请求 。这一点很关键:它不是推测,而是真实的访问记录。文件就摆在那里可以被取走,却没有人来取。在确实到达的请求里,AI 检索机器人只占 1.1%。具体拆开来看,GPTBot 占了对这些文件请求的 4.51%,ClaudeBot 占 0.80%,DeepseekBot 占 0.02%。

把两份研究放在一起,呈现出来的是这样一个标准:发布方热情采用,消费方全面忽视。只看其中一边,增长率会被读成成功的证据。

AI 公司实际上是怎么说的

这部分基本可以为争论定论,下面只看各家公开表述过的内容。

Google 不支持。它在 2025 年 7 月公开这样说过,并表示没有支持计划。OpenAI 在爬虫文档中完全没有提到 llms.txt,而是让网站所有者去看 robots.txt。Anthropic 发布了自己的 llms.txt,也参与过这项提案的讨论,但从未表示 Claude 的检索会解析第三方的文件。

Perplexity 是值得注意的例外,它表示会抓取这个文件,用来帮助确定页面的优先级。

数据里藏着一层有意思的讽刺:Google、OpenAI 和 Anthropic 都为自家文档发布了 llms.txt,同时又建议网站所有者不要指望靠它获得搜索可见性。自家文档可被机器读取当然有用。但这和它们的爬虫会读你的文件,是两件不同的事。目前市面上不少推销话术,正是建立在混淆这两件事之上。

今天真正的消费方是编码智能体,而不是搜索引擎。Cursor、Claude Code、Continue 和 Cline 会在用户把它们指向某个域名时读取 llms.txt。如果你的产品有开发者文档,那就是一群真实存在、意图明确的读者,这也许是拥有这个文件最有力的理由。

那为什么还要发布

四个理由,没有一个是“它会提升你的排名”。

成本几乎为零。 从自己的内容生成一份索引大约是半天的工作量,如果网站本来就清楚自己的结构,还会更快。

现有的消费方意图很强。 把 Cursor 指向你文档的开发者,比大部分搜索流量更接近真正使用你的产品。Perplexity 优先处理你的页面,影响不大,但确实存在。

标准的普及像棘轮一样只朝一个方向走。 如果检索系统真的开始读取它,拥有一份正确且最新文件的网站已经准备好了,没有的则没有。早做的代价是半天,晚做的代价是你意识到这件事所花的全部时间。

写它这件事本身会强制你做一次审计。 要做出准确的索引,就得把发布过的所有东西清点一遍。没有人链接的页面、你已经忘记还存在的栏目,正是在这个过程中被找出来的。

最后一点不是理论。这个月审计我们自己的文件时,翻出了一个比文件本身更值钱的问题。

过期的 llms.txt 比没有更糟

我们的 llms.txt 列出了 29 篇文章,站点上实际有 166 篇。更糟的是,里面每一个 URL 都漏掉了语言前缀,于是 mecanik.dev/posts/<slug>/ 返回 404,而真正的页面在 mecanik.dev/en/posts/<slug>/。文件里共有 243 个站内地址,其中能够正常访问的只有 7 个

任何真的去读它的东西,拿到的都是一张不存在的网站地图。这比什么都不发布严格来说更糟,因为什么都不发布至少是诚实地失败。一份错误的索引会让读取方得出“查过了,这里什么都没有”的结论。

这个教训不止适用于这一个文件。索引是你对自己网站作出的承诺,而无人维护的承诺会悄悄变成谎言。如果你要发布,就把它放进和站点地图相同的发布流程,并且逐个测试地址是否真的能访问,而不是假定生成器一定做对了。内容里存在一个 slug,和服务器上那个 URL 能够响应,并不是同一件事。

怎样把它发布好

请遵循 llmstxt.org 的规范 ,不要自己发明格式。唯一必需的元素是写着站点名称的 H1;引用块形式的摘要,以及由带注释链接组成的 H2 分区,属于惯例。惯例中还有一个 Optional 分区,用来放上下文紧张时智能体可以跳过的链接。

规范之外还有三条实务规则。第一,从内容生成文件,不要手工维护,手工维护的索引两个月内就会过期。第二,用真实请求测试每一个 URL,能生成出来和能被访问到是两回事。第三,如果站点是多语言的,把语言规则写一次,而不是把每个语言版本都列出来,这样读者可以按规则自行拼出任何地址。

我们的生成式引擎优化指南 讲的是 AI 可见性里那些可测量有效的部分,而AI 搜索引擎如何读取结构化数据 讲的是 schema 标记。和 llms.txt 不同,schema 确实被那些公开写明自己会读取它的系统所消费。

结论与建议

发布一份。保持它准确。今年不要对它抱任何期待,也不要让任何人把它当作 AI 可见性服务向你收费。

如果你想要的是真正能推动 AI 引用的东西,那不是域名根目录下的一个文件。而是把一个问题回答得足够完整、值得被引用的内容,加上足以让检索系统信任这个答案的权威度。Mecanik 在技术 SEO 审计 中同时覆盖这两方面,也包括检查你那些机器可读的索引,是否说出了关于网站的实话。


延伸阅读: 为什么你的内容有排名却从不被引用屏蔽还是放行 AI 爬虫:一个商业决策Google AI Mode 对你的网站流量意味着什么律师事务所 SEO 公司:合规、内容与成本


常见问题

llms.txt 在 2026 年真的有用吗? 几乎没有。Ahrefs 对 137,000 个域名的分析发现,2026 年 5 月有 97% 的 llms.txt 文件没有收到任何请求,而在确实到达的请求中,AI 检索机器人只占 1.1%。采用量一年内增长了 8.8 倍,也就是说这个文件被发布的速度,远远快于任何东西读取它的速度。

Google、OpenAI 和 Anthropic 支持 llms.txt 吗? 不支持。Google 在 2025 年 7 月公开表示不支持 llms.txt,也没有支持计划。OpenAI 在爬虫文档中没有提到它,而是让网站所有者去看 robots.txt。Anthropic 发布了自己的文件,但没有说过 Claude 的检索会解析第三方文件。Perplexity 是例外,它表示会抓取这个文件来确定页面优先级。

llms.txt 和 robots.txt 是一回事吗? 不是。robots.txt 告诉爬虫哪些内容可以抓取,行为规范的机器人普遍遵守它。llms.txt 是一份内容索引,告诉语言模型你发布了什么、放在哪里,而遵守它的系统非常少。如果你想控制 AI 爬虫的访问,真正有效的机制是 robots.txt 以及你的 CDN 提供的爬虫控制功能。

今天到底是谁在读 llms.txt? 主要是编码智能体,而不是搜索引擎。Cursor、Claude Code、Continue 和 Cline 会在用户指向某个域名时读取这个文件,Perplexity 也表示会用它来确定页面优先级。如果你发布开发者文档,那是一群规模不大但意图确实很强的读者。

我应该发布 llms.txt 文件吗? 应该,但要出于正确的理由。它只花半天时间,现有的消费方意图很强,而且一旦采用情况改善你已经准备好了。不要指望排名收益。最重要的是保持它准确:一份列着已经无法访问地址的过期文件,比什么都不发布更糟,因为它递给每一个读者一张不存在的网站地图。