<!-- Generated from zh/blog/llms-txt-adoption-is-not-usage/index.html. The canonical document is the HTML page. -->

- [ 首页 ](/zh/) 
/
- [ 博客 ](/zh/blog/) 
/
- 采用不等于使用：正确解读 llms.txt 研究            
# 采用不等于使用：正确解读 `llms.txt` 研究

三个公开 llms.txt 数据集报告的采用数字看似无法调和，其实并非如此。每个数据集抽样的是不同群体，而且只有一个还测量了客户端是否获取这些文件。

最近更新: 2026年8月12日

本页内容

- [ 三个看似矛盾的数字 ](#three-numbers)
- [ 各项实际衡量了什么 ](#what-each-measures)
- [ 关键区别 ](#the-real-split)
- [ 如何解读下一项研究 ](#reading-any-study)              

## 三个看似矛盾的数字

如果你一直关注 llms.txt 的证据，就会看到几个月内报告的采用率分别为 10.13%、28% 和 51.8%。最后一个数字来自我们日期为 3 2026年8月 的固定样本快照。

这些数字都有依据。它们回答的是三个不同的问题，差异完全来自抽样框架。值得把它们理清一次，因为这也解释了为什么“有人在使用 llms.txt 吗”根本不能用采用率数字回答。

## 各项实际衡量了什么

**SE Ranking，约 300,000 个域名。** 他们的[研究](https://seranking.com/blog/llms-txt/)报告称，在其数据集域名中有 **10.13%** 发布了 llms.txt，并发现拥有该文件与域名在主要 LLM 回答中被引用的频率之间没有关系。当他们从 AI 引用预测模型中移除 llms.txt 这一变量后，模型准确率反而提高。在 AI 引用最多的 50 个域名中，只有一个拥有该文件。

**Ahrefs，137,210 个域名。** 他们的[研究](https://ahrefs.com/blog/llmstxt-study/)报告称，这一比例为 **28%** ，样本来自使用 Ahrefs Web Analytics、并在 2026年5月 获得流量的域名。他们明确指出，这一总体比整个 Web 更偏技术、更熟悉 SEO，而且该数字应被视为**上限** 。他们还说明没有根据规范检查文件是否格式正确。

**我们的样本：219 个精选主机。** [llmtxt.info 采用率样本](/zh/llms-txt-adoption/)每周抓取并解析 `/llms.txt`，使用一份有意偏重文档平台和开发者工具的固定列表。在 3 2026年8月，218 个可访问主机中有 113 个提供了符合条件的文件，即 **51.8%** 。这是对所选队列的纵向测量，而不是对整个 Web 的估计。

并排看时，顺序正如预期：先是对普通 Web 的广泛抓取，然后是技术倾向更强的分析总体，最后是该约定发源行业的人工挑选列表。样本越经过筛选，数字越高。这是一幅一致的图景，并不矛盾。

## 关键区别

采用率数据无法触及的部分就在这里。

SE Ranking 衡量了**发布及其与引用的相关性** 。Ahrefs 衡量了**发布，随后单独分析服务器日志** ，覆盖其总体中对 `/llms.txt` 的每个请求，并按用户代理进行分类。

第二项测量产生了采用率抓取无法产生的数字：在 Ahrefs 接受的大约 38,000 个文件中，**97% 在 2026年5月 没有收到任何请求** ，无论来自客户端、机器人还是人类。Ahrefs 检查了 HTTP 200、Markdown 而非 HTML 以及常见错误信号，但没有测试是否完全符合提案。

因此，两项大型研究是叠加关系，而不是相互竞争：

- 根据所统计的总体，发布该文件的网站占 10% 到 28%。

- 已发布的文件中，约有 3% 会被任何对象抓取。

- 在这些抓取中，19.5% 来自具名 AI 机器人，具体来自 AI 检索机器人的为 1.1%。

加上这些因素后，某个月份被 AI 搜索抓取器抓取的已发布文件比例很小，与其给出百分比，不如诚实地称其为罕见。

这些都不是说文件毫无价值，我们在[收益与限制](/zh/benefits-limitations/)中分别说明了正反两面。这说明“X% 的网站已经采用它”不是使用证据，也不应再被当作使用证据引用。

## 如何解读下一项研究

还会有更多研究出现。四个问题可以区分哪些研究真正有用。

**抽样框架是什么？** “我们的分析产品中的域名”和“普通 Web 抓取中的域名”属于不同总体。没有框架的数字就不是完整的数字。

**发布，还是消费？** 检查 `/llms.txt` 是否返回 200 成本很低，并能告诉你供给情况。阅读服务器日志能告诉你需求情况。到目前为止，几乎每个发布的数字都是供给数字。

**抓取过，还是读过？** 正如 Ahrefs 明确指出的，即使是日志数据也有上限问题：请求证明字节被取得，而不是模型使用了它们。每个消费量数字都是实际消费量的上限。

**检查过有效性吗？** Ahrefs 没有根据规范验证其文件，并且明确说明了这一点。一个返回 200 但无法解析的文件，在大多数方法中仍会被算作采用。我们的[验证器](/zh/validator/)之所以存在，部分原因就是这一缺口在汇总统计中不可见。

如果你想知道自己的网站发生了什么，而不是看汇总结果，答案就在访问日志中，过滤条件为 `/llms.txt`。这比上面三个总体都更小，也更与决策相关；正如[没有 AI 代理会主动寻找你的 llms.txt](/zh/blog/agents-do-not-look-for-llms-txt/)所述，它主要测量的是是否有人告诉了代理文件的存在。

## 来源

- [ Ahrefs，《我们分析了 13.7 万个站点：97% 的 llms.txt 文件从未被读取（2026年6月）》 ](https://ahrefs.com/blog/llmstxt-study/)
- [ SE Ranking，LLMs.txt 是否会影响 AI 可见性和引用？（2025年11月） ](https://seranking.com/blog/llms-txt/)
- [ llmtxt.info 采用情况样本，每周测量 ](https://llmtxt.info/zh/llms-txt-adoption/)
