哪些客户端会抓取 llms.txt

请求日志可以识别请求和客户端标签,但不能证明模型读取了该文件、使用了该文件或在回答中引用了该文件。

最近更新:

简短回答

尚不存在经过验证的完整产品清单,能够证明这些产品会自动发现、解析并使用 llms.txt。最有力的公开证据是请求日志数据:它显示命名 客户端在一个定义好的样本中抓取了文件,而不是模型在随后对字节做了什么。

V2 允许在源站根路径或更具体的路径放置地图,并定义了 rel="describedby" 用于发现。页面也可以通过 rel="alternate" type="text/markdown"客户端必须实现这些关系,关系才会产生作用。

请求日志测量了什么

Ahrefs 分析了对 /llms.txt 在 2026年5月 期间覆盖 137,210 个域名。大约 38,000 个域名提供了 Ahrefs 接受的响应,但其中只有 3% 的文件在该月收到过请求。该样本偏技术和 SEO,因此其比例不是整个 Web 的估计。

具名 AI 机器人占已测请求的 19.5%。SEO 审计工具、通用爬虫、分析工具和未识别客户端合计占比高得多。在该样本中,Slackbot 获取文件的次数多于 PerplexityBot。

哪些客户端类别抓取了该文件

命名的 AI 类别占所有已测请求的比例
智能体和智能体基础设施10.5%
训练爬虫5.3%
AI 助手2.5%
用于实时 AI 搜索的检索机器人1.1%

代理式客户端构成了最大的已命名 AI 类别,而 Claude-Code 产生的请求数量 比数据集中的任何检索机器人、助手或训练爬虫都更多。这意味着 开发者发起的工作流是一个合理受众,但这并不能证明自动发现或全站支持。

搜索、训练和用户访问各不相同

OpenAI 的爬虫文档将其区分为 OAI-SearchBot 用于 ChatGPT Search, GPTBot 用于可能被拿来训练基础模型的内容,以及 ChatGPT-User ,用于用户发起的某些操作。OpenAI 表示 ChatGPT-User 不用于自动网页抓取,也不用于决定内容是否出现在搜索结果中。

这种区别有助于对日志进行分类。它不能证明这些 user-agent 中的任何一个会自动发现、解析或特殊对待 llms.txt: 公开文档并未作出该声明。

请求无法证明什么

  • 一次请求只能证明客户端获取了响应,不能证明模型读取或保留了它。
  • 用户代理字符串只是一个声明的标签;除非验证其来源,否则它可能被伪造。
  • 一次获取并不能表明该文件影响了回答、引用、排名或训练语料库。
  • 手动请求明确指定的 URL 与自动发现并不相同。
  • 一个技术面板和一个月的时间,无法证明整个 Web 的行为。

如何衡量你自己的文件

  1. 记录每个根级和路径级 llms.txt URL。
  2. 保留状态、时间戳、请求的 URL、最终 URL 和 user-agent 字符串。
  3. 如果归因很重要,请通过提供商记录在案的方法验证已知机器人。
  4. 区分真人、审计、通用爬虫、智能体、训练、助手和检索流量。
  5. 将请求、引荐、引用和下游转化分别报告。

[监测方法](/blog/how-to-monitor-llms-txt/)解释了分母和响应状态。如需查看实测类别明细,请阅读 谁在请求 llms.txt.

常见问题

ChatGPT 会读取 llms.txt 吗?

没有 OpenAI 文档能证明会自动 llms.txt 发现或特殊处理。OpenAI 记录了 OAI-SearchBot 用于 Search,以及 ChatGPT-User 用于某些由用户发起的访问。这些角色不应混为一谈,而且对某个明确 URL 的请求也不能证明产品范围内的支持。

Claude 会读取 llms.txt 吗?

没有任何公开供应商文档能证明自动 llms.txt 在 Claude 中的发现情况。 日志条目可以表明客户端获取了响应,但不能表明文件已被解析、保留或用于答案。

llms.txt 爬虫的用户代理是什么?

并不存在适用于 llms.txt 爬虫。每个 AI 系统都使用自己的爬虫身份(PerplexityBot、GPTBot、ClaudeBot 等)。 llms.txt 是一个被动文件,爬虫必须明确请求它。

相关页面

来源