哪些客户端会抓取 llms.txt?
请求日志可以识别请求和客户端标签,但不能证明模型读取了该文件、使用了该文件或在回答中引用了该文件。
最近更新:
简短回答
尚不存在经过验证的完整产品清单,能够证明这些产品会自动发现、解析并使用
llms.txt。最有力的公开证据是请求日志数据:它显示命名
客户端在一个定义好的样本中抓取了文件,而不是模型在随后对字节做了什么。
V2 允许在源站根路径或更具体的路径放置地图,并定义了
rel="describedby" 用于发现。页面也可以通过 rel="alternate" type="text/markdown"客户端必须实现这些关系,关系才会产生作用。
请求日志测量了什么
Ahrefs 分析了对 /llms.txt 在 2026年5月 期间覆盖 137,210 个域名。大约 38,000 个域名提供了
Ahrefs 接受的响应,但其中只有 3% 的文件在该月收到过请求。该样本偏技术和 SEO,因此其比例不是整个 Web
的估计。
具名 AI 机器人占已测请求的 19.5%。SEO 审计工具、通用爬虫、分析工具和未识别客户端合计占比高得多。在该样本中,Slackbot 获取文件的次数多于 PerplexityBot。
哪些客户端类别抓取了该文件
| 命名的 AI 类别 | 占所有已测请求的比例 |
|---|---|
| 智能体和智能体基础设施 | 10.5% |
| 训练爬虫 | 5.3% |
| AI 助手 | 2.5% |
| 用于实时 AI 搜索的检索机器人 | 1.1% |
代理式客户端构成了最大的已命名 AI 类别,而 Claude-Code 产生的请求数量 比数据集中的任何检索机器人、助手或训练爬虫都更多。这意味着 开发者发起的工作流是一个合理受众,但这并不能证明自动发现或全站支持。
搜索、训练和用户访问各不相同
OpenAI 的爬虫文档将其区分为 OAI-SearchBot 用于 ChatGPT Search,
GPTBot 用于可能被拿来训练基础模型的内容,以及
ChatGPT-User ,用于用户发起的某些操作。OpenAI 表示
ChatGPT-User 不用于自动网页抓取,也不用于决定内容是否出现在搜索结果中。
这种区别有助于对日志进行分类。它不能证明这些 user-agent 中的任何一个会自动发现、解析或特殊对待 llms.txt: 公开文档并未作出该声明。
请求无法证明什么
- 一次请求只能证明客户端获取了响应,不能证明模型读取或保留了它。
- 用户代理字符串只是一个声明的标签;除非验证其来源,否则它可能被伪造。
- 一次获取并不能表明该文件影响了回答、引用、排名或训练语料库。
- 手动请求明确指定的 URL 与自动发现并不相同。
- 一个技术面板和一个月的时间,无法证明整个 Web 的行为。
如何衡量你自己的文件
- 记录每个根级和路径级
llms.txtURL。 - 保留状态、时间戳、请求的 URL、最终 URL 和 user-agent 字符串。
- 如果归因很重要,请通过提供商记录在案的方法验证已知机器人。
- 区分真人、审计、通用爬虫、智能体、训练、助手和检索流量。
- 将请求、引荐、引用和下游转化分别报告。
[监测方法](/blog/how-to-monitor-llms-txt/)解释了分母和响应状态。如需查看实测类别明细,请阅读 谁在请求 llms.txt.
常见问题
ChatGPT 会读取 llms.txt 吗?
没有 OpenAI 文档能证明会自动 llms.txt 发现或特殊处理。OpenAI 记录了 OAI-SearchBot 用于 Search,以及 ChatGPT-User 用于某些由用户发起的访问。这些角色不应混为一谈,而且对某个明确
URL 的请求也不能证明产品范围内的支持。
Claude 会读取 llms.txt 吗?
没有任何公开供应商文档能证明自动 llms.txt 在 Claude 中的发现情况。 日志条目可以表明客户端获取了响应,但不能表明文件已被解析、保留或用于答案。
llms.txt 爬虫的用户代理是什么?
并不存在适用于 llms.txt 爬虫。每个 AI 系统都使用自己的爬虫身份(PerplexityBot、GPTBot、ClaudeBot
等)。 llms.txt 是一个被动文件,爬虫必须明确请求它。
相关页面
- 谁在使用 llms.txt,真实使用情况的证据。
- llms.txt 格式参考,规范细节。
- 如何创建 llms.txt,适用于任何技术栈的分步指南。
- 验证器 · 生成器.