<!-- Generated from zh/llms-txt-ai-crawlers/index.html. The canonical document is the HTML page. -->

- [ 首页 ](/zh/) 
/
- AI 爬虫            
# 哪些客户端会抓取 `llms.txt`？

请求日志可以识别请求和客户端标签，但不能证明模型读取了该文件、使用了该文件或在回答中引用了该文件。

最近更新: 2026年8月12日

本页内容

- [ 简短回答 ](#overview)
- [ 请求日志测量了什么 ](#evidence)
- [ 哪些客户端类别抓取了该文件 ](#categories)
- [ 搜索、训练和用户访问彼此不同 ](#intent)
- [ 请求不能证明什么 ](#limits)
- [ 如何衡量你自己的文件 ](#measure)
- [ 常见问题 ](#faq)            
## 简短回答

尚不存在经过验证的完整产品清单，能够证明这些产品会自动发现、解析并使用
`llms.txt`。最有力的公开证据是请求日志数据：它显示命名
客户端在一个定义好的样本中抓取了文件，而不是模型在随后对字节做了什么。

V2 允许在源站根路径或更具体的路径放置地图，并定义了
`rel="describedby"` 用于发现。页面也可以通过 `rel="alternate" type="text/markdown"`客户端必须实现这些关系，关系才会产生作用。

## 请求日志测量了什么

Ahrefs 分析了对 `/llms.txt` 在 2026年5月 期间覆盖 137,210 个域名。大约 38,000 个域名提供了
Ahrefs 接受的响应，但其中只有 3% 的文件在该月收到过请求。该样本偏技术和 SEO，因此其比例不是整个 Web
的估计。

具名 AI 机器人占已测请求的 19.5%。SEO
审计工具、通用爬虫、分析工具和未识别客户端合计占比高得多。在该样本中，Slackbot
获取文件的次数多于 PerplexityBot。

## 哪些客户端类别抓取了该文件
命名的 AI 类别  占所有已测请求的比例         智能体和智能体基础设施  10.5%     训练爬虫  5.3%     AI 助手  2.5%     用于实时 AI 搜索的检索机器人  1.1%       
代理式客户端构成了最大的已命名 AI 类别，而 Claude-Code 产生的请求数量
比数据集中的任何检索机器人、助手或训练爬虫都更多。这意味着
开发者发起的工作流是一个合理受众，但这并不能证明自动发现或全站支持。

## 搜索、训练和用户访问各不相同

OpenAI 的爬虫文档将其区分为 `OAI-SearchBot` 用于 ChatGPT Search，
`GPTBot` 用于可能被拿来训练基础模型的内容，以及
`ChatGPT-User` ，用于用户发起的某些操作。OpenAI 表示
`ChatGPT-User` 不用于自动网页抓取，也不用于决定内容是否出现在搜索结果中。

这种区别有助于对日志进行分类。它不能证明这些 user-agent 中的任何一个会自动发现、解析或特殊对待 `llms.txt`: 公开文档并未作出该声明。

## 请求无法证明什么

- 一次请求只能证明客户端获取了响应，不能证明模型读取或保留了它。 
- 用户代理字符串只是一个声明的标签；除非验证其来源，否则它可能被伪造。 
- 一次获取并不能表明该文件影响了回答、引用、排名或训练语料库。 
- 手动请求明确指定的 URL 与自动发现并不相同。 
- 一个技术面板和一个月的时间，无法证明整个 Web 的行为。     
警告

区分“请求”“读取”和“使用”

服务器日志可以支持动词  fetch 。使用  阅读 ,  使用  或  引用  只有在单独的观察证明了更强的主张时才这样做。

## 如何衡量你自己的文件

- 记录每个根级和路径级 `llms.txt` URL。 
- 保留状态、时间戳、请求的 URL、最终 URL 和 user-agent 字符串。 
- 如果归因很重要，请通过提供商记录在案的方法验证已知机器人。 
- 区分真人、审计、通用爬虫、智能体、训练、助手和检索流量。 
- 将请求、引荐、引用和下游转化分别报告。   
[监测方法](/blog/how-to-monitor-llms-txt/)解释了分母和响应状态。如需查看实测类别明细，请阅读
[谁在请求 llms.txt](/zh/blog/who-actually-reads-llms-txt/).

## 常见问题

### ChatGPT 会读取 llms.txt 吗？

没有 OpenAI 文档能证明会自动 `llms.txt` 发现或特殊处理。OpenAI 记录了 `OAI-SearchBot` 用于 Search，以及 `ChatGPT-User` 用于某些由用户发起的访问。这些角色不应混为一谈，而且对某个明确
URL 的请求也不能证明产品范围内的支持。

### Claude 会读取 llms.txt 吗？

没有任何公开供应商文档能证明自动 `llms.txt` 在 Claude 中的发现情况。 日志条目可以表明客户端获取了响应，但不能表明文件已被解析、保留或用于答案。

### llms.txt 爬虫的用户代理是什么？

并不存在适用于 `llms.txt` 爬虫。每个 AI 系统都使用自己的爬虫身份（PerplexityBot、GPTBot、ClaudeBot
等）。 `llms.txt` 是一个被动文件，爬虫必须明确请求它。

## 相关页面

- [谁在使用 llms.txt](/zh/llms-txt-adoption/)，真实使用情况的证据。 
- [llms.txt 格式参考](/zh/llms-txt-format/)，规范细节。 
- [如何创建 llms.txt](/zh/how-to-create/)，适用于任何技术栈的分步指南。 
- [验证器](/zh/validator/) · [生成器](/zh/generator/).        
## 来源

- [ llmstxt.org，社区提案 ](https://llmstxt.org/)
- [ Ahrefs，13.7 万站点 llms.txt 请求日志研究（2026年6月） ](https://ahrefs.com/blog/llmstxt-study/)
- [ Answer.AI，原始提案 ](https://www.answer.ai/posts/2024-09-03-llmstxt.html)
- [ Chrome for Developers，Lighthouse llms.txt 审计 ](https://developer.chrome.com/docs/lighthouse/agentic-browsing/llms-txt)
- [ OpenAI，爬虫和用户代理概览 ](https://developers.openai.com/api/docs/bots)
