AI 爬虫详解:意图、证据与 llms.txt
对 AI 爬虫进行分类,不能只看它的名称。运营方声明的用途、技术身份和你自己的日志分别回答不同的问题。
最近更新:
仅凭爬虫名称不足以确定其用途
真正有用的问题是:运营方声称机器人做什么、机器人如何证明其身份,以及 你自己的证据显示了什么。“AI 机器人”标签涵盖了多种活动。
Cloudflare 的已验证机器人分类展示了范围:搜索、代理、训练、交易、数据 收集、安全测试、SEO、广告验证、社交或链接预览、提要抓取,以及 监测或运维。一个机器人可能声明多种行为。
这些类别有助于组织策略,但不能证明某个请求导致了引用、模型训练或交易完成。
对 llms.txt 的请求可以证明什么
对以下路径的一次成功请求: /llms.txt 可以建立一小组服务器端事实:请求已到达服务器,携带了记录的
user-agent,目标是该 URL,且服务器 在记录的时间返回了记录的状态。
那条日志并不能证明客户端:
- 已正确解析该文件;
- 访问了每个链接;
- 更倾向于使用该文件,而不是 HTML 或结构化数据;
- 将内容用于检索或训练;
- 在答案中引用了该网站;
- 改变了页面或产品的排名。
将证据视为逐级递进的阶梯: fetched, parsed (如果已独立证明),
used (如果已独立证明),然后是 cited 或
converted ,前提是目标系统进行测量。跳过任何一步,都会把技术观察变成缺乏依据的主张。
为什么意图层级的区分很重要
OpenAI 为搜索、模型训练、用户触发的操作和广告审核分别记录了不同的 user-agent。 OAI-SearchBot 支持 ChatGPT 搜索。 GPTBot
涵盖可能用于训练基础模型的内容。 ChatGPT-User 执行某些由用户请求的操作,并不是自动搜索爬虫。
OAI-AdsBot 仅访问作为广告提交的页面。OpenAI 表示该机器人收集的数据不会用于训练基础模型。因此,广告审核与搜索可见性或训练用途不同。
这些角色仍不能证明任何 OpenAI 机器人依赖 llms.txt。只有客户端选择读取该文件时,它才有用。
llms.txt 的定位
llms.txt 可以提供一份简洁、由所有者选定的实用页面地图。它不能取代 HTML、站点地图、信息流、API、结构化数据、平台目录或
robots.txt。每种载体都有自己的作用。
Shopify 是一个有用的例子。它的 storefronts 可以发布 agent discovery 文件,而 Shopify Catalog 则单独承载结构化的产品事实。任一 surface 的存在都不能 保证某个 channel 会展示或排名某个产品。
发布 llms.txt 对于支持这一约定的客户端,然后只验证证据能够支持的内容。文件可用不等于已被采用,采用也不等于获得引用。
继续阅读
- AI 爬虫完整参考,用户代理与控制措施的权威技术参考。
- llms.txt 与 robots.txt,即发现指引与抓取控制之间的区别。
- 如何衡量 llms.txt 的影响,一种读取抓取工具日志、同时不作过度推断的方法。