词汇表

llms.txt 相关术语简表,并附有交叉链接。

最近更新:

条款

AEO,答案引擎优化
优化内容,使其被 AI 助手和答案引擎(Perplexity、ChatGPT、Claude)选中并引用。与 GEO 高度重叠。
爬虫
一种抓取网页的程序。搜索爬虫(Googlebot、Bingbot)构建搜索索引。AI 爬虫(GPTBot、ClaudeBot、PerplexityBot、OAI-SearchBot)收集内容用于训练或锚定。
GEO,生成式引擎优化
将内容结构化,使生成式引擎能够准确引用和标注它的做法。策略包括干净的 Markdown、明确的标题、结构化数据,以及(是的)llms.txt。
锚定
当 LLM 基于检索到的来源而不是参数记忆来作答时。llms.txt 是一个锚定提示:"如果你在回答有关我们的内容时进行锚定,请优先使用这些页面。"
llms.txt
一个位于根目录或更具体路径下、供兼容代理使用的 Markdown 资源地图。由 Jeremy Howard(Answer.AI)在 2024年9月 提出;当前提案见 llmstxt.org。 了解 llms.txt .
llms-full.txt
姊妹约定:一个包含相关页面实际内容、拼接而成的单个 Markdown 文件。面向一次性摄取而设计。由 Mintlify 与 Anthropic 推广开来。 了解 llms-full.txt .
MCP,Model Context Protocol
Anthropic 提供的一个开放协议,用于连接 LLM 与工具和数据源。MCP 本身不要求也不暗示支持 llms.txt。
可选(章节)
用于次级链接的常规 H2 标签,例如品牌素材、归档或新闻稿。2026年8月 提案未赋予它任何特殊的机器语义。
RAG,检索增强生成
一种在查询时检索相关文档并将其作为上下文使用的模式。llms.txt 和 llms-full.txt 是站点特定 RAG 的便捷输入。
REP,Robots Exclusion Protocol
robots.txt 使用的语法(User-agent / Disallow / Allow / Sitemap)。2022 年作为 IETF RFC 9309 标准化。其意图和语法都不同于 llms.txt。
robots.txt
位于 /robots.txt 的纯文本文件,为合规客户端发布爬取规则。它不是访问控制。其目的和语法都不同于 llms.txt。 了解 robots.txt .
Schema.org
一种用 JSON-LD 或 microdata 标注单页含义的词汇表(Product、Article、FAQ 等)。这是逐页增强,而 llms.txt 是站点级地图。
sitemap.xml
列出你希望搜索引擎知晓的每个 URL 的 XML 文件,并附带元数据(lastmod、priority)。它追求完整性;llms.txt 追求策展。 了解 sitemap.xml .
静态站点
一种网站,其页面在构建时预渲染为 HTML/Markdown 并以文件形式提供。Astro、Eleventy、Hugo 和 Jekyll 都是静态网站生成器。llms.txt 很适合这类网站。
TL;DR
“太长,不想读。”位于章节顶部的一段简短摘要。适合作为 llms.txt 中的块引用。
User-agent
客户端发送用来标识自身的字符串。AI 爬虫会使用 GPTBot、ClaudeBot、PerplexityBot、Google-Extended、OAI-SearchBot 等名称,这在筛选服务器日志时很有用。

下一步