llms.txt 验证器错误:拒绝还是警告?
实用的验证器必须区分提案中唯一的必需元素与可提升清晰度的惯例,否则就会把偏好报告为错误。
最近更新:
根据 v2 提案,唯一必需的部分是 H1 项目名或网站名。验证器应拒绝缺少或格式错误的 H1,以及损坏的文件列表链接语法。除非已发布规则明确规定更严格的配置,否则它不应因为缺少摘要、使用相对 URL 或文件较大就判定无效。
要点
- 必需语法和编辑指导需要不同的严重级别。
- 在测量的 113 个 H1 优先响应中,有 90 个使用了引用摘要;另外 23 个表明这种频率并非要求。
- 机器可读的规则代码让 CI 行为可以审计。
什么情况应视为错误?
错误应指出解析器无法按照提案解释的内容。例如空文件、第一行有意义的内容不是 H1、出现额外 H1,或文件列表项不是 Markdown 链接。
行号和稳定的规则代码很重要。H1_REQUIRED具有可操作性,而“你的文件有问题”没有。CI 任务只有在出现有文档记录的错误时才应以非零状态退出,而不是因为主观的风格偏好。
哪些问题应继续作为警告?
引用摘要是可选的,解释性前言、H2 部分、链接后的注释和 Optional 部分也同样可选。验证器可以在它们有助于理解时提出建议,但不应重写提案。
相对 URL 值得警告,因为脱离原始上下文后可能产生歧义,尽管 v2 并没有规定绝对 URL 是语法上唯一可能的形式。文件大小也取决于上下文。即使较小的整理文件更易消费,大型文档地图也可能是有意的。
生产环境中的文件是什么样的?
我们的目录快照包含 113 个返回文本且以 H1 开头的文件。其中 90 个使用引用摘要。中位数为 7 个 H2 部分和 76 个解析列表链接,而观测到的部分数量从 0 到 84。
这些分布说明了为什么不能把频率与有效性混为一谈。常见功能不自动意味着必需,不常见但获准的结构也不自动意味着错误。请将真实示例与正式规则放在一起检查。
透明的严重级别政策
发布确切规则、严重级别和规范版本。分开三层:
- 错误: 解析器无法构建所需结构。
- 警告: 允许的内容可能降低可移植性或清晰度。
- 信息: 例如大小或缺少发现关系等运行观察。
使用免费验证器查看逐行诊断,然后对语法检查器无法决定的事项参考最佳实践指南。
缺少引用摘要就无效吗?
不。在 v2 下它是可选的,虽然通常很有用。
文件超过 50 KB 就无效吗?
提案中没有出现通用最大值。大小可以触发信息性审查,但不能据此发明语法错误。
有效文件仍然可能很差吗?
是的。语法无法判断所选页面是否最新、相关或安全。