llms.txt и robots.txt: в чём разница?

Два файла, две разные задачи. Один публикует рекомендательные правила обхода, другой предлагает отобранную карту. Ни один не является механизмом контроля доступа.

Последнее обновление:

Краткий ответ

robots.txt публикует правила сканирования для совместимых клиентов, таких как Googlebot и Bingbot. Они сообщают, какие URL следует или не следует загружать, но не являются разрешением или техническим контролем доступа.

llms.txt — это слой контекста. Он сообщает языковым моделям ИИ, какие страницы вашего сайта наиболее полезны для понимания вашей работы. Это вовсе не механизм контроля доступа и он не даёт и не запрещает разрешение на обход. Это отобранный список для чтения в Markdown, предложенный 09.2024 Джереми Ховардом из Answer.AI.

Ни один файл не заменяет другой. Они работают на разных уровнях веб-стека и предназначены для разных аудиторий.

Что делает robots.txt

robots.txt файл находится в корне домена (/robots.txt) и использует протокол исключения роботов (REP) для передачи разрешений на обход. Типичная запись выглядит так:

User-agent: Googlebot
Disallow: /private/
Allow: /

Ключевые характеристики robots.txt:

  • Аудитория: Веб-краулеры всех видов, боты поисковых систем, краулеры для обучения AI, проверяющие ссылки и боты-архиваторы.
  • Формат: Обычный текст. Пары ключ-значение с заданным синтаксисом (User-agent, Allow, Disallow, Crawl-delay, Sitemap).
  • Назначение: Политика обхода. Она сообщает совместимым краулерам, что им следует и чего не следует получать.
  • Эффект: Совместимые сканеры не будут запрашивать запрещённые URL. Несовместимые могут игнорировать это правило.
  • Стандартный статус: Широко принятое отраслевое соглашение; информационный RFC IETF (RFC 9309) опубликован в 2022 году.
  • Чего он НЕ делает: robots.txt не объясняет краулерам смысл вашего содержимого, не указывает самые важные страницы или не задаёт контекст, который следует использовать при ответах на вопросы о вас.

Что делает llms.txt

llms.txt файл может находиться в корне домена или по более конкретному пути, например /docs/llms.txt. Это документ Markdown, а не конфигурационный файл «ключ-значение». Минимальный корректный файл выглядит так:

# My Product

> A short, factual description of what this site is about.

## Documentation

- [Getting started](https://example.com/docs/start/): first steps for new users.
- [API reference](https://example.com/docs/api/): complete endpoint documentation.

## Optional

- [Blog](https://example.com/blog/): articles and updates.

Ключевые характеристики llms.txt:

  • Аудитория: Совместимые агенты, конвейеры RAG и инструменты разработчика с явной поддержкой соглашения.
  • Формат: Markdown. Обязательный заголовок (H1), необязательное описание в blockquote и разделы H2 со списками ссылок в Markdown.
  • Назначение: Контекст и отбор. Он направляет совместимых клиентов к выбранным ресурсам, но не гарантирует точные ответы или последующее использование.
  • Эффект: Инструменты, читающие llms.txt, используют его как отправную точку для загрузки вашего содержимого. Он не предоставляет и не ограничивает доступ.
  • Стандартный статус: Общественная инициатива. Не стандарт IETF или W3C. Поддерживается на llmstxt.org Джереми Ховардом.
  • Чего он НЕ делает: llms.txt не управляет тем, кто может сканировать ваш сайт. Он не улучшает позиции в Google. Это не замена robots.txt.

Сравнение бок о бок

Атрибут robots.txt llms.txt
Расположение /robots.txt /llms.txt или путь с заданной областью
Формат Обычный текст, пары ключ-значение Markdown
Основная аудитория Все веб-краулеры Клиенты ИИ/LLM и агентные фреймворки
Функция Рекомендательные правила сканирования Контекст и отбор (что читать)
Управляет доступом поисковых роботов? Нет Нет
Влияет на рейтинг Google? Косвенно (блокировка обхода предотвращает индексацию) Нет
Формальный стандарт? IETF RFC 9309 Предложение сообщества (llmstxt.org)
Год появления 1994 2024
Обязательные разделы User-agent + Disallow/Allow Заголовок H1 (всё остальное необязательно)

Почему они дополняют друг друга

Слой политики обхода и необязательный слой карты ресурсов могут сосуществовать без конфликтов. Тщательно настроенное развёртывание выглядит так:

  1. Используйте robots.txt, чтобы выразить предпочтения по обходу. Если вы хотите, чтобы совместимые системы ИИ читали ваш контент, убедитесь, что случайно не заблокировали user-agent краулеров ИИ в robots.txt. Многие сайты добавили общие блокировки ботов во время споров об обучающих данных ИИ в 2023–2024 годах; проверьте правила, чтобы легитимные краулеры извлечения (в отличие от краулеров обучения, если вы хотите их различать) могли получать доступ к вашим общедоступным страницам.
  2. Используйте llms.txt для определённого совместимого клиента. Карта может предложить тщательно отобранный ярлык, но публикация не доказывает, что клиент обнаружит, прочитает или последует ей.
  3. Убедитесь, что сам llms.txt не заблокирован. Если robots.txt запрещает ботам доступ к корню, они могут не суметь загрузить /llms.txt тоже. Убедитесь, что ваш robots.txt не запрещает доступ к файлу, который вы хотите сделать доступным для AI-систем.

Часто задаваемые вопросы

Заменяет ли llms.txt robots.txt?

Нет. robots.txt публикует рекомендательные правила обхода для совместимых клиентов. llms.txt предлагает отобранную карту совместимым агентам. Используйте каждый файл только для задачи, которую он действительно решает.

Можно ли использовать llms.txt для блокировки ИИ-сканеров?

Нет. llms.txt не выполняет функции контроля доступа. Чтобы заблокировать определённых краулеров ИИ, добавьте их строки user-agent в правила Disallow файла robots.txt. Например, чтобы заблокировать GPTBot:

User-agent: GPTBot
Disallow: /

llms.txt не является документом разрешений. Его публикация не предоставляет краулерам никакого дополнительного доступа, которого у них не было раньше.

Уважают ли AI-сканеры robots.txt?

Провайдеры публикуют рекомендации по robots.txt для отдельных краулеров, но REP остаётся рекомендательным. A Disallow правило сообщает о намерении совместимым клиентам. Если содержимое нельзя загружать, защитите его аутентификацией, сетевой политикой или авторизацией на стороне сервера.

Продолжить чтение

Источники