llms.txt и robots.txt, sitemap.xml и llms-full.txt
Четыре файла, четыре задачи. Вот что именно делает каждый из них и как использовать их вместе.
Последнее обновление:
Кратко
Они не взаимозаменяемы.
robots.txt публикует правила обхода, которые совместимые клиенты могут
применять.
sitemap.xml сообщает поисковым системам, что существует.
llms.txt предоставляет совместимым клиентам карту отобранных ресурсов.
llms-full.txt передаёт им фактическое содержимое.
Матрица бок о бок
| Критерий | robots.txt | sitemap.xml | llms.txt | llms-full.txt |
|---|---|---|---|---|
| Основное назначение | Инструкции по сканированию для соблюдающих правила краулеров | Обнаружение страниц поисковыми системами | Отобранная карта для клиентов LLM | Встроенный корпус для загрузки в LLM |
| Аудитория | Веб-краулеры (Googlebot, Bingbot, GPTBot…) | Поисковые системы | Совместимые агенты и клиенты LLM | Клиенты LLM, которым нужен полный контент |
| Формат | Обычный текст, пользовательская грамматика REP | XML | Markdown | Markdown (объединённый) |
| Стандарт? | Да, IETF RFC 9309 (2022) | Да, sitemaps.org | Предложение сообщества, llmstxt.org | Предложение сообщества, llmstxt.org |
| Обязательно? | Нет, но рекомендуется | Нет, но рекомендуется для крупных сайтов | Нет | Нет |
| Ограничивает доступ или индексацию? | Нет (allow / disallow — это инструкции для краулеров) | Нет (только подсказка для обнаружения) | Нет | Нет |
| Подход | Исключение | Обнаружение (ищите исчерпывающе) | Отбор (будьте избирательны) | Встраивание (передать полный текст) |
| Путь к файлу | /robots.txt | /sitemap.xml (или любой URL, объявленный в robots.txt) | /llms.txt или ограниченный путь, например /docs/llms.txt | /llms-full.txt |
llms.txt и robots.txt
robots.txt — это файл инструкций для поискового робота
стандартизировано как IETF RFC 9309. Он использует грамматику протокола исключения роботов (User-agent,
Disallow, Allow, Sitemap) для указания путей, которые
совместимые сканеры должны или не должны получать. Он не обеспечивает соблюдение правил доступа
и не является уровнем авторизации.
llms.txt — это противоположное намерение: список положительных
рекомендаций. Он никого не блокирует, не предоставляет доступ и не влияет на то, получает ли
краулер что-либо ещё на вашем сайте. Он лишь говорит: если вы клиент LLM, вот качественная
выборка.
Практический вывод: продолжайте использовать robots.txt для настроек обхода и обнаружения
карты сайта. Для фактических ограничений доступа используйте аутентификацию или сетевые средства управления.
Добавьте
llms.txt только как дополнение, если у него есть поддерживаемая аудитория и назначение.
llms.txt и sitemap.xml: сравнение
sitemap.xml стремится к полнота: он перечисляет каждый URL, о
котором вы хотите сообщить поисковой системе, а также метаданные (lastmod, priority, альтернативные языки). Это XML, предназначенный только для машин и часто создаваемый
автоматически.
llms.txt стремится к отбор: небольшой список Markdown со
страницами, которые LLM должна прочитать сначала. Он не заменяет карту сайта. В нём редко бывает
больше нескольких десятков URL, тогда как карта сайта насыщенного контентом сайта может
содержать сотни тысяч.
Представьте себе sitemap.xml как каталог и llms.txt
как полку рекомендованного чтения, составленную библиотекарем.
llms.txt и llms-full.txt
Одна семья, разные роли:
-
llms.txt— это карта: список ссылок с названиями. -
llms-full.txt— это территория: фактическое содержимое этих и других страниц, объединённое в Markdown в один файл.
llms-full.txt соглашение стало популярным благодаря Mintlify в сотрудничестве с Anthropic.
Оно может дать разработчику или инструменту один URL для объединённого корпуса документации. Это удобство
следует сопоставлять со свежестью, размером и риском prompt injection.
Опубликовать llms.txt когда отобранная карта решает реальную задачу. Добавьте llms-full.txt
только когда массовое текстовое поглощение является явным требованием.
llms.txt и schema.org / JSON-LD
Schema.org — это словарь для разметки смысла отдельные страницы в JSON-LD или microdata. Поисковые системы и другое ПО используют это для извлечения структурированных фактов: цены продукта’, ингредиентов рецепта’, вопросов и ответов FAQ’.
llms.txt работает на уровень выше: это
карта всего сайта, а не обогащение каждой страницы. Эти два механизма дополняют
друг друга. Schema.org сообщает LLM, что представляет собой страница является;
llms.txt сообщает ему, какие страницы просматривать в первую очередь.
Как объединить их
-
Публикуйте оба
robots.txtиsitemap.xmlкак вы уже делаете для SEO. -
Добавьте корневой файл или файл для конкретного пути
llms.txtдля определённого совместимого клиента. -
При необходимости добавьте
llms-full.txtесли ваш сайт посвящён документации или содержит много знаний. -
В
robots.txt, оставьте/llms.txtи/llms-full.txtдоступной (неDisallowих). - Сохраняйте schema.org разметку на отдельных страницах, где это уместно (Product, FAQ, Article…).
Далее
- Как работает llms.txt, подробное описание спецификации.
- Лучшие практики.
- FAQ.