llms.txt и robots.txt, sitemap.xml и llms-full.txt

Четыре файла, четыре задачи. Вот что именно делает каждый из них и как использовать их вместе.

Последнее обновление:

Кратко

Они не взаимозаменяемы. robots.txt публикует правила обхода, которые совместимые клиенты могут применять. sitemap.xml сообщает поисковым системам, что существует. llms.txt предоставляет совместимым клиентам карту отобранных ресурсов. llms-full.txt передаёт им фактическое содержимое.

Матрица бок о бок

Quick reference. See sections below for the nuances.
Критерий robots.txt sitemap.xml llms.txt llms-full.txt
Основное назначениеИнструкции по сканированию для соблюдающих правила краулеровОбнаружение страниц поисковыми системамиОтобранная карта для клиентов LLMВстроенный корпус для загрузки в LLM
АудиторияВеб-краулеры (Googlebot, Bingbot, GPTBot…)Поисковые системыСовместимые агенты и клиенты LLMКлиенты LLM, которым нужен полный контент
ФорматОбычный текст, пользовательская грамматика REPXMLMarkdownMarkdown (объединённый)
Стандарт?Да, IETF RFC 9309 (2022)Да, sitemaps.orgПредложение сообщества, llmstxt.orgПредложение сообщества, llmstxt.org
Обязательно?Нет, но рекомендуетсяНет, но рекомендуется для крупных сайтовНетНет
Ограничивает доступ или индексацию?Нет (allow / disallow — это инструкции для краулеров)Нет (только подсказка для обнаружения)НетНет
ПодходИсключениеОбнаружение (ищите исчерпывающе)Отбор (будьте избирательны)Встраивание (передать полный текст)
Путь к файлу/robots.txt/sitemap.xml (или любой URL, объявленный в robots.txt)/llms.txt или ограниченный путь, например /docs/llms.txt/llms-full.txt

llms.txt и robots.txt

robots.txt — это файл инструкций для поискового робота стандартизировано как IETF RFC 9309. Он использует грамматику протокола исключения роботов (User-agent, Disallow, Allow, Sitemap) для указания путей, которые совместимые сканеры должны или не должны получать. Он не обеспечивает соблюдение правил доступа и не является уровнем авторизации.

llms.txt — это противоположное намерение: список положительных рекомендаций. Он никого не блокирует, не предоставляет доступ и не влияет на то, получает ли краулер что-либо ещё на вашем сайте. Он лишь говорит: если вы клиент LLM, вот качественная выборка.

Практический вывод: продолжайте использовать robots.txt для настроек обхода и обнаружения карты сайта. Для фактических ограничений доступа используйте аутентификацию или сетевые средства управления. Добавьте llms.txt только как дополнение, если у него есть поддерживаемая аудитория и назначение.

llms.txt и sitemap.xml: сравнение

sitemap.xml стремится к полнота: он перечисляет каждый URL, о котором вы хотите сообщить поисковой системе, а также метаданные (lastmod, priority, альтернативные языки). Это XML, предназначенный только для машин и часто создаваемый автоматически.

llms.txt стремится к отбор: небольшой список Markdown со страницами, которые LLM должна прочитать сначала. Он не заменяет карту сайта. В нём редко бывает больше нескольких десятков URL, тогда как карта сайта насыщенного контентом сайта может содержать сотни тысяч.

Представьте себе sitemap.xml как каталог и llms.txt как полку рекомендованного чтения, составленную библиотекарем.

llms.txt и llms-full.txt

Одна семья, разные роли:

  • llms.txt — это карта: список ссылок с названиями.
  • llms-full.txt — это территория: фактическое содержимое этих и других страниц, объединённое в Markdown в один файл.

llms-full.txt соглашение стало популярным благодаря Mintlify в сотрудничестве с Anthropic. Оно может дать разработчику или инструменту один URL для объединённого корпуса документации. Это удобство следует сопоставлять со свежестью, размером и риском prompt injection.

Опубликовать llms.txt когда отобранная карта решает реальную задачу. Добавьте llms-full.txt только когда массовое текстовое поглощение является явным требованием.

llms.txt и schema.org / JSON-LD

Schema.org — это словарь для разметки смысла отдельные страницы в JSON-LD или microdata. Поисковые системы и другое ПО используют это для извлечения структурированных фактов: цены продукта’, ингредиентов рецепта’, вопросов и ответов FAQ’.

llms.txt работает на уровень выше: это карта всего сайта, а не обогащение каждой страницы. Эти два механизма дополняют друг друга. Schema.org сообщает LLM, что представляет собой страница является; llms.txt сообщает ему, какие страницы просматривать в первую очередь.

Как объединить их

  1. Публикуйте оба robots.txt и sitemap.xml как вы уже делаете для SEO.
  2. Добавьте корневой файл или файл для конкретного пути llms.txt для определённого совместимого клиента.
  3. При необходимости добавьте llms-full.txt если ваш сайт посвящён документации или содержит много знаний.
  4. В robots.txt, оставьте /llms.txt и /llms-full.txt доступной (не Disallow их).
  5. Сохраняйте schema.org разметку на отдельных страницах, где это уместно (Product, FAQ, Article…).

Далее

Источники