Объяснение ИИ-краулеров: намерения, факты и llms.txt
Чтобы классифицировать краулера ИИ, недостаточно прочитать его имя. Заявленная оператором цель, техническая идентичность и ваши собственные логи отвечают на разные вопросы.
Последнее обновление:
Имени поискового робота недостаточно, чтобы установить его назначение
Важны вопросы о том, какое поведение бота заявляет оператор, как бот подтверждает свою личность, и что показывают ваши собственные доказательства. Метка "бот ИИ" охватывает несколько видов активности.
Таксономия проверенных ботов Cloudflare показывает весь диапазон: Search, Agent, Training, Transact, Data Collection, Security Testing, SEO, Ads Verification, Social или Link Preview, Feed Fetching и Monitoring или Operations. Бот может заявлять более одного типа поведения.
Эти категории помогают организовать политику. Они не доказывают, что один запрос привёл к цитированию, обучил модель или завершил транзакцию.
Что может доказать запрос к llms.txt
Успешный запрос к /llms.txt может установить короткий список серверных фактов: запрос
дошел до сервера, содержал записанный user-agent, был направлен на этот URL, а сервер вернул зафиксированный
статус в зафиксированное время.
Эта запись журнала не подтверждает, что клиент:
- правильно разобрал файл;
- следовал по каждой ссылке;
- предпочёл файл HTML или структурированным данным;
- использовали содержимое для извлечения или обучения;
- упомянул сайт в ответе;
- изменило рейтинг страницы или товара.
Рассматривайте доказательства как лестницу: fetched, parsed при независимом
подтверждении,
used при независимом подтверждении, затем cited или
converted если целевая система это измеряет. Пропуск шага превращает техническое наблюдение
в неподтверждённое утверждение.
Почему различия на уровне намерения важны
OpenAI документирует отдельные user-agent для поиска, обучения моделей, действий по инициативе
пользователя и проверки рекламы. OAI-SearchBot поддерживает поиск ChatGPT. GPTBot
охватывает содержимое, которое может использоваться для обучения базовых моделей. ChatGPT-User выполняет определённые действия по запросу пользователя и не является автоматическим поисковым роботом.
OAI-AdsBot посещает только страницы, отправленные как реклама. OpenAI сообщает, что данные,
собранные этим ботом, не используются для обучения базовых моделей. Поэтому проверка рекламы преследует
другую цель, чем видимость в поиске или обучение.
Эти роли всё ещё не доказывают, что какой-либо бот OpenAI использует llms.txt. Файл
полезен только там, где клиент решает его прочитать.
Где используется llms.txt
llms.txt может дать краткую карту полезных страниц, выбранных владельцем. Это не заменяет
HTML, sitemap, ленты, API, структурированные данные, каталоги платформ или директивы краулеров в
robots.txt. У каждой поверхности своя роль.
Shopify — полезный пример. Его витрины могут публиковать файлы обнаружения для агентов, а Shopify Catalog отдельно содержит структурированные сведения о товарах. Наличие любой из этих поверхностей не гарантирует, что канал покажет товар или поднимет его в рейтинге.
Опубликовать llms.txt для клиентов, поддерживающих это соглашение, а затем проверяйте
только то, что подтверждают ваши данные. Доступность файла не доказывает его использование, а использование
не доказывает цитирование.
Продолжить чтение
- Поисковые роботы ИИ, полный справочник, каноническая техническая справка по user-agent и средствам управления.
- llms.txt и robots.txt, различие между руководством по обнаружению и управлением краулером.
- Как измерять влияние llms.txt, метод чтения журналов краулеров без заявлений, выходящих за пределы показанного.