Публикация не равна использованию: как правильно читать исследования llms.txt

Три общедоступных набора данных llms.txt сообщают о показателях внедрения, которые кажутся несовместимыми. Это не так. Каждый использует другую выборку, и только один также измеряет, загружали ли клиенты файлы.

Последнее обновление:

Три числа, которые выглядят противоречивыми

Если вы изучали свидетельства об llms.txt, то видели показатели внедрения 10.13%, 28% и 51.8%, зафиксированные за несколько месяцев. Последняя цифра получена из снимка панели «фиксированная выборка сайтов», датированного 3 08.2026.

Все эти числа обоснованны. Они отвечают на три разных вопроса, а разногласие полностью объясняется рамкой выборки. Разобраться в этом стоит один раз, поскольку это также объясняет, почему на вопрос «использует ли кто-нибудь llms.txt» нельзя ответить одним показателем внедрения.

Что именно измерял каждый из них

SE Ranking, примерно 300,000 доменов. В их исследовании сообщается, что llms.txt есть у 10.13% доменов из их набора данных, и не обнаруживается связи между наличием файла и частотой цитирования домена в ответах крупных LLM. После исключения llms.txt как переменной из предсказательной модели AI-цитирования точность модели улучшилась. Среди 50 доменов, которые чаще всего цитировались AI, файл был только у одного.

Ahrefs, 137,210 доменов. В их исследовании сообщается о 28% , полученных по доменам, использующим Ahrefs Web Analytics и получавшим трафик в 05.2026. Они прямо отмечают, что эта совокупность более техническая и лучше знакома с SEO, чем веб в целом, поэтому показатель следует считать верхней границей . Также они отмечают, что не проверяли соответствие файлов спецификации.

Наша панель, 219 выбранных хостов. Панель внедрения llmtxt.info еженедельно загружает и разбирает /llms.txt по фиксированному списку, намеренно смещённому в сторону платформ документации и инструментов разработчиков. 3 08.2026 113 из 218 доступных хостов отдавали соответствующий файл, то есть 51.8% . Это продольное измерение выбранной когорты, а не оценка веба.

Если поставить эти данные рядом, порядок будет ровно таким, как ожидается: широкий обход общего веба, затем технически смещённая аналитическая совокупность, затем вручную отобранный список отрасли, где возникло это соглашение. Чем тщательнее отобрана выборка, тем выше числа. Это согласованная картина, а не противоречие.

Важное различие

Вот чего показатели внедрения не показывают.

SE Ranking измерил публикацию и её корреляцию с цитированием . Ahrefs измерил публикацию, а затем отдельно серверные журналы , охватив каждый запрос к /llms.txt в своей совокупности и классифицировав его по User-Agent.

Второе измерение даёт число, которого не даёт обход внедрения: из примерно 38,000 принятых Ahrefs файлов 97% не получили запросов в 05.2026 ни от клиента, бота или человека. Ahrefs проверяли HTTP 200, Markdown вместо HTML и распространённые сигналы ошибок, но не проверяли полное соответствие предложению.

Таким образом, два крупных исследования дополняют, а не опровергают друг друга:

  • Файл публикуют от 10% до 28% сайтов, в зависимости от совокупности.
  • Из опубликованных файлов что-либо загружает примерно 3%.
  • Из всех загрузок 19.5% приходится на именованные AI-боты, а 1.1% — именно на AI-боты извлечения.

Если учесть и это, доля опубликованных файлов, загружаемых AI-сканером поиска в конкретном месяце, настолько мала, что честнее назвать это редкостью, чем указывать процент.

Ничто из этого не означает, что файл бесполезен; аргументы за и против изложены в материале преимущества и ограничения. Это означает, что «X% сайтов внедрили его» не является свидетельством использования и не должно цитироваться так, будто является им.

Как читать следующий пункт

Будут и другие исследования. Четыре вопроса отделяют полезные из них.

Что является рамкой выборки? «Домены в нашем аналитическом продукте» и «домены в общем веб-сканировании» — разные совокупности. Число без рамки не является числом.

Публикация или потребление? Проверка того, что /llms.txt возвращает 200, дёшева и сообщает о предложении. Чтение журналов сервера сообщает о спросе. Почти каждое опубликованное на сегодня число относится к предложению.

Загружен или прочитан? У данных журналов тоже есть проблема верхней границы, которую Ahrefs прямо отмечают: запрос доказывает получение байтов, а не использование их моделью. Каждый показатель потребления — верхняя граница реального потребления.

Проверялась ли корректность? Ahrefs не проверяли свои файлы на соответствие спецификации и прямо это сказали. Файл, возвращающий 200, но не разбираемый парсером, в большинстве методик засчитывается как внедрение. Наш валидатор отчасти создан потому, что в сводной статистике этот пробел невидим.

Если вы хотите узнать, что происходит на вашем сайте, а не в совокупности, ответ находится в журналах доступа, отфильтрованных по /llms.txt. Это меньший и гораздо более полезный для решений набор данных, чем любой из трёх приведённых выше; как сказано в материале ни один AI-агент не ищет ваш llms.txt, в основном он измеряет, сообщил ли кто-то агенту о существовании файла.

Источники