Публикация не равна использованию: как правильно читать исследования llms.txt
Три общедоступных набора данных llms.txt сообщают о показателях внедрения, которые кажутся несовместимыми. Это не так. Каждый использует другую выборку, и только один также измеряет, загружали ли клиенты файлы.
Последнее обновление:
Три числа, которые выглядят противоречивыми
Если вы изучали свидетельства об llms.txt, то видели показатели внедрения 10.13%, 28% и 51.8%, зафиксированные за несколько месяцев. Последняя цифра получена из снимка панели «фиксированная выборка сайтов», датированного 3 08.2026.
Все эти числа обоснованны. Они отвечают на три разных вопроса, а разногласие полностью объясняется рамкой выборки. Разобраться в этом стоит один раз, поскольку это также объясняет, почему на вопрос «использует ли кто-нибудь llms.txt» нельзя ответить одним показателем внедрения.
Что именно измерял каждый из них
SE Ranking, примерно 300,000 доменов. В их исследовании сообщается, что llms.txt есть у 10.13% доменов из их набора данных, и не обнаруживается связи между наличием файла и частотой цитирования домена в ответах крупных LLM. После исключения llms.txt как переменной из предсказательной модели AI-цитирования точность модели улучшилась. Среди 50 доменов, которые чаще всего цитировались AI, файл был только у одного.
Ahrefs, 137,210 доменов. В их исследовании сообщается о 28% , полученных по доменам, использующим Ahrefs Web Analytics и получавшим трафик в 05.2026. Они прямо отмечают, что эта совокупность более техническая и лучше знакома с SEO, чем веб в целом, поэтому показатель следует считать верхней границей . Также они отмечают, что не проверяли соответствие файлов спецификации.
Наша панель, 219 выбранных хостов. Панель внедрения llmtxt.info еженедельно загружает и разбирает /llms.txt по фиксированному списку, намеренно смещённому в сторону платформ документации и инструментов разработчиков. 3 08.2026 113 из 218 доступных хостов отдавали соответствующий файл, то есть 51.8% . Это продольное измерение выбранной когорты, а не оценка веба.
Если поставить эти данные рядом, порядок будет ровно таким, как ожидается: широкий обход общего веба, затем технически смещённая аналитическая совокупность, затем вручную отобранный список отрасли, где возникло это соглашение. Чем тщательнее отобрана выборка, тем выше числа. Это согласованная картина, а не противоречие.
Важное различие
Вот чего показатели внедрения не показывают.
SE Ranking измерил публикацию и её корреляцию с цитированием . Ahrefs измерил публикацию, а затем отдельно серверные журналы , охватив каждый запрос к /llms.txt в своей совокупности и классифицировав его по User-Agent.
Второе измерение даёт число, которого не даёт обход внедрения: из примерно 38,000 принятых Ahrefs файлов 97% не получили запросов в 05.2026 ни от клиента, бота или человека. Ahrefs проверяли HTTP 200, Markdown вместо HTML и распространённые сигналы ошибок, но не проверяли полное соответствие предложению.
Таким образом, два крупных исследования дополняют, а не опровергают друг друга:
- Файл публикуют от 10% до 28% сайтов, в зависимости от совокупности.
- Из опубликованных файлов что-либо загружает примерно 3%.
- Из всех загрузок 19.5% приходится на именованные AI-боты, а 1.1% — именно на AI-боты извлечения.
Если учесть и это, доля опубликованных файлов, загружаемых AI-сканером поиска в конкретном месяце, настолько мала, что честнее назвать это редкостью, чем указывать процент.
Ничто из этого не означает, что файл бесполезен; аргументы за и против изложены в материале преимущества и ограничения. Это означает, что «X% сайтов внедрили его» не является свидетельством использования и не должно цитироваться так, будто является им.
Как читать следующий пункт
Будут и другие исследования. Четыре вопроса отделяют полезные из них.
Что является рамкой выборки? «Домены в нашем аналитическом продукте» и «домены в общем веб-сканировании» — разные совокупности. Число без рамки не является числом.
Публикация или потребление? Проверка того, что /llms.txt возвращает 200, дёшева и сообщает о предложении. Чтение журналов сервера сообщает о спросе. Почти каждое опубликованное на сегодня число относится к предложению.
Загружен или прочитан? У данных журналов тоже есть проблема верхней границы, которую Ahrefs прямо отмечают: запрос доказывает получение байтов, а не использование их моделью. Каждый показатель потребления — верхняя граница реального потребления.
Проверялась ли корректность? Ahrefs не проверяли свои файлы на соответствие спецификации и прямо это сказали. Файл, возвращающий 200, но не разбираемый парсером, в большинстве методик засчитывается как внедрение. Наш валидатор отчасти создан потому, что в сводной статистике этот пробел невидим.
Если вы хотите узнать, что происходит на вашем сайте, а не в совокупности, ответ находится в журналах доступа, отфильтрованных по /llms.txt. Это меньший и гораздо более полезный для решений набор данных, чем любой из трёх приведённых выше; как сказано в материале ни один AI-агент не ищет ваш llms.txt, в основном он измеряет, сообщил ли кто-то агенту о существовании файла.