llms.txt مقابل robots.txt وsitemap.xml وllms-full.txt

أربعة ملفات، وأربع وظائف. إليك بالضبط ما يفعله كل ملف وكيف تستخدمها معاً.

آخر تحديث:

الخلاصة

لا يمكن استبدال أحدها بالآخر. robots.txt ينشر قواعد زحف يمكن للعملاء المتوافقين تطبيقها. sitemap.xml يخبر محركات البحث بما هو موجود. llms.txt يقدّم للعملاء المتوافقين خريطة موارد منتقاة. llms-full.txt يسلّمها المحتوى الفعلي.

مصفوفة جنباً إلى جنب

Quick reference. See sections below for the nuances.
المعيار robots.txt sitemap.xml llms.txt llms-full.txt
الغرض الأساسيتعليمات الزحف للزواحف المتوافقةاكتشاف الصفحات لمحركات البحثخريطة منسّقة لعملاء نماذج اللغة الكبيرةمجموعة مضمّنة لاستيعاب نموذج اللغة الكبير
الجمهورزواحف الويب (Googlebot وBingbot وGPTBot…)محركات البحثالوكلاء والعملاء المتوافقون لنماذج اللغة الكبيرةعملاء نماذج اللغة الكبيرة الذين يحتاجون إلى المحتوى الكامل
التنسيقنص عادي، نحو REP مخصصXMLMarkdownMarkdown (مدمج)
قياسي؟نعم، IETF RFC 9309 (2022)نعم، sitemaps.orgاقتراح المجتمع، llmstxt.orgاقتراح المجتمع، llmstxt.org
مطلوب؟لا، لكن يُوصى بهلا، لكن يُوصى به للمواقع الكبيرةلالا
هل يفرض الوصول أو الفهرسة؟لا (السماح والمنع تعليمات للزواحف)لا (مجرد تلميح للاكتشاف)لالا
النهجالاستبعادالاكتشاف (كن شاملاً)التنقيح (كن انتقائياً)التضمين (توفير النص الكامل)
مسار الملف/robots.txt/sitemap.xml (أو أي عنوان URL مُعلن في robots.txt)/llms.txt أو مسار محصور مثل /docs/llms.txt/llms-full.txt

llms.txt مقابل robots.txt

robots.txt هو ملف تعليمات الزاحف موحّداً في IETF RFC 9309. فهي تستخدم قواعد بروتوكول استبعاد الروبوتات (User-agent, Disallow, Allow, Sitemap) للتعبير عن المسارات التي ينبغي للزواحف المتوافقة أو لا ينبغي لها جلبها. ولا يفرض الوصول وليس طبقة تفويض.

llms.txt هو النية المعاكسة: قائمة توصيات إيجابية. وهي لا تمنع أحداً ولا تمنح وصولاً ولا تؤثر في جلب زاحف لأي شيء آخر على موقعك. إنها تقول فقط: إذا كنت عميل نموذج لغة كبير، فهذه هي المجموعة عالية الجودة.

الأثر العملي: واصل استخدام robots.txt لتفضيلات الزحف واكتشاف خريطة الموقع. استخدم المصادقة أو ضوابط الشبكة لفرض قيود فعلية على الوصول. أضف llms.txt بوصفه مكملاً فقط عندما يكون له جمهور وغرض تتم صيانتهما.

llms.txt مقابل sitemap.xml

sitemap.xml يهدف إلى الشمول: فهو يسرد كل عنوان URL تريد أن يعرفه محرك البحث، إلى جانب البيانات الوصفية (lastmod, priority, اللغات البديلة). وهو XML مخصص للآلة، وغالباً ما يُنشأ تلقائياً.

llms.txt يهدف إلى التنقيح: قائمة Markdown صغيرة بالصفحات التي ينبغي لنموذج اللغة الكبير قراءتها أولاً. وهي لا تستبدل خريطة موقعك. ونادراً ما تضم أكثر من بضع عشرات من عناوين URL، بينما قد تسرد خريطة موقع في موقع كثيف المحتوى مئات الآلاف.

فكّر في sitemap.xml كدليل و llms.txt كرفّ للقراءة الموصى بها منسّق بواسطة أمين مكتبة.

llms.txt مقابل llms-full.txt

العائلة نفسها، والدور مختلف:

  • llms.txt هو خريطة: قائمة روابط معنونة.
  • llms-full.txt هو النطاق: المحتوى الفعلي لتلك الصفحات وغيرها، مضمّناً بصيغة Markdown في ملف واحد.

الـ llms-full.txt عمّمت Mintlify الاتفاقية بالتعاون مع Anthropic. ويمكنها منح مطوّر أو أداة عنوان URL واحداً لمجموعة وثائق موحدة. ويجب موازنة هذه الراحة مع الحداثة والحجم والتعرض لحقن المطالبات.

انشر llms.txt عندما تحل خريطة منسّقة مهمة حقيقية. أضف llms-full.txt فقط عندما يكون الاستيعاب النصي الجماعي مطلباً صريحاً.

llms.txt مقابل schema.org / JSON-LD

Schema.org مفردات لوصف معنى الصفحات الفردية في JSON-LD أو microdata. وتستخدم محركات البحث والبرامج الأخرى ذلك لاستخراج حقائق منظمة: سعر المنتج ومكونات الوصفة وأسئلة FAQ وإجاباتها.

llms.txt يعمل على مستوى أعلى بدرجة واحدة: إنه خريطة على مستوى الموقع، وليس إثراءً لكل صفحة. ويكمّل أحدهما الآخر. وتخبر Schema.org نموذج اللغة الكبير بماهية الصفحة هو; llms.txt يخبره بالصفحات التي ينبغي النظر إليها أولاً.

كيفية دمجهما

  1. انشر كلاهما robots.txt و sitemap.xml كما تفعل بالفعل لتحسين SEO.
  2. أضف ملفاً جذرياً أو محصوراً بالمسار llms.txt لعميل متوافق محدد.
  3. أضف اختيارياً llms-full.txt إذا كان موقعك غنياً بالتوثيق أو المعرفة.
  4. في robots.txt، واترك /llms.txt و /llms-full.txt متاحاً (لا Disallow لهم).
  5. أبقِ schema.org صيغة في صفحات فردية حيث تكون مناسبة (Product وFAQ وArticle…).

Next

المصادر