/ llmtxt.info

llms.txt vs robots.txt, sitemap.xml y llms-full.txt

Cuatro archivos, cuatro trabajos distintos. Qué hace cada uno y cómo usarlos juntos.

Última actualización:

En resumen

No son intercambiables. robots.txt dice a los rastreadores a qué pueden acceder. sitemap.xml dice a los buscadores qué existe. llms.txt dice a los asistentes de IA qué merece la pena leer. llms-full.txt les entrega el contenido en sí.

Matriz comparativa

Referencia rápida. Los matices están en las secciones siguientes.
Criteriorobots.txtsitemap.xmlllms.txtllms-full.txt
Propósito principalControl de acceso para rastreadoresDescubrimiento de páginas para buscadoresMapa curado para clientes LLMCorpus en línea para ingesta por LLM
PúblicoRastreadores web (Googlebot, Bingbot, GPTBot…)BuscadoresClientes LLM y asistentesClientes LLM que necesitan el contenido completo
FormatoTexto plano, gramática REPXMLMarkdownMarkdown (concatenado)
¿Es un estándar?Sí, IETF RFC 9309 (2022)Sí, sitemaps.orgPropuesta comunitaria, llmstxt.orgPropuesta comunitaria, llmstxt.org
¿Obligatorio?No, pero recomendadoNo, pero recomendado en sitios grandesNoNo
¿Controla la indexación?Sí (allow / disallow)No (solo sugerencia de descubrimiento)NoNo
EnfoqueExclusiónDescubrimiento (ser exhaustivo)Curación (ser selectivo)Incorporación (dar el texto completo)
Ruta del archivo/robots.txt/sitemap.xml (o la URL declarada en robots.txt)/llms.txt/llms-full.txt

llms.txt vs robots.txt

robots.txt es un archivo de control de acceso, estandarizado como IETF RFC 9309. Usa la gramática del Robots Exclusion Protocol (User-agent, Disallow, Allow, Sitemap) para indicar a los rastreadores qué rutas pueden recuperar.

llms.txt tiene la intención opuesta: es una lista de recomendación en positivo. No bloquea a nadie, no concede acceso y no influye en si un rastreador recupera cualquier otra cosa de tu web. Solo dice: si eres un cliente LLM, este es el subconjunto de más valor.

Consecuencia práctica: sigue usando robots.txt para lo que sirve (bloquear bots costosos, declarar dónde está tu sitemap). Añade llms.txt como complemento, nunca como sustituto.

llms.txt vs sitemap.xml

sitemap.xml busca la exhaustividad: lista cada URL que quieres que un buscador conozca, con metadatos (lastmod, priority, idiomas alternativos). Es XML, solo para máquinas, y suele generarse automáticamente.

llms.txt busca la curación: una lista breve en Markdown de las páginas que un LLM debería leer primero. No sustituye a tu sitemap. Rara vez pasa de unas pocas decenas de URLs, mientras que un sitemap de un sitio con mucho contenido puede listar cientos de miles.

Piensa en sitemap.xml como el catálogo, y en llms.txt como la lista de lecturas recomendadas de un bibliotecario.

llms.txt vs llms-full.txt

Misma familia, papel distinto:

  • llms.txt es el mapa: una lista de enlaces con título.
  • llms-full.txt es el territorio: el contenido real de esas páginas (y de otras), concatenado como Markdown en un solo archivo.

La convención llms-full.txt la popularizó Mintlify junto con Anthropic. Permite a una persona desarrolladora pegar una única URL en un chat de IA y cargar un corpus de documentación entero como contexto.

Regla práctica: publica siempre llms.txt; añade llms-full.txt cuando tu contenido sea principalmente textual y se beneficie de cargarse en bloque.

llms.txt vs schema.org / JSON-LD

Schema.org es un vocabulario para marcar el significado de páginas concretas en JSON-LD o microdatos. Buscadores y asistentes lo usan para extraer hechos estructurados: el precio de un producto, los ingredientes de una receta, las preguntas de un FAQ.

llms.txt opera un nivel por encima: es un mapa de todo el sitio, no un enriquecimiento por página. Se complementan. Schema.org le dice a un LLM qué es una página; llms.txt le dice qué páginas mirar primero.

Cómo combinarlos

  1. Publica robots.txt y sitemap.xml como siempre, para SEO.
  2. Añade llms.txt en la raíz para clientes de IA.
  3. Añade llms-full.txt de forma opcional si tu sitio es intensivo en documentación o conocimiento.
  4. En robots.txt, deja accesibles /llms.txt y /llms-full.txt: no los bloquees con Disallow.
  5. Mantén el marcado schema.org en las páginas donde tenga sentido (Product, FAQ, Article…).

Seguir leyendo

Fuentes