GEO Rankings
← Blog
Publicado

Qué es llms.txt (el robots.txt para los modelos de lenguaje), cómo funciona y si realmente genera citas de IA

llms.txt es un archivo Markdown en la raíz de tu sitio que guía a los crawlers de IA hacia tu mejor contenido. Elimina una fricción técnica. Por sí solo, no produce citas.

En resumen

llms.txt es un archivo Markdown en texto plano situado en la raíz de tu sitio que indica a los crawlers de IA y a los pipelines RAG qué URLs representan tu mejor contenido. Elimina una fricción técnica. Por sí solo, no produce citas: un análisis del Wix AI Search Lab sobre 586 archivos llms.txt indexados encontró que casi el 6% posicionaba para keywords orgánicas, una cifra que muestra adopción sin garantías de citación.

Última actualización: agosto de 2026. Actualizado con datos de adopción y posicionamiento orgánico del Wix AI Search Lab y con cifras de adopción actuales hasta mediados de 2025.


La respuesta en un párrafo que los motores citarán


Lo que llms.txt no es

Antes de continuar, aclaremos tres confusiones frecuentes.

ArchivoQué haceQuién lo lee¿Bloquea acceso?
robots.txtPermite o bloquea que los crawlers accedan a las URLsTodos los crawlers, bots de búsqueda
sitemap.xmlLista todas las URLs del sitio para que los crawlers las descubranMotores de búsquedaNo
llms.txtSelecciona tus URLs más importantes con contexto legible por humanosCrawlers de IA, pipelines RAG, indexadores de LLMNo
llms-full.txtIgual que llms.txt pero incluye el texto completo de las páginas para procesamiento sin conexiónSistemas de IA que procesan sin hacer fetchNo

llms.txt no bloquea nada. Un crawler que quiera acceder a tu sitio sigue necesitando el permiso de robots.txt. llms.txt es puramente curatorial: dice “si nos estás indexando, empieza aquí y trata estas páginas como las más representativas”.

llms.txt no reemplaza un sitemap. Un sitemap indica a los crawlers qué existe. llms.txt indica a los sistemas de IA qué importa más. Ambos pueden y deben coexistir.

llms.txt no es un tipo de schema. No tiene ninguna relación con los datos estructurados JSON-LD. Añadirlo no replica los efectos del schema FAQ, Article o HowTo. Esos operan a nivel de página dentro del HTML; llms.txt opera a nivel de sitio como un archivo separado.


Cómo funciona llms.txt en la práctica

El mecanismo es sencillo. Cuando un crawler de IA (o un pipeline RAG que construye una base de conocimiento a partir de la web) visita tu dominio, puede comprobar /llms.txt de la misma manera que un bot de búsqueda comprueba /robots.txt. Si el archivo existe, el crawler obtiene una lista curada y legible de tus páginas canónicas con resúmenes cortos.

Un llms.txt mínimo tiene este aspecto:

# Acme Co

> Software de productividad con IA para equipos legales

## Documentación principal
- [Cómo configurar el seguimiento de expedientes](https://acme.co/docs/matter-tracking): Guía de configuración paso a paso para nuevos usuarios.
- [Precios](https://acme.co/pricing): Planes actuales y comparativa de funcionalidades.

## Blog
- [Por qué la IA legal falla sin el contexto del expediente](https://acme.co/blog/matter-context): Análisis del modo de fallo más común en los asistentes de IA legal.

El H1 es el nombre de tu marca o sitio. Una cita en bloque da contexto sobre lo que hace el sitio. Las secciones usan encabezados H2 para agrupar páginas relacionadas. Cada línea es un enlace Markdown seguido de dos puntos y una descripción de una frase.

La variante extendida, llms-full.txt, incluye el texto completo de cada página listada. Es útil cuando los sistemas de IA procesan archivos en batch sin hacer fetch de cada URL individualmente, algo que ocurre en algunos flujos de construcción de pipelines RAG sin conexión.

Lo que el archivo no controla: qué páginas tuyas ya tiene un modelo de lenguaje en sus datos de entrenamiento, cómo pondera el modelo tu contenido frente al de la competencia, o si el modelo te cita en absoluto. Esas decisiones se toman en el momento de la recuperación y la generación, impulsadas por la calidad del contenido, la autoridad de la fuente y la relevancia de la consulta.


La comparación con robots.txt, hecha con precisión

La etiqueta “el robots.txt para los modelos de lenguaje” es intuitiva pero imprecisa. Esta es la comparación precisa:

robots.txt usa una sintaxis de directivas Allow/Disallow que se espera que los crawlers respeten como control de acceso. Es legible por máquinas y agnóstico respecto al crawler. Violarlo se considera un incumplimiento de los términos de servicio para la mayoría de los crawlers.

llms.txt usa Markdown legible por humanos sin ningún mecanismo de cumplimiento. Es de carácter orientativo, no directivo. Un crawler de IA puede optar por ignorarlo por completo sin consecuencias técnicas ni legales. Está más cerca en espíritu de un sitemap (que los crawlers son libres de usar o ignorar) que de robots.txt (que se espera que los crawlers obedezcan).

La implicación práctica: llms.txt funciona cuando el crawler de IA o el operador del pipeline ha elegido respetarlo. Los principales proveedores de LLM no se han comprometido de forma uniforme a respetarlo. Es más útil de forma fiable para los operadores de pipelines RAG (empresas que construyen bases de conocimiento privadas a partir de contenido web) que quieren activamente una lista de URLs limpia y curada, y para los crawlers construidos específicamente para la indexación de IA que han optado por seguir la convención.


La verificación de la realidad sobre la adopción

La especificación de llms.txt fue propuesta por Jeremy Howard en septiembre de 2024. En pocos meses, el archivo tenía un directorio comunitario dedicado y una lista creciente de adoptantes.

El Wix AI Search Lab realizó el análisis de adopción más citado: una revisión masiva de 586 archivos llms.txt indexados en otoño de 2025 encontró que casi el 6% de esas páginas posicionaba para keywords orgánicas. Se trata de un estudio de un solo proveedor con una muestra pequeña, y no mide las tasas de citación de forma directa. Lo que sí muestra: la adopción de llms.txt y una fuerte visibilidad orgánica o de IA no van necesariamente de la mano.

La lectura honesta: la mayoría de los sitios que han adoptado llms.txt son herramientas para desarrolladores, sitios de documentación y empresas SaaS que adoptan tecnología tempranamente. El mercado general no se ha movido todavía. Eso convierte la adopción temprana en una señal técnica con poca competencia, no en una garantía de citación.


¿Genera realmente citas de IA?

La respuesta directa es no, no por sí solo. Aquí está la razón, y qué es lo que sí lo hace.

Las decisiones de citación de IA ocurren en el momento de la recuperación, no en el de la indexación. Un modelo de lenguaje o pipeline RAG no te cita porque hayas registrado una lista ordenada de URLs en /llms.txt. Te cita porque:

  1. Tu contenido es accesible para los crawlers de IA (robots.txt no les bloquea).
  2. Tu página responde la consulta de forma más directa que las páginas de la competencia.
  3. Tu dominio tiene suficiente autoridad de terceros para que la capa de recuperación confíe en él.
  4. Tu contenido aparece suficientemente pronto en la página (según el análisis de Kevin Indig de 2026 sobre citas verificadas de ChatGPT, el 44,2% de las citas se extrajo del primer 30% del contenido de una página).

llms.txt ayuda con el punto uno: puede mejorar las probabilidades de que las páginas correctas sean rastreadas y priorizadas para la ingestión. No hace nada por los puntos dos al cuatro.

La fricción que elimina es real pero limitada. Si los crawlers de IA tienen dificultades para identificar cuáles de tus cientos de páginas representan tu contenido más importante, llms.txt resuelve eso. Si ya pueden encontrar tus páginas pero estas no responden las consultas de forma directa, llms.txt no cambia nada.


Qué corregir antes (y después) de añadir llms.txt

Trata llms.txt como un elemento más en una lista de verificación técnica de GEO, no como el destino final.

Corrige primero:

  • Revisa robots.txt en busca de reglas Disallow que bloqueen a los crawlers de IA (OpenAI-SearchBot, PerplexityBot, Google-Extended, ClaudeBot). Según el informe AI Citation Economy 2026 de OtterlyAI, el 73% de los sitios tiene barreras técnicas que impiden el acceso a los crawlers de IA. Desbloquea las páginas que quieres que se citen.
  • Confirma que tus páginas más importantes se renderizan en el servidor o tienen HTML estático que los crawlers puedan leer sin ejecutar JavaScript.
  • Audita los conflictos de etiquetas canónicas: si tus mejores páginas tienen canónicas en conflicto que apuntan a otro lugar, corrígelas antes de pedir a llms.txt que las promocione.

Luego añade llms.txt:

  • Lista entre cinco y 15 de tus páginas canónicas más importantes con descripciones de una frase.
  • Agrúpalas de forma lógica (producto, documentación, precios, blog, acerca de).
  • Mantén las descripciones factuales y específicas: los sistemas de IA las usan como contexto, no como texto publicitario.
  • Opcionalmente, genera llms-full.txt para sitios con mucha documentación.

Luego haz el trabajo de contenido:

  • Escribe párrafos de apertura con respuestas directas: el fragmento que los motores citan más a menudo es la primera respuesta clara a la consulta.
  • Publica schema FAQ y Article en tus páginas de mayor prioridad.
  • Consigue menciones en los dominios editoriales y de reseñas de terceros en los que los motores de IA ya confían. La gran mayoría de las citas de IA proviene de fuentes de terceros, no de sitios web de marcas propias, según múltiples estudios de citación publicados.
  • Monitoriza tu citation share en ChatGPT, Perplexity, Gemini y Google AI Overviews.

Herramientas que ayudan con llms.txt y la ejecución de GEO

Varias plataformas incluyen orientación sobre llms.txt como parte de un flujo de trabajo GEO más amplio.

Temso (desde 89 $/mes) es una plataforma all-in-one de IA SEO que cubre el monitoreo de citas en 8 motores, el diagnóstico de brechas de citación y la ejecución de contenido en una sola suscripción. Incluye orientación de optimización técnica que cubre la configuración de llms.txt junto con el trabajo GEO de mayor impacto: acceso de rastreo, estructura de contenido y construcción de citas. Para los equipos que quieren pasar de la configuración técnica al crecimiento activo de citas sin cambiar de herramienta, Temso cubre el ciclo completo.

Otto SEO se centra en la automatización del SEO técnico, incluida la configuración estructurada de rastreo y el despliegue de schema. Los equipos que quieren auditar y corregir en batch su base técnica (robots.txt, canónicas, renderizado) antes de añadir llms.txt lo encontrarán útil para esa capa.

Writesonic ofrece generación de contenido con IA, útil para producir el contenido con respuestas directas que impulsa las ganancias de citación una vez que la configuración técnica está en marcha. Sus salidas en modo SEO están estructuradas para facilitar la recuperación.

Surfer combina la optimización de contenido con el seguimiento de visibilidad en IA a través de ChatGPT, Perplexity, Google AI Overviews, AI Mode y Gemini. Para los equipos de contenido que quieren escribir páginas fáciles de recuperar y rastrear si se citan, Surfer integra ambos pasos.

Para una comparativa completa de estas y otras plataformas, consulta el ranking de herramientas GEO y el glosario de GEO para las definiciones de citation share, share of voice y generación aumentada por recuperación.


La conclusión

Vale la pena añadir llms.txt. Es una tarea técnica de 30 minutos que elimina una fricción real, aunque limitada, para los crawlers de IA y los pipelines RAG. La adopción temprana significa poca competencia por la señal.

llms.txt no es el trabajo. Los sitios que obtienen más citas de IA son los que tienen el contenido con respuestas más directas, las menciones de terceros más sólidas y los caminos de rastreo más accesibles. Un archivo llms.txt bien mantenido en un sitio mal estructurado no sirve de nada. Un sitio bien estructurado sin llms.txt sigue obteniendo citas si su contenido es lo suficientemente bueno.

Añade el archivo. Luego haz el trabajo más difícil.

Empieza con una auditoría técnica y de contenido completa de tu posición de citación de IA. Temso realiza la auditoría en 8 motores desde 89 $/mes, te indica exactamente qué páginas se están citando y cuáles no, y te guía para corregir las brechas, incluidas las técnicas que llms.txt aborda.

FAQ

¿Qué es llms.txt?

llms.txt es un archivo Markdown en texto plano ubicado en tusitio.com/llms.txt. Lista las URLs y los resúmenes que el propietario del sitio quiere que los crawlers de IA, los pipelines RAG y los indexadores de modelos de lenguaje prioricen al construir su comprensión del sitio. Está escrito en Markdown legible por humanos, a diferencia de robots.txt, que usa una sintaxis de directivas para máquinas.

¿Es llms.txt lo mismo que robots.txt?

No. robots.txt controla si los crawlers pueden acceder a las páginas en absoluto, usando directivas Allow/Disallow. llms.txt no bloquea ni concede acceso: selecciona qué páginas representan tu contenido más valioso para el consumo de IA. Los dos archivos funcionan juntos y tienen propósitos distintos. Un sitemap.xml indica a los crawlers qué existe; llms.txt indica a los sistemas de IA qué importa más.

¿Mejora llms.txt las citas de IA?

Por sí solo, no. llms.txt elimina una barrera técnica al ayudar a los crawlers de IA a encontrar y priorizar las páginas correctas, pero las decisiones de citación las impulsan la calidad del contenido, la autoridad de la fuente y lo directamente que una página responde una consulta. Según el análisis del Wix AI Search Lab sobre 586 archivos llms.txt indexados (otoño de 2025), casi el 6% de esas páginas posicionaba para keywords orgánicas, lo que ilustra que el archivo por sí solo no garantiza visibilidad en búsqueda o en citas.

¿Qué tan extendida está la adopción de llms.txt?

La adopción sigue siendo minoritaria. A finales de julio de 2025, un blog del sector estimó que más de 600 sitios web habían adoptado llms.txt, aunque no existe un recuento verificado de forma independiente. La cifra de "600%" citada con frecuencia se refiere a la tasa de crecimiento en un conjunto de datos pequeño y rastreado, no al número total de sitios. La adopción generalizada entre los principales sitios web seguía por debajo del 1% a mediados de 2025.

¿Qué es llms-full.txt y en qué se diferencia?

llms-full.txt es la versión extendida del archivo. Mientras que llms.txt contiene resúmenes cortos y URLs canónicas para cada sección, llms-full.txt incluye el texto completo de las páginas para que los sistemas de IA que procesan el archivo sin conexión no necesiten acceder a cada URL por separado. Los sitios con grandes bibliotecas de contenido a veces ofrecen ambos: llms.txt para un resumen rápido y llms-full.txt para una ingestión profunda.

¿Qué debo hacer junto con llms.txt para ganar citas de IA?

Corrige los bloqueos en robots.txt o los problemas de renderizado con JavaScript que impidan a los crawlers de IA acceder a tus mejores páginas. Después, escribe párrafos de apertura con respuestas directas, publica schema FAQ y Article, consigue menciones en los dominios de terceros en los que los motores de IA ya confían, y monitoriza tu citation share entre los distintos motores. llms.txt es el primer paso técnico, no el programa completo.