Qué Es llms.txt y Cómo Crearlo para tu Web (Guía 2026)

Por Guillermo del PinoPublicado el 6 de agosto de 2026Lectura de 17 min
Qué Es llms.txt y Cómo Crearlo para tu Web (Guía 2026)

Si te han vendido que llms.txt es "el robots.txt de la inteligencia artificial" y que sin él ChatGPT jamás te va a citar, tengo buenas y malas noticias. La mala: eso es falso, y hay datos duros de 2026 que lo demuestran. La buena: el archivo sigue mereciendo la pena por otros motivos, se hace bien en menos de una hora y te obliga a ordenar tu web como no lo has hecho en años.

Vamos sin rodeos: llms.txt es un archivo de texto escrito en Markdown que se coloca en la raíz de tu dominio (tudominio.com/llms.txt) y que ofrece a los modelos de lenguaje un índice curado, limpio y jerarquizado de las páginas más importantes de tu web. Lo propuso Jeremy Howard —cofundador de Answer.AI y de fast.ai— el 3 de septiembre de 2024, y la especificación vive en llmstxt.org. No es un estándar oficial, no lo respalda ningún organismo, y a día de hoy ninguna de las grandes plataformas de IA lo utiliza como señal en sus productos de búsqueda. Yo lo implementé igualmente en mi web, y puedes verlo en guillermodelpino.com/llms.txt.

En este artículo te explico qué es exactamente, en qué se diferencia de robots.txt y de sitemap.xml, cómo crearlo paso a paso con un ejemplo real que puedes copiar, qué dicen los datos sobre su adopción (spoiler: son demoledores) y qué deberías hacer en su lugar si tu objetivo es que la IA te cite.

archivo llms txt editor codigo
archivo llms txt editor codigo

¿Qué es llms.txt exactamente?

llms.txt es una propuesta abierta para resolver un problema muy concreto: cuando un modelo de lenguaje entra en tu web, se encuentra con HTML. Y el HTML de una web moderna es un desastre para una máquina que tiene que gastar tokens en leerlo: menús de navegación, banners de cookies, scripts, sidebars, CSS inline, footers de 200 enlaces, popups de newsletter. El contenido útil puede ser el 10% del peso de la página.

La idea de Howard fue elegantemente simple: si los modelos leen Markdown mucho mejor que HTML, dale a la máquina un fichero en Markdown que le diga "estas son las páginas que importan de esta web, y esto es lo que hay en cada una". Un índice editorial, no un volcado técnico.

La especificación define una estructura bastante estricta:

  1. Un H1 con el nombre del sitio o proyecto. Es lo único obligatorio.
  2. Un blockquote (>) inmediatamente después, con un resumen corto de qué es el sitio y para quién. Este es, con diferencia, el trozo más importante del archivo.
  3. Párrafos opcionales de contexto adicional, sin encabezados.
  4. Secciones H2 que agrupan listas de enlaces por temática.
  5. Cada enlace es un elemento de lista con formato [nombre](url) y, opcionalmente, dos puntos y una descripción breve.
  6. Una sección especial llamada ## Optional, cuyo significado está definido en la spec: son URLs secundarias que el modelo puede saltarse si necesita un contexto más corto.

El esqueleto oficial es este:

# Título del sitio

> Descripción breve del sitio en una o dos frases.

Detalles adicionales opcionales, en texto plano.

## Nombre de la sección

- [Título del enlace](https://ejemplo.com/pagina): Descripción opcional del enlace.

## Optional

- [Contenido secundario](https://ejemplo.com/secundario)

Fíjate en un detalle que casi nadie menciona: el archivo se llama llms.txt pero su contenido es Markdown. La extensión .txt es solo para que el servidor lo sirva como texto plano y cualquiera pueda abrirlo en el navegador sin descargarlo.

llms.txt, robots.txt y sitemap.xml: no son lo mismo ni sirven para lo mismo

Esta es la confusión número uno que me encuentro. Los tres son archivos en la raíz del dominio, los tres hablan con máquinas, y ahí terminan los parecidos. Te lo pongo en una tabla:

Aspectorobots.txtsitemap.xmlllms.txt
Qué esEstándar de facto desde 1994Protocolo apoyado por Google y BingPropuesta abierta (sept. 2024), sin organismo detrás
FormatoTexto plano con directivasXMLMarkdown
Para quiénCrawlers: Googlebot, GPTBot, ClaudeBot, PerplexityBotBuscadores tradicionalesLLM y agentes que leen la web en tiempo real
Qué hacePermite o bloquea el rastreoLista todas tus URLs con fechas y prioridadSelecciona y describe tus URLs clave
CriterioExhaustivo y binario (allow/disallow)ExhaustivoCurado: tú eliges qué es importante
¿Lo respetan?Sí, de forma generalizadaSolo cuando alguien le pasa la URL a mano
¿Afecta al SEO?Sí, y mucho (mal configurado te borra de Google)Sí, ayuda a la indexaciónNo. Google confirma que lo ignora
VeredictoObligatorioObligatorioOpcional, coste bajo, beneficio indirecto

La forma corta de recordarlo: robots.txt dice quién puede pasar. sitemap.xml dice qué hay. llms.txt dice qué merece la pena leer y por qué. Los dos primeros son infraestructura; el tercero es curación editorial.

Y ojo con una cosa: llms.txt no bloquea nada. Si quieres controlar qué bots de IA rastrean tu web (GPTBot, ClaudeBot, Google-Extended, PerplexityBot, CCBot, Bytespider), eso se hace en robots.txt y en la cabecera del servidor, no aquí. Poner un llms.txt no protege tu contenido de nada.

comparativa archivos raiz web
comparativa archivos raiz web

¿Lo usan de verdad los LLM en 2026? Los datos, sin humo

Aquí es donde la mayoría de guías se ponen de perfil. Yo voy a poner los números sobre la mesa, aunque no gusten.

En mayo de 2026, Ahrefs publicó el estudio más grande que existe sobre el tema: analizaron 137.210 dominios cruzando datos de Web Analytics y Bot Analytics. Los resultados:

  • El 28% de esos dominios publicaba un llms.txt válido (unos 38.000 sitios). Ojo, la muestra de Ahrefs está sesgada hacia perfiles técnicos y muy conscientes del SEO, así que ese 28% hay que leerlo como un techo, no como la media de internet.
  • De esos archivos, el 97% no recibió ni una sola petición durante todo el mes. Nada los descargó.
  • Del 3% que sí tuvo tráfico, el 96% eran bots y solo el 4% humanos.
  • Dentro del tráfico de bots, el 77% eran herramientas que no tienen nada que ver con IA: auditores SEO, escáneres, crawlers de perfilado tecnológico. Los bots de recuperación de información de asistentes de IA representaron un 1,1%.
  • Y el dato más contundente: cero bots de IA solicitaron un llms.txt en dominios donde no existía. Es decir, ninguna plataforma sale a buscarlos de forma sistemática.

En paralelo, las posturas oficiales. Google fue el más explícito: en julio de 2025 Gary Illyes confirmó que Google no soporta llms.txt ni tiene planes de hacerlo, y John Mueller llegó a compararlo con la vieja meta keywords —el epitafio más duro que se le puede dedicar a una etiqueta en SEO—. En junio de 2026, Google añadió una sección explícita a su documentación de optimización para IA aclarando que estos archivos no son necesarios para aparecer en Search y que tenerlos "no perjudica ni ayuda" a la visibilidad, porque Google Search simplemente los ignora.

Te resumo el estado de la cuestión por plataforma:

PlataformaPostura pública sobre llms.txt¿Lo busca su crawler?
Google (Search, AI Overviews, AI Mode)Documentado: no es necesario, Search lo ignoraNo
OpenAI (ChatGPT, GPTBot)Recomienda robots.txt para control de rastreo; sin compromiso con llms.txtNo de forma sistemática
AnthropicPublica su propio llms.txt en su documentación; sin compromiso público de consumirlo en productoNo de forma sistemática
PerplexitySin postura oficialNo
Herramientas de desarrollo (Cursor, Copilot, agentes MCP)Uso real y frecuente, pero bajo demandaSí, cuando tú o el usuario le dais la URL

Conclusión honesta: si tu objetivo es aparecer citado en ChatGPT o en las AI Overviews, llms.txt no te va a mover la aguja. Punto. Quien te diga lo contrario, o no ha mirado los datos o te está vendiendo algo.

Entonces, ¿por qué yo tengo uno?

Porque el análisis coste-beneficio sigue saliendo a favor, aunque por razones distintas a las que te cuentan.

1. El coste es ridículo. Cuarenta minutos de trabajo una vez, más una revisión trimestral. No hay mantenimiento técnico, no hay riesgo de romper nada, no hay penalización posible. Google ha dicho explícitamente que no perjudica.

2. Sí funciona en el único escenario donde alguien lo lee de verdad: cuando un humano o un agente le pasa tu URL a un modelo. Si alguien mete guillermodelpino.com/llms.txt en Claude, en ChatGPT con navegación o en un agente que esté construyendo, el modelo recibe un mapa perfecto de mi sitio en 400 líneas de Markdown limpio en lugar de tener que rastrear 200 páginas de HTML. Ese escenario es minoritario, pero es real y va a crecer conforme los agentes se generalicen.

3. El ejercicio de escribirlo tiene más valor que el archivo. Para redactar un buen llms.txt tienes que responder a tres preguntas incómodas: quién eres en una frase, qué 20 páginas de tu web importan de verdad, y cómo describirías cada una a alguien que no te conoce. Yo he reordenado la arquitectura de contenidos de mi web a raíz de escribir el mío. Ese trabajo sí se transfiere directamente a tu posicionamiento en IA.

4. Es una apuesta asimétrica. Si la adopción despega en 2027, ya lo tienes. Si no despega, has perdido una tarde. En mi experiencia, esas asimetrías se aceptan siempre.

Lo que no debes hacer: pagar a una agencia 800 € por "implementación de llms.txt para IA", ni instalar un plugin que te genere automáticamente un volcado de las 400 URLs de tu web. Eso último es peor que no tener nada, y ahora te explico por qué.

Cómo crear tu llms.txt paso a paso

Paso 1: elige entre 15 y 40 URLs. No más

Este es el paso que casi todo el mundo se salta y el que define si tu archivo sirve para algo. Un llms.txt con 400 enlaces autogenerados no es un llms.txt, es un sitemap disfrazado, y pierde todo su sentido: la gracia del formato es la curación.

Pregúntate: si tuviera que explicarle mi negocio a alguien que solo va a leer 20 páginas, ¿cuáles serían? Normalmente: la página de servicios, la de "sobre mí" o "quiénes somos", el contacto, los 10-15 contenidos de mayor autoridad, y las páginas legales o de precios si aportan contexto.

Paso 2: escribe el H1 y el blockquote (dedícale el 50% del tiempo)

El blockquote es lo único que un modelo va a leer con seguridad si tiene poco contexto. Tiene que responder, en 3-5 frases: quién eres, a qué te dedicas, para quién trabajas, en qué te especializas y en qué idioma escribes. Sin adjetivos de folleto. Nada de "soluciones innovadoras 360°".

Mal: "Somos una asesoría líder comprometida con la excelencia." Bien: "Asesoría fiscal y laboral en Jaén, especializada en autónomos y pymes del sector servicios. Presentamos modelos 303, 130, 111 y 347, gestionamos nóminas y llevamos contabilidad con software homologado por Verifactu."

La diferencia es que la segunda contiene entidades reales que un modelo puede vincular.

Paso 3: agrupa en secciones H2 temáticas

Nada de "Artículos" y "Páginas". Agrupa por lo que tu audiencia busca: "Fiscalidad para autónomos", "Nóminas y laboral", "Facturación electrónica y Verifactu". Los encabezados son señales semánticas: aprovéchalos.

Paso 4: describe cada enlace en una línea

Después de los dos puntos, una frase de 8-15 palabras que explique qué encuentra ahí el lector. No repitas el título. Añade contexto que el título no da.

Paso 5: usa URLs absolutas y HTTPS

Siempre https://tudominio.com/pagina, nunca /pagina. El archivo se consume fuera de contexto y las rutas relativas no resuelven.

Paso 6: súbelo a la raíz

  • WordPress: sube el archivo por FTP a la carpeta raíz (la misma donde está wp-config.php), o usa un plugin de gestión de archivos. Cuidado con los plugins que lo generan automáticamente sin curación.
  • Next.js / Astro / Nuxt: colócalo en la carpeta public/. Se sirve tal cual en la raíz. Es lo que hago yo.
  • Webflow / Framer / Squarespace: en la mayoría hay una sección de "custom files" o hay que hacerlo vía redirección o proxy. Comprueba la documentación de tu plataforma.

Paso 7: verifica que se sirve bien

Abre tudominio.com/llms.txt en el navegador. Tienes que ver texto plano, no una descarga ni un 404 ni la plantilla de tu web. Si tu framework devuelve el HTML de la página de inicio, tienes mal configurado el enrutado de estáticos. Comprueba también que la cabecera Content-Type sea text/plain.

Paso 8: ponte un recordatorio trimestral

Un llms.txt con enlaces rotos o desactualizados es una señal de descuido. Cuatro revisiones al año son suficientes.

Un ejemplo real: mi propio llms.txt

Te enseño el mío, recortado, para que veas la estructura aplicada de verdad:

# Guillermo del Pino

> Guillermo del Pino es Director de Marketing e Innovación en Clínicas
> Cleardent (red de más de 70 clínicas dentales), con experiencia previa en
> Software DELSOL (software de contabilidad y facturación para asesorías).
> Escribe sobre inteligencia artificial aplicada a negocio real, SEO,
> marketing digital y automatización, con foco en dos sectores:
> asesorías/fiscalidad y clínicas dentales. Contenido en español, sin humo:
> herramientas concretas, precios reales y criterio propio.

## Sobre el autor

- [Sobre mí](https://guillermodelpino.com/sobre-mi): Trayectoria, de SEO técnico a dirección de innovación con IA.
- [Apariciones en medios](https://guillermodelpino.com/apariciones): Charlas, entrevistas y menciones en prensa.

## IA para asesorías, contabilidad y fiscalidad

- [IA para asesorías y despachos](https://guillermodelpino.com/hub/ia-para-asesorias): Guía práctica para asesorías fiscales, contables y laborales.
- [Mejor software fiscal con IA 2026](https://guillermodelpino.com/hub/mejor-software-fiscal-con-ia): Comparativa honesta para despachos en España.

## Marketing y IA para clínicas dentales

- [Marketing para clínicas dentales](https://guillermodelpino.com/hub/marketing-para-dentistas): Guía completa para captar pacientes.
- [IA para clínicas dentales](https://guillermodelpino.com/hub/ia-para-clinicas-dentales): Agenda, recall y reducción de no-shows con IA.

## Hub de conocimiento

- [Hub de IA](https://guillermodelpino.com/hub): Todos los artículos sobre IA, SEO, marketing y negocio.
- [Sitemap](https://guillermodelpino.com/sitemap.xml): Índice completo de URLs del sitio.

Tres decisiones conscientes que verás ahí: el blockquote nombra entidades concretas (Cleardent, Software DELSOL, asesorías, clínicas dentales) en lugar de adjetivos; las secciones están agrupadas por sector, no por tipo de contenido; y al final enlazo al sitemap, para que quien quiera el listado exhaustivo lo tenga a un clic. El archivo entero no llega a 40 líneas.

La Era del Qué
Nuevo Lanzamiento

¿Te preocupa el futuro con la IA?

Descubre cómo la inteligencia artificial ha liquidado las viejas reglas del juego y qué puedes hacer tú al respecto.

Leer más sobre el libro

llms-full.txt y otras variantes que verás por ahí

Además del archivo principal, circulan un par de convenciones que conviene conocer:

  • llms-full.txt: no está en la especificación oficial, pero se ha popularizado. Es un volcado con el contenido completo de tu documentación o artículos en Markdown, en un solo fichero, listo para pegarse en una ventana de contexto. Tiene sentido para documentación técnica (Stripe, Vercel y Cloudflare hacen algo así). Para una web de servicios o un blog, sinceramente, es innecesario y puede llegar a pesar megas.
  • Versiones .md de cada página: servir tudominio.com/articulo.md junto a la versión HTML. Es más útil que llms-full.txt y más fácil de mantener, pero requiere trabajo en el framework.
  • llms-ctx.txt y llms-ctx-full.txt: variantes mencionadas en la propia especificación, con y sin URLs expandidas. Muy de nicho.

Mi recomendación práctica: si tienes una web de servicios, un blog o una marca personal, haz solo el llms.txt y olvídate del resto. Si vendes una API o software con documentación extensa, entonces sí, llms-full.txt y versiones .md tienen retorno real, porque tus usuarios están literalmente pegando tus docs en Cursor o en Claude todos los días.

Errores frecuentes que me encuentro

  1. Autogenerarlo con un plugin sin revisar. Un volcado de 400 URLs sin descripciones no aporta nada. La curación es el producto.
  2. Escribir el blockquote en modo folleto. "Líderes en soluciones digitales" no le dice nada a un modelo. Nombres, sectores, ciudades, servicios concretos.
  3. Usar rutas relativas. No resuelven fuera de contexto.
  4. Creer que sustituye a robots.txt o sitemap.xml. No sustituye a nada. Es aditivo.
  5. Meter contenido que no quieres que se use para entrenar. Estás haciendo justo lo contrario de proteger: lo estás señalando.
  6. Dejarlo muerto dos años. Enlaces rotos = señal de web abandonada.
  7. Venderlo internamente como "la clave para salir en ChatGPT". Vas a quedar mal cuando pidan resultados. Preséntalo como higiene técnica de bajo coste, que es lo que es.
auditoria seo tecnica pantalla
auditoria seo tecnica pantalla

Lo que sí mueve la aguja (y a lo que deberías dedicar el tiempo)

Si has llegado hasta aquí buscando que la IA te cite, aquí está el orden de prioridades real. El llms.txt es el punto seis de una lista de seis.

1. Contenido citable y autoconclusivo. Los modelos extraen fragmentos, no páginas. Cada apartado de tu contenido tiene que poder leerse aislado y tener sentido. Respuesta directa arriba, datos concretos, cifras, fechas. Es el 60% del trabajo y lo desarrollo entero en cómo optimizar contenido para IA.

2. Datos estructurados bien puestos. Article, FAQPage, Organization, Person, LocalBusiness. Esto sí lo consumen los sistemas de Google y sí genera entidades vinculables. Es el equivalente moderno de lo que la gente cree que hace llms.txt, y es la parte que más resultados me ha dado: te lo cuento en schema markup y datos estructurados.

3. Menciones y consenso externo. Los modelos se fían de lo que dicen de ti en sitios que no controlas: prensa, directorios, foros, reseñas. Aparecer en tres fuentes independientes pesa más que cualquier archivo en tu raíz.

4. Accesibilidad para los crawlers de IA. Comprueba que no estás bloqueando GPTBot, ClaudeBot, PerplexityBot o OAI-SearchBot en tu robots.txt sin querer. He visto webs quejándose de que ChatGPT no las cita con un Disallow: / para GPTBot puesto por el desarrollador "por si acaso". Todo el proceso, con checklist, en cómo aparecer en ChatGPT.

5. Velocidad y HTML limpio. Si tu contenido solo aparece tras ejecutar JavaScript, muchos rastreadores de IA no lo van a ver. Renderizado en servidor siempre que puedas.

6. Y sí, tu llms.txt. La guinda. Cuarenta minutos. Después de lo demás, no antes.

Preguntas frecuentes

¿Es obligatorio tener un llms.txt?

No. No es un estándar oficial ni lo exige ninguna plataforma. Google ha documentado que no es necesario para aparecer en Search ni en sus superficies de IA, y que tenerlo ni ayuda ni perjudica. Es completamente opcional.

¿Sirve llms.txt para SEO?

Para SEO tradicional, no: Google lo ignora explícitamente y no influye en rankings. Para GEO (visibilidad en motores generativos), su efecto directo hoy es prácticamente nulo según los datos de Ahrefs de mayo de 2026. Su valor está en el uso bajo demanda por agentes y asistentes, y en el ejercicio de ordenar tu arquitectura de contenidos.

¿Cómo compruebo si mi llms.txt funciona?

Primero, ábrelo en el navegador en tudominio.com/llms.txt: debe mostrarse como texto plano. Segundo, valida que la sintaxis Markdown respete la spec (H1, blockquote, secciones H2). Y tercero, si tienes acceso a los logs del servidor, filtra las peticiones a /llms.txt por user-agent para ver quién lo pide de verdad. Prepárate para no ver casi nada: es lo normal.

¿Cuál es la diferencia entre llms.txt y llms-full.txt?

llms.txt es un índice curado de enlaces con descripciones cortas. llms-full.txt es un volcado del contenido completo en Markdown en un único fichero, pensado para pegarse directamente en la ventana de contexto de un modelo. El primero está en la especificación; el segundo es una convención del ecosistema. Para webs de servicios, con el primero sobra.

¿Puedo usar llms.txt para impedir que la IA use mi contenido?

No, y es un malentendido peligroso. llms.txt no bloquea absolutamente nada; si acaso, señala tu mejor contenido. El control de rastreo se hace en robots.txt (bloqueando GPTBot, ClaudeBot, CCBot, Google-Extended, PerplexityBot, Bytespider) y con reglas a nivel de servidor o CDN.

¿Cuánto tardo en crear uno y cada cuánto lo actualizo?

Entre 40 minutos y dos horas si te tomas en serio la selección de URLs y la redacción del blockquote, que es donde está el valor. Después, una revisión trimestral para retirar enlaces rotos y añadir el contenido nuevo relevante. No necesita más.

Guillermo del Pino
Escrito por

Guillermo del Pino

Director de Marketing e Innovación en Clínicas Cleardent. Escribo sobre inteligencia artificial aplicada a negocio real, con foco en asesorías, fiscalidad y el sector dental. Sin humo: herramientas, datos y criterio.