CodeLess Co

Qué es llms.txt y si tu sitio lo necesita

Qué es llms.txt, en qué se diferencia de robots.txt y del sitemap, qué ponerle a tu sitio y por qué no es una palanca garantizada para aparecer en la IA.

CodeLess Co10 min de lectura

En resumen: llms.txt es un archivo en markdown, propuesto en 2024 en llmstxt.org, que resume tu sitio para modelos de lenguaje: quién eres, qué ofreces y cuáles son tus páginas clave. No es un estándar oficial y no hay confirmación pública de que los grandes asistentes lo usen de forma sistemática. Es barato de tener, pero importa más que los rastreadores de IA puedan entrar.

Si alguien te ofreció "optimizar tu sitio para ChatGPT", es probable que mencionara llms.txt como si fuera la llave. No lo es. Tampoco es humo: es una idea razonable, barata de aplicar y con un alcance todavía incierto. Aquí va la explicación sin exagerar para ningún lado.

¿Qué es llms.txt?

llms.txt es un archivo de texto, ubicado en la raíz del sitio (tudominio.com/llms.txt), que presenta el sitio en markdown para que un modelo de lenguaje lo entienda rápido. La propuesta se publicó en 2024 en llmstxt.org y en 2026 tuvo una segunda versión.

Parte de un problema real: las páginas web están llenas de menús, scripts, avisos de cookies y diseño. Un modelo que quiere entender qué hace una empresa tiene que leer todo eso y descartar casi todo. Un archivo corto, en texto plano y con enlaces a lo importante, le ahorra ese trabajo.

La propuesta define una estructura sencilla:

  • Un título con el nombre del sitio o del proyecto. Es el único elemento obligatorio.
  • Un resumen corto, en forma de cita.
  • Información adicional en párrafos o listas, si hace falta.
  • Secciones con listas de enlaces a las páginas clave, cada uno con una nota breve.
  • Si quieres, una sección llamada "Optional" para enlaces secundarios. En la primera versión les indicaba a las herramientas qué podían omitir; en la segunda queda como una convención útil.

¿Qué es llms-full.txt?

llms-full.txt es una variante que algunos sitios publican junto al llms.txt: en vez de enlaces, trae el contenido completo del sitio en un solo archivo markdown. Sirve para que una herramienta cargue todo de una vez, sin visitar página por página. Se ve sobre todo en documentación técnica, pero no es un requisito de la propuesta.

¿En qué se diferencia llms.txt de robots.txt y del sitemap?

Se diferencian en la pregunta que responde cada uno: robots.txt dice qué se puede rastrear, el sitemap dice qué páginas existen y llms.txt resume de qué se trata el sitio. No se reemplazan entre sí.

Archivo Pregunta que responde Para quién ¿Es un estándar?
robots.txt ¿Qué partes del sitio puede rastrear cada robot? Todos los rastreadores, de buscadores y de IA Sí, el protocolo de exclusión de robots, formalizado por la IETF en 2022 (RFC 9309)
sitemap.xml ¿Qué páginas existen y cuándo cambiaron? Buscadores Sí, el protocolo de sitemaps, aceptado por los principales buscadores
llms.txt ¿De qué se trata el sitio y qué es lo importante? Modelos de lenguaje y agentes de IA No, es una propuesta

Por eso llamar a llms.txt "el robots.txt para IA" es engañoso. llms.txt no permite ni bloquea nada. Si quieres decidir qué rastreadores de IA entran a tu sitio, eso se hace en robots.txt.

¿Los asistentes de IA realmente leen llms.txt?

No hay confirmación pública de que los grandes asistentes lo usen de forma sistemática. Google, por su parte, dice en su guía sobre funciones de IA que su buscador no lo usa: tenerlo no ayuda ni perjudica tu visibilidad en Google, aunque puede servirles a otros sistemas. Esa es la respuesta honesta hoy, y conviene revisarla de vez en cuando porque el tema se mueve rápido.

Lo que sí ocurre:

  • Muchas empresas de software lo publican para su documentación técnica, de modo que las herramientas de programación con IA la consulten con facilidad.
  • Un agente que navega por su cuenta puede encontrarlo y leerlo, como leería cualquier página pública.
  • Una persona puede pegarlo en una conversación con un asistente para darle contexto sobre tu empresa.

Lo que no ocurre es que tener un llms.txt haga que ChatGPT, Claude, Gemini o Perplexity te recomienden. Nadie puede garantizar que una IA te recomiende, ni posiciones en Google, y este archivo no cambia eso. Quien te lo venda como atajo está prometiendo algo que no controla.

¿Qué poner en un llms.txt?

Un buen llms.txt para una empresa de servicios cabe en una pantalla y dice lo mismo que tu sitio, sin adornos:

  1. Nombre y resumen. Qué hace la empresa, para quién y dónde, en dos o tres frases.
  2. Datos clave. País o ciudad, idioma, forma de contacto y lo que no haces, si es una duda frecuente.
  3. Servicios. Un enlace por servicio, con una línea que lo describa.
  4. Páginas clave. Contacto, quiénes somos y los artículos que responden las preguntas más comunes.
  5. Preguntas frecuentes. Las mismas que respondes en el sitio, con las mismas palabras.

Este es un ejemplo para una empresa hipotética:

# Ejemplo Servicios

> Ejemplo Servicios es una empresa colombiana de mantenimiento de equipos de refrigeración para restaurantes y hoteles en Bogotá y municipios cercanos.

- Contacto: [email protected], formulario en https://www.ejemplo.com/contacto
- Atención en el sitio del cliente, con cita previa.

## Servicios

- [Mantenimiento preventivo](https://www.ejemplo.com/servicios/preventivo): visitas programadas y reporte del estado de cada equipo.
- [Reparaciones](https://www.ejemplo.com/servicios/reparaciones): diagnóstico y arreglo de cuartos fríos y neveras industriales.

## Preguntas comunes

- [¿Atienden fuera de Bogotá?](https://www.ejemplo.com/preguntas#cobertura): sí, en municipios cercanos.

## Optional

- [Blog](https://www.ejemplo.com/blog): guías sobre el cuidado de equipos de frío.

La regla más importante: lo que diga el llms.txt tiene que coincidir con lo que dice el sitio. Si el archivo dice que atiendes en todo el país y la página dice que solo en Bogotá, le estás dando a la máquina dos versiones de ti.

En el sitio de CodeLess Co, el llms.txt y el llms-full.txt se generan automáticamente con cada publicación, a partir de los mismos datos que alimentan las páginas: servicios, artículos y preguntas frecuentes. Así nunca se desactualizan ni dicen algo distinto de la web.

¿Qué importa más que el llms.txt?

Importa más que los rastreadores de IA puedan entrar a tu sitio y que el contenido sea claro. Si un asistente no puede leer tus páginas, ningún archivo de resumen lo compensa.

Revisa tu robots.txt

Los rastreadores de IA se identifican con nombres propios, según la documentación de cada empresa. OpenAI usa GPTBot para entrenamiento, OAI-SearchBot para la búsqueda de ChatGPT y ChatGPT-User para visitas que pide un usuario. Anthropic usa ClaudeBot, Claude-SearchBot y Claude-User. Perplexity usa PerplexityBot. Google-Extended controla el uso de tu contenido para Gemini y para entrenamiento, y no afecta tu posicionamiento en Google Search. Los nombres pueden cambiar; revisa la documentación vigente de cada uno.

Un robots.txt que permite de forma explícita a los rastreadores de búsqueda de IA y a los agentes que visitan páginas a pedido de un usuario se ve así:

User-agent: *
Allow: /
Disallow: /admin

User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: Claude-SearchBot
User-agent: Claude-User
User-agent: PerplexityBot
Allow: /
Disallow: /admin

Sitemap: https://www.ejemplo.com/sitemap.xml

Tres detalles que se pasan por alto:

  • Un robot que encuentra un grupo con su nombre ignora las reglas generales del asterisco. Si nombras rastreadores, repite en su grupo las rutas privadas.
  • Búsqueda y entrenamiento son decisiones separadas. Puedes permitir los rastreadores de búsqueda y bloquear los de entrenamiento, o al revés. Decide con tu equipo qué prefieres; no hay una respuesta única.
  • Los agentes que actúan a pedido de un usuario pueden no seguir robots.txt. Según la documentación de OpenAI, eso aplica a ChatGPT-User; para aparecer o no en la búsqueda de ChatGPT, el que cuenta es OAI-SearchBot.

Revisa el CDN y el firewall

Algunos servicios de CDN y seguridad, como Cloudflare, ofrecen opciones para bloquear rastreadores de IA que pueden venir activadas, e incluso para agregar a tu robots.txt reglas que los excluyen. Si están activas, tu robots.txt puede decir "adelante" mientras el firewall les cierra la puerta. Vale la pena revisar esa configuración o pedirle a quien administra tu sitio que lo haga.

Que Bing tenga tu sitio indexado también cuenta, porque Microsoft Copilot usa su índice. Lo explicamos en la guía de Search Console, Bing Webmaster Tools e IndexNow.

Escribe contenido claro

Un asistente cita lo que entiende: páginas que dicen sin rodeos qué haces, para quién, dónde y en qué condiciones; preguntas frecuentes reales; subtítulos que responden. Eso lo desarrollamos en cómo escribir contenido que Google y la IA puedan citar. Y para describir sin ambigüedad tu empresa, tus servicios y tus artículos están los datos estructurados con schema.org.

¿Cuándo no vale la pena preocuparse por llms.txt?

No vale la pena preocuparse cuando hay cosas más básicas sin resolver, que es lo más común:

  • Tu sitio no aparece bien en Google ni en Bing. Primero van la indexación, el sitemap y las herramientas para webmasters.
  • Tu robots.txt o tu CDN bloquean a los rastreadores de IA. El llms.txt no sirve de nada si no los dejas entrar.
  • Tu sitio no explica con claridad qué haces. Resumir algo confuso produce un resumen confuso.
  • Tu sitio tiene cinco páginas. Un modelo puede leerlas todas sin ayuda. El archivo aporta poco, aunque tampoco estorba.
  • Te lo cobran como si fuera la solución. Es un archivo de texto de una pantalla. Tiene sentido dentro de un trabajo más amplio, no como producto aparte.

¿Entonces lo pongo o no?

Si ya resolviste lo básico, sí: ponlo. Cuesta una tarde la primera vez, casi nada si se genera solo, y no tiene contraindicaciones mientras diga la verdad. Piénsalo como una tarjeta de presentación para máquinas: no te consigue el contrato, pero ayuda a que no te confundan.

Para entender dónde encaja todo esto, lee qué es AEO y cómo aparecer en las respuestas de la IA. Y si quieres que lo revisemos junto con el resto de tu sitio, mira el servicio de SEO y AEO.

La primera conversación es gratis: cuéntanos qué tiene hoy tu sitio.

Preguntas frecuentes

¿Dónde se pone el archivo llms.txt?

En la raíz del dominio, de modo que quede en tudominio.com/llms.txt, igual que robots.txt. Debe ser un archivo público, sin contraseña, que cualquiera pueda abrir desde el navegador. Si usas un gestor de contenido, algunos complementos lo generan. Si tu sitio es a medida, conviene que se genere automáticamente con cada publicación para que nunca quede desactualizado.

¿llms.txt reemplaza a robots.txt?

No. Hacen cosas distintas. Robots.txt le dice a cada rastreador qué partes del sitio puede visitar, y es lo que debes revisar si quieres que los asistentes de IA entren o no. Llms.txt solo resume el sitio y señala las páginas importantes; no permite ni bloquea nada. Un sitio puede tener los dos, y en ese caso deben ser coherentes entre sí.

¿Bloquear a GPTBot me saca de las respuestas de ChatGPT?

Según la documentación de OpenAI, GPTBot es el rastreador que recoge contenido para entrenamiento y OAI-SearchBot es el de la búsqueda de ChatGPT; se configuran por separado. Bloquear solo a GPTBot no debería sacarte de la búsqueda de ChatGPT, pero bloquear a OAI-SearchBot sí puede hacerlo. Como estas reglas cambian, revisa la documentación vigente antes de decidir.

¿Necesito un llms-full.txt además del llms.txt?

No es obligatorio. El llms-full.txt tiene sentido cuando tu sitio tiene mucho contenido de referencia, como documentación, guías o un blog grande, y quieres que una herramienta lo cargue de una vez. Si tu sitio tiene pocas páginas, un llms.txt con buenos enlaces basta. Si publicas ambos, genéralos de la misma fuente para que digan lo mismo.

¿Cómo sé si los rastreadores de IA están visitando mi sitio?

Revisa los registros de visitas de tu hosting o las estadísticas de tu CDN, filtrando por el nombre del rastreador: GPTBot, ClaudeBot, PerplexityBot y otros. Ahí ves si entran y a qué páginas. Para saber si te citan hay datos parciales: Bing Webmaster Tools muestra citas en Copilot y Search Console, impresiones en las funciones de IA de Google, pero ningún informe cubre todos los asistentes.

¿Tienes un problema parecido?

La primera conversación es gratis. Miramos tu caso y te decimos con honestidad qué implicaría resolverlo.

Agenda un diagnóstico