
ChatGPT y Claude no leen tu página web como Google. No siguen menús, no procesan JavaScript igual y casi nunca revisan un sitio completo antes de responder una pregunta. Por eso existe el llms.txt, un archivo en la raíz del dominio que le dice a un agente de IA qué páginas conviene leer primero.
En el artículo sobre la guía de robots.txt para bots de IA vemos cómo ese archivo controla qué partes de un sitio pueden rastrear GPTBot, Google-Extended y compañía. El llms.txt hace algo distinto. No bloquea nada ni da permisos de rastreo. Es un índice curado, en formato Markdown, con los enlaces que un modelo de lenguaje debería consultar para entender de qué trata tu negocio, sin tener que descargar y procesar el sitio entero.
La propuesta la publicó Jeremy Howard, fundador de Answer.AI, en septiembre de 2024. La especificación vive en llmstxt.org y define tres piezas obligatorias, un H1 con el nombre del proyecto, un blockquote con un resumen corto y secciones H2 con enlaces anotados, nada más. No incluye permisos, directivas de entrenamiento ni configuración avanzada de acceso.
Aunque el archivo tiene poco más de un año de existencia, ya circula bastante información equivocada sobre lo que hace y lo que promete. Es importante aclarar eso antes de entrar a la parte práctica de crearlo.
Qué archivo es, exactamente
Un llms.txt básico se ve así:
# Nombre de la Empresa
> Agencia de SEO en Colombia especializada en posicionamiento orgánico y GEO.
## Servicios
- [SEO para empresas](https://tudominio.com/servicios-seo/): posicionamiento orgánico en Google.
- [Diseño web](https://tudominio.com/diseno-web/): sitios en WordPress optimizados para conversión.
## Recursos
- [Blog](https://tudominio.com/blog/): guías sobre SEO y visibilidad en IA.
El H1 identifica el sitio. El blockquote responde, en una o dos frases, la pregunta “¿qué hace esta empresa?”. Las secciones H2 agrupan los enlaces por tipo de contenido, sean servicios, documentación, blog o casos de referencia. Cada enlace lleva una descripción corta, porque un enlace sin contexto obliga al agente a descargar la página completa antes de decidir si le sirve. Esa descripción, más que el propio enlace, es la parte que un modelo aprovecha primero.
No se copia el sitemap completo. Un sitemap.xml lista todas las URLs indexables de un sitio para que Google las descubra. El llms.txt selecciona, a mano, las páginas que mejor explican el negocio. Páginas de filtros, carritos de compra, URLs paginadas o contenido legal quedan fuera.
Lo que no hace, y donde se equivocan varios artículos en español
Circula una versión inflada del estándar que incluye directivas como $trainingAllowed o $chatAllowed, presentadas como parte del archivo. Esas directivas no existen en la especificación de llmstxt.org. Esa confusión viene de mezclar tres propuestas distintas. Robots.txt controla el rastreo, ai.txt (de la empresa Spawning) gestiona permisos de entrenamiento, y llms.txt no controla ningún acceso, solo organiza lo que ya está publicado.
Tampoco es un factor de posicionamiento en Google. John Mueller lo comparó públicamente con la meta tag “keywords”, una declaración del propietario del sitio sobre de qué trata, sin ningún peso confirmado en el algoritmo. Gary Illyes fue más directo todavía y descartó cualquier plan de Google para adoptarlo.
Los datos disponibles respaldan esa posición. SE Ranking analizó cerca de 300.000 dominios en noviembre de 2025. Encontró que el 10,13% de esos dominios ya tenía llms.txt implementado, pero no halló ninguna correlación estadística entre tenerlo y aparecer citado con más frecuencia en respuestas de IA. Cuando quitaron esa variable del modelo predictivo, la precisión mejoró: el archivo estaba añadiendo ruido, no señal. Entre los 50 dominios más citados de la muestra, solo uno tenía llms.txt.
Otro estudio, de OtterlyAI, monitoreó el tráfico de bots de IA hacia un dominio de prueba durante 90 días. De 62.100 visitas registradas, apenas 84 apuntaron al archivo llms.txt, menos del 0,15% del total.
Donde sí hay evidencia real de uso es en herramientas de desarrollo. Agentes como Cursor, GitHub Copilot y Claude Code consultan activamente el llms.txt de librerías y APIs para entender cómo usarlas sin rastrear páginas enteras de documentación en HTML. Las empresas que primero adoptaron el archivo (Anthropic, Stripe, Cloudflare, Vercel, Supabase) son, casi todas, infraestructura para desarrolladores.
Entonces, ¿vale la pena implementarlo en Colombia?
Para una pyme colombiana sin documentación técnica ni producto de desarrollador, la respuesta honesta es sencilla. El costo es bajo y el archivo no hace daño, pero tampoco hay evidencia de que cambie cuántas veces ChatGPT o Perplexity mencionan tu negocio. Prepararlo conviene más como una medida de bajo esfuerzo dentro de una estrategia más amplia de optimización para motores generativos que como una apuesta que vaya a cambiar algo por sí sola.
En Keyword Planner, la búsqueda “qué es llms txt” en Colombia mueve apenas 10 consultas al mes. La mayoría de dueños de negocio en Colombia todavía no busca esto de forma activa, y eso mismo es información útil: mientras casi nadie en el mercado colombiano lo ha implementado, tenerlo listo es una ventaja de bajo costo frente a competidores que ni siquiera saben que existe.
Donde sí ayuda de forma concreta:
- Sitios con documentación extensa, guías o recursos técnicos que un agente pueda necesitar interpretar rápido
- Negocios B2B con contenido de referencia (whitepapers, casos, comparativas) que quieren guiar qué páginas leer primero
- Empresas que ya invierten en contenido educativo y quieren que ese trabajo rinda también del lado de la IA
Donde aporta poco:
- Una landing page de una sola URL
- Un sitio brochure con menos de 30 o 40 páginas y sin documentación
Cuándo conviene hacerlo internamente y cuándo delegarlo
Redactar un llms.txt para un sitio pequeño, con menos de 30 páginas y una estructura simple, es un trabajo de una tarde para cualquier persona del equipo con acceso al hosting. La parte que suele fallar no es la redacción, es el mantenimiento. Mover una página, cambiar un slug o lanzar un servicio nuevo sin actualizar el archivo lo deja desactualizado en semanas.
Para sitios con varias líneas de servicio, documentación técnica o presencia en más de un idioma, conviene que quede integrado al mismo trabajo de mantenimiento técnico del sitio, no como una tarea suelta que alguien recuerda hacer una vez al año. En Designs and IT lo revisamos como parte del servicio de SEO de Designs and IT para los clientes que ya tienen una estrategia de contenido activa, junto con robots.txt, sitemap.xml y el resto de la arquitectura técnica del sitio.
Cómo se estructura y qué incluir
Un archivo completo suele tener entre tres y siete secciones H2. Menos y el índice queda incompleto. Más y pierde el propósito de ser un resumen navegable.
Contenido que conviene incluir:
- Página principal y una línea que describa la actividad del negocio
- Servicios o líneas de producto principales, cada uno con su propia descripción
- Documentación, guías o preguntas frecuentes si el negocio las tiene publicadas
- Blog o recursos, si hay contenido educativo con volumen suficiente
Contenido que se descarta:
- Filtros de categoría, etiquetas y resultados de búsqueda interna
- Páginas de checkout o carrito
- Aviso legal, política de privacidad, términos y condiciones
- URLs paginadas (página 2, página 3…) de un mismo listado
Existe una variante, llms-full.txt, que concatena el contenido completo de las páginas listadas en un único archivo markdown. Nace de una colaboración entre Mintlify y Anthropic. Según datos de Mintlify, se consulta bastante más que la versión índice porque los agentes prefieren el contenido entero cuando pueden obtenerlo. Para un sitio editorial sin documentación pesada, generar esta variante suele costar más mantenimiento del que vale.
Implementarlo en WordPress
La mayoría de webs de pymes colombianas corre sobre WordPress, y ahí el camino más corto depende del plugin de SEO que ya se use.
Yoast SEO genera el archivo de forma automática desde su versión 25.3, publicada en 2025, y lo actualiza cada semana según cambie el contenido del sitio. Rank Math y All in One SEO ofrecen generación parecida desde sus paneles, sin necesidad de tocar código.
Si no se usa ninguno de esos plugins, hay complementos dedicados como Website LLMs.txt, que crean y sirven el archivo directamente. Vale la pena revisar antes si el sitio ya tiene un plugin de SEO instalado que cubra esta función. Activar dos generadores de llms.txt a la vez en WordPress puede provocar un error fatal, porque varios de estos plugins registran la misma clase interna en PHP y el sitio deja de cargar si los dos están activos.
Tres errores frecuentes al montarlo en WordPress:
- El servidor devuelve HTML en vez de texto plano. Pasa cuando el archivo queda detrás de una regla de caché o de un firewall que intercepta la ruta. Se verifica con
curl -I https://tudominio.com/llms.txt: si elContent-Typeno dicetext/plain, hay que revisar la configuración del servidor. - La ruta queda con una barra final (
/llms.txt/en vez de/llms.txt). WordPress puede tratarla como si fuera un directorio, y el archivo deja de ser legible para el agente que lo busca. - Enlaces rotos por cambios de slug. Un llms.txt desactualizado, con URLs que ya no existen, genera más desconfianza en el modelo que no tener archivo. Conviene revisarlo cada vez que se publique o se mueva contenido importante, no solo una vez al montarlo.
Antes de publicarlo, valídalo
Un llms.txt mal formado es peor que no tener ninguno, porque un agente que confía en un índice con enlaces rotos o rutas equivocadas pierde tiempo y credibilidad en la fuente. Antes de dejarlo en producción conviene confirmar que el archivo responde con código 200 al visitarlo en el navegador, que el servidor lo entrega como texto plano y no como una página de error disfrazada de contenido, y que cada enlace listado apunta a una URL que realmente existe, sin redirecciones rotas de por medio.
Un chequeo rápido y gratuito consiste en copiar el contenido del archivo en ChatGPT o Claude y preguntar qué hace el sitio según ese índice y qué debería leer primero un visitante. Si la respuesta coincide con la realidad del negocio, la estructura funciona. Si el modelo se confunde o inventa cosas que el archivo no dice, hay que revisar la redacción del blockquote y las descripciones de cada enlace.
Cómo saber si alguien lo está leyendo
Publicar el archivo no confirma que un agente lo consulte. Cloudflare Bot Analytics permite filtrar el tráfico por user-agent (GPTBot, ClaudeBot, PerplexityBot) y ver cuántas peticiones llegan específicamente a /llms.txt. Si son menos de 10 al mes, casi nadie lo está usando todavía. Herramientas como Ahrefs Brand Radar rastrean, del otro lado, si las IAs mencionan la marca en sus respuestas, lo que da una idea más directa de si el trabajo de contenido detrás del archivo está funcionando.
Llms.txt frente a los bots que ya conoces
Si ya revisaste la diferencia entre GPTBot y OAI-SearchBot, sabes que cada bot de OpenAI cumple un rol distinto. Uno indexa para respuestas conversacionales, el otro navega en tiempo real durante una búsqueda. El llms.txt no cambia el comportamiento de ninguno de los dos. Ni GPTBot ni OAI-SearchBot están obligados a leerlo, ni existe confirmación pública de que lo hagan de forma sistemática. Lo que sí hace es dejar el índice listo para cuando un agente decida consultarlo, sea de OpenAI, de Anthropic o de cualquier otro proveedor que lo adopte en el futuro.
Esa es la relación real entre los tres archivos técnicos del sitio. Robots.txt define quién puede entrar, sitemap.xml enumera todo lo que existe, y llms.txt selecciona lo que más importa. Ninguno reemplaza a los otros dos, y ninguno sustituye una guía de SEO para empresas en Colombia bien ejecutada, con contenido de calidad y autoridad temática real.
Preguntas frecuentes sobre llms.txt
En la raíz del dominio, en una ruta como https://tudominio.com/llms.txt. Es la ubicación que buscan los agentes de IA compatibles, igual que ocurre con robots.txt.
Robots.txt controla qué rutas pueden rastrear los bots. Llms.txt no bloquea ni permite nada. Ofrece, en cambio, un índice curado de las páginas que un modelo de lenguaje debería leer primero.
No hay evidencia pública de eso. Google descartó explícitamente usarlo como señal de ranking, y los estudios disponibles no encuentran relación entre tenerlo y aparecer citado con más frecuencia en respuestas de IA.
No hay garantía. Los datos muestran uso real en herramientas de desarrollo, pero ningún proveedor confirma públicamente que lo consulte de forma sistemática para inferencia general en la web.
En una web pequeña, se puede redactar y publicar en menos de una hora. En sitios grandes o multiidioma, conviene automatizarlo desde el CMS o el proceso de despliegue para que no quede desactualizado.
Lo que sí puedes controlar mientras tanto
El llms.txt no va a decidir si tu negocio aparece o no en una respuesta de ChatGPT. Eso sigue dependiendo de si tu contenido tiene autoridad suficiente para entrar al conjunto de páginas que un agente considera al responder. El archivo ordena lo que ya existe, no lo crea. La pregunta que vale la pena hacerse antes de montarlo no es “¿cómo lo configuro?”, sino si el contenido detrás de ese índice ya es lo bastante sólido como para que merezca la pena señalarlo.