Agencia SEO Boutique en Colombia y Estados Unidos - SEO Local
✕
  • Agencia Boutique
  • Servicios SEO
    • SEO local en Google Maps
      • Auditoría GBP
      • Recuperación de perfil GBP
      • Optimización de ficha
      • Gestión mensual de ficha GBP
    • SEO para páginas web
      • Auditoría SEO
      • Optimización SEO
      • Servicio SEO mensual
    • Paquetes SEO
  • Diseño web WordPress
  • Blog
    • Cápsulas SEO
  • Contáctanos
    • Política de Privacidad
  • Agencia Boutique
  • Servicios SEO
    • SEO local en Google Maps
      • Auditoría GBP
      • Recuperación de perfil GBP
      • Optimización de ficha
      • Gestión mensual de ficha GBP
    • SEO para páginas web
      • Auditoría SEO
      • Optimización SEO
      • Servicio SEO mensual
    • Paquetes SEO
  • Diseño web WordPress
  • Blog
    • Cápsulas SEO
  • Contáctanos
    • Política de Privacidad
¡LLÁMANOS!

Robots.txt para IA: configura tu sitio para que ChatGPT y Google IA puedan leerlo

  • Inicio
  • Blog de SEO, SEO local para PyMES | tutoriales
  • GEO
  • Robots.txt para IA: configura tu sitio para que ChatGPT y Google IA puedan leerlo
Publicado por Leonardo E. Báez el 28 agosto, 2026
Robots.txt para IA: configura tu sitio para que ChatGPT y Google IA puedan leerlo

Abre tudominio.com/robots.txt ahora mismo. Si tu hosting o un plugin de seguridad decidió por ti bloquear los bots de IA, no vas a aparecer citado en ChatGPT ni en las respuestas de Google IA, sin importar cuánto contenido publiques.

Ese archivo de texto en la raíz de tu sitio le dice a cada bot qué puede visitar y qué no. Funciona parecido a un letrero de “no pasar” en la entrada de un local. Los visitantes que respetan las reglas lo obedecen, pero el letrero no detiene físicamente a nadie que decida ignorarlo.

Para un negocio en Colombia que apenas empieza a mirar la optimización para motores generativos, robots.txt es el primer punto de control. Antes de escribir contenido citable o revisar schema markup, hay que confirmar que los bots correctos pueden entrar.

La mayoría de sitios de PYMES colombianas nunca ha tocado este archivo. Y no hay nada malo en eso hasta que el negocio empieza a preguntarse por qué nunca aparece cuando alguien le pregunta a ChatGPT quién ofrece su servicio en su ciudad. A veces la respuesta no tiene nada que ver con el contenido publicado. Tiene que ver con un archivo de tres líneas que nadie revisó.

Qué bots de IA existen hoy (y por qué bloquear uno no bloquea los demás)

Contenidos del artículo

  • Qué bots de IA existen hoy (y por qué bloquear uno no bloquea los demás)
  • Bloquear no es lo mismo que desindexar
  • Cómo escribir las reglas: sintaxis básica
  • Configurarlo en WordPress con hosting colombiano
  • Si tu sitio todavía no tiene robots.txt
  • El error que nadie revisa: tu propio hosting bloqueando bots sin que lo sepas
  • Cómo verificar que tu configuración funciona
  • Qué configuración le conviene a tu negocio
  • Preguntas frecuentes

Hace pocos años, la lista de bots que importaban cabía en una línea, apenas Googlebot y poco más. Hoy cada empresa de IA opera varios bots distintos, y confundirlos entre sí es el error más frecuente al configurar robots.txt para IA.

Existen tres categorías:

  1. Los bots de entrenamiento descargan contenido a gran escala para alimentar el modelo. Aquí están GPTBot (OpenAI), ClaudeBot (Anthropic), Google-Extended (Google) y Bytespider (ByteDance). Bloquearlos no afecta si apareces citado en una conversación de IA, solo si tu contenido termina entrenando al siguiente modelo.
  2. Los bots de búsqueda rastrean tu web para incluirla en resultados cuando alguien busca dentro de ChatGPT, Claude o Perplexity. OAI-SearchBot, Claude-SearchBot y PerplexityBot funcionan así. Bloquear estos sí te saca de esas respuestas.
  3. Los bots de petición de usuario solo entran cuando una persona le pide al chatbot que lea una URL puntual. ChatGPT-User es el ejemplo más conocido, y en la documentación reciente de OpenAI ya no aparece listado entre los bots que respetan robots.txt de forma garantizada.
EmpresaEntrenamientoBúsquedaPetición de usuario
OpenAIGPTBotOAI-SearchBotChatGPT-User
AnthropicClaudeBotClaude-SearchBotClaude-User
GoogleGoogle-ExtendedGooglebot (el mismo de siempre)No aplica
PerplexityNo tiene bot propioPerplexityBotPerplexity-User
ByteDanceBytespiderNo tieneNo tiene

Google-Extended genera confusión real y merece la aclaración. Bloquearlo no te saca de AI Overviews, esos resúmenes que Google pone sobre los resultados normales. AI Overviews usa el Googlebot de siempre. Google-Extended solo decide si tu contenido entrena a Gemini.

La diferencia entre bots de entrenamiento y bots de búsqueda no es solo conceptual. Firmas que monitorean tráfico de bots han documentado que GPTBot rastrea miles de páginas por cada visita que termina generando una referencia de vuelta al sitio de origen, mientras que ClaudeBot opera con una proporción todavía más alta. Los bots de búsqueda, en cambio, mantienen proporciones mucho más bajas porque su función es justamente devolver tráfico. Esa diferencia es la razón real detrás de la estrategia de bloqueo selectivo. No toda visita de un bot de IA equivale a una oportunidad de negocio, y separar cuáles sí lo son cambia por completo la decisión de configuración. Esto conecta directamente con cómo ChatGPT y Google IA deciden a quién citar. Esa decisión empieza siempre por poder rastrear tu contenido, y un robots.txt mal configurado la bloquea antes de que llegue a la etapa de decidir si te cita o no.

OpenAI mantiene tres bots distintos con comportamientos que se prestan a confusión entre sí, y ahí es donde la mayoría de sitios se equivoca al escribir su robots.txt. Le dedicamos un artículo completo a la diferencia entre GPTBot y OAI-SearchBot porque bloquear el que no debías bloquear te saca de las respuestas de ChatGPT sin que te des cuenta.

Este trabajo es distinto del SEO tradicional que probablemente ya trabajas en la guía de SEO para empresas en Colombia, aunque los dos compiten por el mismo objetivo, que te encuentren cuando alguien busca lo que ofreces.

Bloquear no es lo mismo que desindexar

Un matiz que casi nadie explica bien. Bloquear un bot en robots.txt impide que rastree tu contenido, pero no impide que aparezca referenciado en otro lado. Si otra web te enlaza y un motor de búsqueda encuentra esa URL, puede mostrarla igual usando el título y la descripción que logre extraer del enlace, aunque nunca haya leído tu página completa.

Para bots de IA la lógica es parecida. Bloquear GPTBot no borra las menciones de tu negocio que ya existan en foros, directorios o reseñas que ese modelo sí pudo leer en su momento de entrenamiento. Solo evita que el contenido nuevo que publiques a partir de hoy entre a ese entrenamiento. Confundir bloqueo con desaparición lleva a decisiones basadas en una premisa equivocada.

Cómo escribir las reglas: sintaxis básica

Un bloque de robots.txt para bots de IA sigue la lógica de siempre. User-agent indica a qué bot aplica la regla, Disallow bloquea una ruta y Allow la deja pasar.

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Allow: /

Sitemap: https://tudominio.com/sitemap.xml

Esta configuración bloquea el entrenamiento de OpenAI pero deja pasar al bot que alimenta las búsquedas dentro de ChatGPT. Es la que recomendamos para la mayoría de negocios en Colombia que venden un servicio y buscan visibilidad, no anonimato.

Si el negocio prioriza aparecer en todas partes sin filtrar nada, la regla se simplifica:

User-agent: *
Allow: /

Sitemap: https://tudominio.com/sitemap.xml

Y si el modelo de negocio depende del contenido original (un medio, un fotógrafo, un creador), bloquear cada bot de entrenamiento por separado es una postura legítima. El costo es real: desapareces de las respuestas de IA por completo, no solo del entrenamiento.

Un error arruina esta configuración entera. Escribir la línea User-agent y dejarla sin Disallow ni Allow correspondiente deja al bot sin regla aplicable, lo que en la práctica equivale a acceso libre.

Configurarlo en WordPress con hosting colombiano

La mayoría de sitios de PYMES en Colombia corren sobre WordPress con hostings tipo cPanel: GoDaddy, Hostinger o proveedores locales con paneles similares. Ahí hay dos caminos para tocar robots.txt.

El primero es desde un plugin de SEO ya instalado. Yoast SEO tiene un editor de archivos dentro de Herramientas > Editor de archivos. Rank Math lo ubica en General Settings > Editar robots.txt. En cualquiera de los dos se pega el bloque de reglas directamente, sin tocar el servidor.

El segundo camino es entrar al Administrador de Archivos de cPanel, ubicar public_html y editar robots.txt ahí, o crearlo si no existe. WordPress genera uno virtual por defecto que no permite editar bots específicos, así que sin un plugin de SEO activo, este es el único camino disponible.

Si tu sitio todavía no tiene robots.txt

Es más común de lo que parece. Sitios de dos, cinco o diez años llevan sin este archivo, y muchos dueños de negocio asumen que WordPress ya lo resolvió por su cuenta. Lo que WordPress genera por defecto cuando no existe uno físico es una versión virtual que casi nunca contempla bots de IA, solo las reglas genéricas más básicas.

Crearlo desde cero no tiene complicación. El contenido mínimo, sin bloquear ningún bot, es este:

User-agent: *
Allow: /

Sitemap: https://tudominio.com/sitemap.xml

A partir de ahí se agregan los bloques específicos para cada bot de IA según la decisión que tome el negocio. Lo que no conviene es dejarlo en manos del comportamiento por defecto del hosting, porque ese comportamiento varía entre proveedores y rara vez está documentado en español.

El error que nadie revisa: tu propio hosting bloqueando bots sin que lo sepas

Varios hostings y plugins de seguridad usados en Colombia (Wordfence, Sucuri, o el firewall que activa el proveedor por defecto) bloquean automáticamente cualquier bot que no reconozcan como confiable, y varios bots de IA entran ahí por defecto.

Cloudflare, que usan bastantes sitios colombianos por su capa gratuita, lanzó una opción de bloqueo de bots de IA con un solo clic. En algunas cuentas quedó activada de fábrica. Así que el dueño del sitio nunca tocó robots.txt, nunca decidió bloquear nada, y aun así ningún bot de OpenAI, Anthropic o Perplexity puede leer su contenido.

Revisar esto toma cinco minutos. Si el sitio usa Cloudflare, el panel se llama AI Crawl Control y muestra, bot por bot, si está permitido o bloqueado. Si el sitio usa un plugin de seguridad de WordPress, conviene revisar su lista de user agents bloqueados antes de asumir que el problema está en robots.txt.

Cómo verificar que tu configuración funciona

Google Search Console tiene un probador de robots.txt integrado. Se ingresa el user agent, por ejemplo GPTBot, y una URL, y confirma si ese bot puede acceder o no. Es la forma más directa de comprobar que la regla que escribiste hace lo que pensabas que hacía.

Conviene revisar los logs del servidor cada tanto. Si GPTBot sigue apareciendo después de bloquearlo, alguna otra capa (el CDN, el firewall, un plugin) está permitiendo lo que robots.txt bloquea. Robots.txt es una convención: los bots que respetan las reglas la siguen, pero nada obliga a ninguno a hacerlo.

Hay otras dos herramientas gratuitas que ayudan a confirmar la configuración sin depender solo de Search Console. Merkle Robots.txt Tester valida reglas por bot individual con una interfaz sencilla, y TechnicalSEO.com usa la misma librería que Google para revisar la sintaxis. Ninguna reemplaza a Search Console para el caso específico de Googlebot, pero sirven para probar bots de IA que Search Console no cubre directamente.

Hay un descuido frecuente al escribir estas reglas. Las mayúsculas y minúsculas importan en las rutas, aunque no en el nombre del bot. Disallow: /Admin no bloquea /admin. Y una línea en blanco en medio de un bloque de reglas puede cortar la asociación entre User-agent y su Disallow, dejando el resto de esa regla sin efecto. Revisar el archivo completo después de editarlo evita este tipo de errores silenciosos, no solo mirar la línea que se acaba de agregar.

Qué configuración le conviene a tu negocio

No hay una regla única para todo el mundo, y quien la venda así probablemente no entiende el problema real. La decisión depende de qué espera el negocio del tráfico de IA.

Un negocio de servicios (agencias, consultorios, talleres, comercio) que se beneficia de aparecer cuando alguien le pregunta a ChatGPT quién hace algo en Colombia necesita permitir los bots de búsqueda y de petición de usuario, y decidir aparte si le importa el entrenamiento. Es el escenario más común entre los clientes que revisamos en el servicio de SEO de Designs and IT, y suele resolverse con la configuración de bloqueo selectivo que mostramos arriba.

Un medio o un creador de contenido cuyo negocio es el contenido en sí mismo tiene un cálculo distinto. Cada bot de entrenamiento que entra alimenta un modelo que compite por la misma atención de sus lectores. Ahí bloquear todo, aunque cueste visibilidad en IA, puede ser la decisión correcta.

Ninguna de las dos posturas es incorrecta. La que sí falla es no decidir, dejar la configuración por defecto del hosting y enterarse meses después de que nunca hubo una elección real de por medio.

Para un negocio de servicios, cuántas veces te cita ChatGPT importa menos que si esas citas terminan generando un mensaje de WhatsApp, una llamada o un formulario lleno. Configurar robots.txt correctamente es condición necesaria para aparecer, pero la conversión sigue dependiendo de que la respuesta que dé la IA sobre tu negocio sea precisa y esté respaldada por contenido real en tu sitio, no de la configuración técnica por sí sola.

Preguntas frecuentes

¿Bloquear bots de IA me saca de los resultados normales de Google?

No. Bloquear GPTBot, ClaudeBot o Google-Extended no cambia cómo Googlebot rastrea e indexa tu sitio para búsqueda tradicional. Son bots distintos con reglas independientes.

¿Todos los bots de IA respetan robots.txt?

No todos. Es una convención, no una restricción técnica forzada. Los bots de las empresas grandes suelen respetarla, pero existen reportes documentados de crawlers que acceden a contenido bloqueado usando métodos que no se identifican con su user agent real.

¿Necesito llms.txt además de robots.txt?

Para la mayoría de sitios de servicios, todavía no. Es un archivo aparte pensado para documentación técnica extensa, y los bots grandes de IA por ahora prefieren rastrear el sitio real en vez de leer ese resumen. Lo cubrimos con detalle en el artículo dedicado a llms.txt en Colombia.

¿Cómo sé si mi robots.txt ya está bloqueando bots de IA sin que yo lo haya configurado?

Entra a tudominio.com/robots.txt y busca líneas con GPTBot, ClaudeBot, Google-Extended u otros nombres de bots de IA con Disallow: /. Si no las escribiste tú, es probable que el plugin de seguridad o el CDN las haya agregado por defecto.

La configuración de robots.txt no requiere presupuesto ni un desarrollador especializado, toma una tarde de trabajo. Requiere decidir, con datos del propio negocio, si conviene abrir la puerta a los bots de IA o dejarla cerrada mientras buena parte del mercado colombiano ni siquiera sabe que esa puerta existe.

Compartir
Leonardo E. Báez

Leonardo E. Báez

Diseñando sitios web desde 2004 y haciendo SEO desde 2014, aprendiz constante sobre nuevas tecnologías para la web. Apasionado por la cocina, la música y la IA aplicada a usabilidad, marketing digital y posicionamiento en buscadores (y ahora en LLM´s).

Deja un comentario Cancelar respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Lo + reciente

  • Robots.txt para IA: configura tu sitio para que ChatGPT y Google IA puedan leerlo0
    Robots.txt para IA: configura tu sitio para que ChatGPT y Google IA puedan leerlo
    28 agosto, 2026
  • Cuántos Colombianos ya usan ChatGPT para buscar (y qué significa para tu negocio)0
    Cuántos Colombianos ya usan ChatGPT para buscar (y qué significa para tu negocio)
    26 agosto, 2026
  • Zero-Click, por qué tu tráfico orgánico cae sin bajar de posición0
    Zero-Click, por qué tu tráfico orgánico cae sin bajar de posición
    24 agosto, 2026
  • Por qué tu SEO ya no es suficiente (y qué hacer al respecto en 2026)0
    Por qué tu SEO ya no es suficiente (y qué hacer al respecto en 2026)
    21 agosto, 2026
  • Por qué rankear primero en Google no garantiza que ChatGPT te cite0
    Por qué rankear primero en Google no garantiza que ChatGPT (u otras IAs) te citen
    19 agosto, 2026

Síguenos

  • Inicio
  • Agencia Boutique
  • SEO
  • Blog
  • Contáctanos
  • Cápsulas SEO
  • Política de Privacidad

Para contactarnos

01
Celular
+57 315 321 8102
02
E-mail
info@designsandit.com
03
Horario
Lun-Vie: 9AM - 5PM
¡Escríbenos!

© 2004 - 2026 | Designs and I.T. - Agencia SEO en Colombia y Estados Unidos - SEO Local. | Todos los Derechos Reservados.

¡Contáctanos por WhatsApp!