
Muchos sitios a nivel mundial bloquearon “todos los bots de IA” en 2024 y 2025, como reacción al scraping agresivo que pasó por aquel entonces. Ese bloqueo genérico puede continuar ahí, sin que nadie lo haya vuelto a revisar y eso es un grave problema porque “bots de IA” no se refiere a una cosa en específico. OpenAI opera dos rastreadores con propósitos opuestos, y confundirlos puede salirte caro. Puedes bloquear el que entrena modelos sin afectar tu visibilidad en absoluto, o puedes bloquear el que sirve tu contenido en las respuestas de ChatGPT sin darte cuenta de que acabas de desaparecer de ahí.
Esa diferencia conecta de manera directa con la optimización para motores generativos que ya trabajamos en nuestro artículo principal de GEO. De nada sirve tener contenido bien construido si el bot que decide citarte nunca pudo leerlo.
GPTBot: el rastreador de entrenamiento
GPTBot es el crawler que OpenAI usa para recolectar contenido público con el que entrena futuras versiones de sus modelos. ¿Qué no hace? No trae tráfico de vuelta, ni cita la fuente en una respuesta puntual y tampoco afecta tu posicionamiento en Google. Su función es exclusivamente nutrir el entrenamiento del modelo.
Bloquear GPTBot es una decisión de negocio válida para tu negocio pues protege el contenido de terminar como material de entrenamiento gratuito para OpenAI. El costo de tomar esa decisión es a largo plazo y no inmediato, y no tiene ninguna relación con si ChatGPT puede o no citarte hoy.
OAI-SearchBot: este es el rastreador que decide si apareces en ChatGPT
OAI-SearchBot es un bot distinto, con un propósito distinto. OpenAI lo usa para indexar contenido apenas se publica y poder citarlo dentro de las respuestas de ChatGPT Search. Si este bot no puede leer tu sitio, ChatGPT no tiene forma de mostrarte como fuente cuando alguien pregunta algo relacionado con tu negocio.
Bloquear OAI-SearchBot no protege nada. Solo saca tu contenido de un canal de descubrimiento que ya está activo y que un competidor tuyo probablemente sí tiene abierto.
| GPTBot | OAI-SearchBot | |
|---|---|---|
| Función | Entrenamiento de modelos | Búsqueda e indexación en vivo para ChatGPT |
| Qué recibes a cambio | Nada, ni tráfico ni cita | Posibilidad de cita con enlace |
| Bloquearlo afecta | Entrenamiento futuro de OpenAI | Tu presencia en ChatGPT Search hoy |
| Decisión típica | Bloquear, si te importa el uso de tu contenido | Permitir, si buscas visibilidad en IA |
Los dos bots respetan robots.txt y funcionan de forma independiente. Bloquear uno no bloquea al otro, así que puedes tomar una decisión distinta para cada uno sin que se contradigan.
El error de configuración más común a día de hoy
El error casi nunca es una decisión consciente de bloquear OAI-SearchBot. Ocurre por arrastre. Un plugin de seguridad que instalaste hace un año pudo bloquear “todo lo que sonara a IA” durante la primera ola de rechazo a los crawlers, y seguramente no volviste a revisar ese plugin desde entonces. Quizás tu equipo de marketing (o tú mismo) pregunta meses después por qué la marca nunca aparece en respuestas de ChatGPT sobre su categoría. La respuesta podría estar en cuatro líneas de un archivo robots.txt que se escribió con otra intención y en otro momento, para un problema diferente.
Un archivo robots.txt que separa entrenamiento de búsqueda se ve así:
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
Con esta configuración sales del entrenamiento de OpenAI y sigues disponible para que ChatGPT te cite cuando alguien pregunta en vivo. Son dos decisiones independientes y no una sola, recuerda eso.
CDN y firewall: el bloqueo que no aparece en el robots.txt
Un robots.txt correcto no garantiza nada si otra capa de tu infraestructura bloquea al bot antes de que llegue a leerlo. En hostings norteamericanos, el caso más frecuente es Cloudflare con su “Bot Fight Mode” activado por defecto, una configuración que bloquea rastreadores legítimos de IA en el borde de la red, antes de que la petición toque tu servidor. Puedes tener el robots.txt perfecto y seguir invisible para ChatGPT porque el bloqueo ocurre una capa más arriba, en un panel que probablemente nunca abriste.
Un análisis de tráfico con datos de más de 300 páginas encontró que GPTBot y OAI-SearchBot rastrean con una frecuencia de casi 4 a 1. Confirma que son rastreos con ritmos y prioridades distintos, no una sola actividad genérica de “IA leyendo tu sitio”. Tratarlos como si fueran lo mismo es justo el punto donde empieza el error.
Verificar ambos por separado, en el archivo y en la infraestructura, es la única forma de confirmar qué está pasando de verdad.
Cómo verificar tu configuración, en dos capas
Capa 1, el archivo. Abre tudominio.com/robots.txt en el navegador y busca las líneas User-agent: GPTBot y User-agent: OAI-SearchBot. Si no existen, tu servidor no tiene ninguna regla específica para ninguno de los dos. En la práctica, eso significa dejar la decisión en manos del valor por defecto de tu hosting, que rara vez favorece la visibilidad en IA.
Capa 2, el CDN o firewall. Si usas Cloudflare, entra a Seguridad → Bots y revisa si el modo de protección contra bots está bloqueando tráfico de IA. Suma a esa revisión los logs del servidor. Un patrón de respuestas 403 al user-agent de OAI-SearchBot confirma el bloqueo, incluso si tu robots.txt dice lo contrario.
Este mismo cruce de capas es la extensión práctica de lo que ya cubrimos en la guía de robots.txt para bots de IA, aplicado esta vez al caso específico de los dos bots de OpenAI.
Un detalle que suele generar falsas alarmas: los cambios en robots.txt no se reflejan de inmediato en los sistemas de rastreo de OpenAI. Pueden tardar hasta un día. Antes de asumir que la corrección no funcionó, conviene esperar ese margen y revisar logs, no solo el archivo.
¿Y ChatGPT-User?
Hay un tercer bot que conviene no mezclar con los dos anteriores. ChatGPT-User solo se activa cuando una persona pega tu URL directamente en un chat, o cuando una acción de un GPT personalizado llama a tu página. No rastrea de forma proactiva ni decide si apareces en resultados de búsqueda, así que la configuración recomendada es casi siempre permitirlo sin mayor análisis. La decisión que de verdad importa para tu visibilidad en GEO está en OAI-SearchBot, no en este tercer bot que actúa por encargo puntual de un usuario.
Qué significa esto para un negocio en Colombia
Los criterios que ChatGPT y Google IA usan para decidir a quién citar parten de una base mínima: que el bot pueda entrar al sitio. Un negocio puede tener contenido sólido, datos actualizados y una estructura interna impecable, y seguir sin aparecer en ChatGPT por una regla técnica que nadie revisó desde que se activó la primera protección anti-scraping, dos años atrás.
La mayoría de las PyMES colombianas usando WordPress para su sitio web, con hosting compartido seguramente no tocaron jamás el archivo robots.txt pensando en IA. Lo que tienen ahí seguramente está marcado por un plugin, una plantilla o el proveedor de hosting, sin que nadie del negocio haya decidido nada al respecto. Un caso típico: un negocio que contrató un servicio de hosting local con un plan de seguridad básico que activa Cloudflare por defecto, instala Yoast o Rank Math sin revisar el archivo generado, y ahí queda la configuración, sin tocarse, durante años. Nadie decidió bloquear a OAI-SearchBot. Simplemente nadie decidió nada, y el valor por defecto terminó decidiendo por ese negocio (dañando el acceso a ser registrado por LLMs).
Auditar esa configuración toma algunos minutos, y suele ser parte de un servicio de SEO cuando el diagnóstico técnico incluye la capa de accesibilidad para IA y no solo el rastreo tradicional de Google. Revisarlo antes de invertir en contenido nuevo para IA evita el escenario más frustrante de todos: escribir piezas pensadas para que ChatGPT cite la marca, mientras un bloqueo técnico de hace dos años sigue impidiendo que el bot entre a leerlas.
Preguntas frecuentes
No. GPTBot solo afecta el entrenamiento de modelos futuros de OpenAI. El bot que decide si apareces en respuestas de ChatGPT Search es OAI-SearchBot, y es una decisión independiente.
Revisa tu robots.txt en busca de una línea Disallow bajo ese user-agent, y revisa la configuración de tu CDN o firewall: el bloqueo puede ocurrir ahí aunque el archivo esté bien configurado.
No. Permitirlo elimina un obstáculo de acceso, pero no asegura ranking ni citas automáticas. Lo que sí hace es evitar quedar fuera del canal por una razón puramente técnica, algo que sí está bajo tu control.
robots.txt? Los cambios pueden tardar hasta un día en reflejarse en los sistemas de rastreo de OpenAI. Conviene revisar logs después de ese período antes de asumir que algo falló.
La diferencia entre aparecer en ChatGPT y quedar fuera puede estar en cuatro líneas de un archivo que nadie ha vuelto a abrir desde que se activó la primera regla anti-bots. Revisarlo hoy toma menos tiempo que seguir preguntándose, mes tras mes, por qué la marca no aparece.