
Le preguntas a ChatGPT o a Perplexity por servicios como el tuyo y tu empresa nunca aparece. Revisas tu posición en Google y ahí sí sales, incluso en los primeros resultados. El problema casi nunca es lo que escribiste en tu web. Es que un bot de IA llegó a esa misma web y se encontro con una barrera técnica que Google tolera sin problema y que los rastreadores de IA no perdonan.
Esa diferencia de trato entre buscadores tradicionales y motores generativos es justamente lo que explica qué es GEO y cómo evalúan los modelos tu sitio: reglas nuevas, con exigencias técnicas propias que Google nunca tuvo.
Estos son los cinco errores más comunes que dejan un sitio invisible para ChatGPT, Perplexity, Gemini y Claude aunque ese mismo sitio rankee bien en Google. Cada uno incluye cómo detectarlo en pocos minutos y qué corregir primero.
Error 1: El robots.txt bloquea a los bots de IA sin que nadie se dé cuenta
Muchos plugins de seguridad y configuraciones de hosting bloquean por defecto a los rastreadores nuevos, y los bots de IA entran en esa categoría desde hace apenas un par de años. Si tu robots.txt no tiene reglas explícitas para GPTBot, ClaudeBot o PerplexityBot, el bot sigue la directiva general del archivo. Cuando esa directiva general es restrictiva, tu contenido queda bloqueado sin que nadie haya tomado esa decisión a propósito.
Aquí hay un matiz que casi nadie explica bien. Existen dos tipos de bots de IA y conviene tratarlos distinto. Los bots de entrenamiento (GPTBot, Google-Extended, anthropic-ai) recogen contenido para entrenar modelos futuros. Los bots de recuperación (ChatGPT-User, OAI-SearchBot, Claude-User, PerplexityBot) leen tu web en tiempo real cuando alguien le hace una pregunta a la IA sobre tu categoría de negocio. Bloquear los primeros es una decisión sobre propiedad intelectual, algo legítimo si no quieres que tu contenido entrene modelos futuros. Bloquear los segundos por accidente es perder la visibilidad que estás buscando, porque son justo los que le permiten a ChatGPT o a Perplexity leer tu página cuando alguien pregunta por tu categoría en el momento real de la consulta. La diferencia entre GPTBot y OAI-SearchBot, dos nombres que suenan igual pero cumplen funciones opuestas, es justo el tipo de confusión que lleva a bloquear por error al bot equivocado.
Diagnóstico rápido
Entra a tudominio.com/robots.txt directamente en el navegador y busca líneas con “GPTBot”, “ClaudeBot” o “PerplexityBot”. Si no aparecen, o si ves un Disallow: / general sin excepciones para ningún user-agent, tienes el problema. Muchos plugins de seguridad de WordPress activan esa regla general sin avisar durante una instalación por defecto.
Cómo corregirlo
Decide primero qué prioridad tienes. Si tu objetivo es visibilidad en respuestas de IA, permite explícitamente a los bots de recuperación. Si además te preocupa que tu contenido entrene modelos futuros, bloquea por separado a los bots de entrenamiento sin tocar a los de recuperación. En Colombia, donde la mayoría de negocios apenas empieza a construir presencia en IA, la prioridad casi siempre es dejar pasar a los bots de recuperación mientras se decide con calma qué hacer con los de entrenamiento. La configuración exacta de reglas para cada tipo de bot, con ejemplos de sintaxis listos para copiar, está desarrollada en nuestra guía de robots.txt para IA.
Error 2: El contenido depende de JavaScript para mostrarse
Si tu web está construida con React, Angular o Vue y renderiza el contenido en el navegador del usuario, un bot de IA que llega a esa URL puede encontrarse con una página prácticamente vacía. Ve el esqueleto HTML, pero no el texto real. Los títulos, los párrafos, los precios, todo eso se genera después, cuando el navegador ejecuta el código. Los rastreadores de IA de hoy tienen menos capacidad para ejecutar JavaScript que Googlebot. Lo que Google logra leer sin esfuerzo, la IA muchas veces no.
Esto no significa que tener un sitio moderno sea un problema en sí mismo. El problema aparece cuando el contenido crítico, el que responde la pregunta del usuario, solo existe después de que el navegador termine de procesar el JavaScript.
Diagnóstico rápido
Desactiva JavaScript en tu navegador, en Chrome se hace desde las herramientas de desarrollador, y visita tu propia web. Si el contenido principal desaparece o queda incompleto, un bot de IA está viendo exactamente eso: una página en blanco donde debería haber información.
Cómo corregirlo
El contenido crítico de cada página, títulos, texto principal, datos de contacto, tiene que estar presente en el HTML que entrega el servidor en la primera respuesta, sin depender de que el navegador ejecute código después. Si tu sitio está en WordPress, este problema casi nunca aplica porque WordPress genera el HTML en el servidor por defecto. Si usa un framework moderno sin renderizado del lado del servidor, sí es una prioridad técnica real, y la solución pasa por implementar Server-Side Rendering o generar páginas estáticas para el contenido que necesita ser leído por bots externos.
Error 3: Las cadenas de redirección son demasiado largas
Este es el error que más webs bien posicionadas en Google pierden en IA sin saberlo, porque Google y los rastreadores de IA tienen tolerancias muy distintas. Google tolera hasta diez saltos de redirección antes de dejar de seguir una URL. Los rastreadores de IA en tiempo real, como OAI-SearchBot o Perplexity-User, abandonan al tercer salto y no reintentan.
Una cadena típica y silenciosa funciona así. La URL sin https redirige a la versión con https. Esa redirige a la versión con www. Y esa, a su vez, redirige a la carpeta final donde vive el contenido real. Son tres saltos que Google sigue sin ningún problema y que un bot de IA en tiempo real simplemente descarta a mitad de camino, sin dejar ninguna señal de error visible en ningún reporte que puedas revisar después.
Diagnóstico rápido
Revisa tus URLs principales, la página de inicio, las páginas de servicio, los artículos con más tráfico, con una herramienta como httpstatus.io, o con el comando curl -IL desde la terminal si tienes acceso técnico. Cuenta cuántos saltos hace cada URL antes de llegar a su destino final.
Cómo corregirlo
El objetivo es una o dos redirecciones como máximo hacia cualquier URL importante. Cuando encuentres una cadena de tres o más saltos, colapsa la redirección para que apunte directo al destino final, sin pasar por los intermedios. La mayoría de los CMS y paneles de hosting permiten editar esto sin tocar código, aunque conviene hacerlo con acompañamiento técnico para no romper enlaces que ya funcionan.
Error 4: No hay datos estructurados (schema) implementados
El schema es la forma en que le explicas a una máquina qué es cada cosa en tu sitio. Que eres un negocio, qué servicios ofreces, dónde estás ubicado, quién escribió cada artículo. Sin schema, la IA tiene que inferir esa información a partir del texto suelto, y con frecuencia se equivoca o simplemente no le alcanza la confianza para citarte sobre una fuente que sí lo tiene explícito.
| Tipo de schema | Qué comunica | Prioridad |
|---|---|---|
| Organization | Identidad del negocio, logo, perfiles verificables | Crítica |
| LocalBusiness | Ubicación y área de servicio | Crítica para negocios locales |
| Service | Detalle de cada servicio ofrecido | Alta |
| Article | Autor, fecha de publicación y actualización | Alta |
| FAQPage | Preguntas frecuentes con respuesta directa | Alta |
No hace falta implementar los cinco tipos el mismo día. Un negocio local que atiende clientes en su ciudad debería priorizar Organization y LocalBusiness antes que cualquier otro. Una empresa que vende varios servicios distintos gana más implementando Service en cada página de oferta, porque eso le da a la IA una descripción explícita de cada línea de negocio en vez de dejarla adivinar a partir del menú de navegación.
Diagnóstico rápido
Usa el validador de Schema.org sobre cualquier página clave de tu sitio y revisa si aparece algo más que el schema genérico que trae el tema de WordPress por defecto, que suele limitarse a datos básicos de la publicación.
Cómo corregirlo
Empieza por Organization en la página principal y LocalBusiness si tu negocio depende de clientes cercanos. Luego añade Service en cada página de servicio y Article con fecha visible en cada entrada del blog. Prioriza según el tipo de impacto que más necesita tu negocio en este momento, no según la lista completa de opciones disponibles.
Error 5: Errores de servidor y enlaces rotos que la IA no reintenta
Cuando una persona se encuentra un error 404 o un error de servidor, suele volver más tarde o buscar otra ruta para llegar a lo que necesita. Los agentes de IA no tienen esa paciencia. Si una URL devuelve un 404, un 403 o un error 5xx, ese contenido queda descartado para esa consulta y probablemente para las siguientes.
Un estudio reciente de Ahrefs sobre 16 millones de URLs citadas por asistentes de IA encontró que ChatGPT cita páginas con error 404 en un 1,01% de los casos, Claude en un 0,58%, Copilot en un 0,34%, Perplexity en un 0,31% y Gemini en un 0,21%. La cifra confirma algo importante: incluso los modelos más usados fallan al verificar el estado real de una URL antes de citarla. Un enlace roto en tu propio sitio puede estar restándote citas que nunca vas a ver reflejadas en ningún reporte, porque el modelo simplemente descarta el resultado sin avisar a nadie.
Hay una capa adicional que muchos negocios pasan por alto. Si usas Cloudflare u otro CDN, esa capa puede sobrescribir lo que dice tu robots.txt. Cloudflare tiene bloqueos automáticos para bots de IA activados por defecto en varias configuraciones, y es común que una web permita el acceso en su robots.txt mientras el CDN lo bloquea sin que el dueño del sitio lo sepa.
Diagnóstico rápido
En Google Search Console, revisa el informe de páginas para encontrar URLs con error 404. Si usas Cloudflare u otro CDN, revisa también su panel de configuración de bots, no solo el archivo robots.txt del servidor.
Cómo corregirlo
Redirige cada 404 identificado hacia la página viva más relevante, nunca hacia la página principal por defecto, porque eso confunde tanto a Google como a la IA sobre qué contenido reemplaza al que desapareció. Revisa el estado de los bots de IA directamente en la capa del CDN. Si el CDN y el robots.txt del servidor dicen cosas distintas, gana la configuración más restrictiva, y ahí suele estar el bloqueo que nadie había detectado.
Un archivo adicional que es importante revisar
Existe un archivo específico para IA, el llms.txt, que algunos sitios ya empiezan a implementar como guía curada de su contenido para los modelos de lenguaje. No corrige ninguno de los cinco errores anteriores por sí solo, pero complementa el trabajo técnico una vez que el robots.txt, el renderizado y el schema ya están resueltos. Su adopción todavía es baja y ningún proveedor mayor de IA ha confirmado oficialmente que lo procese en producción, así que conviene verlo como higiene técnica adicional, no como el primer paso a resolver. Cubrimos qué es y cómo implementarlo con ejemplos concretos en nuestra guía de llms.txt para sitios colombianos.
Preguntas frecuentes
Los cinco se pueden revisar sin herramientas de pago. Robots.txt visitando la URL directamente en el navegador. JavaScript desactivándolo en las herramientas de desarrollador. Redirecciones con httpstatus.io. Schema con el validador de Schema.org. Y errores de servidor desde el informe de páginas de Google Search Console.
No. Corregirlos elimina las barreras técnicas que impiden que un bot de IA acceda a tu contenido y lo procese. Que te terminen citando depende, además, de que ese contenido responda con datos concretos a lo que la gente le pregunta a la IA sobre tu categoría de negocio, algo que trabajamos en la parte de contenido de nuestra metodología GEO.
El robots.txt y las cadenas de redirección primero, porque son los que impiden el acceso desde el inicio. Si el bot ni siquiera logra entrar a tu sitio, el schema o el renderizado no importan todavía.
El robots.txt mal configurado y los enlaces rotos sí afectan a Google también. Las cadenas de redirección y la dependencia de JavaScript las tolera mejor, y por eso una web puede rankear bien en buscadores tradicionales y seguir siendo invisible para la IA.
La diferencia entre un sitio que la IA puede leer y uno que no suele estar en configuraciones que llevan minutos de corregir, no meses de trabajo. La pregunta es si alguien ya revisó cuáles de estos cinco errores tiene tu sitio en este momento. Si prefieres que lo revise alguien más, así trabajamos el posicionamiento web en Designs and IT.