44,9 % de los 107 sitios web principales bloquean al menos un rastreador de IA, según un análisis de 2026. El riesgo no es solo una pérdida de tráfico; es una posible desaparición de los nuevos canales donde los usuarios obtienen información hoy en día.
El alcance del problema
Robots.txt ha sido el archivo de referencia para indicar a Googlebot y a otros rastreadores de búsqueda tradicionales qué páginas indexar. Un archivo similar controla ahora a los rastreadores de IA: agentes de software que leen contenido web para generar respuestas para herramientas como ChatGPT, Claude y Perplexity. El estudio reveló que el 44,9 % de los sitios examinados han prohibido deliberadamente al menos uno de estos bots. GPTBot, el rastreador utilizado por los modelos de OpenAI, encabeza la lista de agentes bloqueados.
Una parte sorprendente de los bloqueos proviene de configuraciones de un solo clic en servicios como Cloudflare, donde los propietarios de sitios pueden denegar el acceso a la IA de forma involuntaria mientras intentan reforzar la seguridad.
Qué significa realmente la "rastreabilidad de IA"
La rastreabilidad es la capacidad de un bot para obtener una página. Para la IA, la rastreabilidad determina si un modelo puede extraer los datos más recientes sobre una marca, producto o servicio cuando un usuario hace una pregunta. Si un sitio no es rastreable, la IA no tiene una fuente que citar y la marca desaparece del flujo de respuestas.
El antiguo manual de SEO se centraba en que Googlebot rastreara las páginas para que pudieran clasificarse en una lista de enlaces. La rastreabilidad de IA cambia el objetivo: en lugar de un ranking, el resultado es una recomendación dentro de una respuesta conversacional.
Bots de entrenamiento frente a bots de respuesta
No todos los rastreadores de IA sirven para el mismo propósito.
- Bots de entrenamiento – ejemplos incluyen GPTBot, ClaudeBot y Google-Extended. Estos extraen grandes fragmentos de la web para alimentar los conjuntos de datos masivos que impulsan los modelos de lenguaje subyacentes. Los propietarios de sitios pueden bloquearlos si desean mantener su contenido patentado fuera del entrenamiento de futuros modelos.
- Bots de respuesta – ejemplos incluyen OAI-SearchBot, Claude-SearchBot y PerplexityBot. Estos operan en tiempo real, extrayendo fragmentos específicos para responder a la consulta de un usuario. Bloquear un bot de respuesta significa que el contenido del sitio nunca aparecerá en una respuesta conversacional, incluso si la misma página sigue siendo indexada por los motores de búsqueda tradicionales.
El análisis muestra que muchos sitios están confundiendo ambos conceptos, terminando con una regla general de "bloquear toda la IA" que perjudica la visibilidad sin proteger ninguna propiedad intelectual real.
Por qué se bloquean los bots incorrectos
Un puñado de factores explican esta configuración errónea:
- Ajustes de seguridad predeterminados – las plataformas que ofrecen un único interruptor de "bloquear IA" a menudo lo aplican a todos los rastreadores conocidos, incluidos los bots de respuesta que el sitio realmente desearía que lo alcanzaran.
- Falta de conocimiento – la mayoría de los webmasters conocen robots.txt para Googlebot, pero las nuevas directivas específicas para la IA son menos familiares.
- Temor al uso indebido de los datos – los propietarios temen que los bots de entrenamiento incorporen su contenido en modelos futuros, una preocupación legítima que no se aplica a los bots de respuesta, que solo extraen datos bajo demanda.
Cómo lograr el equilibrio adecuado
- Editar robots.txt – permite explícitamente los bots de respuesta que quieres que te alcancen. Una línea como
User-agent: OAI-SearchBot\nAllow: /permite que el bot de respuesta de OpenAI rastree todo el sitio mientras mantiene bloqueados a otros agentes. - Decidir sobre los datos de entrenamiento – si proteger el material patentado es una prioridad, mantén una regla
Disallowpara GPTBot, ClaudeBot y agentes de entrenamiento similares. - Adoptar llms.txt – este estándar emergente permite a los editores destacar las páginas más importantes para el consumo de la IA, acelerando el proceso de descubrimiento para los bots de respuesta.
- Auditar la configuración de terceros – revisa cualquier configuración de seguridad o CDN que pueda haber bloqueado automáticamente a los rastreadores de IA y ajusta las reglas manualmente.
El compromiso que debes sopesar
Permitir los bots de respuesta mejora la exposición de la marca en las conversaciones impulsadas por IA, pero también significa que el contenido puede reproducirse textualmente en las respuestas dirigidas al usuario. Bloquear los bots de entrenamiento protege los datos para que no se incorporen en los pesos de futuros modelos, pero esto no impide que los bots de respuesta extraigan las mismas páginas públicas.
Si el valor principal de una empresa es el control estricto sobre su propiedad intelectual, un bloqueo más riguroso puede estar justificado, pero el coste es una menor presencia en los canales donde muchos usuarios inician ahora sus investigaciones. Por el contrario, un sitio de comercio electrónico que prospera gracias al descubrimiento de productos probablemente se beneficiará más de ser rastreable por la IA que del riesgo marginal de unos pocos fragmentos citados.
Qué observar a continuación
- Adopción de llms.txt – a medida que el estándar gane tracción, las herramientas que lo analicen podrían convertirse en la forma principal en que los bots de respuesta de IA localicen contenido de alto valor.
- Cambios en las políticas de los proveedores de IA – OpenAI, Anthropic y otros podrían refinar sus políticas de rastreo (crawler), ofreciendo potencialmente mecanismos de inclusión (opt-in) más granulares.
- Orientación legal sobre los datos de entrenamiento de la IA – los debates actuales sobre si el contenido público extraído (scraped) puede utilizarse para el entrenamiento de modelos podrían influir en cuántos sitios deciden bloquear directamente a los bots de entrenamiento.
En resumen: si una marca quiere seguir siendo visible donde los usuarios cada vez hacen más preguntas en lugar de escribir palabras clave, debe hacer que su sitio sea rastreable por la IA. El primer paso es una simple edición de robots.txt; el segundo es una decisión clara sobre qué datos se siente cómoda compartiendo con la próxima generación de búsqueda. Ignorar la distinción entre los bots de entrenamiento y los de respuesta podría dejar a una empresa invisible en el mismo espacio que está redefiniendo la forma en que se encuentra la información.
