Cloudflare: bloquear entrenamiento IA sin perder Google

Por qué hasta hoy había que elegir entre aparecer en Google o regalar el contenido a las IAs

Si tienes una web, hasta ahora la elección era agria: dejar que los grandes crawlers usen tu contenido para entrenar modelos, o bloquearlos y arriesgarte a desaparecer de Google. El motivo es que Googlebot, Bingbot y Applebot mezclan dos trabajos en una sola araña — indexar páginas para el buscador y, a la vez, alimentar datos a productos de IA. Bloqueabas uno y, sin querer, bloqueabas el otro.

Cloudflare anuncia este 15 de septiembre una solución específica para ese dilema: una nueva opción llamada Disallow AI Training que rechaza el entrenamiento sin tocar el posicionamiento. Apple, Google y Microsoft ya se comprometieron a respetarla (algunas, dentro de plazos definidos) y obtienen la etiqueta «Accountable» de Cloudflare por hacerlo, según el anuncio oficial de la compañía.

Qué cambia el 15 de septiembre de 2026

Tres movimientos concretos entran en vigor hoy en el panel de Bot Management y AI Crawl Control de Cloudflare:

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad
  • Block y «Block on pages with ads» ahora aplican a los crawlers de uso mixto (Applebot, Bingbot, Googlebot). Elegir «Bloquear» los expulsa del sitio, búsqueda incluida. Para detener solo el entrenamiento, hay que usar la nueva opción Disallow AI Training.
  • «Block AI Bots» se deprecia y se reemplaza por controles granulares de Search, Training y Agent.
  • Managed Robots.txt también se deprecia y migra a Bot Preference Sync, que publica la preferencia en tu robots.txt automáticamente.

Según TechCrunch, la nueva configuración por defecto aplica a nuevos clientes, a sitios nuevos de clientes actuales y a todos los usuarios gratuitos que no tocaron sus ajustes: las páginas con anuncios bloquean por defecto a bots de entrenamiento y de agentes, y solo dejan pasar a los de búsqueda.

La nueva gramática de crawlers: Search, Training y Agent

Cloudflare ahora clasifica cada bot por comportamiento, y un mismo bot puede exhibir más de uno. Las tres categorías que un editor puede controlar son:

  • Search: crawling para construir el índice del buscador.
  • Training: crawling para entrenar o ajustar un modelo.
  • Agent: agentes que actúan en nombre de un humano (chat fetch bots, browser-use agents).

Un crawler de uso mixto es el que combina Search y Training en una sola identidad. Ahí nace la trampa. Para esos, Cloudflare introduce Disallow AI Training: publica una directiva Disallow específica en tu robots.txt, deja pasar a los bots «Accountable» para búsqueda, y bloquea al resto — incluidos los crawlers de entrenamiento puros de Amazon, Anthropic, Meta y OpenAI, sin afectar a Search.

Qué es la designación «Accountable»

Cloudflare creó esta etiqueta para reconocer operadores que cumplen (o se comprometieron a cumplir dentro de plazos definidos) cuatro condiciones:

  • Mecanismo para que el editor desactive el entrenamiento vía robots.txt o un estándar equivalente.
  • Mecanismo para desactivar AI summaries, primero con cada operador y, según Cloudflare, «el año que viene» desde el propio panel.
  • Visibilidad a nivel de URL sobre qué páginas fueron usadas para entrenamiento, con métricas de cómo aparecieron en búsqueda.
  • Garantía de que desactivar el entrenamiento no afecta el ranking en búsqueda tradicional.

Apple, Google y Microsoft ya reciben esa etiqueta. Cada una mezcla capacidades disponibles hoy con compromisos calendarizados. Amazon, Anthropic, Meta y OpenAI también califican como Accountable, pero separan sus crawlers de Search y Training, lo que permite a Cloudflare bloquear el de entrenamiento sin tocar la búsqueda.

Cómo queda el cuadro por buscador

  • Applebot (Apple): opt-out de entrenamiento con Disallow para Applebot-Extended en robots.txt. Apple asegura que no impacta el ranking de búsqueda. Falta una herramienta de inspección a nivel de URL; según Cloudflare, está en desarrollo.
  • Googlebot (Google): opt-out con Disallow para Google-Extended, más un toggle en Search Console para excluir el sitio de resultados generativos. Google promete herramientas de transparencia a nivel de URL en las próximas semanas.
  • Bingbot (Microsoft): control granular vía Webmaster Tools y meta tag NOARCHIVE. Microsoft está construyendo el respeto a una preferencia no training en robots.txt a nivel de dominio, con meta principios de 2027. Hasta entonces, elegir Disallow AI Training no transmite automáticamente esa preferencia a Bing por robots.txt.

Por qué importa el timing

El movimiento llega en un momento bisagra. Cloudflare reportó que los bots ya superan a los humanos en tráfico web, un hito que la propia compañía esperaba «no hasta el año que viene», según declaró a TechCrunch su CEO Matthew Prince. Y el dato que incomoda a Google: según Cloudflare, su Googlebot le da acceso a «aproximadamente el doble de información» que a otros competidores, porque mezclan indexación con entrenamiento y eso dificulta a los editores negarse a uno sin perder el otro.

Google respondió que Google-Extended ya permite opt-out sin afectar al ranking. Es cierto, pero el Googlebot principal — el que da el tráfico que importa — sigue siendo el mismo bot, y ahí sigue la trampa que Cloudflare intenta romper.

En paralelo, según The Next Web, Reino Unido ya obliga a Google a permitir que los publishers rechacen los resúmenes de IA sin perder ranking, y varios editores tienen litigios abiertos contra OpenAI por el uso de contenido en entrenamiento. Cloudflare coloca su nueva opción justo en medio de esa pelea.

Qué significa esto para tu startup

Si tu sitio corre sobre Cloudflare — o si lo vas a mover ahí — la decisión ya viene tomada en parte por los nuevos defaults. Para no llevarte sorpresas, conviene revisar tres cosas esta semana.

  • Audita qué tipo de sitio tienes: si monetizas con anuncios, los nuevos defaults bloquearán Training y Agent en páginas con ads desde el día uno. Si vendes otro tipo de conversión (suscripción, lead, demo), quizá quieras permitir Search y Agent y solo cortar Training.
  • Verifica el robots.txt después del 15 de septiembre: Bot Preference Sync publica la preferencia por ti, pero si tenías reglas a mano, conviene revisar que no se contradigan con las nuevas directivas. Search Engine Journal reportó casos de editores viendo HTTP 403 al subir sitemaps porque Cloudflare bloqueaba Googlebot junto con los bots de entrenamiento — un efecto que la nueva opción Disallow AI Training debería resolver, pero que conviene probar antes de darlo por hecho.
  • Piensa en AI summaries como segunda capa: según datos citados por Cloudflare, más de la mitad de los consumidores leen resúmenes en Search, y quienes lo hacen terminan la búsqueda un 40% más sin hacer clic. Pero los referidos desde AI Search convierten entre 3 y 5 veces más que los de búsqueda tradicional. Son métricas con efectos opuestos sobre tus KPIs — decides según tu modelo de negocio.

Acción concreta n.º 1: entra al panel de Cloudflare antes del 15 de septiembre y confirma si tu sitio está marcado como «monetizado con anuncios». Ese solo toggle cambia el preset por defecto de Training de Allow a Disallow AI Training, y el de Agent a Block on pages with ads.

Acción concreta n.º 2: si dependes de Bing, documenta manualmente el uso del meta tag NOARCHIVE en tus páginas más valiosas, porque hasta principios de 2027 Bing no va a leer la preferencia no training desde robots.txt.

Fuentes

¿te gustó o sirvió lo que leíste?, Por favor, comparte.

🤖 La IA no es solo para leer sobre ella

En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.

👥 Aplicarla en la comunidad

Daily Shot: Tu ventaja táctica

Lo que pasó en las últimas 24 horas, resumido para que tú no tengas que filtrarlo.

Suscríbete para recibir cada mañana la curaduría definitiva del ecosistema startup e inversionista. Sin ruido ni rodeos, solo la información estratégica que necesitas para avanzar:

  • Venture Capital & Inversiones: Rondas, fondos y movimientos de capital.
  • IA & Tecnología: Tendencias, Web3 y herramientas de automatización.
  • Modelos de Negocio: Actualidad en SaaS, Fintech y Cripto.
  • Propósito: Erradicar el estancamiento informativo dándote claridad desde tu primer café.

📡 El Daily Shot Startupero

Noticias del ecosistema startup en 2 minutos. Gratis, todos los días.

Share to...