Por qué hasta hoy había que elegir entre aparecer en Google o regalar el contenido a las IAs
Si tienes una web, hasta ahora la elección era agria: dejar que los grandes crawlers usen tu contenido para entrenar modelos, o bloquearlos y arriesgarte a desaparecer de Google. El motivo es que Googlebot, Bingbot y Applebot mezclan dos trabajos en una sola araña — indexar páginas para el buscador y, a la vez, alimentar datos a productos de IA. Bloqueabas uno y, sin querer, bloqueabas el otro.
Cloudflare anuncia este 15 de septiembre una solución específica para ese dilema: una nueva opción llamada Disallow AI Training que rechaza el entrenamiento sin tocar el posicionamiento. Apple, Google y Microsoft ya se comprometieron a respetarla (algunas, dentro de plazos definidos) y obtienen la etiqueta "Accountable" de Cloudflare por hacerlo, según el anuncio oficial de la compañía.
Qué cambia el 15 de septiembre de 2026
Tres movimientos concretos entran en vigor hoy en el panel de Bot Management y AI Crawl Control de Cloudflare:
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad- Block y "Block on pages with ads" ahora aplican a los crawlers de uso mixto (Applebot, Bingbot, Googlebot). Elegir "Bloquear" los expulsa del sitio, búsqueda incluida. Para detener solo el entrenamiento, hay que usar la nueva opción Disallow AI Training.
- "Block AI Bots" se deprecia y se reemplaza por controles granulares de Search, Training y Agent.
- Managed Robots.txt también se deprecia y migra a Bot Preference Sync, que publica la preferencia en tu
robots.txtautomáticamente.
Según TechCrunch, la nueva configuración por defecto aplica a nuevos clientes, a sitios nuevos de clientes actuales y a todos los usuarios gratuitos que no tocaron sus ajustes: las páginas con anuncios bloquean por defecto a bots de entrenamiento y de agentes, y solo dejan pasar a los de búsqueda.
La nueva gramática de crawlers: Search, Training y Agent
Cloudflare ahora clasifica cada bot por comportamiento, y un mismo bot puede exhibir más de uno. Las tres categorías que un editor puede controlar son:
- Search: crawling para construir el índice del buscador.
- Training: crawling para entrenar o ajustar un modelo.
- Agent: agentes que actúan en nombre de un humano (chat fetch bots, browser-use agents).
Un crawler de uso mixto es el que combina Search y Training en una sola identidad. Ahí nace la trampa. Para esos, Cloudflare introduce Disallow AI Training: publica una directiva Disallow específica en tu robots.txt, deja pasar a los bots "Accountable" para búsqueda, y bloquea al resto — incluidos los crawlers de entrenamiento puros de Amazon, Anthropic, Meta y OpenAI, sin afectar a Search.
Qué es la designación "Accountable"
Cloudflare creó esta etiqueta para reconocer operadores que cumplen (o se comprometieron a cumplir dentro de plazos definidos) cuatro condiciones:
- Mecanismo para que el editor desactive el entrenamiento vía
robots.txto un estándar equivalente. - Mecanismo para desactivar AI summaries, primero con cada operador y, según Cloudflare, "el año que viene" desde el propio panel.
- Visibilidad a nivel de URL sobre qué páginas fueron usadas para entrenamiento, con métricas de cómo aparecieron en búsqueda.
- Garantía de que desactivar el entrenamiento no afecta el ranking en búsqueda tradicional.
Apple, Google y Microsoft ya reciben esa etiqueta. Cada una mezcla capacidades disponibles hoy con compromisos calendarizados. Amazon, Anthropic, Meta y OpenAI también califican como Accountable, pero separan sus crawlers de Search y Training, lo que permite a Cloudflare bloquear el de entrenamiento sin tocar la búsqueda.
Cómo queda el cuadro por buscador
- Applebot (Apple): opt-out de entrenamiento con
DisallowparaApplebot-Extendedenrobots.txt. Apple asegura que no impacta el ranking de búsqueda. Falta una herramienta de inspección a nivel de URL; según Cloudflare, está en desarrollo. - Googlebot (Google): opt-out con
DisallowparaGoogle-Extended, más un toggle en Search Console para excluir el sitio de resultados generativos. Google promete herramientas de transparencia a nivel de URL en las próximas semanas. - Bingbot (Microsoft): control granular vía Webmaster Tools y meta tag
NOARCHIVE. Microsoft está construyendo el respeto a una preferenciano trainingenrobots.txta nivel de dominio, con meta principios de 2027. Hasta entonces, elegir Disallow AI Training no transmite automáticamente esa preferencia a Bing porrobots.txt.
Por qué importa el timing
El movimiento llega en un momento bisagra. Cloudflare reportó que los bots ya superan a los humanos en tráfico web, un hito que la propia compañía esperaba "no hasta el año que viene", según declaró a TechCrunch su CEO Matthew Prince. Y el dato que incomoda a Google: según Cloudflare, su Googlebot le da acceso a "aproximadamente el doble de información" que a otros competidores, porque mezclan indexación con entrenamiento y eso dificulta a los editores negarse a uno sin perder el otro.
Google respondió que Google-Extended ya permite opt-out sin afectar al ranking. Es cierto, pero el Googlebot principal — el que da el tráfico que importa — sigue siendo el mismo bot, y ahí sigue la trampa que Cloudflare intenta romper.
En paralelo, según The Next Web, Reino Unido ya obliga a Google a permitir que los publishers rechacen los resúmenes de IA sin perder ranking, y varios editores tienen litigios abiertos contra OpenAI por el uso de contenido en entrenamiento. Cloudflare coloca su nueva opción justo en medio de esa pelea.
Qué significa esto para tu startup
Si tu sitio corre sobre Cloudflare — o si lo vas a mover ahí — la decisión ya viene tomada en parte por los nuevos defaults. Para no llevarte sorpresas, conviene revisar tres cosas esta semana.
- Audita qué tipo de sitio tienes: si monetizas con anuncios, los nuevos defaults bloquearán Training y Agent en páginas con ads desde el día uno. Si vendes otro tipo de conversión (suscripción, lead, demo), quizá quieras permitir Search y Agent y solo cortar Training.
- Verifica el
robots.txtdespués del 15 de septiembre: Bot Preference Sync publica la preferencia por ti, pero si tenías reglas a mano, conviene revisar que no se contradigan con las nuevas directivas. Search Engine Journal reportó casos de editores viendo HTTP 403 al subir sitemaps porque Cloudflare bloqueaba Googlebot junto con los bots de entrenamiento — un efecto que la nueva opción Disallow AI Training debería resolver, pero que conviene probar antes de darlo por hecho. - Piensa en AI summaries como segunda capa: según datos citados por Cloudflare, más de la mitad de los consumidores leen resúmenes en Search, y quienes lo hacen terminan la búsqueda un 40% más sin hacer clic. Pero los referidos desde AI Search convierten entre 3 y 5 veces más que los de búsqueda tradicional. Son métricas con efectos opuestos sobre tus KPIs — decides según tu modelo de negocio.
Acción concreta n.º 1: entra al panel de Cloudflare antes del 15 de septiembre y confirma si tu sitio está marcado como "monetizado con anuncios". Ese solo toggle cambia el preset por defecto de Training de Allow a Disallow AI Training, y el de Agent a Block on pages with ads.
Acción concreta n.º 2: si dependes de Bing, documenta manualmente el uso del meta tag NOARCHIVE en tus páginas más valiosas, porque hasta principios de 2027 Bing no va a leer la preferencia no training desde robots.txt.
Fuentes
- Have it both ways: stay discoverable in search while disallowing AI training — Cloudflare Blog
- Cloudflare's new policy pushes AI companies to pay for publishers' content — TechCrunch
- Cloudflare Gives AI Agents Wallets That Pay For What They Access — Search Engine Journal
- Cloudflare gives AI crawlers a September deadline: pay publishers or get blocked — The Next Web
- Report That Cloudflare AI Bot Blocking Prevents Googlebot From Indexing Sites — Search Engine Journal
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad














