Cloudflare cierra la brecha entre lo que dices y lo que ejecutas
Hasta hoy, cualquier sitio protegido por Cloudflare podía encontrarse con una contradicción operativa: su archivo robots.txt decía una cosa y sus reglas de Bot Management hacían otra. Esa descoordinación la aprovechaban crawlers混合 — bots que mezclan indexación, entrenamiento y tareas de agente detrás de un mismo identificador — para ignorar la preferencia del dueño del sitio o intentar rodear el bloqueo en el borde.
El 21 de agosto de 2026, Cloudflare anunció Bot Preference Sync, una función que escribe automáticamente en tu robots.txt exactamente lo que ya configuraste para Search, Agent y Training en el dashboard de la zona. El resultado: lo que declaras al mundo y lo que enforces en el edge quedan alineados, sin tener que mantener un archivo estático a mano.
Qué hace exactamente Bot Preference Sync
La función es deliberadamente simple. Si ya configuraste tu política de bots de IA en el panel — Allow, Block en páginas con anuncios o Block en todo, según la categoría — Cloudflare genera o actualiza tu robots.txt para reflejarlo. El bloque generado se antepone a cualquier contenido que ya tengas en el archivo, así que los Disallow existentes se mantienen.
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidadPara Training específicamente, la opción se llama Disallow y escribe una preferencia "no training" en el robots.txt. La diferencia clave frente a un bloqueo puro es que crawlers cooperantes que toman el paso extra de transparencia siguen pudiendo entrar a indexar tu sitio, así tu visibilidad en búsqueda no se ve afectada cuando optas por sacar tu contenido del entrenamiento.
La función estará disponible la semana del 21 de agosto de 2026 para todos los clientes, desde el plan Free hasta Enterprise. Para nuevos clientes viene activada por defecto. Los clientes existentes que usaban el robots.txt administrado legado recibirán un prompt en su dashboard para confirmar sus preferencias y migrar.
Por qué importa: el problema del robots.txt como simple sugerencia
El estándar robots.txt nació en 1994 para un internet de bots bien portados. En 2026 eso no se sostiene. Según datos de la propia industria recogidos por Cloudflare en su reporte del aniversario del Content Independence Day, los crawlers de IA violan robots.txt un promedio de 156 veces por sitio en periodos de tres semanas, y alrededor del 13% de los bots los ignora por completo.
El problema se agravó con los crawlers mixed-use: bots que unifican Search, Agent y Training bajo el mismo User-agent. El 36% de toda la actividad de crawlers en la red de Cloudflare corresponde hoy a esta categoría. Si bloqueas Training sin saber que ese mismo bot también indexa para búsqueda, te borras del buscador como efecto colateral.
Esa es exactamente la tensión que Cloudflare lleva un año intentando resolver. El 1 de julio de 2026 lanzó los controles granulares por categoría (Search, Agent, Training) y fijó el 15 de septiembre de 2026 como fecha en la que los crawlers混合 de Googlebot, Applebot y BingBot serán tratados bajo la regla más restrictiva aplicable en páginas con anuncios. Bot Preference Sync es la pieza que faltaba para que esa política se propague sola al robots.txt, sin que tengas que mantener dos fuentes de verdad.
El nuevo estándar de transparencia: lo que Cloudflare exige a los bots "verificados"
Bot Preference Sync llega acompañado de un endurecimiento del programa Verified para bots. Antes, un bot verificado pasaba por defecto; ahora, verificado solo significa que puede ser permitido — la categoría configurada por el dueño del sitio es la que decide si entra.
Para que un bot mixto no sea bloqueado cuando el dueño marca "Disallow Training", su operador tiene que demostrar cuatro cosas:
- Respeta una preferencia "no training" en
robots.txtmediante cualquier mecanismo - Ofrece a los dueños del sitio una forma de opt-out de resúmenes generados por IA
- Provee visibilidad a nivel de URL de qué páginas se usaron para entrenamiento, además de métricas de resultados de búsqueda
- Puede mostrar públicamente que deshabilitar Training no afecta el ranking tradicional de búsqueda
Los bots de operadores de IA que cumplen estos criterios se rastrean públicamente en la sección de AI bot transparency de Cloudflare Radar, con ejemplos de buenas prácticas y de incumplimientos. Quienes no los cumplen no tienen beneficio de la duda: cuando un sitio dice "no training", quedan bloqueados. La transparencia deja de ser un nice-to-have y pasa a ser el precio de entrada.
Una excepción útil para sitios monetizados con anuncios
Un detalle que a los founders con medios les va a gustar: en el onboarding, los sitios que se identifican como "monetizo con anuncios en este dominio" tendrán Training en Disallow como default. Así pueden quedarse en búsqueda mientras mantienen su contenido fuera del entrenamiento de modelos, sin tener que configurarlo a mano. Los demás sitios nuevos no reciben ningún bloque por defecto: la elección es del cliente desde el primer momento.
Qué significa esto para tu startup
Si tu sitio corre sobre Cloudflare (recordemos: está frente a más del 20% de los dominios del mundo según datos del propio Internet Governance Project citados en cobertura reciente), este lanzamiento te cambia tres decisiones operativas que probablemente venías postergando.
1. Audita tu política de bots antes del 15 de septiembre. La regla de "strictest rule applies" para crawlers混合 entra en vigor esa fecha. Si activaste el viejo toggle "Block AI Bots" y no has revisado nada, Googlebot empezará a ser bloqueado en tus páginas con anuncios. Decide si eso es lo que quieres o ajusta en Security Settings antes del deadline.
2. Deja que Bot Preference Sync haga el trabajo mecánico. Si tu estrategia es "permitir búsqueda, permitir agentes, no entrenar conmigo", ya no tienes que mantener un robots.txt estático a la vez que tu configuración en el dashboard. Activa el sync, deja que escriba por ti y dedícate a pensar en estrategia, no en sintaxis. La función viene activada por defecto para clientes nuevos, y para los existentes será opcional pero recomendado.
3. Empieza a pensar en Pay Per Crawl como línea de negocio, no como curiosidad. El programa de monetización directa de Cloudflare para AI crawlers, anunciado en julio de 2026 y basado en el protocolo abierto x402 (donado por Coinbase a la Linux Foundation en abril de 2026, con AWS, Stripe, Google y Microsoft entre los miembros fundadores), ya tiene socios comerciales como Ceramic.ai, You.com y, según TechCrunch, otros operadores en camino. Si tu modelo depende de contenido original — un medio nicho, una base de datos técnica, documentación proprietary —, esta es la ventana para diseñar cómo vas a cobrar cuando un agente use tu trabajo en lugar de referirte tráfico. La pregunta ya no es si vas a participar, sino a qué precio.
Fuentes
- Cloudflare: Say it once: introducing Bot Preference Sync
- TechCrunch: Cloudflare's new policy pushes AI companies to pay for publishers' content
- TechCrunch: Patreon stops asking AI bots not to scrape — and starts blocking them
- Forbes: Bots Now Outnumber Humans Online And The Internet Was Never Built For This
- TechTimes: Cloudflare Separates AI Crawlers by Purpose and Opens Door to Charging Them Directly
- Search Engine Journal: Cloudflare's AI Crawler Rules Can Block Googlebot
- The Next Web: Cloudflare gives AI crawlers a September deadline: pay publishers or get blocked
🤖 La IA no es solo para leer sobre ella
En la comunidad la aplicamos: automatización, agentes IA y herramientas reales para emprender, no solo para informarte.
👥 Aplicarla en la comunidad













