- Los clientes de todos los planes ahora pueden permitir o bloquear el tráfico automatizado dividiéndolo en Search·Agent·Training, lo que permite configurar políticas más detalladas que el bloqueo general de bots de IA que existía antes
- En vez de usar como criterio si se usa IA o no, se clasifica según la acción y el uso del contenido que se realiza en el sitio; a los crawlers multipropósito se les aplican todas las reglas relacionadas y se recomienda separar los crawlers por objetivo
- A partir del 15 de septiembre de 2026, en las páginas con anuncios de dominios nuevos, Training y Agent quedarán bloqueados por defecto y Search estará permitido; a crawlers multipropósito como Googlebot, Applebot y BingBot se les aplicará la regla más restrictiva
- En BotBase para Enterprise Bot Management se pueden buscar la clasificación y los ID de detección de bots y agentes conocidos; además se introducen los niveles de uso de contenido
immediate·reference·full y la señal use en robots.txt
- Verified ya no significa permiso automático, y se busca transmitir más allá de las capas intermedias quién es el operador y cómo usa el contenido mediante confianza transitiva usando el encabezado
Forwarded de RFC 7239
Por qué hay que controlar el tráfico de IA según su propósito
- Antes, el rastreo web implicaba recopilar contenido de un sitio a cambio de devolverle tráfico desde búsquedas, pero con el entrenamiento de IA surgió el problema de que toma el contenido sin devolver valor al propietario del sitio
- Hace un año, Cloudflare lanzó la opción de un clic Block AI Bots y el Pay-Per-Crawl marketplace
- Los dueños de contenido quieren proteger el original y recibir compensación, pero es difícil cubrir esa necesidad bloqueando toda la automatización por igual
- Los sitios pequeños pueden verse obligados a permitir incluso el entrenamiento de IA para ganar visibilidad en buscadores, o a bloquear el entrenamiento y perder capacidad de descubrimiento
- Es una estructura favorable para los buscadores establecidos que usan el mismo bot para búsqueda y entrenamiento
- Para nuevos participantes que buscan cerrar la brecha competitiva, se genera un incentivo para evitar la detección
- Con la aparición de servicios que responden directamente en la página de resultados, como Google Search, pasa a ser más importante qué hace, almacena y redistribuye un bot que si es o no de IA
Clasificación Search·Agent·Training
- Se dividen en tres casos de uso centrados en IA que todos los clientes pueden gestionar
- Search: recopila o indexa contenido por adelantado y luego responde preguntas; el dueño del sitio puede esperar tráfico de referencia o una compensación equivalente
- Agent: realiza tareas en tiempo real en lugar de una persona; incluye bots de recopilación para chat como ChatGPT-User y agentes de navegador como Gemini y Claude que operan Chrome
- Training: toma contenido para entrenar o ajustar modelos; los datos quedan absorbidos de forma permanente en una estructura basada en IA y se usan para mejorar el rendimiento
- Como un mismo crawler puede tener varios propósitos, se rastrean juntos todos los que correspondan
- A los operadores que hacen indexación para búsqueda, tareas de agente y entrenamiento de modelos, se les recomienda separar tres crawlers por propósito para dejar claro el objetivo de la visita y los permisos de acceso
- También se clasifican por separado conductas automatizadas como verificación de anuncios, recolección de feeds y transacciones por agentes, pero Search·Agent·Training son las funciones que todos los dueños de sitios pueden gestionar directamente
Controles disponibles en todos los planes y nuevos valores predeterminados
- El preset anterior de Block AI Bots bloqueaba sobre todo bots de un solo propósito para entrenamiento de modelos, pero la nueva configuración ofrece controles por Search·Agent·Training hasta en el plan Free
- A partir del 15 de septiembre de 2026, se aplicarán estos valores predeterminados en las páginas con anuncios de dominios recién registrados en Cloudflare
- Training y Agent quedarán bloqueados por defecto
- Search quedará permitido por defecto
- Como los anuncios son una señal de monetización diseñada para que una persona visite y vea la página, se bloquean Training y Agent, que podrían interrumpir esa atención humana
- Search queda permitido por defecto porque es el comportamiento más cercano a llevar visitantes al sitio
- En crawlers multipropósito que hacen Search y Training a la vez, tendrá prioridad la regla más restrictiva
- Para clientes que elijan bloquear Training, también se bloquearán Googlebot, Applebot y BingBot
- Esto se aplica tanto a las nuevas opciones de gestión de tráfico de IA como al servicio existente Block AI Bots
- Los clientes actuales pueden marcar su rechazo al cambio antes del 15 de septiembre en Security settings para mantener la configuración anterior en crawlers de Training que también hacen Search
Visibilidad de bots y clasificación de comportamiento con BotBase
- BotBase, añadido a Enterprise Bot Management, es una base de datos consultable de tráfico automatizado conocido, incluidos bots y agentes Verified
- En el dashboard de Cloudflare se puede ver la lista completa de bots y agentes Verified y la nueva clasificación
- Se puede filtrar el tráfico de un bot específico
- Se puede copiar el ID de detección para usarlo en reglas de Security
- La pantalla dedicada está disponible desde la Bot Management configuration card
- Al principio se enfoca en la visibilidad, y en la segunda mitad de 2026 planea ampliarse a un centro de gestión para controlar directamente el contenido automatizado conocido del sitio
- BotBase asigna una o más categorías según las acciones que un bot puede realizar en el sitio
- Search: crawling para aparecer en resultados de búsqueda
- Agent: agentes que visitan páginas por instrucciones de una persona
- Training: crawling para entrenamiento o ajuste fino de modelos
- Transact: tareas de pago en nombre del usuario
- Data Collection: recopilación de precios, inteligencia competitiva y análisis de terceros
- Security Testing: escaneo de vulnerabilidades y pruebas de penetración
- SEO: crawling SEO, auditoría del sitio y revisión de accesibilidad
- Ads Verification: verificación de ubicación de anuncios y detección de fraude publicitario
- Social / Link Preview: vista previa de enlaces en plataformas sociales y apps de mensajería
- Feed Fetching: lectores RSS, agregadores de pódcasts y bots de feeds de noticias
- Monitoring & Operations: monitoreo de disponibilidad, webhooks y comprobaciones de estado
Niveles de uso de contenido y señales en robots.txt
- Se está desarrollando una función para gestionar como nivel de uso de contenido (content use) la forma en que un bot almacena y reutiliza el contenido recopilado
immediate: solo interactúa y no almacena ni reutiliza
reference: indexa, cita una parte y enlaza al original; es el valor predeterminado
full: puede resumir y reproducir
- Al combinar la clasificación del bot y el nivel de uso de contenido, se pueden crear políticas como “permitir Search·SEO·Ads Verification, pero solo hasta
reference”
- Se puede decidir el acceso por grupos de comportamiento sin escribir reglas para cada bot individual
- Se está probando en robots.txt la señal
use, una extensión de Content Signals
use=immediate
use=reference
use=full
- El valor de uso de contenido en robots.txt no ejecuta bloqueos directamente, sino que transmite la preferencia del dueño del sitio
- A los clientes que usaban
search=yes,ai-train=no en robots.txt administrado existente se les agregará use=reference
User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /
- BotBase también rastrea cómo usa el contenido cada bot, y los bots que abusen de la señal perderán el estatus Verified y dejarán de estar permitidos
- Los bots que reproducen todo el contenido actualmente no pueden recibir estatus Verified
El significado actualizado de Verified
- Antes, todos los bots Verified se permitían por defecto, y ese criterio se reflejaba en Bot Fight Mode y en las plantillas de reglas de Enterprise Bot Management
- Ahora, los bots no verificados seguirán bloqueados por defecto, pero los bots Verified tampoco quedarán permitidos automáticamente
- Verified significa que el bot es aceptable dentro de las categorías correspondientes, y el acceso real dependerá de si esa categoría, como Search, está permitida
- Para que un operador obtenga estatus Verified, debe cumplir dos condiciones
- Debe identificarse con honestidad
- No debe abusar del acceso obtenido gracias a esa honestidad
- Cloudflare también está desarrollando herramientas para operadores de bots para que puedan gestionar si quedaron reflejados con precisión en la clasificación de Cloudflare
Confianza transitiva a través de plataformas intermediarias
- La automatización o los agentes pueden no ser operados directamente por la empresa que los creó, y una sola plataforma de desarrollo puede ejecutar solicitudes en nombre de miles de operadores, desde empresas hasta desarrolladores individuales
- Cloudflare define como confianza transitiva (transitive trust) la relación que va del dueño del sitio → la empresa propietaria del bot → el usuario final
- Propone usar el encabezado
Forwarded de RFC 7239 para incluir en la solicitud la información del operador que se pierde durante el paso por proxies
Forwarded: for="openai"
- También se puede transmitir junto con el nivel de uso de contenido
Forwarded: for="openai";use="reference"
- Si un sitio permite a un operador específico, puede mantener la misma política incluso para solicitudes que pasan por varias capas intermediarias de confianza; el formato detallado puede consultarse en la documentación de autenticación de bots web
- Como los dominios web detrás de Cloudflare superan el 20%, perder el estado de confianza puede ser un mecanismo de disuasión real para los operadores
- Cuando se mezcla tráfico de bots y humano, la confianza transitiva puede aplicarse solo a usuarios que estén en condiciones de revelar su identidad
- Las fuentes pequeñas de tráfico necesitan protección de privacidad
- Para empresas que buscan cumplir compromisos de privacidad, se necesitan componentes alternativos de configuración como private rate limiting
Estado de despliegue y principios operativos
- Las nuevas opciones de tráfico de IA ya están disponibles para todos los clientes actuales y pueden configurarse en zone Settings
- Los nuevos valores predeterminados y el sistema de clasificación apuntan a que el dueño del sitio decida quién usa su contenido y cómo, y a que los operadores de automatización obtengan más acceso cuanto más transparentes sean sobre su propósito
- Aunque las políticas detalladas seguirán ajustándose según cambien la web y el tráfico automatizado, se mantendrá el principio de poner en el centro la elección y la confianza de quienes crean contenido
1 comentarios
Opiniones de Hacker News
Googlebot usa la misma infraestructura de rastreo tanto para el índice de búsqueda como para el entrenamiento de Gemini, así que desde el 15 de septiembre quedará sujeto a la política de Cloudflare de “bloquear entrenamiento”
Como se aplica primero la regla más restrictiva, en los sitios de clientes que bloqueen el entrenamiento también se bloquearán rastreadores multipropósito como Googlebot, Applebot y BingBot
Frenar este tipo de conducta de una empresa con monopolio en búsquedas es justamente para lo que existe la ley antimonopolio, así que ojalá al menos intervengan los reguladores de la UE, y todos los registros de rastreo de Googlebot en los logs de acceso podrían servir como base para reclamar daños
Fue frustrante que fuera difícil incluso encontrar en la búsqueda una forma correcta de rechazar que Google usara el contenido de esa manera
La postura de Cloudflare en dominios nuevos, de bloquear por defecto el entrenamiento y el rastreo de agentes en páginas con anuncios mientras permite la búsqueda, cansa porque parece que está metido en ambos bandos de la carrera armamentista
Por un lado ofrece la tecnología para crear agentes y productos de IA, y por otro impulsa este tipo de políticas, así que cuesta confiar de entrada en una empresa así
También sorprende ver que presenten de forma positiva el poder de otorgar o quitar un ‘estatus de confianza’ basándose en más del 20% de los dominios web
Ojalá consideren implementar prueba de trabajo (PoW) como Anubis en lugar de las funciones de Cloudflare
Cada vez hay más casos de sitios protegidos por Cloudflare que bloquean por completo incluso sin CAPTCHA, y aunque cada sitio individual no importe mucho, es sombrío ver cómo estas decisiones erosionan los cimientos de internet
Si hubo un bloqueo completo, probablemente fue una decisión del sitio para bloquear todas las VPN o a usuarios fuera de ciertos países, más que algo propio de Cloudflare
Inquieta dejar voluntariamente en manos de una sola empresa cada vez más dominante quién puede acceder a un sitio
Si se bloquea por reflejo a los ‘bots’ y a la ‘IA’, al final ni siquiera podrán entrar los agentes de IA que trabajan en nombre del usuario, así que la premisa de la política también está equivocada
No queda claro cuál es el resultado final que quieren Cloudflare y la web. No parece que Anthropic, DeepMind, OpenAI ni Google vayan a pagar costos de rastreo; es más probable que firmen acuerdos privados con grandes proveedores de discusión como Reddit
La función de traer información nueva al contexto seguirá existiendo, pero eso es distinto del scraping indiscriminado
Si Google logra avanzar hacia responder preguntas directamente y casi dejar de enviar usuarios a los sitios originales, desaparecerá a gran escala el valor económico de publicar contenido en la web. Si esto sigue así, Google terminará bloqueado técnica y legalmente, no podrá obtener contenido y todos perderán
Ni un mundo donde todos trabajen gratis para que solo Google y los motores de IA capturen el valor, ni uno donde se detenga por completo la producción de contenido, son sostenibles; aun así, sigue existiendo la posibilidad de que casi todo el contenido termine tras pago
Pero los micropagos hasta ahora han fracasado por completo, y si no hay forma de reducir lo suficiente la fricción, gran parte del contenido valioso quedará encerrado y aumentarán los costos de descubrimiento y acceso, lo que podría encoger bruscamente toda la industria del contenido. Si solo quedan pagos grandes, la web comercial será mucho más pequeña y quizá de mayor calidad, pero el costo será considerable
Más allá de que esté liderando, en decisiones así la IETF debería participar directamente para que se pueda considerar a todas las partes interesadas; de lo contrario, internet podría fragmentarse
Las grandes empresas existentes podrían incluso recibirlo bien, porque pueden pagarlo mientras levantan una enorme barrera financiera para los nuevos entrantes
Incluso los clientes de Cloudflare probablemente no se preocuparán por cómo trate la empresa a las grandes compañías de IA, siempre que ellos reciban su parte mediante servicios gratis o baratos
Me pregunto si es posible configurar algo que permita solo Google, OpenAI, Grok, Claude y Perplexity y bloquee al resto de los bots
Hoy por hoy, el único que realmente envía visitantes es Google, pero otros grandes servicios de IA también podrían hacerlo en el futuro
‘Bloquear bots anónimos’ también podría ser una alternativa. Desde que aumentaron los bots de IA, ha habido mucho daño por enormes volúmenes de solicitudes desde IP residenciales que imitan personas reales, y ese tráfico solo genera costos sin ingresos
También me pregunto si Amazon CloudFront tiene alguna función para ayudar con eso
Agradezco que Cloudflare sea una de las pocas plataformas que permite a los sitios web elegir cómo relacionarse con la IA y hasta ofrecer una forma de monetizar el tráfico de IA
Me pregunto si hay novedades sobre el programa de cobro por rastreo
Probé bloquear el entrenamiento de IA y también se bloqueó el bot de búsqueda de Google, así que el tráfico cayó a la mitad, por eso no lo recomiendo
Me pregunto si de verdad hay gente usando esta función. Dudo que los scrapers vayan a pagar, e incluso si lo hacen, soy escéptico de que paguen lo suficiente para que valga la pena