1 puntos por GN⁺ 3 시간 전 | 1 comentarios | Compartir por WhatsApp
  • Los clientes de todos los planes ahora pueden permitir o bloquear el tráfico automatizado dividiéndolo en Search·Agent·Training, lo que permite configurar políticas más detalladas que el bloqueo general de bots de IA que existía antes
  • En vez de usar como criterio si se usa IA o no, se clasifica según la acción y el uso del contenido que se realiza en el sitio; a los crawlers multipropósito se les aplican todas las reglas relacionadas y se recomienda separar los crawlers por objetivo
  • A partir del 15 de septiembre de 2026, en las páginas con anuncios de dominios nuevos, Training y Agent quedarán bloqueados por defecto y Search estará permitido; a crawlers multipropósito como Googlebot, Applebot y BingBot se les aplicará la regla más restrictiva
  • En BotBase para Enterprise Bot Management se pueden buscar la clasificación y los ID de detección de bots y agentes conocidos; además se introducen los niveles de uso de contenido immediate·reference·full y la señal use en robots.txt
  • Verified ya no significa permiso automático, y se busca transmitir más allá de las capas intermedias quién es el operador y cómo usa el contenido mediante confianza transitiva usando el encabezado Forwarded de RFC 7239

Por qué hay que controlar el tráfico de IA según su propósito

  • Antes, el rastreo web implicaba recopilar contenido de un sitio a cambio de devolverle tráfico desde búsquedas, pero con el entrenamiento de IA surgió el problema de que toma el contenido sin devolver valor al propietario del sitio
  • Hace un año, Cloudflare lanzó la opción de un clic Block AI Bots y el Pay-Per-Crawl marketplace
  • Los dueños de contenido quieren proteger el original y recibir compensación, pero es difícil cubrir esa necesidad bloqueando toda la automatización por igual
  • Los sitios pequeños pueden verse obligados a permitir incluso el entrenamiento de IA para ganar visibilidad en buscadores, o a bloquear el entrenamiento y perder capacidad de descubrimiento
    • Es una estructura favorable para los buscadores establecidos que usan el mismo bot para búsqueda y entrenamiento
    • Para nuevos participantes que buscan cerrar la brecha competitiva, se genera un incentivo para evitar la detección
  • Con la aparición de servicios que responden directamente en la página de resultados, como Google Search, pasa a ser más importante qué hace, almacena y redistribuye un bot que si es o no de IA

Clasificación Search·Agent·Training

  • Se dividen en tres casos de uso centrados en IA que todos los clientes pueden gestionar
    • Search: recopila o indexa contenido por adelantado y luego responde preguntas; el dueño del sitio puede esperar tráfico de referencia o una compensación equivalente
    • Agent: realiza tareas en tiempo real en lugar de una persona; incluye bots de recopilación para chat como ChatGPT-User y agentes de navegador como Gemini y Claude que operan Chrome
    • Training: toma contenido para entrenar o ajustar modelos; los datos quedan absorbidos de forma permanente en una estructura basada en IA y se usan para mejorar el rendimiento
  • Como un mismo crawler puede tener varios propósitos, se rastrean juntos todos los que correspondan
  • A los operadores que hacen indexación para búsqueda, tareas de agente y entrenamiento de modelos, se les recomienda separar tres crawlers por propósito para dejar claro el objetivo de la visita y los permisos de acceso
  • También se clasifican por separado conductas automatizadas como verificación de anuncios, recolección de feeds y transacciones por agentes, pero Search·Agent·Training son las funciones que todos los dueños de sitios pueden gestionar directamente

Controles disponibles en todos los planes y nuevos valores predeterminados

  • El preset anterior de Block AI Bots bloqueaba sobre todo bots de un solo propósito para entrenamiento de modelos, pero la nueva configuración ofrece controles por Search·Agent·Training hasta en el plan Free
  • A partir del 15 de septiembre de 2026, se aplicarán estos valores predeterminados en las páginas con anuncios de dominios recién registrados en Cloudflare
    • Training y Agent quedarán bloqueados por defecto
    • Search quedará permitido por defecto
  • Como los anuncios son una señal de monetización diseñada para que una persona visite y vea la página, se bloquean Training y Agent, que podrían interrumpir esa atención humana
  • Search queda permitido por defecto porque es el comportamiento más cercano a llevar visitantes al sitio
  • En crawlers multipropósito que hacen Search y Training a la vez, tendrá prioridad la regla más restrictiva
    • Para clientes que elijan bloquear Training, también se bloquearán Googlebot, Applebot y BingBot
    • Esto se aplica tanto a las nuevas opciones de gestión de tráfico de IA como al servicio existente Block AI Bots
  • Los clientes actuales pueden marcar su rechazo al cambio antes del 15 de septiembre en Security settings para mantener la configuración anterior en crawlers de Training que también hacen Search

Visibilidad de bots y clasificación de comportamiento con BotBase

  • BotBase, añadido a Enterprise Bot Management, es una base de datos consultable de tráfico automatizado conocido, incluidos bots y agentes Verified
  • En el dashboard de Cloudflare se puede ver la lista completa de bots y agentes Verified y la nueva clasificación
    • Se puede filtrar el tráfico de un bot específico
    • Se puede copiar el ID de detección para usarlo en reglas de Security
    • La pantalla dedicada está disponible desde la Bot Management configuration card
  • Al principio se enfoca en la visibilidad, y en la segunda mitad de 2026 planea ampliarse a un centro de gestión para controlar directamente el contenido automatizado conocido del sitio
  • BotBase asigna una o más categorías según las acciones que un bot puede realizar en el sitio
    • Search: crawling para aparecer en resultados de búsqueda
    • Agent: agentes que visitan páginas por instrucciones de una persona
    • Training: crawling para entrenamiento o ajuste fino de modelos
    • Transact: tareas de pago en nombre del usuario
    • Data Collection: recopilación de precios, inteligencia competitiva y análisis de terceros
    • Security Testing: escaneo de vulnerabilidades y pruebas de penetración
    • SEO: crawling SEO, auditoría del sitio y revisión de accesibilidad
    • Ads Verification: verificación de ubicación de anuncios y detección de fraude publicitario
    • Social / Link Preview: vista previa de enlaces en plataformas sociales y apps de mensajería
    • Feed Fetching: lectores RSS, agregadores de pódcasts y bots de feeds de noticias
    • Monitoring & Operations: monitoreo de disponibilidad, webhooks y comprobaciones de estado

Niveles de uso de contenido y señales en robots.txt

  • Se está desarrollando una función para gestionar como nivel de uso de contenido (content use) la forma en que un bot almacena y reutiliza el contenido recopilado
    • immediate: solo interactúa y no almacena ni reutiliza
    • reference: indexa, cita una parte y enlaza al original; es el valor predeterminado
    • full: puede resumir y reproducir
  • Al combinar la clasificación del bot y el nivel de uso de contenido, se pueden crear políticas como “permitir Search·SEO·Ads Verification, pero solo hasta reference
  • Se puede decidir el acceso por grupos de comportamiento sin escribir reglas para cada bot individual
  • Se está probando en robots.txt la señal use, una extensión de Content Signals
    • use=immediate
    • use=reference
    • use=full
  • El valor de uso de contenido en robots.txt no ejecuta bloqueos directamente, sino que transmite la preferencia del dueño del sitio
  • A los clientes que usaban search=yes,ai-train=no en robots.txt administrado existente se les agregará use=reference
User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /
  • BotBase también rastrea cómo usa el contenido cada bot, y los bots que abusen de la señal perderán el estatus Verified y dejarán de estar permitidos
  • Los bots que reproducen todo el contenido actualmente no pueden recibir estatus Verified

El significado actualizado de Verified

  • Antes, todos los bots Verified se permitían por defecto, y ese criterio se reflejaba en Bot Fight Mode y en las plantillas de reglas de Enterprise Bot Management
  • Ahora, los bots no verificados seguirán bloqueados por defecto, pero los bots Verified tampoco quedarán permitidos automáticamente
  • Verified significa que el bot es aceptable dentro de las categorías correspondientes, y el acceso real dependerá de si esa categoría, como Search, está permitida
  • Para que un operador obtenga estatus Verified, debe cumplir dos condiciones
    • Debe identificarse con honestidad
    • No debe abusar del acceso obtenido gracias a esa honestidad
  • Cloudflare también está desarrollando herramientas para operadores de bots para que puedan gestionar si quedaron reflejados con precisión en la clasificación de Cloudflare

Confianza transitiva a través de plataformas intermediarias

  • La automatización o los agentes pueden no ser operados directamente por la empresa que los creó, y una sola plataforma de desarrollo puede ejecutar solicitudes en nombre de miles de operadores, desde empresas hasta desarrolladores individuales
  • Cloudflare define como confianza transitiva (transitive trust) la relación que va del dueño del sitio → la empresa propietaria del bot → el usuario final
  • Propone usar el encabezado Forwarded de RFC 7239 para incluir en la solicitud la información del operador que se pierde durante el paso por proxies
Forwarded: for="openai"
  • También se puede transmitir junto con el nivel de uso de contenido
Forwarded: for="openai";use="reference"
  • Si un sitio permite a un operador específico, puede mantener la misma política incluso para solicitudes que pasan por varias capas intermediarias de confianza; el formato detallado puede consultarse en la documentación de autenticación de bots web
  • Como los dominios web detrás de Cloudflare superan el 20%, perder el estado de confianza puede ser un mecanismo de disuasión real para los operadores
  • Cuando se mezcla tráfico de bots y humano, la confianza transitiva puede aplicarse solo a usuarios que estén en condiciones de revelar su identidad
    • Las fuentes pequeñas de tráfico necesitan protección de privacidad
    • Para empresas que buscan cumplir compromisos de privacidad, se necesitan componentes alternativos de configuración como private rate limiting

Estado de despliegue y principios operativos

  • Las nuevas opciones de tráfico de IA ya están disponibles para todos los clientes actuales y pueden configurarse en zone Settings
  • Los nuevos valores predeterminados y el sistema de clasificación apuntan a que el dueño del sitio decida quién usa su contenido y cómo, y a que los operadores de automatización obtengan más acceso cuanto más transparentes sean sobre su propósito
  • Aunque las políticas detalladas seguirán ajustándose según cambien la web y el tráfico automatizado, se mantendrá el principio de poner en el centro la elección y la confianza de quienes crean contenido

1 comentarios

 
GN⁺ 3 시간 전
Opiniones de Hacker News
  • Googlebot usa la misma infraestructura de rastreo tanto para el índice de búsqueda como para el entrenamiento de Gemini, así que desde el 15 de septiembre quedará sujeto a la política de Cloudflare de “bloquear entrenamiento”
    Como se aplica primero la regla más restrictiva, en los sitios de clientes que bloqueen el entrenamiento también se bloquearán rastreadores multipropósito como Googlebot, Applebot y BingBot

    • La forma en que Google obliga a los dueños de sitios a aceptar el entrenamiento de IA o quedar fuera de la búsqueda parece depredadora, injusta e ilegal
      Frenar este tipo de conducta de una empresa con monopolio en búsquedas es justamente para lo que existe la ley antimonopolio, así que ojalá al menos intervengan los reguladores de la UE, y todos los registros de rastreo de Googlebot en los logs de acceso podrían servir como base para reclamar daños
    • Solo después de que Googlebot bombardeara aleatoriamente los sistemas del cliente hasta llevarlos casi a una caída se supo que también se usaba para entrenamiento de IA
      Fue frustrante que fuera difícil incluso encontrar en la búsqueda una forma correcta de rechazar que Google usara el contenido de esa manera
    • Se siente como una amenaza enviada a las empresas que se niegan al robo de contenido
    • Los usuarios usan la búsqueda de una forma u otra, y alguien tiene que indexar las páginas, ya sea un modelo de lenguaje grande o un motor de búsqueda tradicional
  • La postura de Cloudflare en dominios nuevos, de bloquear por defecto el entrenamiento y el rastreo de agentes en páginas con anuncios mientras permite la búsqueda, cansa porque parece que está metido en ambos bandos de la carrera armamentista
    Por un lado ofrece la tecnología para crear agentes y productos de IA, y por otro impulsa este tipo de políticas, así que cuesta confiar de entrada en una empresa así
    También sorprende ver que presenten de forma positiva el poder de otorgar o quitar un ‘estatus de confianza’ basándose en más del 20% de los dominios web

    • No parece correcto decir que está en ambos bandos. Entiendo que los productos de scraping de Cloudflare también buscan funcionar de manera moderada sin tumbar sistemas
    • Parece que intentan crear un punto intermedio: ni permitir rastreo ilimitado ni bloquearlo todo, sino dar herramientas para que productores y consumidores negocien con base en permiso y compensación
  • Ojalá consideren implementar prueba de trabajo (PoW) como Anubis en lugar de las funciones de Cloudflare
    Cada vez hay más casos de sitios protegidos por Cloudflare que bloquean por completo incluso sin CAPTCHA, y aunque cada sitio individual no importe mucho, es sombrío ver cómo estas decisiones erosionan los cimientos de internet

    • La prueba de trabajo como Anubis no sirve. Los bots usan cada vez más navegadores headless para resolver CAPTCHA y pruebas de trabajo y evadir casi todos los bloqueos, así que cada vez es más difícil impedir que el tráfico no deseado golpee sitios y servicios
    • Ojalá no usen Anubis, porque en hardware viejo y smartphones baratos puede tardar varios minutos en permitir el acceso al sitio
    • A menos que se esté navegando con la cadena de agente de usuario de Googlebot, no debería haber un bloqueo total sino como mucho un desafío de Turnstile, y eso no es muy distinto a un desafío de Anubis
      Si hubo un bloqueo completo, probablemente fue una decisión del sitio para bloquear todas las VPN o a usuarios fuera de ciertos países, más que algo propio de Cloudflare
    • En vez de desperdiciar por completo el cómputo con prueba de trabajo, mejor minar Monero, ¿no?
    • Para quien tenga curiosidad, aquí está el enlace de GitHub: https://github.com/techaroHQ/anubis
  • Inquieta dejar voluntariamente en manos de una sola empresa cada vez más dominante quién puede acceder a un sitio
    Si se bloquea por reflejo a los ‘bots’ y a la ‘IA’, al final ni siquiera podrán entrar los agentes de IA que trabajan en nombre del usuario, así que la premisa de la política también está equivocada

  • No queda claro cuál es el resultado final que quieren Cloudflare y la web. No parece que Anthropic, DeepMind, OpenAI ni Google vayan a pagar costos de rastreo; es más probable que firmen acuerdos privados con grandes proveedores de discusión como Reddit
    La función de traer información nueva al contexto seguirá existiendo, pero eso es distinto del scraping indiscriminado

    • Nadie sabe cuál será el resultado. El equilibrio previo alrededor de cómo los motores de búsqueda recolectaban contenido ya era incómodo, pero decir que los bots de IA solo se llevan cosas y no devuelven nada no es una exageración, es la situación actual
      Si Google logra avanzar hacia responder preguntas directamente y casi dejar de enviar usuarios a los sitios originales, desaparecerá a gran escala el valor económico de publicar contenido en la web. Si esto sigue así, Google terminará bloqueado técnica y legalmente, no podrá obtener contenido y todos perderán
      Ni un mundo donde todos trabajen gratis para que solo Google y los motores de IA capturen el valor, ni uno donde se detenga por completo la producción de contenido, son sostenibles; aun así, sigue existiendo la posibilidad de que casi todo el contenido termine tras pago
      Pero los micropagos hasta ahora han fracasado por completo, y si no hay forma de reducir lo suficiente la fricción, gran parte del contenido valioso quedará encerrado y aumentarán los costos de descubrimiento y acceso, lo que podría encoger bruscamente toda la industria del contenido. Si solo quedan pagos grandes, la web comercial será mucho más pequeña y quizá de mayor calidad, pero el costo será considerable
    • Me genera sentimientos encontrados que Cloudflare tome unilateralmente decisiones que afectan el flujo de tráfico de todo internet
      Más allá de que esté liderando, en decisiones así la IETF debería participar directamente para que se pueda considerar a todas las partes interesadas; de lo contrario, internet podría fragmentarse
    • Cloudflare parece querer convertirse en el recaudador universal de impuestos de internet, cobrando 1 penique por cada acceso a una página
      Las grandes empresas existentes podrían incluso recibirlo bien, porque pueden pagarlo mientras levantan una enorme barrera financiera para los nuevos entrantes
    • Las opciones son pagar o morir, y Cloudflare cobrará el peaje con gusto. Apple también ya cobra este tipo de impuesto al recibir 20 mil millones de dólares al año de Google
      Incluso los clientes de Cloudflare probablemente no se preocuparán por cómo trate la empresa a las grandes compañías de IA, siempre que ellos reciban su parte mediante servicios gratis o baratos
  • Me pregunto si es posible configurar algo que permita solo Google, OpenAI, Grok, Claude y Perplexity y bloquee al resto de los bots
    Hoy por hoy, el único que realmente envía visitantes es Google, pero otros grandes servicios de IA también podrían hacerlo en el futuro
    ‘Bloquear bots anónimos’ también podría ser una alternativa. Desde que aumentaron los bots de IA, ha habido mucho daño por enormes volúmenes de solicitudes desde IP residenciales que imitan personas reales, y ese tráfico solo genera costos sin ingresos
    También me pregunto si Amazon CloudFront tiene alguna función para ayudar con eso

    • Google ahora se está moviendo activamente para no enviar visitantes a los sitios
  • Agradezco que Cloudflare sea una de las pocas plataformas que permite a los sitios web elegir cómo relacionarse con la IA y hasta ofrecer una forma de monetizar el tráfico de IA

  • Me pregunto si hay novedades sobre el programa de cobro por rastreo

  • Probé bloquear el entrenamiento de IA y también se bloqueó el bot de búsqueda de Google, así que el tráfico cayó a la mitad, por eso no lo recomiendo

  • Me pregunto si de verdad hay gente usando esta función. Dudo que los scrapers vayan a pagar, e incluso si lo hacen, soy escéptico de que paguen lo suficiente para que valga la pena