1 puntos por GN⁺ 2 시간 전 | 1 comentarios | Compartir por WhatsApp
  • Muchos de los casos en que se envían solicitudes suficientes para provocar fallas en un sitio no provienen de Google, sino de bots externos que se hacen pasar por Googlebot
  • El User-Agent de HTTP puede ser definido arbitrariamente por quien hace la solicitud, así que la cadena Googlebot/2.1 en los logs por sí sola no garantiza que sea un Googlebot real
  • Los bots impostores usan el nombre de Googlebot para evadir bloqueos, y también podrían formar parte de una sola campaña maliciosa de rastreo a gran escala que utiliza servidores de varios proveedores de hosting
  • Para verificar si realmente es Googlebot, hay que validarlo con el comando host o con los rangos de IP publicados por Google; incluso una IP cuyo registrante sea Google LLC podría ser una dirección de Google Cloud, por lo que hace falta una verificación adicional
  • No hay datos que prueben que más de la mitad de todo el tráfico de Googlebot sea falso, pero el tráfico de Googlebot que interfiere con el servicio parece provenir principalmente de bots impostores

Malentendidos en torno al tráfico de Googlebot

  • Hay quejas de administradores que dicen que el crawler de búsqueda de Google genera tráfico excesivo, provoca caídas del sitio o actúa como si fuera un DDoS
  • Sin embargo, ese tráfico destructivo podría no venir de Google, sino de solicitudes impostoras enviadas por otros actores que usan el nombre de Googlebot
  • Encontrar la cadena Googlebot en los logs del servidor no basta para concluir que Google es la fuente del tráfico

El User-Agent no es una prueba de identidad

  • Las solicitudes que parecen venir de Googlebot normalmente incluyen un valor como este
  • La misma cadena también puede quedar registrada en los logs de nginx, pero el header User-Agent puede configurarse libremente con cualquier valor que quiera el solicitante
  • El User-Agent no es una credencial verificada, sino una autoidentificación voluntaria, así que cualquiera puede afirmar que es Googlebot

Origen y escala de los bots impostores

  • Parece que quienes suplantan a Googlebot usan ese User-Agent para evadir bloqueos existentes contra bots
  • La IP del ejemplo de log corresponde a un servidor provisto por Virtual Machine Solutions LLC, un proveedor de hosting ajeno a Google
  • La suplantación de Googlebot es una táctica usada desde hace mucho tiempo, y recientemente se ha observado a mayor escala
  • Chris Siebenmann plantea que, más que una vieja táctica reapareciendo al mismo tiempo en muchos lugares, podría tratarse de una campaña a gran escala de un solo crawler malicioso que consiguió muchos servidores en múltiples proveedores de hosting

Cómo verificar si es el Googlebot real

  • Siguiendo la documentación de Google para verificar Googlebot, se puede comprobar ejecutando algunas veces el comando host o comparando con los rangos de IP publicados por Google
  • La mayoría de los crawlers importantes publica listas de IP, aunque el formato específico y la forma de operarlas varían entre ellos
  • JAFAR es una propuesta para estandarizar las listas de IP de crawlers, y el proceso de estandarización sigue en curso
  • Aunque el registrante de una IP figure como Google LLC, podría tratarse de una dirección de hosting de Google Cloud, así que hace falta una validación aparte
    • No se han confirmado casos recientes de suplantación a través de Google Cloud
  • Si la verificación muestra que sí es Googlebot real el que está rastreando en exceso, hay que seguir la documentación de Google sobre cómo responder al rastreo excesivo

Autenticación confiable para bots

  • Agregar simplemente un campo más no sirve de mucho, porque no hay razón para que un actor malicioso configure ese valor de forma honesta
  • El llamado evil bit de RFC 3514 satiriza justamente el hecho de que los actores maliciosos no siguen ese tipo de estándares
  • Web Bot Auth HTTP Signatures es una propuesta más compleja que añadir un campo aparte, pero busca implementar un User-Agent confiable mediante firmas criptográficas

Los límites de la palabra “mayoría”

  • No hay datos que demuestren que los bots falsos sean realmente más de la mitad de todo el tráfico de Googlebot
  • Aun así, la mayoría de los casos de tráfico de Googlebot que han perjudicado gravemente a sitios parecen haber sido causados por Googlebot falsos
  • En la experiencia observada, el Googlebot real suele comportarse de forma muy estable, mientras que los bots impostores pueden seguir enviando solicitudes hasta tirar un sitio

1 comentarios

 
GN⁺ 2 시간 전
Opiniones en Lobste.rs
  • Para los usuarios de bots, TLS mutuo (mTLS) parece encajar bien. No es difícil que los operadores de bots emitan certificados válidos, y los operadores de sitios pueden permitir clientes bot según el dominio
    • Como explica el artículo, la mayoría de los crawlers legítimos publican sus subredes de crawler. También hubo intentos de estandarizar la firma de solicitudes, pero hasta donde sé no se adoptó ampliamente
  • Bloquear todo el tráfico que dice ser googlebot resuelve el problema