- Muchos de los casos en que se envían solicitudes suficientes para provocar fallas en un sitio no provienen de Google, sino de bots externos que se hacen pasar por Googlebot
- El
User-Agentde HTTP puede ser definido arbitrariamente por quien hace la solicitud, así que la cadenaGooglebot/2.1en los logs por sí sola no garantiza que sea un Googlebot real - Los bots impostores usan el nombre de Googlebot para evadir bloqueos, y también podrían formar parte de una sola campaña maliciosa de rastreo a gran escala que utiliza servidores de varios proveedores de hosting
- Para verificar si realmente es Googlebot, hay que validarlo con el comando
hosto con los rangos de IP publicados por Google; incluso una IP cuyo registrante sea Google LLC podría ser una dirección de Google Cloud, por lo que hace falta una verificación adicional - No hay datos que prueben que más de la mitad de todo el tráfico de Googlebot sea falso, pero el tráfico de Googlebot que interfiere con el servicio parece provenir principalmente de bots impostores
Malentendidos en torno al tráfico de Googlebot
- Hay quejas de administradores que dicen que el crawler de búsqueda de Google genera tráfico excesivo, provoca caídas del sitio o actúa como si fuera un DDoS
- Sin embargo, ese tráfico destructivo podría no venir de Google, sino de solicitudes impostoras enviadas por otros actores que usan el nombre de Googlebot
- Encontrar la cadena Googlebot en los logs del servidor no basta para concluir que Google es la fuente del tráfico
El User-Agent no es una prueba de identidad
- Las solicitudes que parecen venir de Googlebot normalmente incluyen un valor como este
User-Agent: Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)
- La misma cadena también puede quedar registrada en los logs de nginx, pero el header User-Agent puede configurarse libremente con cualquier valor que quiera el solicitante
- El User-Agent no es una credencial verificada, sino una autoidentificación voluntaria, así que cualquiera puede afirmar que es Googlebot
Origen y escala de los bots impostores
- Parece que quienes suplantan a Googlebot usan ese User-Agent para evadir bloqueos existentes contra bots
- La IP del ejemplo de log corresponde a un servidor provisto por Virtual Machine Solutions LLC, un proveedor de hosting ajeno a Google
- La suplantación de Googlebot es una táctica usada desde hace mucho tiempo, y recientemente se ha observado a mayor escala
- Chris Siebenmann plantea que, más que una vieja táctica reapareciendo al mismo tiempo en muchos lugares, podría tratarse de una campaña a gran escala de un solo crawler malicioso que consiguió muchos servidores en múltiples proveedores de hosting
Cómo verificar si es el Googlebot real
- Siguiendo la documentación de Google para verificar Googlebot, se puede comprobar ejecutando algunas veces el comando
hosto comparando con los rangos de IP publicados por Google - La mayoría de los crawlers importantes publica listas de IP, aunque el formato específico y la forma de operarlas varían entre ellos
- JAFAR es una propuesta para estandarizar las listas de IP de crawlers, y el proceso de estandarización sigue en curso
- Aunque el registrante de una IP figure como Google LLC, podría tratarse de una dirección de hosting de Google Cloud, así que hace falta una validación aparte
- No se han confirmado casos recientes de suplantación a través de Google Cloud
- Si la verificación muestra que sí es Googlebot real el que está rastreando en exceso, hay que seguir la documentación de Google sobre cómo responder al rastreo excesivo
Autenticación confiable para bots
- Agregar simplemente un campo más no sirve de mucho, porque no hay razón para que un actor malicioso configure ese valor de forma honesta
- El llamado
evil bitde RFC 3514 satiriza justamente el hecho de que los actores maliciosos no siguen ese tipo de estándares - Web Bot Auth HTTP Signatures es una propuesta más compleja que añadir un campo aparte, pero busca implementar un User-Agent confiable mediante firmas criptográficas
Los límites de la palabra “mayoría”
- No hay datos que demuestren que los bots falsos sean realmente más de la mitad de todo el tráfico de Googlebot
- Aun así, la mayoría de los casos de tráfico de Googlebot que han perjudicado gravemente a sitios parecen haber sido causados por Googlebot falsos
- En la experiencia observada, el Googlebot real suele comportarse de forma muy estable, mientras que los bots impostores pueden seguir enviando solicitudes hasta tirar un sitio
1 comentarios
Opiniones en Lobste.rs