- Backblaze comparó las tasas de falla de Q4, anuales y de por vida con base en 301,120 unidades de datos de las 305,180 unidades que administraba al cierre de 2024
- El cálculo de Q4 2024 se hizo sobre 300,633 discos duros, excluyendo 487 que no cumplían los criterios mínimos, y el AFR trimestral bajó de 1.89% en Q3 a 1.35% en Q4
- En la tabla anual de 2024 quedaron 298,954 unidades y 27 modelos, y el AFR anual total bajó de 1.70% en 2023 a 1.57% en 2024
- Las 1,200 unidades Seagate de 24TB, incorporadas a inicios de diciembre de 2024, no registraron fallas hasta el final de Q4, pero quedaron fuera de las tablas anual y de por vida por no acumular suficientes días de unidad
- El AFR de por vida bajó de 1.46% en 2023 a 1.31% en 2024, con un impacto importante por la migración completada de las unidades Seagate de 4TB
Alcance del cálculo y criterios de exclusión
- Al 31 de diciembre de 2024, Backblaze administraba un total de 305,180 unidades
- Unidades de arranque: 4,060
- Unidades de datos: 301,120
- Las estadísticas comparan la tasa anualizada de fallas (AFR) de los discos duros de almacenamiento de datos para Q4 2024, el total anual de 2024 y el período de vida útil
- Para aparecer en las tablas y gráficas, cada modelo debe cumplir condiciones mínimas según el período
- Trimestral: más de 100 unidades y más de 10,000 días de unidad
- Anual: más de 250 unidades y más de 50,000 días de unidad
- De por vida: más de 500 unidades y más de 100,000 días de unidad
- Entre las exclusiones se incluyen unidades de prueba que no se consideran actualmente unidades de producción y modelos con datos insuficientes
- Los datos completos, incluyendo las unidades que no aparecen en las tablas, pueden descargarse desde la Drive Stats page
Tasa de fallas de discos duros en Q4 2024
- El análisis de Q4 2024 cubrió 300,633 de las 301,120 unidades de datos, tras excluir 487 que no cumplían los criterios
- El Seagate de 24TB ST24000NM002H, incorporado a inicios de diciembre, entró en un lote de 1,200 unidades que llenó una bóveda de Backblaze y no registró fallas hasta el cierre de Q4
- Este modelo se incluye, junto con los Toshiba de 20TB y los WDC de 22TB, en el grupo de más de 20TB
- Hubo 5 modelos sin fallas en Q4
- Seagate 24TB ST24000NM002H
- HGST 4TB HMS5C4040ALE640
- Seagate 8TB ST8000NM000A
- Seagate 14TB ST14000NM000J
- Seagate 16TB ST16000NM002J
- Estos modelos con 0 fallas tienen relativamente pocas unidades y pocos días de unidad, por lo que hay que interpretarlos con cautela
- El AFR total de Q4 bajó de 1.89% en Q3 a 1.35%
- Todos los grupos por capacidad mejoraron frente a Q3
- Un factor importante fue la incorporación de más de 14,000 unidades de más de 20TB
- El AFR de Q4 para el grupo de unidades de más de 20TB fue de 0.77%
Reemplazo de unidades de 4TB y transición a mayores capacidades
- En Q4, la cantidad de unidades de 4TB disminuyó en 1,774 adicionales
- Se espera que las cerca de 4,000 unidades de 4TB restantes desaparezcan hacia el final de Q1 2025
- Las reemplazan nuevas unidades de 20TB, 22TB y 24TB
- Como en Q4 solo falló 1 de las unidades de 4TB en operación, para comparar tasas de falla el foco principal pasa a ser el grupo de unidades de más de 20TB
Tasa de fallas anual de 2024
- En la tabla anual de 2024 se excluyeron 9 modelos y 2,012 unidades por no cumplir los criterios mínimos
- El conteo final fue de 298,954 unidades y 27 modelos
- En 2024 no hubo modelos con 0 fallas entre los que sí cumplieron los criterios
- El Seagate 16TB ST16000NM002J registró solo 1 falla en Q3, por lo que su AFR de 2024 fue de apenas 0.22%
- El equipo técnico del centro de datos instaló 53,337 unidades durante 2024
- Suponiendo 2,080 horas laborales al año, eso equivale a 26 unidades instaladas por hora
- Las 1,200 nuevas unidades Seagate de 24TB añadidas en 2024 se instalaron a inicios de diciembre y no acumularon suficientes días de unidad para entrar en las tablas anual y de por vida
- Los modelos que no alcanzaron a entrar en la tabla anual fueron:
- Seagate ST8000NM000A: 247 unidades, 22,684 días de unidad, AFR 2024 de 0.84%
- Seagate ST14000NM000J: 232 unidades, 19,696 días de unidad, AFR 2024 de 1.32%
- Seagate ST24000NM002H: 1,200 unidades, 18,000 días de unidad, AFR 2024 de 0.00%
Comparación 2022~2024 y tendencias por capacidad
- El AFR anual total de 2024 fue de 1.57%, por debajo del 1.70% de 2023
- Se espera que la tasa total de fallas siga bajando en 2025, aunque los grupos por capacidad que conviene observar son distintos
- Modelos de 8TB y 12TB: ambos ya superaron 5 años de uso, y normalmente después de ese punto la tasa de fallas aumenta de forma visible
- Modelos de 14TB y 16TB: se acercan a una edad intermedia de 3 a 5 años en operación, donde según la bathtub curve la tasa de fallas podría aumentar gradualmente
- Modelos de 20TB, 22TB y 24TB: están entrando en la zona plana de la bathtub curve, donde la tasa de fallas debería ser la más baja
- Las unidades de 4TB y 10TB ya eran relativamente pocas al cierre de 2024, por lo que su impacto sobre la tasa total de fallas fue pequeño
- Las unidades de 8TB y 12TB son modelos antiguos de 5 a 8 años
- Las de 12TB subieron de cerca de 1% de AFR en 2021 a alrededor de 3% en 2024
- Las de 8TB mostraron variaciones trimestrales, pero la línea de tendencia del mismo período fue casi plana
- Las unidades de 14TB y 16TB representan 57% del total de unidades en operación
- Su edad promedio es de 2 a 4 años
- Están en una etapa en la que deberían mostrar tasas de falla bajas y estables, y en la práctica así ocurre
- Las unidades de 22TB todavía están en una fase inicial de expansión, por lo que la dirección de su AFR se verá mejor cuando el grupo se estabilice
- Su AFR de por vida actual es de 1.06%
Tendencias de tasas de falla por fabricante
- La línea de tendencia del fabricante HGST no luce bien, pero hasta antes de Q4 2023 estaba por debajo o alrededor del promedio general
- El AFR alto de HGST en 2024 estuvo impulsado por dos modelos de 12TB
- HUH721212ALN604 muestra señales de aumento en el AFR trimestral desde Q1 2023
- HUH721212ALE604 presenta una tendencia similar desde Q3 2024
- Excluyendo esos dos modelos, el AFR de HGST en 2024 fue de 0.55%
- La línea de tendencia del AFR trimestral de Seagate bajó ligeramente de 2.25% a 2.0% entre 2022 y 2024
- Entre los fabricantes, Seagate fue el único con una tendencia descendente en ese período
- Parte de esa baja parece explicarse por la salida de las unidades Seagate de 4TB
- El AFR trimestral de los modelos Toshiba se movió en un rango de 0.80% a 1.52% entre 2022 y 2024
- En la mayoría de los trimestres estuvo cerca de 1.2%
- El AFR trimestral más alto entre modelos individuales de Toshiba fue 1.58%
- Los modelos de WDC mostraron una consistencia similar a la de Toshiba, pero con AFR más bajos en cada trimestre
- Entre 2022 y 2024, el rango del AFR trimestral de los modelos WDC fue de 0.0% a 0.85%
- En Q1 2022 no falló ninguna de las 12,207 unidades WDC en operación, por lo que registraron un AFR de 0.0%
Estadísticas de por vida y advertencia sobre respaldos
- En la tabla de por vida se excluyeron 11 modelos y 2,736 unidades por no cumplir los criterios mínimos
- El conteo final fue de 298,230 unidades y 25 modelos
- El AFR total de por vida bajó de 1.46% en 2023 a 1.31% en 2024
- La razón principal de esta caída fue que en 2024 se completó la migración de las unidades Seagate de 4TB
- Al cierre de 2024 solo quedaban 2 unidades Seagate de 4TB en operación
- Los 79 millones de días de unidad acumulados y más de 5,600 fallas de estas unidades hasta finales de 2023 ya no se incluyen en la tabla de por vida de 2024
- También se ofrece una tabla ordenada solo con modelos de AFR de por vida de 1.50% o menor
- Los valores de AFR por modelo pueden considerarse sólidos por la cantidad de datos disponible, pero las tasas de falla suelen seguir la bathtub curve y todavía hay excepciones
- Hay modelos que casi no fallan pese a ser antiguos, como los HGST de 4TB
- Algunos modelos pueden comportarse bien durante un tiempo y luego mostrar un aumento brusco en su curva de fallas
- Un AFR de 1% significa que 1 de cada 100 unidades podría fallar en un año
- Aunque una persona solo tenga una unidad, esa única unidad también puede fallar
- Siempre hay que tener y probar respaldos
Publicación de datos y cambio de responsables
- El conjunto de datos completo usado para elaborar las tablas y gráficas de este informe está disponible en la página de Hard Drive Test Data
- Los datos pueden descargarse y usarse gratis
- Al usarlos, se debe atribuir la fuente a Backblaze
- El usuario es responsable de cómo use los datos
- No se deben vender los datos en sí
- La persona responsable que elaboró los reportes de Drive Stats durante los últimos 10 años se retira con este informe como el último
- A partir del informe de Q1 2025, Stephanie Doyle y David Johnson continuarán con Drive Stats
1 comentarios
Comentarios en Hacker News
Cuesta creer que ya llevo 10 años leyendo de forma constante los informes Drive Stats
Los datos no tienen un valor intrínseco antes de actuar, y tampoco garantizan el resultado deseado después de actuar. Gracias por 10 años de excelentes estadísticas y aprendizajes, y ojalá disfrutes del “resilvering” incluso después de retirarte
No es una best practice, pero durante los últimos 10 años he operado mi servidor casero con una unidad pequeña y rápida para el OS y un solo disco grande elegido según Backblaze Drive Stats, y todavía no he tenido fallas.
Confío en la metodología de Backblaze y me parece un recurso muy valioso desde la perspectiva del consumidor. Mi unidad más reciente fue una WDC WUH722222ALE6L4 de 22TiB, y aunque solo hay datos de unos cuantos meses, ver la tendencia general de WDC en este informe me deja tranquilo de cara al próximo ciclo de reemplazo
En línea se ven seguido historias de varias unidades compradas del mismo lote que fallan. No conozco el patrón de abastecimiento de Backblaze, así que no puedo probarlo, pero compré un ST16000NM001G, que en la lista se veía bastante bien, y falló en menos de un año. Con discos duros o almacenamiento, lo mejor es prepararse para el tiempo de inactividad con RAID por software y respaldos, y si van a fallar, mejor que sea dentro del período de garantía
Porque incluso si una mayor confiabilidad redujera el costo total de propiedad, pensé que como mucho rondaría el 10%, y eso se compensaría con la falta de descuentos en la unidad “mejor”. El problema de una anécdota con n=1 es que no puedes saber si te fue bien por seguir un buen consejo o solo por suerte
El marketing de discos todavía usa unidades decimales, mientras que TiB usa unidades binarias. 22TB son aproximadamente 20TiB
En este caso, tres WUH721414ALE6L4 reacondicionadas tienen un precio total parecido. Si las juntas en RAIDZ1, obtienes 28TB y una confiabilidad más cercana a la que uno esperaría dentro de un solo dispositivo. Claro, los respaldos siguen siendo importantes, pero ese es otro tema
Aquí “de cualquier tipo” significa tanto hardware como software
En los últimos 24 meses probé 17 unidades Seagate ST12000NM001G 12TB SATA en un pool grande raidz3, y mis estadísticas personales según las primeras 3 o 4 letras del número de serie fueron estas: ZLW2 tuvo 5 fallas de 8 unidades, ZL2 tuvo 1 de 4, ZS80 tuvo 1 de 2, ZTN tuvo 0 de 2 y ZLW0 tuvo 0 de 1.
Todas eran unidades reacondicionadas; 2 las compré en la tienda de eBay de Seagate y el resto en ServerPartDeals. De las 15 compradas en ServerPartDeals, fallaron 7, y al menos 4 de ellas fallaron dentro de las 6 semanas posteriores a la instalación. Cuando elegí las unidades para armar el pool de almacenamiento inicial, me guié por las estadísticas de Backblaze, y cada vez que llegaban estadísticas actualizadas a mi bandeja de entrada volvía a mirar la tabla para verificar si mis unidades realmente eran las 001G a las que Backblaze atribuía una tasa anual de fallas de 0.99%. Al final, los resultados pueden variar según la persona
Antes me parecían interesantes estas estadísticas y una referencia útil para mi siguiente compra de HDD, pero al final me di cuenta de que últimamente solo las usaba para elegir una marca con confiabilidad razonable.
Ahora en la práctica solo quedan 3 marcas, y como las estadísticas son en su mayoría de modelos viejos, su uso principal es cuando compras unidades usadas del mismo lote que Backblaze utilizó por casualidad. Es mejor comprar 2 en vendedores distintos y armar un RAID, o hacer respaldos offsite periódicos
Idealmente conviene usar RAID por software o un sistema de archivos con scrubbing y reparación para detectar bit rot. O necesitas una solución de hardware que haga lo mismo y pueda informar al OS sobre la corrección de errores. Como siempre, las soluciones tipo RAID sirven principalmente para aumentar la disponibilidad, y los respaldos son un problema totalmente distinto. No hay nada mejor que tener muchas copias en varios lugares
Viendo los números de WDC y Toshiba, es difícil refutarlos, y en comparación los números de Seagate se ven bastante vergonzosos.
Las unidades HGST eran excelentes, pero ahora son unidades heredadas que forman parte de WDC. Ya eran parte de WD desde hace bastante tiempo, y los modelos nuevos salen con la marca WDC
https://www.heise.de/en/news/Hard-disk-fraud-Increasing-evid...
Hace más de 10 años, cuando empecé mi actual NAS de 24 bahías, decidí qué unidades comprar mirando las estadísticas de Backblaze Drive Stats, que en ese momento recién empezaban a salir. La elección fueron unidades HGST de 4TB 7200rpm.
Según mis estadísticas personales estilo Louwrentius, he tenido 0 fallas de disco en más de 10 años. Por otro lado, como Andy Klein, autor de Backblaze Drive Stats, se va a retirar, le deseo lo mejor y le doy las gracias. Como detalle extra, me impresiona que los datos de mi NAS de 24 discos ahora quepan en apenas 2 unidades modernas de 32TB
Backblaze es uno de los servicios más respetados de la industria del almacenamiento, y después de lanzar mi propia solución de almacenamiento en la nube lo respeto todavía más
Después de que fallaran varios discos duros en un NVR anterior, me di cuenta de que el calor es el peor enemigo de los discos duros.
Ese NVR alimentaba cámaras PoE, hacía transcodificación de video y escribía continuamente en los discos, así que generaba mucho calor. Probablemente, por el calor los discos se deformaron y los cabezales golpearon la superficie, causando pérdida de datos. En el nuevo NVR separé la alimentación PoE a un switch con fuente de poder, el nuevo CPU se encarga de la codificación de video por hardware, uso SSD para la grabación primaria y dejo los discos duros como respaldo secundario. El calor bajó muchísimo y hasta ahora ha funcionado bien. Sé que no es ideal reescribir continuamente sobre un SSD, pero viendo el tiempo medio entre fallas de los SSD, parece un riesgo aceptable porque pasarán varios años antes de que falle
Incluso los discos HGST para centros de datos promedian unos 5.5 W y su potencia térmica de diseño bajo carga máxima ronda los 7.8 W. No es difícil diseñar un gabinete que enfríe de 6 a 8 discos duros haciendo pasar aire con un ventilador DC de 12 V de 120 mm o 140 mm relativamente lento y silencioso. Incluso cuando se usa como NAS un gabinete mid-tower de PC de escritorio con un CPU de bajo consumo, muchas veces basta con un solo ventilador trasero de 140 mm jalando aire de adelante hacia atrás para enfriar bien 8 HDD de 3.5 pulgadas. Pero los diseñadores de equipos siguen metiéndolos en espacios demasiado pequeños y con ventilación insuficiente
Cada año este informe parece una excelente promoción de marca de Backblaze dirigida a posibles clientes técnicos, y además le presta un buen servicio a la industria.
Me pregunto qué otros ejemplos parecidos habrá de otras empresas, aparte del código open source
Aun así, las publicaciones de estadísticas de discos de Backblaze tienen mucho más trabajo detrás y un estándar de calidad bastante más alto que lo que suele verse con esta táctica
https://www.techempower.com/benchmarks/#hw=ph&test=fortune&s...
Los desarmes de iFixIt también son bastante buenos como contenido informativo: https://www.ifixit.com/Teardown
También están los escaneos CT de Lumafield: https://www.scanofthemonth.com/
También hay benchmarks de hardware: https://benchmark.clickhouse.com/hardware/ y Phoronix también lo usa
Se ven señales de eso por ahí, pero todavía es divertido hacerlo por cuenta propia, y además se está expandiendo con Networking Stats y más contenido que viene en camino. También planean cubrir cómo estas estadísticas influyen en el despliegue de infraestructura, así que suena bastante interesante
Está bien ver esto cada año. Pero, aunque sé que es gratis, si tuviera una pequeña queja sería que me gustaría ver también métricas de uso real, y no solo que “estuvieron encendidos”.
Si no sabes cuánto tiempo y con qué frecuencia se usó cada disco, por ejemplo cuántas lecturas y escrituras hizo o cuántos bytes por segundo movió, la tasa anual de fallas de los HDD pierde bastante significado. Si todos los discos hubieran estado al 99% de utilización durante todo el año, entonces sí tendría sentido
De hecho, Backblaze tiene que considerar si seguir usando discos más pequeños debido al tiempo de reconstrucción y a que los discos de alta densidad no soportan tanta exigencia adicional