1 puntos por GN⁺ 2023-08-18 | 1 comentarios | Compartir por WhatsApp
  • Una PC que se congeló durante un juego cayó en un bucle de BIOS, y como solo se detectaba uno de dos SSD Seagate Firecuda 530 de 1 TB, la recuperación de datos se volvió urgente
  • Al ver que solo funcionaba brevemente cuando estaba fría, metieron el SSD en un congelador a -18 °C durante 30 minutos, y luego la unidad apareció en una Mac a través de una carcasa USB para NVMe M.2
  • Como la temperatura por sí sola no daba suficiente tiempo, encontraron un punto donde la unidad funcionaba al presionar un chip específico de la placa, y fijaron la presión con una abrazadera G y un trozo de tarjeta
  • Cuando el calor aumentó durante la copia, pegaron un disipador de PC y parte de una escuadra de carpintería con cinta adhesiva térmicamente conductora, y revisaron la temperatura con la cámara térmica de un CAT S60
  • Después de copiar /Users y crear una imagen de 1 TB basada en dd, aplicaron aire caliente SMD al SSD, lograron que funcionara sin herramientas y restauraron la imagen del sistema de Windows en un Firecuda nuevo, además de activar los respaldos

Detección de la falla y diagnóstico inicial

  • La PC de juegos usaba dos SSD Seagate Firecuda 530 de 1 TB como almacenamiento
  • Tras varios meses de uso, la PC se congeló mientras jugaban y después cayó en un bucle de BIOS sin poder arrancar
  • Solo se detectaba uno de los dos SSD, y aun cambiándolos de ranura el mismo disco seguía fallando, así que todo apuntaba a una avería en uno de los SSD
  • Después de dejar la PC apagada durante unos días, volvió a arrancar en Windows, pero se bloqueó casi de inmediato

Seguimiento de temperatura y falso contacto

  • Como parecía funcionar por momentos cuando estaba fría, tomó fuerza la posibilidad de una falla relacionada con la temperatura
  • Después de meter el Firecuda en un congelador a -18 °C durante 30 minutos y colocarlo en una carcasa USB para NVMe M.2, la unidad apareció en la Mac
  • El tiempo de funcionamiento era de solo unos minutos, y cuando la unidad se calentaba volvía a fallar
  • Sospechando de una conexión defectuosa en alguna parte de la placa, repitieron pruebas de conectar y desconectar hasta encontrar el punto donde el SSD funcionaba al presionar un chip específico

Dispositivo temporal hecho con abrazadera y trozo de tarjeta

  • Como no era posible copiar datos manteniendo el chip presionado con la mano todo el tiempo, usaron una abrazadera G de metal
  • Para sostener el PCB del SSD, colocaron debajo un trozo de una tarjeta de crédito de Silicon Valley Bank
  • Al ajustar la abrazadera G con la fuerza adecuada para aplicar presión sobre el chip, el SSD volvió a funcionar
  • Con este método, pudieron hacer que la unidad fuera reconocida incluso sin enfriarla

Refuerzo de enfriamiento y copia de datos

  • El SSD se calentaba bastante durante el funcionamiento, así que necesitaban enfriamiento para una copia estable
  • Pegaron uno de los disipadores que usaban en la PC y parte de una escuadra de carpintería con cinta adhesiva térmicamente conductora para usarlo como disipador temporal
  • Durante la copia, revisaban la temperatura con la cámara térmica del teléfono CAT S60
  • Con esa combinación, primero copiaron y guardaron el directorio /Users de la unidad
  • Después usaron dd para crear una imagen completa de la unidad en un solo archivo de 1 TB

Aplicación de aire caliente y restauración final

  • Consideraron si valía la pena reparar el SSD de forma permanente con una pistola de aire caliente SMD, aunque pensaban que quizá era mejor reemplazarlo
  • Después aplicaron aire caliente SMD al chip marcado con una flecha roja, y el SSD comenzó a funcionar incluso sin herramientas de carpintería
  • Tras la reparación, el SSD volvió a poder arrancar en la PC
  • Crearon una imagen del sistema de Windows de ese SSD en otra unidad y restauraron esa imagen en un Firecuda nuevo
  • Por último, activaron los respaldos

1 comentarios

 
GN⁺ 2023-08-18
Opiniones de Hacker News
  • Hace mucho, cuando trabajaba como técnico de banco en un taller de reparación de PC, hice algo parecido. Era un viejo disco Connor de 40 MB que corría DOS; si lo apretabas justo lo necesario funcionaba, pero si presionabas demasiado fuerte o demasiado suave aparecía “Abort/retry/ignore”
    Así que mantuve el disco presionado con la mano y seguí apretando r para reintentar, y al final funcionó. El dueño pasó y me preguntó: “¿Qué rayos estás haciendo?”, y le respondí: “¡Estoy exprimiendo los datos de este disco!”

    • Me pasó algo similar, pero la causa parecía ser más bien una fuerza tipo giroscopio que la presión sobre la carcasa. Tenía que sostener la laptop inclinada y girar en el lugar mientras copiaba los datos; si me detenía, el disco chocaba como si se estuviera raspando y el sistema operativo se congelaba
    • Para los lectores más jóvenes, quiero aclarar que disco de 40 MB no es un error de tipeo. Basta pensar en lo pequeña que era la capacidad de ese disco duro y que, además, podría haber sido un disco 5.25" de altura completa, de 3.25 pulgadas de alto
      También hay un recorrido interesante que muestra lo sorprendentemente simple que era la tecnología de discos antiguos: https://www.youtube.com/watch?v=8LbFKV_pPAE
    • Usé un método parecido con un disco duro de iPod dañado. Funcionaba al presionarlo, así que metí una tarjeta de presentación doblada entre la tapa trasera externa y el disco, y eso lo presionó lo suficiente como para que anduviera. Como tampoco se calentó al punto de incendiarse, diría que fue seguro
    • En 1990, cuando trabajaba como ingeniero de servicio en campo en un taller de reparación de PC, usaba mucho spray enfriador de circuitos. La recuperación de datos de discos duros normalmente la hacía en 3 pasos, y casi nunca hacía falta pasar del segundo
      1. Probarlo en otra computadora, 2) rociar bastante spray enfriador y ver si funcionaba durante una hora más o menos, 3) quitar la placa de circuito del disco y reemplazarla por la de un disco sano del mismo modelo
        Si aun así no funcionaba y los datos realmente hacían falta, lo enviábamos a Ontrack. Ahí sacaban los platos en una sala limpia y leían los datos directamente
    • Tenía un disco que se detenía al acceder archivos y empezaba a hacer clics; si lo ponía de lado y lo golpeaba contra la mesa, parecía que algo trabado se soltaba
  • Me hizo acordar a cuando, siendo un estudiante universitario pobre, arreglé una computadora con palillos chinos. En ese momento no sabía nada sobre soldaduras frías, pero descubrí que si doblaba una motherboard inestable en cierta dirección, funcionaba
    Así que metí unos palillos de bambú entre la motherboard y el gabinete para mantenerla ligeramente doblada, y aguantó todo lo que quedaba de ese año

    • No es exactamente lo mismo, pero hubo una época en que los clips de plástico en ambos extremos de los viejos zócalos SIMM de 30 pines eran pésimos. Cuando era joven no controlaba bien la fuerza y a veces los rompía; por suerte, detrás de esa ranura en mi máquina principal había otro módulo, así que metí una goma de borrar de lápiz para mantener presionado el SIMM del zócalo dañado y que siguiera haciendo contacto
      Cuando luego salió un nuevo diseño de zócalo, fue un gran alivio
  • No fue con herramientas de carpintería, pero fue la reparación más rara que hice. Una Surface Pro 3 que funcionaba bien de repente murió y no encendía; al final vi en Reddit que alguien había revivido una SP3 metiéndola en una bolsa hermética para congelador y dejándola en el freezer
    Era escéptico y pensaba que congelarla probablemente la dañaría más, pero el equipo ya estaba muerto, así que no tenía nada que perder. La metí en una bolsa hermética para congelador, saqué todo el aire que pude, la dejé unas horas en el freezer, la saqué, le conecté la corriente y encendió
    Al principio solo aguantó unos días, pero la congelé de nuevo y volvió a la vida; incluso varios años después sigue funcionando. Parecía un problema de energía, y supongo que al congelar la batería ocurrió algún ciclo químico que la recuperó
    Eso sí, envolví la Surface en varias capas de toallas para que la temperatura subiera lentamente. Principalmente para evitar que se formara humedad en alguna parte interna
    https://www.reddit.com/r/Surface/comments/5tficj/how_i_reviv...

    • En la época de la Game Boy original, cuando usaba 4 pilas AA, si las pilas se agotaban podías meterlas un rato en el freezer y sacarles unos minutos más de uso. La teoría de la batería podría ser correcta
    • Me pregunto si se habría arreglado cambiando la batería
  • Dijeron que el SSD se calentaba bastante mientras funcionaba y que lo enfriaron con un disipador de PC, parte de una escuadra de carpintero y cinta adhesiva térmica; yo, en cambio, recomendaría un ventilador. Incluso un ventilador pequeño, puesto al lado del dispositivo, genera mucho más flujo de aire del necesario

    • Un bloque de metal es un excelente disipador, y una regla larga como esa también conduce el calor y tiene bastante superficie, así que sirve para disiparlo. Más importante todavía: un ventilador no es una herramienta de carpintería
      Si uno insiste, podría generar viento con un taladro, una aspiradora industrial o una sierra circular, pero sería mucho menos eficiente energéticamente que un disipador pasivo
  • Hasta ahora tuve éxito dos veces con reflow del controlador. Una fue con una unidad Intel Optane que había usado sin problemas durante 3 años y un día empezó a sobrecalentarse; la otra, con una unidad mSATA de una máquina fanless que murió un domingo, cuando ni siquiera tenía un disco mSATA de repuesto
    En ambos casos busqué capacitores en corto con microscopio, pero no encontré ninguno; al final el problema eran las bolas de soldadura BGA fatigadas del controlador. Pude revivirlas con un reflow de remojo a 225 °C → pico de 400 °C → mantenimiento a 325 °C

  • Es un caso excelente. Parece la versión moderna del golpe de ingeniero que se usaba antes cuando un disco giratorio ya no hacía spin-up.

    • Una vez recibí una IBM-PC vieja cuyo dueño anterior había actualizado con un disco duro de 20 MB. Me la pasó porque en algún momento dejó de arrancar; si manipulaba el eje del brazo del cabezal de lectura/escritura que salía por la parte inferior del disco, el cabezal se despegaba de la superficie del disco y arrancaba.
      Supongo que, si la máquina pasaba cierto tiempo apagada, el lubricante interno se endurecía o algo así. Así que dejé quitada la tapa de la ranura del disco y, tocándolo con el dedo, arrancó de forma confiable durante años.
    • Compré barata una PS4 inicial usada, pero solo encendía si presionaba la placa madre cerca de la fuente de alimentación. Presioné ese punto con un trozo de madera y una prensa, y funcionó.
      Vi que usar arandelas en la abrazadera del disipador aplicaba la misma presión, así que lo hice y lleva meses funcionando bien. Las uniones de soldadura de la GPU se habían vuelto frágiles por estrés térmico, y al comprimirlas se restablecía el contacto.
      Aplicar presión o hacer reflow es solo una solución temporal; la reparación real es hacer reballing de la GPU, pero eso encarece mucho.
    • Un disco viejo que llevaba años en un cajón no arrancaba en absoluto, pero después de que lo dejé caer por accidente y golpeó con fuerza la pata metálica de una mesa, empezó a funcionar normalmente. Gracias a eso pude copiar todos los datos.
    • Metí dos veces un disco externo giratorio averiado en el congelador, y en ambos casos revivió el tiempo suficiente para recuperar los datos. Los dos eran HDD pequeños de laptop que habían dejado de funcionar por completo.
  • Si metió un Firecuda 30 minutos en un congelador a -18 °C y luego, al conectarlo a una carcasa USB NVMe M.2, el disco apareció en la Mac, supongo que eso significa que el truco del refrigerador ahora también funciona con NVMe.
    Hace unos 20 años también metí un HDD viejo en el refrigerador unos 30 minutos, saqué los archivos y luego tiré el disco.

    • Una vez, estando de viaje de trabajo y editando audio tarde por la noche, tuve una emergencia: la laptop se apagó de repente. Al encenderla de nuevo moría enseguida, y la siguiente vez murió aún más rápido, así que finalmente entendí que era sobrecalentamiento.
      Fui por hielo a la máquina de hielo del hotel y, con un ventilador y una bandeja metálica, mantuve viva la laptop hasta terminar el trabajo.
  • Me pregunto si 42 °C es una temperatura alta para un NVMe. Hace poco empecé a recopilar estadísticas SMART de varios discos de mi casa, y en los que tengo esa temperatura parece normal incluso cuando están casi en reposo.
    También he leído que mantener un NVMe demasiado frío puede perjudicar el rendimiento. Lo más importante es que hay que hacer backups sí o sí. A mis amigos cercanos les gusta Synology, pero yo soy de ahorrar y uso urbackup; ya me ha salvado de varios problemas grandes.
    https://www.worldbackupday.com/

    • Es cierto. Tengo un Synology y casi todo estaba respaldado, pero justo esta PC había quedado fuera. Pensaba que era simplemente una “PC para juegos”, pero luego me di cuenta de que no quería tener que reinstalar todo y pelearme para recuperar el disco. Ahora ya la configuré para que se respalde en el Synology.
    • No creo que 42 °C sea una temperatura alta en absoluto para un SSD NVMe. No recuerdo de inmediato cuál es el límite recomendado.
      La capacidad de diagnóstico y la creatividad para recuperar datos son admirables, pero en la misma situación yo simplemente habría restaurado desde un backup. Yo soy un poco particular: tengo un servidor de archivos de homelab con hardware de servidor real, donde se respaldan mi desktop y mi laptop, y ese servidor local a su vez se respalda en un servidor remoto.
    • En general, la temperatura segura de operación está entre 0 y 70 °C.
      Ej.: Samsung https://download.semiconductor.samsung.com/resources/data-sh...
    • En la foto, el campo Max dice 42.4°, pero si miras el objetivo del centro aparece 88.7°. Yo también me lo perdí al principio y me confundí igual.
  • Más allá de enviarlo a un servicio profesional de recuperación de datos, surge la duda de si habría alguna forma de acceder a los datos de un HDD cuya tarjeta controladora está dañada. Tampoco acepta una tarjeta controladora de repuesto retirada de un HDD nuevo del mismo modelo

    • Desde hace ya unos 15 años, las PCB de los discos duros suelen tener un chip EEPROM o flash con valores de fábrica llamados datos adaptativos. Esos valores están ajustados a los cabezales y platos de la unidad en la que está montada esa PCB.
      Con hardware y software especializados se pueden extraer esos datos y guardarlos en la memoria de otra placa, pero el método barato es mover el chip físico de la placa original a una placa nueva idéntica.
      Suele llamarse intercambio de ROM (ROM swap) y, como normalmente es un simple chip de 8 pines, si tienes experiencia soldando y desoldando podrías hacerlo tú mismo. Si no tienes experiencia, normalmente lo puede hacer un taller de reparación de hardware, como los que arreglan celulares.
      Eso sí, en discos duros relativamente recientes puede no haber un chip separado, así que hay que verificar el modelo. Hay más información aquí: https://hddpcb.eu/gb/content/how-to-swap-hdd-pcb
    • Puedes enfriarlo hasta temperatura de congelador y ver si funciona. A la inversa, también puedes calentarlo hasta unos 60 °C y probar. Este método aplica tanto a discos duros como a SSD.
      Muchas unidades “dañadas” pueden volver a funcionar al menos unas horas más con este método. Si, como en el post original, muestra señales de vida, mejor no meterse con prensas ni reflow: conviene conectarlo con cables largos de alimentación/SATA a una computadora fuera de la puerta del congelador o del horno y extraer los datos.
      Para extraer los datos se recomienda GNU ddrescue. Cuando solo quedan unas horas antes de que muera por completo, maximiza la cantidad recuperada en el tiempo disponible. Si sospechas que la unidad está casi vacía, también vale la pena usar alguno de los métodos para crear un archivo de mapa que omita la recuperación de bloques vacíos.
    • En la placa controladora hay un chip BIOS que debe trasladarse a la placa nueva. Si es una unidad bastante moderna, probablemente sea bastante delicado y requiera equipo de retrabajo con aire caliente.
      https://www.hddzone.com/hard_drive_pcb_replacement.html
    • Primero habría que ver cómo se sabe con certeza que el problema es realmente la controladora. Muchas controladoras guardan parte del firmware o de la configuración en los platos del disco, así que sin los platos la placa podría no aparecer en SATA.
    • Hay que volver a verificar el número de la placa controladora. Un HDD es complejo, como una computadora pequeña, y los fabricantes cambian bastante seguido el interior incluso durante la producción de un mismo modelo.
      Si aun teniendo la placa correcta no hay ninguna respuesta, quizá sea el momento de buscar ayuda profesional o asumir que los datos se perdieron.
  • Que hayan reparado temporalmente una memoria flash dudosa con una prensa de carpintería y un trozo de tarjeta de crédito de Silicon Valley Bank es la historia más al estilo HN que he visto hasta ahora.