1 puntos por GN⁺ 2024-02-06 | 1 comentarios | Compartir por WhatsApp
  • El Vesuvius Challenge 2023 logró restaurar parte de un texto que no se veía desde hacía 2.000 años al leer, sin desenrollarlos, los Papiros de Herculano carbonizados por la erupción del Vesubio en el año 79
  • El equipo de Youssef Nader, Luke Farritor y Julian Schilliger recibió el Gran Premio de $700.000 tras cumplir el criterio de 4 pasajes de 140 caracteres cada uno y una tasa de recuperación de caracteres superior al 85%; su entrega incluyó 15 columnas y más de 2.000 caracteres de texto
  • El rollo restaurado no parece ser una copia duplicada de una obra existente, sino un texto antiguo inédito, interpretado como un texto de filosofía epicúrea sobre música, comida, sentidos y placer
  • La tecnología central combina tomografía de rayos X, segmentación 3D de capas de papiro y detección de tinta basada en machine learning; el código ganador y los datos de entrenamiento fueron publicados, lo que permite reproducir y verificar los resultados
  • El objetivo para 2024 es pasar de leer alrededor del 5% del primer rollo a leer el 90% de los 4 rollos escaneados; el mayor cuello de botella es automatizar la segmentación, que hoy requiere mucho trabajo manual

Leen un rollo de 2.000 años sin abrirlo

  • Los Papiros de Herculano son rollos de papiro carbonizados por la erupción del Mount Vesuvius en el año 79; fueron descubiertos en el siglo XVIII y hoy se conservan cientos de ellos en una biblioteca de Naples, Italia
  • Como están en estado de masas carbonizadas de ceniza, desplegarlos físicamente podría dañarlos gravemente, por lo que hacía falta un método no destructivo para leer el texto interno
  • Nat Friedman, Daniel Gross y Brent Seales lanzaron el Vesuvius Challenge el 15 de marzo de 2023
    • Escanearon un rollo del Institut de France con CT de alta resolución en el acelerador de partículas Diamond Light Source, cerca de Oxford
    • A partir de los escaneos CT publicados, participantes de todo el mundo combinaron visión por computadora, machine learning y trabajo manual para resolver el problema
    • El total de premios superaba el millón de dólares, aportado por varios donantes
  • En diciembre de 2023, los participantes lograron leer parte del primer rollo
    • En PHerc.Paris. 4 se reveló texto que no había sido visto en 2.000 años
    • Aproximadamente el 95% del rollo sigue sin leerse

Resultados del Grand Prize 2023

  • Las entregas para el Grand Prize llegaron hasta justo antes de la medianoche del 1 de enero de 2024, y durante enero fueron revisadas por el equipo de papirología y el equipo técnico
    • El equipo de papirología revisó el texto de 15 columnas de las entregas anonimizadas
    • El equipo técnico auditó y reprodujo el código y los métodos presentados
  • El Gran Premio fue para el equipo de Youssef Nader, Luke Farritor y Julian Schilliger
    • El premio fue de $700.000
    • El criterio era 4 pasajes, de 140 caracteres cada uno, con al menos 85% de probabilidad de recuperación de caracteres
    • Cuando se anunciaron los criterios, muchas personas del equipo organizador estimaban la probabilidad de éxito en menos del 30%
    • La entrega ganadora incluyó 11 columnas adicionales y más de 2.000 caracteres de texto en total
  • Los tres contribuyeron a la comunidad desde las primeras etapas del Vesuvius Challenge
    • Youssef Nader, estudiante egipcio de PhD en Berlin, leyó varias columnas en octubre de 2023 y obtuvo el segundo lugar del First Letters Prize
    • Luke Farritor, estudiante universitario de 21 años de Nebraska e intern de SpaceX, fue el primero en leer una palabra completa dentro de un rollo de Herculano, ΠΟΡΦΥΡΑϹ (“purple”), y ganó el primer lugar del First Letters Prize
    • Julian Schilliger, estudiante suizo de robótica en ETH Zürich, recibió 3 premios de Segmentation Tooling por su trabajo en Volume Cartographer

Composición técnica de la entrega ganadora

  • La entrega incluyó resultados de tres arquitecturas de modelos que se respaldan entre sí
    • Las imágenes más sólidas suelen provenir de un modelo basado en TimeSformer
    • Para evitar sobreajuste y alucinaciones se usaron resultados de varias arquitecturas, estudios de tamaños de ventana de entrada y salida, label smoothing y variaciones de folds de validación
    • El código de detección de tinta fue publicado como open source en GitHub
  • Además de una detección de tinta sólida, la entrega incorporó el enfoque de segmentación automática más fuerte
    • ThaumatoAnakalyptor, de Julian, genera grandes segmentos de papiro en varios rollos
    • Re-segmenta áreas ya conocidas para verificar hallazgos de tinta anteriores
    • También revela letras en zonas nuevas, como el enrollado más externo del rollo
    • Es una herramienta prometedora, aunque todavía queda mucho por mejorar

Finalistas y métodos publicados

  • Entre las entregas restantes, tres equipos empataron como finalistas según las puntuaciones del equipo de papirología
    • Cada equipo recibió $50.000
    • Las tres entregas mostraron una legibilidad similar y eran bastante más fáciles de leer que el resto
  • Entregas publicadas de los equipos finalistas:
    • Elian Rafael Dal Prá, Sean Johnson, Leonardo Scabini, Raí Fernando Dal Prá, João Vitor Brentigani Torezan, Daniel Baldin Franceschini, Bruno Pereira Kellm, Marcelo Soccol Gris, Odemir Martinez Bruno: GitHub
    • Louis Schlessinger, Arefeh Sherafati: GitHub
  • Los equipos finalistas aportaron nuevos enfoques a problemas específicos de etiquetado y muestreo de tinta
  • En la comunidad de Discord se puede acceder a los datos CT e imágenes adicionales bajo un acuerdo de datos, y continúan los hallazgos y la colaboración entre participantes

Contenido del texto restaurado

  • Hasta ahora se desplegó y leyó aproximadamente el 5% del primer rollo
  • El equipo de papirología preparó una transcripción preliminar de todas las columnas reveladas
  • Este rollo no es una copia duplicada de una obra existente, sino un texto antiguo visto por primera vez
  • Según las primeras lecturas, el tema general es el placer, entendido como el bien supremo en la filosofía epicúrea
    • Parte de dos columnas consecutivas trata sobre cómo la disponibilidad de bienes como la comida influye en el placer
    • El autor deja una frase con el sentido de que “no creemos de inmediato que lo escaso sea necesariamente más placentero que lo abundante”
    • Luego continúa con la idea de que “esas preguntas serán examinadas con frecuencia”
  • Como se trata del final del rollo, es posible que la discusión continúe en un libro posterior de la misma obra
  • Al comienzo del primer texto se menciona a una persona llamada Xenophantus
    • Podría tratarse de alguien quizá relacionado con la música, también mencionado en On Music de Philodemus
  • Philodemus fue una figura de la escuela epicúrea y se cree que fue un filósofo activo en la pequeña biblioteca de la villa donde se encontraron los rollos
  • Richard Janko considera muy probable que el autor sea Philodemus, filósofo y poeta maestro de Virgil
    • Cree que es bastante probable que el texto compare los efectos de la música sobre el oyente con otros placeres, como la comida y la bebida
    • También podría ser un texto de un tratado en cuatro partes sobre música, del cual se conoce el Book 4
  • Federica Nicolardi ve este texto como un texto de epicureísmo lleno de música, comida, sentidos y placer
  • Bob Fowler considera que Philodemus valoraba mucho el placer, pero no como simple libertinaje, sino como placer correctamente entendido

Cómo se verificó la precisión de las imágenes resultantes

  • Una de las cuestiones a verificar era la posibilidad de alucinaciones, es decir, que el modelo de machine learning generara letras o imágenes parecidas a los datos de entrenamiento
  • El equipo de revisión técnica del Vesuvius Challenge reprodujo manualmente la entrega ganadora
    • Entendió cada parte del código y verificó que, al ejecutarlo de forma independiente, produjera imágenes de salida similares
    • El código y los datos de entrenamiento están publicados, por lo que otras personas pueden hacer la misma verificación
  • Varias entregas produjeron resultados muy similares en la misma zona del rollo
    • El equipo organizador de segmentación publicó segmentos: hojas de papiro mapeadas en 3D dentro del escaneo CT
    • Los participantes usaron distintos modelos de ML y etiquetas de entrenamiento, pero generaron imágenes de salida parecidas
    • Esta coincidencia apareció no solo en el equipo ganador y los finalistas, sino también en otras entregas
  • El modelo de detección de tinta no se basa en letras griegas, OCR ni modelos de lenguaje
    • Detecta de forma independiente puntos de tinta muy pequeños en el escaneo CT
    • Las letras aparecen después, cuando se agrupan esos pequeños resultados de detección
    • En algunos casos, la salida es un valor binario de “tinta” o “no tinta”
    • Por esta estructura, consideran muy baja la probabilidad de que el modelo alucine formas parecidas a letras

Tres etapas del desenrollado virtual

  • El desenrollado virtual se compone, en términos generales, de escaneo, segmentación y detección de tinta
  • Escaneo

    • El rollo o los fragmentos se escanean en 3D mediante tomografía de rayos X
    • Diamond Light Source permite imágenes de alta resolución rápidas y precisas gracias a un haz paralelo de rayos X de alto flujo
    • Las radiografías se convierten en un volumen 3D basado en voxels mediante algoritmos de reconstrucción tomográfica, y se genera una pila de imágenes por cortes
  • Segmentación

    • Se rastrean las capas individuales del papiro enrollado y arrugado en el espacio 3D, y luego se despliegan y aplanan
    • Se usa principalmente Volume Cartographer, creado por Seth Parker y otros en el laboratorio de Brent Seales
    • Julian Schilliger, Philip Allgaier y otros ampliaron las herramientas
    • Un equipo de segmentación de tiempo completo formado por Ben Kyles, David Josey y Konrad Rosenberg usa una combinación de algoritmos automáticos y ajustes manuales
    • Segmentar un rollo completo sigue siendo un proceso muy laborioso, con amplio margen de mejora
  • Detección de tinta

    • Stephen Parsons demostró que la tinta de Herculano podía detectarse teóricamente en escaneos CT, pero antes solo era posible en pequeños fragmentos
    • Detectar tinta en grandes escaneos de rollos completos aún no se había logrado

Avances clave en la detección de tinta

  • El primer avance fue el descubrimiento del crackle pattern
    • Casey Handmer observaba volúmenes de superficie aplanada sin procesar durante el verano de 2023 cuando descubrió un patrón de grietas inusual que parecía letras
    • Este hallazgo le valió el First Ink Prize y fue compartido con la comunidad
    • Luke Farritor encontró más crackle en los volúmenes de superficie aplanada creados por el equipo de segmentación, entrenó un modelo y eso llevó al premio First Letters Prize en octubre
  • La segunda línea fue la Kaggle competition
    • Cientos de equipos crearon modelos de machine learning para detectar tinta en fragmentos abiertos
    • Esos fragmentos eran piezas desprendidas durante intentos físicos de desenrollado realizados siglos atrás
    • Los participantes podían usar datos de ground truth obtenidos a partir de fotografías de los fragmentos
    • Aunque el rendimiento de los modelos era excelente, al principio parecían no funcionar bien sobre los segmentos aplanados creados por el equipo de segmentación
    • Cuando Youssef Nader aplicó técnicas de domain adaptation, eso desembocó en su segundo lugar en el First Letters Prize
  • Después del First Letters Prize, alcanzar el Grand Prize se volvió algo visible, y Youssef, Luke y Julian formaron equipo

Prácticas operativas que contribuyeron al éxito en 2023

  • El proyecto atrajo cobertura inicial, donaciones y una comunidad con fuerte motivación intrínseca gracias a un objetivo claro e inusual
  • La base construida durante 20 años por Brent Seales y su equipo fue clave
    • Primeros escaneos de los rollos
    • Construcción de Volume Cartographer
    • Primer caso exitoso de desenrollado virtual
    • Prueba de que la tinta de Herculano puede detectarse en CT
  • Para combinar competencia y colaboración, se implementaron progress prizes
    • Aproximadamente cada 2 meses se ofrecían premios pequeños de entre $1.000 y $10.000
    • Para recibir un progress prize, era necesario publicar el código o la investigación como open source
    • Este mecanismo elevó el nivel de toda la comunidad y ayudó a invertir en equipos, cómputo y tiempo, además de facilitar la formación de equipos
  • La decisión de contratar un equipo de segmentación de tiempo completo también fue clave
    • Para aumentar la probabilidad de ganar, se realizó internamente el trabajo que era cuello de botella: rastrear el papiro
    • La calidad de la segmentación era difícil de evaluar antes de detectar tinta, y recompensar por cantidad podía perjudicar la calidad
    • El trabajo de etiquetado es tedioso, toma mucho tiempo y tiene una curva de aprendizaje larga, por lo que era difícil compensarlo solo con premios
    • Esta decisión llevó directamente al descubrimiento del crackle pattern por Casey Handmer y contribuyó a crear mejor software de segmentación junto con la comunidad
  • El éxito fue resultado de la combinación de pequeños avances de muchas personas, y se necesitaron muchas contribuciones para encontrar ideas que funcionaran en un espacio de búsqueda amplio

Objetivo de Stage 2 para 2024

  • En 2023 se pasó de 0% a 5% en un rollo
  • El objetivo para 2024 es leer el 90% de los 4 rollos escaneados en su totalidad, y el primer equipo que lo logre recibirá el Grand Prize 2024
    • Los criterios exactos de evaluación se entregarán en marzo
  • El mayor cuello de botella actual es el proceso de rastrear la superficie del papiro dentro del rollo
    • Para producir el texto que hoy puede leerse, el costo de trabajo manual superó los 100 dólares por centímetro cuadrado
    • Con esa estructura de costos, segmentar todos los rollos podría costar cientos de millones o miles de millones de dólares
    • Las mejoras de herramientas aumentaron la eficiencia, pero el proceso sigue siendo demasiado manual y caro
  • El objetivo central de Stage 2 es completar la segmentación automática
    • Si funciona correctamente, también permitirá leer zonas difíciles, muy comprimidas, agrietadas, delaminadas o dañadas
    • También apunta a zonas a las que las herramientas actuales no pueden acceder
  • En 2024 planean mantener el Grand Prize y, al mismo tiempo, aumentar la proporción de premios destinados a contribuciones de la comunidad
  • Además del equipo de segmentación de tiempo completo, planean contratar un pequeño equipo de software y ML para colaborar abiertamente con la comunidad

Objetivo más grande y posibilidades restantes

  • El objetivo posterior es escanear y leer todos los rollos
  • Se estima que los rollos de Naples contienen más de 16 MB de texto
  • Parte del equipo de papirología cree que la publicación de este texto podría ser la mayor revolución en estudios clásicos desde el Renacimiento
  • En la Villa of the Papyri aún quedan dos niveles sin excavar
    • Es probable que haya más papiros, al menos dentro de gabinetes y cajas de transporte
    • La biblioteca principal de la villa todavía no fue descubierta
    • Esa biblioteca podría contener una variedad más amplia de textos griegos y latinos, y miles o decenas de miles de rollos enterrados
  • Más detalles sobre los próximos planes están en el Master Plan

1 comentarios

 
GN⁺ 2024-02-06
Comentarios de Hacker News
  • Cuando vi este proyecto por primera vez en HN a inicios del año pasado, parecía casi imposible y me impresionó lo inteligentes que eran los participantes
    Aunque vi varios nombres brillantes, inconscientemente pensé que harían falta al menos 5 a 10 años para lograr un avance
    Hoy vuelvo a sentir la misma admiración, sorprendiéndome otra vez de lo absurdamente genial que es esto. Felicitaciones a los ganadores y a todos los que participaron

    • Muchas cosas que parecían imposibles se están volviendo realidad. Ver un rollo completamente quemado y pensar en leerlo parecía una locura
      También pensé que faltarían 20 años para que una computadora escribiera un texto alternativo inquietantemente preciso sobre mis fotos, hasta con adornos retóricos, pero eso ya está pasando
    • Al final es un problema de estructura de incentivos. Un millón de dólares es mucho dinero, y en la mayoría de los problemas difíciles la recompensa no compensa el esfuerzo, así que no atraen a muchas mentes brillantes
      En machine learning, matemáticas y áreas afines ya existen carreras muy bien pagadas, así que es difícil mantener el interés de los mejores expertos en algo que podría terminar en fracaso
      No es solo la recompensa en efectivo; un reto con un gran premio también eleva el prestigio de encontrar la solución. El Nobel al final también viene acompañado de alrededor de un millón de dólares
      Si alguien ofreciera 100 millones de dólares por descifrar el manuscrito Voynich o el Linear A, estoy bastante seguro de que habría una solución en menos de 3 años
  • Cuando hacia octubre del año pasado empezaron a salir poco a poco los primeros resultados, leer esto me emocionó muchísimo. La metodología fue especialmente atractiva
    Primero desenrollaron digitalmente el rollo, luego descubrieron que rastros como las grietas del papel eran señales de la tinta, y fue impresionante cómo construyeron un modelo para detectarlo fragmento por fragmento
    Tendría que ver el repositorio final para saber exactamente qué hicieron, pero parece que usaron TimeSFormer. Yo lo conocía como algo para video, así que me intriga cómo lo aplicaron a imágenes
    En cualquier caso, es un día realmente increíble para la arqueología, y estos jóvenes talentos merecen un gran aplauso por lo que lograron

    • Según entendí, el escaneo del rollo parece haber devuelto las capas mismas
      La estructura sería más o menos así:

      xxxxxxxxxx <- superficie del rollo
      
      xxxxxxxxxx
      
      ...
      
      xxxxxxxxxx <- fondo del rollo  
      

      Así que, si divides la imagen de la superficie en mosaicos, obtienes datos de tamaño size_x * size_y * n_layers
      Es decir, puede verse como una secuencia de video con forma size_x * size_y * 1 channel * n_layers, donde las capas sustituyen la dimensión temporal

  • Aquí encaja perfecto la frase “cualquier tecnología suficientemente avanzada es indistinguible de la magia”
    La capacidad tecnológica casi mágica de convertir una masa de rollos ennegrecidos y carbonizados en texto legible es una locura
    Apenas conozco machine learning por encima, así que me pregunto si las técnicas mencionadas en el artículo fueron descubiertas hace poco o si ya existían desde hace bastante tiempo
    También me pregunto si estos algoritmos alcanzaron un punto de inflexión y por eso ahora se usan más ampliamente, lo que está llevando a más casos de aplicar enfoques nuevos a problemas antiguos

    • Definitivamente hubo un círculo virtuoso entre la capacidad de procesamiento de GPU de propósito general, los algoritmos, las librerías y el software que usan ese hardware, y los investigadores que trabajan con esas herramientas
    • Si ya estamos al nivel de convertir rollos carbonizados en texto legible, uno se pone a imaginar qué podría hacerse dentro de 100 años con el cerebro de personas vivas o muertas
      En 10 mil años tal vez estén reconstruyendo conos de luz. Quizá nosotros mismos seamos justamente ese tipo de seres en este momento. No lo digo en serio, pero es un experimento mental divertido
  • Hay un enlace al “plan maestro” para leer todos los rollos excavados: https://scrollprize.org/master_plan
    Parecen existir dos cuellos de botella principales para leer más: se necesita intervención manual al segmentar los rollos escaneados, y es caro escanear nuevos rollos

    • Solo viendo el escaneo, 30 millones de dólares para escanear 800 rollos con historia y obras desconocidas no parece una cantidad enorme comparada con otros usos de presupuesto
      Parece posible que alguien done ese costo y que los rollos se trasladen cerca de un acelerador de partículas todos de una vez, o en unos pocos lotes grandes. Con otro millón de dólares quizá hasta podría hacerse un contenedor con control de temperatura y humedad para transportarlos todos juntos
      Si yo tuviera 30 millones de dólares, sin duda los donaría a esto. Parece uno de los mejores usos posibles para una cantidad así. Eso permitiría saltarse la necesidad de hacer I+D para un escáner de escritorio u otras soluciones, y también parece viable hacer crowdfunding
      La segmentación podría resolverse con una solución colectiva tipo Seti@Home. Solo que en vez de usar computadoras, se usaría a personas que se la pasan todo el día scrolleando Reddit o Twitter por aburrimiento
      Incluso podría hacerse como un CAPTCHA para que se procese gratis. Si fuera posible, yo mismo dedicaría unas cuantas horas al mes a la segmentación
      Este proyecto ya llegó hasta aquí gracias a un gran esfuerzo comunitario, y no hay razón para no abrir y expandir aún más el colectivo humano que intenta comprender estos rollos. Si atraes a millones de personas, no necesitas depender solo de apoyos tecnológicos y desarrollo. Aunque claro, desarrollar tecnología tampoco es un mal camino
    • El financiamiento también es enorme. El financiamiento es la rueda que hace girar este proyecto. Lo digo como alguien que estuvo cerca de la gente del proyecto durante un tiempo
      Si conoces a alguien que pueda aportar a la fase 2 del proyecto, o sea la etapa de expansión, estaría bien avisarle a Nat. No tengo relación directa con el equipo operativo del proyecto, solo lo señalo como contacto para gente excelente
    • Es un plan realmente refrescante por lo claro y bien armado que está. Para ser sincero, este proyecto da mucha esperanza
  • Cuando viajé por Italia con mi esposa, Herculaneum fue uno de los lugares que más me impresionó
    No tenía idea real de la magnitud de cuánta ceniza y tierra hubo que retirar para excavarla; fueron decenas de metros [1]
    De verdad es una lástima que reciba solo una fracción de la atención que recibe Pompeii. Su estado de conservación es mucho mejor y de verdad inspira asombro [2]
    Recomiendo muchísimo recorrer el sitio durante unas horas. Es un lugar realmente increíble
    1: https://www.icloud.com/photos/#08dJAA5eM9jpbhlEa3fzkl5ng
    2: https://www.icloud.com/photos/#076Pof4FziA7WgcI8hZrGZmzg

    • Disfruté mucho la parte sobre Herculaneum en el videojuego de 1992 Rome: Pathway to Power
      El juego empieza con uno como esclavo que tiene que escapar de Herculaneum antes de que el Vesubio haga erupción. Era un juego que me encantaba de niño, y se parecía más a una simulación inmersiva isométrica con una interfaz tosca
      Gracias a ese juego me interesé por la antigua Roma, y me gustaría visitar Herculaneum algún día
    • La ciudad italiana moderna de Ercolano está justo encima de Herculaneum, así que excavar el resto de la ciudad antigua es bastante complicado
      Hasta ahora solo se ha excavado cerca de una cuarta parte, en contraste con Pompeii, de la que se ha descubierto alrededor de dos tercios
  • Es de lo más genial que he leído este año. Casi se lee como ciencia ficción
    Quién habría imaginado que sería posible leer texto en papel de hace 2,000 años, enrollado y carbonizado hasta quedar reseco

    • Esto es el fruto de 270 años de arqueología y tecnología. Los rollos fueron excavados en 1752
      Toda la acumulación de la Revolución Industrial, la ciencia, la ingeniería y la capacidad de manufactura hizo posible descubrir, preservar y escanear los rollos, y al final la actual revolución de la IA se colocó como el remate que crea inferencias y conexiones más allá de la comprensión humana
      Y así terminó brotando sabiduría antigua de hace 2,000 años
    • Leí por primera vez sobre los Herculaneum Papyri hace más de 10 años, e imaginé el día en que podrían leerse
      En realidad, la investigación para desenvolver virtualmente este tipo de rollos venía desde 2007 (https://en.wikipedia.org/wiki/Herculaneum_papyri#Virtual_unr...), pero jamás imaginé que ocurriría tan pronto
      Una vez más demuestra que la aceleración exponencial de la tecnología es real
    • Ya que salió eso de “se lee como ciencia ficción”, no logro recordar qué novela era esa en la que, para escanear libros completos, los metían de forma destructiva en una especie de trituradora de libros
      Había una escena en la que cortaban los libros en pedacitos, absorbían esos fragmentos y los escaneaban mientras fluían, y luego reconstruían el texto original armando el resultado del escaneo como si fuera un rompecabezas
      Era una trama secundaria, pero no hay forma de que me acuerde del título
    • Antes descartaba a la ligera a la gente que criopreserva su cuerpo esperando una resurrección incierta en el futuro, pero ahora ya me hace dudar un poco
      Una novela de ciencia ficción con esta premisa me sonaría bastante atractiva
      Algún multimillonario se liofiliza en vez de depender de máquinas y hace que lo guarden en un cráter del polo sur de la Luna. Luego crea una fundación para financiar investigación en propulsión interestelar, para que vayan trasladando su cuerpo a los puntos más fríos y estables que se descubran en el camino hacia un punto de 1 kelvin en la Boomerang Nebula, y para que sigan investigando cómo revivirlo después de haber quedado carbonizado y reseco
      Esa fundación, por su objetivo quijotesco de completar la misión, termina detonando todo tipo de avances: fusión práctica, generación de energía más exótica, inteligencia artificial general, manipulación gravitatoria, nanotecnología al estilo Drexler, Dyson swarm, star wisps y cuerpos autocorrectivos
  • Una de las cosas más fascinantes de la arqueología es la práctica de dejar algunos artefactos sin explorar a propósito
    Parece que quienes encontraron los primeros rollos intentaron desenrollar algunos, y al darse cuenta de que era imposible hacerlo sin destruirlos por completo, dejaron el resto intacto
    En vez de forzarlo y arruinarlo todo, lo dejaron como un misterio para una era futura
    No fue sino hasta dos siglos después que, con ayuda de tecnologías que ellos no podían ni imaginar, por fin empezamos a poder entenderlos

    • Aunque hubieran insistido al principio, no habrían obtenido nada, así que no creo que haya hecho falta una autocontención tan extraordinaria para detenerse
      Más bien admiro más a la gente de los años 90 o principios de los 2000. Tal vez ya había alguna posibilidad, pero el riesgo seguía siendo demasiado alto, así que esperaron hasta que las probabilidades fueran más seguras
    • Una característica de esa época es que la gente casi veneraba a los romanos
      Buena parte de la educación de entonces consistía en aprender latín, y al mismo tiempo sabían muy bien que solo se había conservado una fracción pequeñísima de los textos clásicos
      Así que es muy plausible que entendieran lo importante que era preservar estos rollos y hacer posible abrirlos algún día
    • Hay un ejemplo de lo mismo a escala macroscópica: https://www.smithsonianmag.com/smart-news/archaeologists-reb...
    • Del mismo modo, grandes zonas de Pompeii siguen sin excavarse y se dejan para el futuro
  • Es un logro asombroso considerar que se estima que los rollos en Naples contienen más de 16 MB de texto
    Parte del equipo de papirología considera que, si este texto se publica, será la mayor revolución en los estudios clásicos desde el Renacimiento; ojalá el gobierno italiano permita más excavaciones en la Villa

    • Probablemente sí lo permitan. Pompeii y Herculaneum siguen excavándose incluso ahora, dos siglos después, así que la situación no está detenida
      Pero solo hemos leído 5% de estos rollos y ya hay una cantidad enorme de material excavado, así que probablemente tomará años procesar tan solo lo que ya tenemos
    • El gran problema es que la Villa of the Papyri está debajo de construcciones modernas
      Eso no significa que excavar sin demoler sea imposible, pero aunque hay casos como las Scavi bajo la Basílica de San Pedro, se vuelve mucho más difícil
  • Es realmente un trabajo impresionante, incluso considerando que el modelo que originalmente logró el avance fue entrenado en una GTX 1070: https://twitter.com/LukeFarritor/status/1754532281690243339

    • A causa de los grandes modelos de lenguaje, se ha distorsionado la percepción sobre cuánta capacidad de cómputo se necesita para hacer cosas útiles con aprendizaje automático
  • Publicaciones relacionadas:
    First word discovered in unopened Herculaneum scroll by CS student - https://news.ycombinator.com/item?id=37857417 - octubre de 2023, 207 comentarios
    The Vesuvius Challenge - https://news.ycombinator.com/item?id=35322809 - marzo de 2023, 32 comentarios
    Vesuvius Challenge - https://news.ycombinator.com/item?id=35169869 - marzo de 2023, 32 comentarios