Ganadores del Gran Premio del Vesuvius Challenge 2023: logran leer el primer rollo
(scrollprize.org)- El Vesuvius Challenge 2023 logró restaurar parte de un texto que no se veía desde hacía 2.000 años al leer, sin desenrollarlos, los Papiros de Herculano carbonizados por la erupción del Vesubio en el año 79
- El equipo de Youssef Nader, Luke Farritor y Julian Schilliger recibió el Gran Premio de $700.000 tras cumplir el criterio de 4 pasajes de 140 caracteres cada uno y una tasa de recuperación de caracteres superior al 85%; su entrega incluyó 15 columnas y más de 2.000 caracteres de texto
- El rollo restaurado no parece ser una copia duplicada de una obra existente, sino un texto antiguo inédito, interpretado como un texto de filosofía epicúrea sobre música, comida, sentidos y placer
- La tecnología central combina tomografía de rayos X, segmentación 3D de capas de papiro y detección de tinta basada en machine learning; el código ganador y los datos de entrenamiento fueron publicados, lo que permite reproducir y verificar los resultados
- El objetivo para 2024 es pasar de leer alrededor del 5% del primer rollo a leer el 90% de los 4 rollos escaneados; el mayor cuello de botella es automatizar la segmentación, que hoy requiere mucho trabajo manual
Leen un rollo de 2.000 años sin abrirlo
- Los Papiros de Herculano son rollos de papiro carbonizados por la erupción del Mount Vesuvius en el año 79; fueron descubiertos en el siglo XVIII y hoy se conservan cientos de ellos en una biblioteca de Naples, Italia
- Como están en estado de masas carbonizadas de ceniza, desplegarlos físicamente podría dañarlos gravemente, por lo que hacía falta un método no destructivo para leer el texto interno
- Nat Friedman, Daniel Gross y Brent Seales lanzaron el Vesuvius Challenge el 15 de marzo de 2023
- Escanearon un rollo del Institut de France con CT de alta resolución en el acelerador de partículas Diamond Light Source, cerca de Oxford
- A partir de los escaneos CT publicados, participantes de todo el mundo combinaron visión por computadora, machine learning y trabajo manual para resolver el problema
- El total de premios superaba el millón de dólares, aportado por varios donantes
- En diciembre de 2023, los participantes lograron leer parte del primer rollo
- En PHerc.Paris. 4 se reveló texto que no había sido visto en 2.000 años
- Aproximadamente el 95% del rollo sigue sin leerse
Resultados del Grand Prize 2023
- Las entregas para el Grand Prize llegaron hasta justo antes de la medianoche del 1 de enero de 2024, y durante enero fueron revisadas por el equipo de papirología y el equipo técnico
- El equipo de papirología revisó el texto de 15 columnas de las entregas anonimizadas
- El equipo técnico auditó y reprodujo el código y los métodos presentados
- El Gran Premio fue para el equipo de Youssef Nader, Luke Farritor y Julian Schilliger
- El premio fue de $700.000
- El criterio era 4 pasajes, de 140 caracteres cada uno, con al menos 85% de probabilidad de recuperación de caracteres
- Cuando se anunciaron los criterios, muchas personas del equipo organizador estimaban la probabilidad de éxito en menos del 30%
- La entrega ganadora incluyó 11 columnas adicionales y más de 2.000 caracteres de texto en total
- Los tres contribuyeron a la comunidad desde las primeras etapas del Vesuvius Challenge
- Youssef Nader, estudiante egipcio de PhD en Berlin, leyó varias columnas en octubre de 2023 y obtuvo el segundo lugar del First Letters Prize
- Luke Farritor, estudiante universitario de 21 años de Nebraska e intern de SpaceX, fue el primero en leer una palabra completa dentro de un rollo de Herculano, ΠΟΡΦΥΡΑϹ (“purple”), y ganó el primer lugar del First Letters Prize
- Julian Schilliger, estudiante suizo de robótica en ETH Zürich, recibió 3 premios de Segmentation Tooling por su trabajo en Volume Cartographer
Composición técnica de la entrega ganadora
- La entrega incluyó resultados de tres arquitecturas de modelos que se respaldan entre sí
- Las imágenes más sólidas suelen provenir de un modelo basado en TimeSformer
- Para evitar sobreajuste y alucinaciones se usaron resultados de varias arquitecturas, estudios de tamaños de ventana de entrada y salida, label smoothing y variaciones de folds de validación
- El código de detección de tinta fue publicado como open source en GitHub
- Además de una detección de tinta sólida, la entrega incorporó el enfoque de segmentación automática más fuerte
- ThaumatoAnakalyptor, de Julian, genera grandes segmentos de papiro en varios rollos
- Re-segmenta áreas ya conocidas para verificar hallazgos de tinta anteriores
- También revela letras en zonas nuevas, como el enrollado más externo del rollo
- Es una herramienta prometedora, aunque todavía queda mucho por mejorar
Finalistas y métodos publicados
- Entre las entregas restantes, tres equipos empataron como finalistas según las puntuaciones del equipo de papirología
- Cada equipo recibió $50.000
- Las tres entregas mostraron una legibilidad similar y eran bastante más fáciles de leer que el resto
- Entregas publicadas de los equipos finalistas:
- Los equipos finalistas aportaron nuevos enfoques a problemas específicos de etiquetado y muestreo de tinta
- En la comunidad de Discord se puede acceder a los datos CT e imágenes adicionales bajo un acuerdo de datos, y continúan los hallazgos y la colaboración entre participantes
Contenido del texto restaurado
- Hasta ahora se desplegó y leyó aproximadamente el 5% del primer rollo
- El equipo de papirología preparó una transcripción preliminar de todas las columnas reveladas
- Este rollo no es una copia duplicada de una obra existente, sino un texto antiguo visto por primera vez
- Según las primeras lecturas, el tema general es el placer, entendido como el bien supremo en la filosofía epicúrea
- Parte de dos columnas consecutivas trata sobre cómo la disponibilidad de bienes como la comida influye en el placer
- El autor deja una frase con el sentido de que “no creemos de inmediato que lo escaso sea necesariamente más placentero que lo abundante”
- Luego continúa con la idea de que “esas preguntas serán examinadas con frecuencia”
- Como se trata del final del rollo, es posible que la discusión continúe en un libro posterior de la misma obra
- Al comienzo del primer texto se menciona a una persona llamada Xenophantus
- Podría tratarse de alguien quizá relacionado con la música, también mencionado en On Music de Philodemus
- Philodemus fue una figura de la escuela epicúrea y se cree que fue un filósofo activo en la pequeña biblioteca de la villa donde se encontraron los rollos
- Richard Janko considera muy probable que el autor sea Philodemus, filósofo y poeta maestro de Virgil
- Cree que es bastante probable que el texto compare los efectos de la música sobre el oyente con otros placeres, como la comida y la bebida
- También podría ser un texto de un tratado en cuatro partes sobre música, del cual se conoce el Book 4
- Federica Nicolardi ve este texto como un texto de epicureísmo lleno de música, comida, sentidos y placer
- Bob Fowler considera que Philodemus valoraba mucho el placer, pero no como simple libertinaje, sino como placer correctamente entendido
Cómo se verificó la precisión de las imágenes resultantes
- Una de las cuestiones a verificar era la posibilidad de alucinaciones, es decir, que el modelo de machine learning generara letras o imágenes parecidas a los datos de entrenamiento
- El equipo de revisión técnica del Vesuvius Challenge reprodujo manualmente la entrega ganadora
- Entendió cada parte del código y verificó que, al ejecutarlo de forma independiente, produjera imágenes de salida similares
- El código y los datos de entrenamiento están publicados, por lo que otras personas pueden hacer la misma verificación
- Varias entregas produjeron resultados muy similares en la misma zona del rollo
- El equipo organizador de segmentación publicó segmentos: hojas de papiro mapeadas en 3D dentro del escaneo CT
- Los participantes usaron distintos modelos de ML y etiquetas de entrenamiento, pero generaron imágenes de salida parecidas
- Esta coincidencia apareció no solo en el equipo ganador y los finalistas, sino también en otras entregas
- El modelo de detección de tinta no se basa en letras griegas, OCR ni modelos de lenguaje
- Detecta de forma independiente puntos de tinta muy pequeños en el escaneo CT
- Las letras aparecen después, cuando se agrupan esos pequeños resultados de detección
- En algunos casos, la salida es un valor binario de “tinta” o “no tinta”
- Por esta estructura, consideran muy baja la probabilidad de que el modelo alucine formas parecidas a letras
Tres etapas del desenrollado virtual
- El desenrollado virtual se compone, en términos generales, de escaneo, segmentación y detección de tinta
-
Escaneo
- El rollo o los fragmentos se escanean en 3D mediante tomografía de rayos X
- Diamond Light Source permite imágenes de alta resolución rápidas y precisas gracias a un haz paralelo de rayos X de alto flujo
- Las radiografías se convierten en un volumen 3D basado en voxels mediante algoritmos de reconstrucción tomográfica, y se genera una pila de imágenes por cortes
-
Segmentación
- Se rastrean las capas individuales del papiro enrollado y arrugado en el espacio 3D, y luego se despliegan y aplanan
- Se usa principalmente Volume Cartographer, creado por Seth Parker y otros en el laboratorio de Brent Seales
- Julian Schilliger, Philip Allgaier y otros ampliaron las herramientas
- Un equipo de segmentación de tiempo completo formado por Ben Kyles, David Josey y Konrad Rosenberg usa una combinación de algoritmos automáticos y ajustes manuales
- Segmentar un rollo completo sigue siendo un proceso muy laborioso, con amplio margen de mejora
-
Detección de tinta
- Stephen Parsons demostró que la tinta de Herculano podía detectarse teóricamente en escaneos CT, pero antes solo era posible en pequeños fragmentos
- Detectar tinta en grandes escaneos de rollos completos aún no se había logrado
Avances clave en la detección de tinta
- El primer avance fue el descubrimiento del crackle pattern
- Casey Handmer observaba volúmenes de superficie aplanada sin procesar durante el verano de 2023 cuando descubrió un patrón de grietas inusual que parecía letras
- Este hallazgo le valió el First Ink Prize y fue compartido con la comunidad
- Luke Farritor encontró más crackle en los volúmenes de superficie aplanada creados por el equipo de segmentación, entrenó un modelo y eso llevó al premio First Letters Prize en octubre
- La segunda línea fue la Kaggle competition
- Cientos de equipos crearon modelos de machine learning para detectar tinta en fragmentos abiertos
- Esos fragmentos eran piezas desprendidas durante intentos físicos de desenrollado realizados siglos atrás
- Los participantes podían usar datos de ground truth obtenidos a partir de fotografías de los fragmentos
- Aunque el rendimiento de los modelos era excelente, al principio parecían no funcionar bien sobre los segmentos aplanados creados por el equipo de segmentación
- Cuando Youssef Nader aplicó técnicas de domain adaptation, eso desembocó en su segundo lugar en el First Letters Prize
- Después del First Letters Prize, alcanzar el Grand Prize se volvió algo visible, y Youssef, Luke y Julian formaron equipo
Prácticas operativas que contribuyeron al éxito en 2023
- El proyecto atrajo cobertura inicial, donaciones y una comunidad con fuerte motivación intrínseca gracias a un objetivo claro e inusual
- La base construida durante 20 años por Brent Seales y su equipo fue clave
- Primeros escaneos de los rollos
- Construcción de Volume Cartographer
- Primer caso exitoso de desenrollado virtual
- Prueba de que la tinta de Herculano puede detectarse en CT
- Para combinar competencia y colaboración, se implementaron progress prizes
- Aproximadamente cada 2 meses se ofrecían premios pequeños de entre $1.000 y $10.000
- Para recibir un progress prize, era necesario publicar el código o la investigación como open source
- Este mecanismo elevó el nivel de toda la comunidad y ayudó a invertir en equipos, cómputo y tiempo, además de facilitar la formación de equipos
- La decisión de contratar un equipo de segmentación de tiempo completo también fue clave
- Para aumentar la probabilidad de ganar, se realizó internamente el trabajo que era cuello de botella: rastrear el papiro
- La calidad de la segmentación era difícil de evaluar antes de detectar tinta, y recompensar por cantidad podía perjudicar la calidad
- El trabajo de etiquetado es tedioso, toma mucho tiempo y tiene una curva de aprendizaje larga, por lo que era difícil compensarlo solo con premios
- Esta decisión llevó directamente al descubrimiento del crackle pattern por Casey Handmer y contribuyó a crear mejor software de segmentación junto con la comunidad
- El éxito fue resultado de la combinación de pequeños avances de muchas personas, y se necesitaron muchas contribuciones para encontrar ideas que funcionaran en un espacio de búsqueda amplio
Objetivo de Stage 2 para 2024
- En 2023 se pasó de 0% a 5% en un rollo
- El objetivo para 2024 es leer el 90% de los 4 rollos escaneados en su totalidad, y el primer equipo que lo logre recibirá el Grand Prize 2024
- Los criterios exactos de evaluación se entregarán en marzo
- El mayor cuello de botella actual es el proceso de rastrear la superficie del papiro dentro del rollo
- Para producir el texto que hoy puede leerse, el costo de trabajo manual superó los 100 dólares por centímetro cuadrado
- Con esa estructura de costos, segmentar todos los rollos podría costar cientos de millones o miles de millones de dólares
- Las mejoras de herramientas aumentaron la eficiencia, pero el proceso sigue siendo demasiado manual y caro
- El objetivo central de Stage 2 es completar la segmentación automática
- Si funciona correctamente, también permitirá leer zonas difíciles, muy comprimidas, agrietadas, delaminadas o dañadas
- También apunta a zonas a las que las herramientas actuales no pueden acceder
- En 2024 planean mantener el Grand Prize y, al mismo tiempo, aumentar la proporción de premios destinados a contribuciones de la comunidad
- Además del equipo de segmentación de tiempo completo, planean contratar un pequeño equipo de software y ML para colaborar abiertamente con la comunidad
Objetivo más grande y posibilidades restantes
- El objetivo posterior es escanear y leer todos los rollos
- Se estima que los rollos de Naples contienen más de 16 MB de texto
- Parte del equipo de papirología cree que la publicación de este texto podría ser la mayor revolución en estudios clásicos desde el Renacimiento
- En la Villa of the Papyri aún quedan dos niveles sin excavar
- Es probable que haya más papiros, al menos dentro de gabinetes y cajas de transporte
- La biblioteca principal de la villa todavía no fue descubierta
- Esa biblioteca podría contener una variedad más amplia de textos griegos y latinos, y miles o decenas de miles de rollos enterrados
- Más detalles sobre los próximos planes están en el Master Plan
1 comentarios
Comentarios de Hacker News
Cuando vi este proyecto por primera vez en HN a inicios del año pasado, parecía casi imposible y me impresionó lo inteligentes que eran los participantes
Aunque vi varios nombres brillantes, inconscientemente pensé que harían falta al menos 5 a 10 años para lograr un avance
Hoy vuelvo a sentir la misma admiración, sorprendiéndome otra vez de lo absurdamente genial que es esto. Felicitaciones a los ganadores y a todos los que participaron
También pensé que faltarían 20 años para que una computadora escribiera un texto alternativo inquietantemente preciso sobre mis fotos, hasta con adornos retóricos, pero eso ya está pasando
En machine learning, matemáticas y áreas afines ya existen carreras muy bien pagadas, así que es difícil mantener el interés de los mejores expertos en algo que podría terminar en fracaso
No es solo la recompensa en efectivo; un reto con un gran premio también eleva el prestigio de encontrar la solución. El Nobel al final también viene acompañado de alrededor de un millón de dólares
Si alguien ofreciera 100 millones de dólares por descifrar el manuscrito Voynich o el Linear A, estoy bastante seguro de que habría una solución en menos de 3 años
Cuando hacia octubre del año pasado empezaron a salir poco a poco los primeros resultados, leer esto me emocionó muchísimo. La metodología fue especialmente atractiva
Primero desenrollaron digitalmente el rollo, luego descubrieron que rastros como las grietas del papel eran señales de la tinta, y fue impresionante cómo construyeron un modelo para detectarlo fragmento por fragmento
Tendría que ver el repositorio final para saber exactamente qué hicieron, pero parece que usaron TimeSFormer. Yo lo conocía como algo para video, así que me intriga cómo lo aplicaron a imágenes
En cualquier caso, es un día realmente increíble para la arqueología, y estos jóvenes talentos merecen un gran aplauso por lo que lograron
Según entendí, el escaneo del rollo parece haber devuelto las capas mismas
La estructura sería más o menos así:
Así que, si divides la imagen de la superficie en mosaicos, obtienes datos de tamaño
size_x * size_y * n_layersEs decir, puede verse como una secuencia de video con forma
size_x * size_y * 1 channel * n_layers, donde las capas sustituyen la dimensión temporalAquí encaja perfecto la frase “cualquier tecnología suficientemente avanzada es indistinguible de la magia”
La capacidad tecnológica casi mágica de convertir una masa de rollos ennegrecidos y carbonizados en texto legible es una locura
Apenas conozco machine learning por encima, así que me pregunto si las técnicas mencionadas en el artículo fueron descubiertas hace poco o si ya existían desde hace bastante tiempo
También me pregunto si estos algoritmos alcanzaron un punto de inflexión y por eso ahora se usan más ampliamente, lo que está llevando a más casos de aplicar enfoques nuevos a problemas antiguos
En 10 mil años tal vez estén reconstruyendo conos de luz. Quizá nosotros mismos seamos justamente ese tipo de seres en este momento. No lo digo en serio, pero es un experimento mental divertido
Hay un enlace al “plan maestro” para leer todos los rollos excavados: https://scrollprize.org/master_plan
Parecen existir dos cuellos de botella principales para leer más: se necesita intervención manual al segmentar los rollos escaneados, y es caro escanear nuevos rollos
Parece posible que alguien done ese costo y que los rollos se trasladen cerca de un acelerador de partículas todos de una vez, o en unos pocos lotes grandes. Con otro millón de dólares quizá hasta podría hacerse un contenedor con control de temperatura y humedad para transportarlos todos juntos
Si yo tuviera 30 millones de dólares, sin duda los donaría a esto. Parece uno de los mejores usos posibles para una cantidad así. Eso permitiría saltarse la necesidad de hacer I+D para un escáner de escritorio u otras soluciones, y también parece viable hacer crowdfunding
La segmentación podría resolverse con una solución colectiva tipo Seti@Home. Solo que en vez de usar computadoras, se usaría a personas que se la pasan todo el día scrolleando Reddit o Twitter por aburrimiento
Incluso podría hacerse como un CAPTCHA para que se procese gratis. Si fuera posible, yo mismo dedicaría unas cuantas horas al mes a la segmentación
Este proyecto ya llegó hasta aquí gracias a un gran esfuerzo comunitario, y no hay razón para no abrir y expandir aún más el colectivo humano que intenta comprender estos rollos. Si atraes a millones de personas, no necesitas depender solo de apoyos tecnológicos y desarrollo. Aunque claro, desarrollar tecnología tampoco es un mal camino
Si conoces a alguien que pueda aportar a la fase 2 del proyecto, o sea la etapa de expansión, estaría bien avisarle a Nat. No tengo relación directa con el equipo operativo del proyecto, solo lo señalo como contacto para gente excelente
Cuando viajé por Italia con mi esposa, Herculaneum fue uno de los lugares que más me impresionó
No tenía idea real de la magnitud de cuánta ceniza y tierra hubo que retirar para excavarla; fueron decenas de metros [1]
De verdad es una lástima que reciba solo una fracción de la atención que recibe Pompeii. Su estado de conservación es mucho mejor y de verdad inspira asombro [2]
Recomiendo muchísimo recorrer el sitio durante unas horas. Es un lugar realmente increíble
1: https://www.icloud.com/photos/#08dJAA5eM9jpbhlEa3fzkl5ng
2: https://www.icloud.com/photos/#076Pof4FziA7WgcI8hZrGZmzg
El juego empieza con uno como esclavo que tiene que escapar de Herculaneum antes de que el Vesubio haga erupción. Era un juego que me encantaba de niño, y se parecía más a una simulación inmersiva isométrica con una interfaz tosca
Gracias a ese juego me interesé por la antigua Roma, y me gustaría visitar Herculaneum algún día
Hasta ahora solo se ha excavado cerca de una cuarta parte, en contraste con Pompeii, de la que se ha descubierto alrededor de dos tercios
Es de lo más genial que he leído este año. Casi se lee como ciencia ficción
Quién habría imaginado que sería posible leer texto en papel de hace 2,000 años, enrollado y carbonizado hasta quedar reseco
Toda la acumulación de la Revolución Industrial, la ciencia, la ingeniería y la capacidad de manufactura hizo posible descubrir, preservar y escanear los rollos, y al final la actual revolución de la IA se colocó como el remate que crea inferencias y conexiones más allá de la comprensión humana
Y así terminó brotando sabiduría antigua de hace 2,000 años
En realidad, la investigación para desenvolver virtualmente este tipo de rollos venía desde 2007 (https://en.wikipedia.org/wiki/Herculaneum_papyri#Virtual_unr...), pero jamás imaginé que ocurriría tan pronto
Una vez más demuestra que la aceleración exponencial de la tecnología es real
Había una escena en la que cortaban los libros en pedacitos, absorbían esos fragmentos y los escaneaban mientras fluían, y luego reconstruían el texto original armando el resultado del escaneo como si fuera un rompecabezas
Era una trama secundaria, pero no hay forma de que me acuerde del título
Una novela de ciencia ficción con esta premisa me sonaría bastante atractiva
Algún multimillonario se liofiliza en vez de depender de máquinas y hace que lo guarden en un cráter del polo sur de la Luna. Luego crea una fundación para financiar investigación en propulsión interestelar, para que vayan trasladando su cuerpo a los puntos más fríos y estables que se descubran en el camino hacia un punto de 1 kelvin en la Boomerang Nebula, y para que sigan investigando cómo revivirlo después de haber quedado carbonizado y reseco
Esa fundación, por su objetivo quijotesco de completar la misión, termina detonando todo tipo de avances: fusión práctica, generación de energía más exótica, inteligencia artificial general, manipulación gravitatoria, nanotecnología al estilo Drexler, Dyson swarm, star wisps y cuerpos autocorrectivos
Una de las cosas más fascinantes de la arqueología es la práctica de dejar algunos artefactos sin explorar a propósito
Parece que quienes encontraron los primeros rollos intentaron desenrollar algunos, y al darse cuenta de que era imposible hacerlo sin destruirlos por completo, dejaron el resto intacto
En vez de forzarlo y arruinarlo todo, lo dejaron como un misterio para una era futura
No fue sino hasta dos siglos después que, con ayuda de tecnologías que ellos no podían ni imaginar, por fin empezamos a poder entenderlos
Más bien admiro más a la gente de los años 90 o principios de los 2000. Tal vez ya había alguna posibilidad, pero el riesgo seguía siendo demasiado alto, así que esperaron hasta que las probabilidades fueran más seguras
Buena parte de la educación de entonces consistía en aprender latín, y al mismo tiempo sabían muy bien que solo se había conservado una fracción pequeñísima de los textos clásicos
Así que es muy plausible que entendieran lo importante que era preservar estos rollos y hacer posible abrirlos algún día
Es un logro asombroso considerar que se estima que los rollos en Naples contienen más de 16 MB de texto
Parte del equipo de papirología considera que, si este texto se publica, será la mayor revolución en los estudios clásicos desde el Renacimiento; ojalá el gobierno italiano permita más excavaciones en la Villa
Pero solo hemos leído 5% de estos rollos y ya hay una cantidad enorme de material excavado, así que probablemente tomará años procesar tan solo lo que ya tenemos
Eso no significa que excavar sin demoler sea imposible, pero aunque hay casos como las Scavi bajo la Basílica de San Pedro, se vuelve mucho más difícil
Es realmente un trabajo impresionante, incluso considerando que el modelo que originalmente logró el avance fue entrenado en una GTX 1070: https://twitter.com/LukeFarritor/status/1754532281690243339
Publicaciones relacionadas:
First word discovered in unopened Herculaneum scroll by CS student - https://news.ycombinator.com/item?id=37857417 - octubre de 2023, 207 comentarios
The Vesuvius Challenge - https://news.ycombinator.com/item?id=35322809 - marzo de 2023, 32 comentarios
Vesuvius Challenge - https://news.ycombinator.com/item?id=35169869 - marzo de 2023, 32 comentarios
Can AI Unlock the Secrets of the Ancient World? - https://news.ycombinator.com/item?id=39261465 - febrero de 2024, 1 comentario
Y también hay un tuit que probablemente trata lo mismo que el OP
The $700k Vesuvius Challenge prize has been won - https://news.ycombinator.com/item?id=39261933 - febrero de 2024, 2 comentarios