1 puntos por GN⁺ 2026-04-23 | 1 comentarios | Compartir por WhatsApp
  • Edición digital de la 11.ª edición de la Encyclopædia Britannica (1910–1911), con búsqueda completa, referencias cruzadas y anotaciones
  • La navegación superior ofrece las secciones Articles, Contributors, Topics y Ancillary
  • En el encabezado se indica Encyclopædia Britannica y Eleventh Edition · 1910–1911
  • La frase introductoria muestra explícitamente Fully searchable, cross-referenced, and annotated
  • No se presentan explicación adicional del contenido, ejemplos ni detalles de funciones

Resumen

  • Edición digital de la 11.ª edición de la Encyclopædia Britannica (1910–1911), con búsqueda completa, referencias cruzadas y anotaciones
  • La navegación superior ofrece las secciones Articles, Contributors, Topics y Ancillary
  • En el encabezado se indican Encyclopædia Britannica y Eleventh Edition · 1910–1911
  • La frase introductoria muestra explícitamente Fully searchable, cross-referenced, and annotated
  • No se ofrece explicación adicional del contenido, ejemplos ni detalles de funciones

Información proporcionada

  • Se pueden verificar directamente como características clave de la edición digital la capacidad de búsqueda, las referencias cruzadas y las anotaciones
  • No se incluye una explicación ampliada correspondiente al cuerpo de los artículos ni una introducción detallada para cada entrada
  • Los metadatos como información de autoría, publicación y referencia quedan excluidos del resumen

1 comentarios

 
GN⁺ 2026-04-23
Comentarios en Hacker News
  • Recreé la Encyclopædia Britannica de 1911 como un sitio limpio, estructurado y fácil de explorar. Se puede ver en https://britannica11.org/
    Restauré unos 37 mil artículos según los volúmenes originales, e incluí clic en el índice por secciones, enlaces de referencias cruzadas, búsqueda por colaborador, indicación de volumen y página originales, enlace al escaneo original de cada página, materiales suplementarios, índice temático y búsqueda de texto completo con metadatos
    El trabajo principal fue procesar el pipeline de restauración para la estructura de títulos, artículos que abarcan varias páginas, tablas, fórmulas, varios idiomas, notas al pie e ilustraciones
    La meta era conservar la sensación del original, pero convertirlo en algo realmente utilizable
    Me gustaría especialmente recibir comentarios sobre la calidad de búsqueda, la navegación entre secciones y referencias cruzadas, y cualquier parte donde la estructura se vea extraña
    También son bienvenidas las preguntas sobre el pipeline o el modelo de datos

    • Creo que algo que combinaría muy bien con el material suplementario sería añadir The Reader's Guide to the Encyclopaedia Britannica. El texto de dominio público está en https://www.gutenberg.org/ebooks/74039 y el escaneo en https://archive.org/details/readersguidetoen00londuoft
    • Me pareció realmente muy bien hecho. Como propuesta de función, estaría genial que el pipeline también soportara generación de EPUB. Así se podría buscar y leer sin conexión aunque el sitio desaparezca, y gracias a la compresión de EPUB quizá el archivo completo de la enciclopedia no sería tan grande como uno pensaría
    • Me parece que hay un problema de escape en el índice. Por ejemplo, en el artículo de United States la escritura de Roosevelt's se ve rota. https://britannica11.org/article/27-0635-united-states-the/united_states__the
    • Me gustó tanto que terminé explorando varios temas durante un buen rato
      Eso sí, una vez dentro de un artículo, la barra de búsqueda superior, "Search titles and full text...", no me funcionó para moverme a otros temas
      Además, cuando entré por primera vez me costó un poco saber por dónde empezar, y no entendí de inmediato que había que hacer clic en "Articles" o "Topics" para comenzar a explorar. Creo que esperaba que la imagen principal misma sirviera como punto de entrada
    • Sentí que sería aún mejor si hubiera enlaces internos estilo Wikipedia que conectaran los temas mencionados dentro de un artículo con otros artículos
  • Este proyecto me pareció realmente genial. Yo también llevo tiempo pensando en hacer algo parecido, pero a menor escala
    Hay varias razones por las que la Britannica de 1911 es especialmente famosa, pero creo que la más conocida es que fue la última enciclopedia anterior a la Primera Guerra Mundial
    Por eso todavía conserva el optimismo del vapor de la primera y segunda revolución industrial y de la Progressive Era, sin estar aún teñida por el impacto de la “guerra para terminar con todas las guerras”
    Probé directamente en https://britannica11.org buscando al azar Portuguese East Africa, y la encontró enseguida y la mostró bien; el resultado fue https://britannica11.org/article/22-0177-portuguese-east-africa/portuguese_east_africa
    Como petición amable, me parecería excelente una opción de vista paralela que mostrara el texto y la imagen original de la página lado a lado
    Así uno podría comprobar directamente la fidelidad del OCR mientras también disfruta del hermoso estado de impresión, y además no haría falta abrir una ventana nueva por cada página
    Personalmente, me gustaría usar este sitio como punto de entrada al documento, leer principalmente desde la imagen y cambiar al texto cuando quiera verificar o copiar algo
    Ya había notado que las imágenes originales estaban disponibles, pero me tomó tres visitas encontrar los enlaces laterales, así que no destacan mucho visualmente. Una solución intermedia como miniaturas opcionales también podría funcionar
    Y sobre todo, va muy rápido

  • Al ver algo como el artículo "Adolescence", uno encuentra creencias que hoy se leen de forma bastante chocante
    Por ejemplo, incluye afirmaciones del tipo de que cerca de la pubertad a las niñas se les debe reducir el ejercicio y la carga de educación intelectual, e imponerles descanso

    • Estoy de acuerdo. Una de las razones por las que me parece interesante la edición de 1911 es justamente esa. Los autores podían expresar sus opiniones de forma más directa, y esas opiniones reflejan de manera natural las nociones comunes de su época
    • Siento que ese tipo de contenido también parece más chocante cuando queda explicitado por escrito
      En la práctica, mucha gente sigue formas de vida parecidas, y creo que incluso el feminismo, después de impulsar con fuerza lo contrario en cierto momento, luego también se ajustó hacia enfatizar la libertad de elegir no entrar al mercado laboral
      La preferencia por la llamada "soft life" existe en cualquier época, y pienso que si los hombres también tuvieran muy abierta la opción cultural de ser mantenidos económicamente por otra persona, una proporción bastante alta elegiría roles graduales y con menor carga intelectual
      Desde esa mirada, parte del desequilibrio de representación en otros campos podría aliviarse no por una incorporación forzada de mujeres, sino por una salida voluntaria de hombres
    • Ahora, si el texto es de dominio público, siento que casi cualquier cosa se puede meter en LLM de primera línea como Kimi o GLM para obtener buenos resúmenes en lenguaje actual
      También es inesperadamente útil cómo los LLM reordenan con formato excesivo esos párrafos tipo ladrillo tan típicos de los documentos históricos
      Y si además les das un prompt como "¿Cómo se recibiría este texto hoy?", también te señalan con bastante detalle las partes que hoy resultarían inapropiadas o difíciles de aceptar
  • Tenía curiosidad por la estructura interna de la información. Hace poco descubrí que en humanidades digitales se suele usar mucho el marcado semántico tipo XML-TEI para este tipo de trabajo
    Aprendí BaseX y XQuery viendo materiales del diccionario Latin-English Lewis & Short codificados en XML-TEI, y me divertí haciendo preguntas como "¿qué autor clásico usó palabras que aparecen una sola vez en todo el corpus?" o "¿cuál es la palabra hapax más larga?"
    También me pareció excelente que Tufts University publicara ese tipo de materiales
    Siento que sería divertidísimo cargar la Britannica de 1911 en BaseX y ponerse a explorarla con XQuery

    • La estructura interna no está basada en XML-TEI, sino en datos relacionales y un pipeline. Restauré como registros estructurados los límites de los artículos, las secciones, los colaboradores, las referencias cruzadas y la información de procedencia de las páginas originales
      El texto en sí es de dominio público, pero todavía no he publicado una exportación estructurada masiva
      Aun así, en este hilo también han aparecido muchas solicitudes de acceso al dataset, así que lo estoy considerando seriamente, y si lo publico me gustaría hacerlo en una forma que conserve la estructura, no como un simple volcado de texto plano
  • Me pareció interesante lo distinto que es el estilo y la estructura comparado con textos modernos
    Por ejemplo, en la entrada de Copenhagen https://britannica11.org/article/07-0111-copenhagen/copenhagen, mientras describe con precisión la geografía y los principales atractivos, los autores también meten sin reparo adjetivos emocionales y opiniones personales sobre lo que les parece interesante o extraño
    Además, en la parte inferior, el pasaje sobre la Battle of Copenhagen cambia de repente de una descripción geográfica a una narración escena por escena de una batalla naval, como si cambiara el género mismo

    • Totalmente. Esa es una de las cosas que más me gustan de esta edición. Los artículos tienen un tono más personal y menos homogeneizado
      Mezclan geografía, historia y a veces opiniones bastante fuertes en un mismo lugar, y por eso mismo yo creo que se disfrutan más al leer
      También resumí algo de eso en mi texto de presentación: https://britannica11.org/about.html
    • Apenas vi la entrada de Victor Hugo, sentí enseguida que el autor era claramente fan
      Un ejemplo perfecto es cuando elogia Les Misérables como "la más grande novela épica y dramática jamás creada o concebida"
  • Llevo tiempo pensando si será posible conseguir enciclopedias relativamente recientes como Encarta o Britannica edición 2021
    Me atrae la idea de algo así como la última fuente de información con poca contaminación de IA, en esa frontera rara entre antes de los LLM y después de la pandemia
    Una de mis posesiones favoritas de la infancia eran las enciclopedias en CD-ROM, y me encantaba la experiencia de abrir un artículo favorito en una tarde lluviosa, leer y aprender en una época en que internet todavía no era algo común

  • A quien le guste la Encyclopedia Britannica de 1911 probablemente también le parecerá interesante https://OldEncyc.com
    Ahí se pueden explorar enciclopedias antiguas de 22 ediciones, desde 1728 hasta 1926, por volumen y por rango alfabético. No está orientado a búsqueda como el sitio del OP, pero tiene un abanico documental más amplio

    • No conocía ese sitio, pero me pareció una colección realmente buena. Me gusta especialmente que abarque muchas ediciones distintas
  • Es un reporte de bug muy menor, pero me parece que la fuente actual no soporta el carácter ℔, así que artículos como https://britannica11.org/article/22-0688-s2/putting_the_shot se ven raros
    También podría valer la pena considerar normalizarlo a lb, que hoy es una notación más familiar

    • Buena observación. Eso es un problema de cobertura de glifos, así que estoy pensando en añadir una fuente de respaldo para los caracteres faltantes o normalizar esos casos
      Aunque parezca algo pequeño, este proyecto está lleno de detalles de ese tipo
  • Qué pequeño es el mundo. Yo ahora mismo estoy limpiando escaneos de la 9th edition de la EB para subirlos a un sitio de MediaWiki, y como estoy incluyendo ilustraciones y láminas, todavía voy apenas como por un tercio
    Probé varias herramientas de OCR, y hasta ahora la que más me impresionó fue paddleOCR. Separó bastante bien las columnas de texto, el etiquetado de ilustraciones y el reconocimiento del texto en márgenes
    Claro, no es perfecta, así que algunas tablas las estoy corrigiendo a mano, y planeo subir también las páginas fuente para que se pueda alternar entre el escaneo original y el texto electrónico

    • Como referencia, la 9th edition de 1875 era conocida como la scholar's edition por la cantidad de colaboradores notables que tuvo, y me parece una instantánea fascinante de finales del siglo XIX
      Pensando en materiales que sería divertido llevar a internet con hipervínculos e índices de esta manera, también se me ocurren atlas geográficos, atlas médicos y guías de viaje Baedeker
    • Suena emocionante. La novena edición es excelente por derecho propio, y gran parte de su contenido continúa en la undécima
      Se me vienen enseguida a la mente las extensísimas entradas sobre aves de Alfred Newton o algunos de los ensayos clásicos de Macaulay
  • Algunas partes, leídas hoy, tienen un sabor bastante curioso y extraño. Por ejemplo, en la entrada sobre stars https://britannica11.org/article/25-0806-star/star#section-10, se dice algo así como que si las estrellas estuvieran distribuidas de manera infinita y uniforme en el espacio y no hubiera absorción de luz, el fondo del cielo debería verse deslumbrantemente brillante

    • Busqué "computer" y no apareció ninguna computadora en el sentido moderno; solo salió Chauncey Wright, que trabajó como computer en el American Ephemeris and Nautical Almanac
      El resultado fue https://britannica11.org/article/28-0872-wright-chauncey/wright__chauncey?q=computer&match=1, y realmente se siente cuánto ha cambiado la época
    • La entrada sobre Sun también estuvo bastante interesante. No conocían la fusión nuclear, pero ya habían descartado en su mayoría teorías como la combustión química o la contracción gravitacional para explicar de dónde salía tanta energía solar
      En cambio, consideraban más plausible algún tipo de reordenamiento en la estructura atómica de los elementos, y explicaban que al condensarse la nebulosa en el Sol y desarrollarse la materia hasta convertirse en los elementos conocidos, se liberaba energía
      Tomando en cuenta el nivel de conocimiento de la época, me pareció una estimación sorprendentemente cercana
    • Creo que ese pasaje se entiende mejor si se lo conecta con la paradoja de Olbers