2 puntos por GN⁺ 2023-09-18 | 1 comentarios | Compartir por WhatsApp
  • Linear Book Scanner es un escáner de libros de código abierto y de bajo costo que automatiza el paso de páginas y el escaneo
  • Mientras el libro se mueve hacia adelante y hacia atrás sobre el dispositivo, el paso de páginas y el escaneo se realizan de forma secuencial
  • En cada desplazamiento, una succión por vacío pasa una página de un lado al otro
  • Las páginas se escanean al pasar por dos sensores de imagen
  • El software dedicado convierte los resultados del escaneo en PDF con búsqueda de texto, aumentando su utilidad

Estructura que escanea mientras pasa las páginas

  • Linear Book Scanner fue diseñado como un escáner de libros con paso de páginas de bajo costo
  • El diseño se publica como código abierto, por lo que cualquiera puede construirlo por su cuenta
  • El libro se mueve hacia adelante y hacia atrás sobre la máquina, y cada vez que pasa, el vacío succiona una página de un lado al otro para voltearla

Resultados del escaneo

  • Las páginas se escanean mientras pasan por dos sensores de imagen
  • El software genera el libro escaneado como un PDF con búsqueda de texto

1 comentarios

 
GN⁺ 2023-09-18
Opiniones de Hacker News
  • Este tema tiene una comunidad en https://diybookscanner.org/
    Hace unos años hice una pequeña herramienta en Java llamada bookbuilder, con la que se podían pasar las páginas a mano, tomar fotos y luego procesar automáticamente todas las imágenes para crear un PDF con búsqueda
    Usé una biblioteca de visión por computadora en Java puro llamada https://boofcv.org/, que todavía existe y es bastante rápida
    Podía encargarse automáticamente de detectar el contorno de la página, corregir la inclinación, aplanar la imagen e incluso eliminar el contorno de los dedos mediante coincidencia de tonos de piel, y después generar un PDF con una capa OCR invisible sin intervención del usuario
    Recuerdo que también trabajé en la detección de la inclinación de líneas con una especie de algoritmo de watershed para mejorar el aplanado
    Fue un proyecto divertido, y me pregunto si el código fuente habrá quedado en algún lado. La página de descarga ya desapareció, y en ese momento todavía no lo había publicado como open source porque no pensé que un pequeño proyecto paralelo así pudiera interesarle a otra persona

    • El foro real de escáneres de libros de https://diybookscanner.org/ lleva varias semanas caído y están trabajando en restaurarlo
    • Desde hace tiempo me interesaba el escaneo de libros, y creo recordar haber visto este software
      Hice una de las primeras versiones que vi en el sitio, y hace unos años me encontré por casualidad con Jonathon Duerig e hice algunos trabajos de corte por chorro de agua para él
      Cuando vi por primera vez el escáner lineal de libros, sentí que estaba al revés. Si pudiera moverse por sí mismo en una estructura suspendida, se podrían evitar los problemas de no conocer la masa del libro o de tener que lidiar con la fricción
      Con un contrapeso se podría mantener constante la fuerza, y sin importar qué libro se escanee, solo habría que mover una masa conocida
    • BoofCV es realmente genial
      Me da pena no haberlo conocido hasta hoy; si lo hubiera sabido, creo que habría dedicado tiempo a aprenderlo y contribuir. Todavía es posible, pero por lo que veo ya cubre casi todas las funciones de las que he oído hablar, y más
      Pasé 30 minutos haciendo clic en los ejemplos uno por uno
    • Sería bueno que lo publicaran en GitHub si es posible
  • Hay escáneres comerciales similares [1] [2], y este también tiene un diseño en V, pero está invertido para escanear desde arriba
    Como se mueve el escáner y no el libro, funciona de forma mucho más suave para el libro
    Me da mucho gusto ver que se esté desarrollando una alternativa open source de este tipo
    [1] https://www.treventus.com
    [2] https://youtu.be/SdipuAuWsEs?si=dFWRtva5gO2oM91o

    • Alquilarlo, rentarlo o usar un servicio de digitalización probablemente también sea caro
      porque en ambos casos no hay información de precios publicada, solo te hacen llenar un formulario de contacto
    • Este dispositivo también aparece en una presentación de Google relacionada con el proyecto original
      https://youtu.be/4JuoOaL11bw?si=do1qet5Kq_WErQgz&t=162
    • Aquí hay una versión DIY de la misma idea: https://www.diybookscanner.org
    • No estoy seguro de que este escáner sea una gran alternativa, porque funciona cortando una página cada vez que escanea
      Después de eso, qué tan delicado sea al manipularlas parece importar poco
      Quizá podría servir si la idea es volver a encuadernar las páginas restantes y hacer un libro nuevo
  • Me gusta la idea, pero para fines de preservación o para libros valiosos me preocupa un poco el riesgo de rasgar páginas
    En esos casos, de todos modos preferiría escanearlos a mano, pero muchas veces quise tener un aparato así para digitalizar demasiados libros
    Según la explicación en el FAQ sobre la frecuencia de páginas rasgadas:

    Prototype 1 could scan the majority of books without damage, but may tear one or two pages in some books. Out of 50 books tested, 45% had one or two of their pages either torn or folded. This is a very early prototype and there are many areas for improvement in the design.
    Personalmente, en general me parece aceptable. Sobre todo si en versiones posteriores reducen ese 45% a algo como 10–20%, consideraría construir uno si tuviera espacio para un dispositivo así

    • Durante un tiempo, Internet Archive hizo un escáner de libros en el que se colocaba el libro sobre un soporte en forma de V
      Un voluntario pasaba las páginas a mano, bajaba y subía dos placas de vidrio para presionar suavemente las páginas, y dos cámaras DSLR en montajes inclinados tomaban las fotos
      El dispositivo completo no es automático, pero se puede operar fácilmente a mano
      https://blog.archive.org/2021/02/09/meet-eliza-zhang-book-sc...
    • Si todavía no lo han visto, vale la pena visitar este sitio
      https://www.diybookscanner.org/en/intro.html
    • Para libros irremplazables, por ejemplo libros antiguos y descatalogados, no sería aceptable en absoluto
      Deben ser 0 páginas rasgadas
      Antes de las computadoras, tampoco existían copias electrónicas
  • En este ámbito, el software todavía no alcanzó el nivel posible, así que la gente está resolviendo con hardware cosas que podrían hacerse con software
    Con dos o más fotos, o una imagen estéreo, por ejemplo de un iPhone nuevo, se podría estimar una página aplanada mediante triangulación y generar una imagen que parezca una página recortada de un escáner plano
    Después bastaría con pagar lo suficiente a alguien en Etiopía para que pase las páginas con cuidado sin dañar el libro
    Como sabe cualquier investigador, las bibliotecas digitales actuales tienen acumulado un siglo de escaneos de calidad dudosa
    La IA puede estimar un escaneo difícil de distinguir del formato original de fuente de contorno en un monitor 8K
    Hace tiempo, en relación con las guerras de fuentes de los años 80, asesoré sobre la conversión de formatos antiguos y escaneos digitales a fuentes PostScript y TrueType
    En aquel momento era difícil, pero cuando el software se ponga al día, esto se entenderá como la forma correcta de escanear texto
    La literatura científica necesita algo como ChatGPT que restaure el código fuente LaTeX capaz de reproducir cada página. De hecho, lo que realmente hace falta es un sucesor de LaTeX menos críptico y que permita crear texto fijo y texto fluido con la misma facilidad

    • Este es un problema muy físico, y no hay muchos atajos utilizables
      Participé en un proyecto de preservación y escaneé muchísimas revistas; en general, si se colocaban o no sobre una superficie plana no importaba demasiado. De todos modos, pasar las páginas a mano toma tiempo
      Ya existen métodos conocidos para escanear revistas y libros muy rápidamente: cortar el lomo de la encuadernación y poner las páginas en un escáner automático
      Claro que, si después del escaneo se quiere conservar el objeto, eso no aplica porque se destruye la copia
      Al final, la mejor manera de automatizar el escaneo sin arruinar el objeto tiene que combinar una cámara superior con una máquina pasadora de páginas. Supongo que el proyecto de escaneo a gran escala de Google también funcionaba así
      Quizás se puedan “escanear” algunos libros con rayos X sin pasar las páginas, pero ahí también parecerían surgir problemas nuevos
    • No veo exactamente en qué sentido construir infraestructura para explotar mano de obra del Tercer Mundo es un problema de software
      El problema no es tanto que el software no haga bien la corrección de distorsión, sino que, una vez hecha toda la preparación para escanear un libro, conviene más usar un dispositivo que no requiera corrección de distorsión
    • El software ya era posible en 2017. Básicamente hice este trabajo en un dispositivo para personas con discapacidad visual, y ni siquiera hizo falta imagen estéreo
      Aquí se puede ver cómo funciona el aplanado. Esa parte la manejaba una biblioteca, así que no tuve que escribir código aparte
      https://youtu.be/DPu0iJtK2sI?t=1542
      También tenía funciones para indicar que se pasara la página, detectar si ya se había pasado y tomar la foto. En segundo plano aplanaba las fotos, separaba las páginas y hacía OCR
      Con un poco de práctica, se podía escanear y hacer OCR de un libro a razón de 1 a 5 segundos por página
      https://youtu.be/DPu0iJtK2sI?t=1909
      Después guardaba el libro con OCR y lo leía cuando uno quisiera
    • Como sucesor de LaTeX, https://typst.app/ se está consolidando bastante bien
    • La IA, de ninguna manera. Que el texto cambie sutilmente durante el proceso de digitalización es lo que más hay que evitar
      https://news.ycombinator.com/item?id=29223815
      El riesgo de obtener resultados plausibles pero incorrectos ya era una preocupación incluso antes de la IA
  • Esto parece mucho más seguro
    https://www.inforum.com/newsmd/ndsu-students-book-scanner-in...
    http://diybookscanner.org

    • Ese enfoque sin duda es más seguro, pero no es automático y alguien tiene que pasar las páginas
      Este proyecto intenta resolver ese problema, pero tendría que hacerlo de una forma mucho más suave para no dañar los libros
  • Como después de escanear todo queda en formato digital, me pregunto por qué desencuadernar el libro en hojas sueltas antes de escanearlo no es un modelo escalable
    ¿Se busca evitar el trabajo adicional de desmontarlo?

    • A los archivistas normalmente no les gusta destruir las obras que quieren preservar
      Aunque escanees un libro, lo que obtienes son solo imágenes ópticas. En el caso de un manuscrito medieval, por ejemplo, una página pudo haber sido borrada y escrita de nuevo
      Si simplemente escaneas el libro y luego destruyes la copia física, pierdes esas evidencias
      Dicho eso, si se trata de un libro barato de mercado masivo, creo que a la mayoría de los archivistas no les importaría demasiado destruir uno entre millones de ejemplares para preservar la obra
      Solo se vuelve un problema real con obras muy antiguas y muy raras
    • Si el libro no es extremadamente valioso, por lo general es más fácil cortar por completo la parte de la encuadernación con una guillotina y meter las hojas en un escáner con alimentador
  • Parece que cualquier libro un poco dañado terminaría hecho trizas

    • Yo también me estremecí al ver esto
      Tengo bastantes libros viejos que me gustaría digitalizar, y la mayoría de los escáneres de libros comunes al menos requieren abrir el libro por completo; como dices, eso puede hacer que se rompa
      Además, esos dispositivos no incluyen vacío, movimiento pasando por bordes filosos ni motores paso a paso
      En la segunda pregunta de https://linearbookscanner.org/faq/ dice:

      Out of 50 books tested, 45% had one or two of their pages either torn or folded
      Yo no usaría esto ni con mis libros menos valiosos

    • Seguro que sí. Si algo se atasca o cambian las condiciones ambientales y reaccionan con el papel, incluso un libro que no estaba dañado puede terminar así
      Aun así, si tienes una montaña de libros por escanear y puedes procesar la mayoría con una máquina como esta, dejando solo los casos especiales para tratarlos con más cuidado, eso es una ventaja
  • Google, a grandes rasgos, ya había escaneado todos los libros. El problema eran los derechos de autor y los titulares de esos derechos
    Para pasar las páginas usaron mano de obra de bajos salarios. Si nadie pone primero el enlace, lo enviaré después
    Al volver a casa vi que era este artículo: https://www.theatlantic.com/technology/archive/2017/04/the-t...

  • Se ve realmente genial. No solo puede digitalizar libros, sino que además los tritura gratis
    Es una promoción 2x1 bastante buena

  • Tengo alergia a los ácaros del polvo, así que si un libro lleva unos 6 meses en un estante, me da una reacción alérgica con solo tocarlo
    Sacudir la cubierta o pasarle la aspiradora no sirve de nada
    Creo que este dispositivo podría usarse para quitar los ácaros del polvo de los libros y poder leerlos