Linear Book Scanner: escáner automático de libros de código abierto (2014)
(linearbookscanner.org)- Linear Book Scanner es un escáner de libros de código abierto y de bajo costo que automatiza el paso de páginas y el escaneo
- Mientras el libro se mueve hacia adelante y hacia atrás sobre el dispositivo, el paso de páginas y el escaneo se realizan de forma secuencial
- En cada desplazamiento, una succión por vacío pasa una página de un lado al otro
- Las páginas se escanean al pasar por dos sensores de imagen
- El software dedicado convierte los resultados del escaneo en PDF con búsqueda de texto, aumentando su utilidad
Estructura que escanea mientras pasa las páginas
- Linear Book Scanner fue diseñado como un escáner de libros con paso de páginas de bajo costo
- El diseño se publica como código abierto, por lo que cualquiera puede construirlo por su cuenta
- El libro se mueve hacia adelante y hacia atrás sobre la máquina, y cada vez que pasa, el vacío succiona una página de un lado al otro para voltearla
Resultados del escaneo
- Las páginas se escanean mientras pasan por dos sensores de imagen
- El software genera el libro escaneado como un PDF con búsqueda de texto
1 comentarios
Opiniones de Hacker News
Este tema tiene una comunidad en https://diybookscanner.org/
Hace unos años hice una pequeña herramienta en Java llamada bookbuilder, con la que se podían pasar las páginas a mano, tomar fotos y luego procesar automáticamente todas las imágenes para crear un PDF con búsqueda
Usé una biblioteca de visión por computadora en Java puro llamada https://boofcv.org/, que todavía existe y es bastante rápida
Podía encargarse automáticamente de detectar el contorno de la página, corregir la inclinación, aplanar la imagen e incluso eliminar el contorno de los dedos mediante coincidencia de tonos de piel, y después generar un PDF con una capa OCR invisible sin intervención del usuario
Recuerdo que también trabajé en la detección de la inclinación de líneas con una especie de algoritmo de watershed para mejorar el aplanado
Fue un proyecto divertido, y me pregunto si el código fuente habrá quedado en algún lado. La página de descarga ya desapareció, y en ese momento todavía no lo había publicado como open source porque no pensé que un pequeño proyecto paralelo así pudiera interesarle a otra persona
Hice una de las primeras versiones que vi en el sitio, y hace unos años me encontré por casualidad con Jonathon Duerig e hice algunos trabajos de corte por chorro de agua para él
Cuando vi por primera vez el escáner lineal de libros, sentí que estaba al revés. Si pudiera moverse por sí mismo en una estructura suspendida, se podrían evitar los problemas de no conocer la masa del libro o de tener que lidiar con la fricción
Con un contrapeso se podría mantener constante la fuerza, y sin importar qué libro se escanee, solo habría que mover una masa conocida
Me da pena no haberlo conocido hasta hoy; si lo hubiera sabido, creo que habría dedicado tiempo a aprenderlo y contribuir. Todavía es posible, pero por lo que veo ya cubre casi todas las funciones de las que he oído hablar, y más
Pasé 30 minutos haciendo clic en los ejemplos uno por uno
Hay escáneres comerciales similares [1] [2], y este también tiene un diseño en V, pero está invertido para escanear desde arriba
Como se mueve el escáner y no el libro, funciona de forma mucho más suave para el libro
Me da mucho gusto ver que se esté desarrollando una alternativa open source de este tipo
[1] https://www.treventus.com
[2] https://youtu.be/SdipuAuWsEs?si=dFWRtva5gO2oM91o
porque en ambos casos no hay información de precios publicada, solo te hacen llenar un formulario de contacto
https://youtu.be/4JuoOaL11bw?si=do1qet5Kq_WErQgz&t=162
Después de eso, qué tan delicado sea al manipularlas parece importar poco
Quizá podría servir si la idea es volver a encuadernar las páginas restantes y hacer un libro nuevo
Me gusta la idea, pero para fines de preservación o para libros valiosos me preocupa un poco el riesgo de rasgar páginas
En esos casos, de todos modos preferiría escanearlos a mano, pero muchas veces quise tener un aparato así para digitalizar demasiados libros
Según la explicación en el FAQ sobre la frecuencia de páginas rasgadas:
Un voluntario pasaba las páginas a mano, bajaba y subía dos placas de vidrio para presionar suavemente las páginas, y dos cámaras DSLR en montajes inclinados tomaban las fotos
El dispositivo completo no es automático, pero se puede operar fácilmente a mano
https://blog.archive.org/2021/02/09/meet-eliza-zhang-book-sc...
https://www.diybookscanner.org/en/intro.html
Deben ser 0 páginas rasgadas
Antes de las computadoras, tampoco existían copias electrónicas
En este ámbito, el software todavía no alcanzó el nivel posible, así que la gente está resolviendo con hardware cosas que podrían hacerse con software
Con dos o más fotos, o una imagen estéreo, por ejemplo de un iPhone nuevo, se podría estimar una página aplanada mediante triangulación y generar una imagen que parezca una página recortada de un escáner plano
Después bastaría con pagar lo suficiente a alguien en Etiopía para que pase las páginas con cuidado sin dañar el libro
Como sabe cualquier investigador, las bibliotecas digitales actuales tienen acumulado un siglo de escaneos de calidad dudosa
La IA puede estimar un escaneo difícil de distinguir del formato original de fuente de contorno en un monitor 8K
Hace tiempo, en relación con las guerras de fuentes de los años 80, asesoré sobre la conversión de formatos antiguos y escaneos digitales a fuentes PostScript y TrueType
En aquel momento era difícil, pero cuando el software se ponga al día, esto se entenderá como la forma correcta de escanear texto
La literatura científica necesita algo como ChatGPT que restaure el código fuente LaTeX capaz de reproducir cada página. De hecho, lo que realmente hace falta es un sucesor de LaTeX menos críptico y que permita crear texto fijo y texto fluido con la misma facilidad
Participé en un proyecto de preservación y escaneé muchísimas revistas; en general, si se colocaban o no sobre una superficie plana no importaba demasiado. De todos modos, pasar las páginas a mano toma tiempo
Ya existen métodos conocidos para escanear revistas y libros muy rápidamente: cortar el lomo de la encuadernación y poner las páginas en un escáner automático
Claro que, si después del escaneo se quiere conservar el objeto, eso no aplica porque se destruye la copia
Al final, la mejor manera de automatizar el escaneo sin arruinar el objeto tiene que combinar una cámara superior con una máquina pasadora de páginas. Supongo que el proyecto de escaneo a gran escala de Google también funcionaba así
Quizás se puedan “escanear” algunos libros con rayos X sin pasar las páginas, pero ahí también parecerían surgir problemas nuevos
El problema no es tanto que el software no haga bien la corrección de distorsión, sino que, una vez hecha toda la preparación para escanear un libro, conviene más usar un dispositivo que no requiera corrección de distorsión
Aquí se puede ver cómo funciona el aplanado. Esa parte la manejaba una biblioteca, así que no tuve que escribir código aparte
https://youtu.be/DPu0iJtK2sI?t=1542
También tenía funciones para indicar que se pasara la página, detectar si ya se había pasado y tomar la foto. En segundo plano aplanaba las fotos, separaba las páginas y hacía OCR
Con un poco de práctica, se podía escanear y hacer OCR de un libro a razón de 1 a 5 segundos por página
https://youtu.be/DPu0iJtK2sI?t=1909
Después guardaba el libro con OCR y lo leía cuando uno quisiera
https://news.ycombinator.com/item?id=29223815
El riesgo de obtener resultados plausibles pero incorrectos ya era una preocupación incluso antes de la IA
Esto parece mucho más seguro
https://www.inforum.com/newsmd/ndsu-students-book-scanner-in...
http://diybookscanner.org
Este proyecto intenta resolver ese problema, pero tendría que hacerlo de una forma mucho más suave para no dañar los libros
Como después de escanear todo queda en formato digital, me pregunto por qué desencuadernar el libro en hojas sueltas antes de escanearlo no es un modelo escalable
¿Se busca evitar el trabajo adicional de desmontarlo?
Aunque escanees un libro, lo que obtienes son solo imágenes ópticas. En el caso de un manuscrito medieval, por ejemplo, una página pudo haber sido borrada y escrita de nuevo
Si simplemente escaneas el libro y luego destruyes la copia física, pierdes esas evidencias
Dicho eso, si se trata de un libro barato de mercado masivo, creo que a la mayoría de los archivistas no les importaría demasiado destruir uno entre millones de ejemplares para preservar la obra
Solo se vuelve un problema real con obras muy antiguas y muy raras
Parece que cualquier libro un poco dañado terminaría hecho trizas
Tengo bastantes libros viejos que me gustaría digitalizar, y la mayoría de los escáneres de libros comunes al menos requieren abrir el libro por completo; como dices, eso puede hacer que se rompa
Además, esos dispositivos no incluyen vacío, movimiento pasando por bordes filosos ni motores paso a paso
En la segunda pregunta de https://linearbookscanner.org/faq/ dice:
Aun así, si tienes una montaña de libros por escanear y puedes procesar la mayoría con una máquina como esta, dejando solo los casos especiales para tratarlos con más cuidado, eso es una ventaja
Google, a grandes rasgos, ya había escaneado todos los libros. El problema eran los derechos de autor y los titulares de esos derechos
Para pasar las páginas usaron mano de obra de bajos salarios. Si nadie pone primero el enlace, lo enviaré después
Al volver a casa vi que era este artículo: https://www.theatlantic.com/technology/archive/2017/04/the-t...
Se ve realmente genial. No solo puede digitalizar libros, sino que además los tritura gratis
Es una promoción 2x1 bastante buena
Tengo alergia a los ácaros del polvo, así que si un libro lleva unos 6 meses en un estante, me da una reacción alérgica con solo tocarlo
Sacudir la cubierta o pasarle la aspiradora no sirve de nada
Creo que este dispositivo podría usarse para quitar los ácaros del polvo de los libros y poder leerlos