1 puntos por GN⁺ 3 시간 전 | 1 comentarios | Compartir por WhatsApp
  • Las empresas de IA están cortando el lomo de libros raros comprados en grandes cantidades para escanearlos a alta velocidad, y luego destruyen los originales
  • ISBNdb admite pedidos de hasta 1 millón de libros, anonimato del comprador y NDA, y recomienda a sus clientes llamar a este proceso “preservación digital”
  • Las publicaciones anteriores a 2022 son consideradas datos de alto valor porque no mezclan texto generado por IA, y Anthropic también impulsa una adquisición masiva de libros
  • Un juez federal consideró uso justo la práctica de eliminar el original para que solo quede una copia a la vez, pero entre los materiales procesados también hay libros de los que sobreviven poquísimos ejemplares
  • El último ejemplar existente de un libro del siglo XVIII no puede reemplazarse después de ser destruido, por lo que un fallo legal puede acelerar un daño irreversible

Cómo los libros raros se convierten en datos de entrenamiento

  • Las empresas de IA compran libros en grandes cantidades, luego les cortan el lomo para escanearlos a alta velocidad y destruyen los originales
  • ISBNdb intermedia pedidos de hasta 1 millón de libros mientras oculta la identidad del comprador
    • Ofrece NDA como una función del servicio
    • Recomienda a los clientes llamar a este trabajo “preservación digital”
    • En su propio sitio web señala que la frase “una empresa de IA destruye 2 millones de libros” no es un titular que genere simpatía
  • Las publicaciones anteriores a 2022 se tratan como datos premium porque no contienen texto generado por IA
  • Anthropic contrató al exresponsable de alianzas de Google Books para asegurar “todos los libros del mundo”

La irreversibilidad que dejó el fallo de uso justo

  • Un juez federal consideró esta práctica como uso justo con la lógica de que, si se elimina el original, solo existe una copia en un momento dado
  • Una persona vinculada a una librería dijo a 404 Media que incluso libros raros de los que casi no quedan ejemplares entran en este proceso
  • Se puede volver a subir un sitio web y los bestsellers pueden reimprimirse, pero un libro de botánica del siglo XVIII del que solo quedan los últimos tres ejemplares no puede reemplazarse después de ser destruido
  • A diferencia del scraping de internet, los torrents de bibliotecas o la obtención no autorizada de música, destruir el original no se puede revertir, y tras el fallo legal este tipo de negocio podría acelerarse

1 comentarios

 
GN⁺ 3 시간 전
Opiniones en Hacker News
  • No siento mucha simpatía por las editoriales. Mantienen libros fuera de catálogo hasta que vence el copyright, convirtiendo libros perfectamente normales en ejemplares raros, y aun los libros que están a la venta muchas veces solo vienen en papel que se ondula con la humedad y encuadernación rústica encolada que se deshoja en pocos años.
    Si una editorial descataloga un libro, otra editorial debería poder publicarlo sin compensar a la editorial original, pero renegociando regalías con el autor. También debería cambiarse la ley de copyright para que, si no ofrecen una edición de tapa dura con papel durable y encuadernación cosida, otra editorial pueda hacer una edición de alta calidad.

    • Creo que el copyright debería terminar con la muerte del autor o de su cónyuge. Es injusto que las discográficas moneticen incluso videos de análisis musical de apenas unos segundos que claramente son uso justo, y se queden con los ingresos de canales pequeños que invirtieron mucho tiempo y dinero.
      Los streamers pequeños tampoco tienen recursos para defenderse legalmente. El canal en cuestión es https://www.youtube.com/@diggingthegreats/videos.
    • En los siglos XVII y XVIII era común que las editoriales no encuadernaran los libros y que el comprador hiciera un pedido personalizado a un encuadernador independiente; incluso bibliotecas personales completas seguían un estilo de portada uniforme definido por su dueño.
      En esa época los libros eran un lujo que la mayoría no podía comprar, y la encuadernación barata de producción masiva aumentó el acceso. Incluso hoy existe un mercado de artesanos que desarman libros comerciales para hacerles encuadernaciones y cubiertas personalizadas de alta calidad.
    • Puede que los libros de los siglos XVII y XVIII que aún vemos hoy hayan sobrevivido justamente porque estaban bien hechos desde el principio. Hay un sesgo de supervivencia: los libros mal fabricados ya desaparecieron y no podemos verlos.
    • Si las editoriales encuadernan todos los libros en ediciones de lujo y los acumulan en depósitos mientras los consumidores solo compran ediciones de bolsillo baratas, no tienen motivo para asumir el costo adicional; es una respuesta a la demanda del mercado.
      Más que suponer que las editoriales ignoran deliberadamente una demanda oculta de ediciones premium, es más simple pensar que, por sus datos de ventas, saben que no se venderían. Si el objetivo es la preservación, no habría que exigir un papel apenas mejor, sino construir archivos digitales sólidos, no depósitos de inventario ni estantes de coleccionistas.
    • Siento aún menos simpatía por los operadores de LLM que roban propiedad intelectual que por las editoriales.
  • Estamos republicando libros antiguos después de verificar el copyright. Todos los libros son ediciones publicadas antes de 1930 y, según si el titular renovó los derechos, también es posible trabajar con una cantidad considerable de libros hasta 1964 o 1973.
    Cortamos el lomo con una guillotina especial, guardamos las hojas sueltas en bolsas plásticas selladas para conservación permanente y preservamos también los archivos originales sin comprimir en discos magnéticos por si hay que volver a escanear. También buscamos por adelantado ejemplares raros posteriores a 1931 para poder publicarlos apenas venza el copyright, pero ninguna empresa de IA nos ha pedido nunca que le permitamos entrenar con los escaneos completos.

    • Me pregunto quiénes son ese “nosotros” y si las bolsas plásticas selladas son adecuadas para preservación a largo plazo. Como la descomposición química podría acumular humedad o vapores corrosivos en el interior, habría que verificar si no conviene más un entorno con control activo de temperatura y humedad.
    • Los libros muy antiguos pueden introducir un sesgo hacia estilos de escritura arcaicos, y mucho conocimiento valioso suele estar tratado con más profundidad y detalle en literatura moderna, así que su valor como material de entrenamiento para IA tiende a ser bajo.
      Los textos antiguos en sí son interesantes y muy valiosos de preservar, pero son menos útiles para mezclarlos en enormes conjuntos de entrenamiento.
    • Hace falta fuente y contexto para saber si se trata de una organización sin fines de lucro de dos personas o de una empresa pre-IPO valuada en un billón de dólares.
    • Si se corta el lomo, me pregunto si no terminan quedando solo hojas sueltas como unos “Rollos del Mar Muerto” sin procedencia.
  • Si los únicos libros escaneados fueran libros con copyright vigente, me pregunto por qué incluirían libros de botánica del siglo XVIII. Escanear un libro propio debería ser legal bajo el copyright, y no debería requerir destruirlo.
    Para obras publicadas hace más de 50 años y en riesgo de caer en el olvido, podrían aplicarse reglas de obras huérfanas que obliguen al titular de derechos a demostrar que se conservan en varias bibliotecas, etc., o a permitir copias adicionales, o a renunciar al copyright.

    • Desarmar un libro en hojas sueltas para escanearlo es más rápido y barato, y el entrenamiento de IA es una pelea de volumen, así que ese método conviene. Después de escanear, las hojas sueltas ya inútiles se convierten en pulpa y se reciclan, por lo que es probable que el escaneo destructivo se hubiera vuelto dominante incluso sin copyright.
      La razón por la que OpenAI no puede simplemente comprar en Amazon la edición digital de un libro de 2018 y usarla es que, además de violar la licencia, también entra en juego la DMCA, que prohíbe eludir DRM.
    • Como los libros del siglo XVIII ya están en dominio público, escanearlos conservando el original no es ilegal.
    • La razón para destruir libros irremplazables no es el copyright, sino el ahorro de costos del escaneo destructivo: https://www.404media.co/ai-companies-are-buying-tons-of-old-....
    • Los libros antiguos raros de los que quedan copias de un solo dígito deberían recibir protección como patrimonio cultural, igual que las piezas de museo. Si el propietario intenta dañarlos o desecharlos, el Estado debería tener derecho de compra preferente.
    • Los libros triturados también tienen la ventaja de que un competidor no puede volver a escanearlos.
  • Si Archive.org no hubiera sido demandado por prestar los libros físicos que tenía, este resultado podría haberse evitado. Las editoriales tendrían que haber pensado con más cuidado en el resultado que querían.

    • Archive.org originalmente prestaba libros que poseía físicamente y había escaneado, con DRM y límite de un usuario simultáneo por ejemplar, pero durante la pandemia eliminó ese límite y permitió préstamos simultáneos ilimitados, lo que inició el conflicto con las editoriales.
    • Cuando se destruye un libro, sube el valor de otras copias y del inventario no publicado, así que no es obvio que a las editoriales necesariamente les disguste.
    • Puede decirse que el enfoque imprudente de Archive.org terminó debilitando incluso la posición de las actividades legítimas de preservación.
  • Las editoriales demandaron a empresas de IA que entrenaron con datos de bibliotecas en la sombra, buscando contratos de contenido por grandes sumas, pero las empresas de IA usaron un vacío analógico. Comprar un libro usado por 5 dólares y gastar 25 dólares en escaneo destructivo es mucho más barato que pagar regalías de copyright.
    Dicho esto, el objetivo no son textos antiguos sino libros con copyright vigente, y que sean viejos no los hace valiosos. Como las bibliotecas descartan libros sin demanda que solo generan costos de almacenamiento, las empresas de escaneo pueden conseguirlos baratos.

    • Como son libros que tienen valor para las empresas de IA, deberían pagar una compensación justa.
    • La literatura moderna también se convierte en literatura antigua con el tiempo, así que no puede juzgarse solo por su valor físico actual.
    • Incluso incluyendo desgaste de equipos, mano de obra para retirar papel atascado y costos de reciclaje, el costo del escaneo destructivo podría estar más cerca de 0,25 dólares que de 25 dólares por libro.
    • Si se altera información de múltiples compradores y se destruye el material original, los contenidos erróneos quedan en el LLM, así que justificarlo se acerca bastante a la propaganda.
  • Se parece más a la fábrica de “triturar y luego escanear” de 《Rainbows End》 de Vernor Vinge que a 《Fahrenheit 451》 de Bradbury.

    • Vernor Vinge predijo especialmente bien el futuro cercano, y describió el escaneo destructivo como un método que los villanos usaban por poco tiempo antes de pasar al escaneo no destructivo. A largo plazo, creo que una de las mejores cosas que se pueden hacer por la humanidad es apoyar a Anna’s Archive.
    • Aunque difiere del significado que suele darle el público, también está bastante cerca de lo que pretendía el autor de 《Fahrenheit 451》.
  • Al digitalizar libros raros, también se podría revertir el daño de Authors Guild v. Google. Se podría permitir que las empresas de IA los escaneen, pero exigir que publiquen las copias digitales, con un período de gracia de algunos años para dar ventaja a la primera empresa que los escanee: https://en.wikipedia.org/wiki/Authors_Guild,_Inc._v._Google,...

    • Destruir la única copia de un libro de 1850 para encerrar su contenido en un sistema con fines de lucro es saqueo de recursos públicos, como extraer recursos de tierras públicas sin permiso.
      En cambio, sería mucho más razonable regular que se digitalice en alta calidad, se publique de forma permanente y gratuita, se permita acceder a él mediante bibliotecas y un LLM público disponible gratis en línea, y, si no quedan copias físicas, que se conserve en un archivo público de libros raros tras una verificación suficiente.
  • Si, por culpa de leyes de copyright absurdas, este es el método legal que pueden elegir las empresas de IA, es difícil culparlas por completo. Se puede apoyar a una biblioteca sombra local: https://annas-archive.pk/donate

  • Viendo solo los materiales citados, faltan pruebas de que realmente se estén destruyendo libros raros. Aunque se agregó como ejemplo un libro de botánica irreemplazable del siglo XVIII, no se puede descartar que los libros en cuestión estén a la venta o sean comunes.

    • Todos los libros del siglo XVIII ya están en dominio público, así que no hay razón para triturarlos.
  • Aquí, “libros raros” no parece referirse a manuscritos medievales de importancia histórica, sino a libros relativamente recientes que aún tienen copyright, pero de los que quedan pocas copias físicas en circulación. No necesariamente es malo destruir uno de esos libros para preservar digitalmente su contenido, y el valor de los libros que aún tienen copyright suele estar más en el contenido que en el soporte físico.

    • Los manuscritos medievales de importancia histórica también se están publicando cada vez más en línea, y cuando los investigadores pueden acceder directamente a escaneos de las fuentes originales, la investigación histórica se acelera. Claro que, en ese caso, se hace de forma no destructiva.
    • También hay libros en los que el soporte físico en sí tiene valor, como ediciones especiales de colección con firma del autor o dorado, pero es poco probable que una empresa de IA use esas ediciones.
    • Incluso con libros de los que quedan copias en cifras de un solo dígito, podría aceptar el escaneo destructivo con la condición de que se publiquen escaneos digitales de alta calidad.
    • La pregunta clave es para quién se preservan digitalmente.
    • Me pregunto si cambiar un poco los pesos de alguna cadena de Markov en algún lugar realmente puede llamarse preservación del contenido.