- wordfreq es una instantánea del uso del lenguaje observada en varias fuentes en línea hasta 2021; quedó congelado manteniendo su versión más reciente porque actualizar los datos después de eso podría incluso empeorar su calidad
- Después de 2021, en la web pública se propagó ampliamente el texto generado por IA que parece escrito por personas, lo que dificulta medir la frecuencia de palabras con base en el uso real del lenguaje humano
- Los datos existentes ya incluían spam, pero en general era posible identificarlo y gestionarlo; sin embargo, las salidas de la IA generativa, como en el caso de “delve” de ChatGPT, pueden disparar de forma anormal la frecuencia de ciertas palabras
- Se perdió el acceso a datos de Twitter y Reddit, que eran fuentes importantes de lenguaje conversacional, o se volvió demasiado caro; además, por las condiciones de distribución, los datos históricos de Twitter tampoco podían redistribuirse externamente
- A medida que el campo del procesamiento de lenguaje natural se inclinó hacia la IA generativa y la dependencia de datos cerrados, el desarrollador no quiere que wordfreq ayude a la IA generativa ni que se confunda con ese tipo de trabajo
Complemento de septiembre de 2024
- El documento sobre la suspensión de actualizaciones de wordfreq recibió mucha atención, y el desarrollador considera que la gente en general entiende su postura
- No ha dejado de trabajar en bibliotecas de código abierto; ftfy, una herramienta multipropósito para corregir Unicode, sigue en desarrollo
- Congelar los datos no necesariamente es un mal final
- Mucha gente ha usado wordfreq con utilidad, y la versión más reciente no va a desaparecer
- Ya no se actualiza porque se considera que hacerlo podría empeorar los datos
- Con el tiempo se irá volviendo anticuado, pero no empeorará activamente
Una instantánea del uso del lenguaje hasta 2021
- Los datos de wordfreq son una instantánea del uso del lenguaje que podía encontrarse en varias fuentes en línea hasta 2021
- La razón para no seguir actualizándolo es una combinación de contaminación de datos, costo de acceso y cambios en el campo del procesamiento de lenguaje natural
La web pública contaminada por la IA generativa
- Se considera que, desde 2021, es difícil obtener información confiable sobre el lenguaje que la gente realmente usa
- La web pública, una de las fuentes de datos de wordfreq, se usaba a través de OSCAR
- Hoy, la web en sentido amplio contiene mucho texto generado por modelos de lenguaje grandes, y si se incluye, la frecuencia de palabras se distorsiona
- Las fuentes de datos anteriores también tenían spam, pero en muchos casos era manejable e identificable
- Los modelos de lenguaje grandes crean texto que parece lenguaje con intención real, y sus salidas se propagan por muchos lugares
- Según la publicación sobre delve de Philip Shapira, ChatGPT usaba “delve” de manera obsesiva y distinta a como la usaban las personas, elevando su frecuencia total en un order of magnitude
Los datos conversacionales que desaparecieron o se encarecieron
- wordfreq no trataba solo palabras formales impresas; también recopilaba uso del lenguaje más cercano a la conversación, especialmente de Twitter y Reddit
-
Twitter y X
- La base de datos de Twitter fue inestable desde el principio
- Incluso cuando Twitter permitía acceso gratuito a parte del “firehose”, los términos de uso no permitían distribuir fuera de Luminoso los datos recopilados
- wordfreq incluye valores de frecuencia generados a partir de esos datos, pero los datos recopilados en sí no eran propiedad del desarrollador y ya no los conserva
- Actualmente Twitter ya no existe, la API pública fue cerrada y el sitio fue reemplazado por X
- Aun si X ofreciera un feed de datos en bruto, se considera que no habría información valiosa que extraer
-
Reddit
- Reddit también dejó de ofrecer archivos de datos públicos
- Actualmente Reddit vende sus archivos, y se dice que el precio está en un nivel que solo OpenAI puede pagar
Por qué quiere mantener distancia de la IA generativa
- wordfreq estaba originalmente en la intersección entre la lingüística de corpus y el trabajo útil para herramientas de procesamiento de lenguaje natural
- El campo de “natural language processing” que el desarrollador conocía ahora es difícil de encontrar, y considera que la IA generativa está devorando ese espacio
- Otras técnicas siguen existiendo, pero la IA generativa se lleva la mayor parte de la atención y el financiamiento
- Considera que es raro ver investigación en NLP que no dependa de datos cerrados controlados por OpenAI y Google
- Trabajos como wordfreq, que recopilan mucho texto en varios idiomas, antes se consideraban bastante razonables
- Hoy, las herramientas de recolección de texto se usan sobre todo para entrenar IA generativa, y considera justificado que la gente reaccione a la defensiva frente a eso
- Si se recopila todo el texto de libros, artículos, sitios web y publicaciones públicas, considera muy probable que el objetivo sea crear una máquina de plagio que reclame como propias las palabras de otros
Conclusión sobre la suspensión de actualizaciones
- El desarrollador no quiere trabajar en algo que pueda confundirse con la IA generativa o que pueda ayudarla
- Declara que OpenAI y Google deberían recopilar sus propios datos y pagar un precio muy alto por ello
- wordfreq ya no se actualizará, pero la versión más reciente existente se mantendrá
1 comentarios
Opiniones de Hacker News
En general estoy de acuerdo, pero la web ya estaba contaminada por las reglas SEO no oficiales de Google.
Los párrafos de una sola oración, la repetición de palabras clave y la prioridad dada a la “indexabilidad” por encima de la legibilidad hicieron que, desde antes de los LLM, la web no fuera una fuente ideal para este tipo de análisis.
Lo mismo aplicaba para los datos de entrenamiento y, al final, los LLM crecieron alimentándose no de textos escritos para personas, sino de textos escritos para Googlebot. ML/LLM son la segunda iteración de la contaminación de la escritura; la primera fue cuando la gente empezó a escribir no para otras personas, sino para bots corporativos.
Las frecuencias tendrán sesgos, pero eso pasa con la mayoría de los textos, y en un manual de mantenimiento de carburadores inevitablemente aparecerá la palabra “carburetor” mucho más que en la línea base.
Si hay una mezcla saludable de libros, artículos de noticias y blogs diversos, está bien. En cambio, el contenido de LLM se parece más a una serpiente que se muerde la cola: es como intentar crear de nuevo un modelo estadístico de distribución de palabras a partir de la salida de un modelo de distribución de palabras.
Los periódicos, las novelas, los correos al jefe, etc., también tienen estilos particulares en longitud de oraciones y párrafos, repeticiones innecesarias y métricas distintas de la legibilidad.
Al menos si el texto fue escrito por un humano pensando en la posibilidad de que otra persona lo lea, puede considerarse un uso del lenguaje mucho más legítimo que el texto generado por una máquina.
No sé cuánto más podrá aguantar Internet esto, y mi uso ya bajó de forma notable incluso comparado con 2018. Ahora es tan difícil encontrar algo que valga la pena leer que termino pasando mucho tiempo aquí.
El spam SEO no es nuevo; solo cambió de forma.
En 2023 hice https://lowbackgroundsteel.ai/ como un espacio para reunir referencias a datasets no contaminados.
También pienso agregar wordfreq, así que me gustaría que manden material por Tumblr.
Esta es una lista útil que armé mientras investigaba: invención de la arquitectura Transformer en 2017, GPT-1 en junio de 2018, GPT-2 en febrero de 2019, GPT-3 en junio de 2020, GPT-3.5 en marzo de 2022, ChatGPT en noviembre de 2022.
También estaría bien agregar archivos kiwix anteriores a la fecha de corte que definan. Se pueden encontrar en Internet Archive e incluyen versiones de Wikipedia, Stack Overflow, Wikisource, Wikibooks y varias wikis.
Reunir estas fuentes solo hará que a las grandes tecnológicas les resulte mucho más fácil raspar más datos.
Es una pena que OP se haya decepcionado con la comunidad de procesamiento de lenguaje natural a la que pertenezco, y aunque sea una moda y esté casi en el punto máximo del hype, quiero decir que “no todos somos así”.
El problema de la contaminación de la web con contenido artificial es oportuno, y ya hubo casos anteriores, como granjas de spam que intentaban manipular PageRank.
Por eso quizá vuelva a ganar valor una lista de sitios web de alta calidad curada manualmente por personas, la llamada “web pequeña”.
Cada generación de la web necesitó tecnologías para superar los mecanismos adversarios de su propia generación, y la web actual no es la excepción.
Cuando Eric Arthur Blair escribió 1984 bajo el seudónimo “George Orwell”, anticipó una situación en la que el público consumiría contenido generado automáticamente que lo alejaría del pensamiento crítico. Eso está pasando ahora, pero la tecnología criticada también puede usarse para el bien, y en mi equipo de investigación de NLP intentamos hacerlo así. Al final, el bien vencerá.
IRC, Usenet, Reddit, Facebook, Geocities, Yahoo, webrings: parece que cualquier sistema de contenido que llega al uso masivo termina contaminado por ruido.
Las opciones pequeñas y curadas, cuando crecen lo suficiente, acaban siendo víctimas de su propio éxito y tomadas por el spam.
Siempre es una carrera armamentista entre calidad y cantidad, y al final los curadores ya no pueden seguirle el ritmo al volumen abrumador.
Es extraño que sigamos cruzando estas “líneas rojas” como si nada. Como en ese meme: un autor de ciencia ficción dice “creé el Torment Nexus como una historia de advertencia”, y la empresa tecnológica responde “creamos el Torment Nexus de la clásica novela de ciencia ficción ‘No creen el Torment Nexus’”.
Para decirlo sin rodeos: la web está muerta. Gracias a la “IA”, ahora toma más tiempo escarbar en búsquedas para encontrar algo útil que en 2005.
Los sitios que uno encuentra, en general, también son basura.
Por ejemplo, incluso para encontrar unos audífonos inalámbricos conocidos, aunque ya sepas la empresa, su sitio web y los puntos de venta, toma al menos 10 minutos. Están enterrados bajo todo tipo de porquería.
Mi laptop es una i7 de 8 núcleos “vieja”, con 16 GB de RAM, y aun así sufre con sitios “modernos” cargados de gráficos. Los sitios de antes eran simples y funcionaban bien, así que podías buscar y comprar productos rápido; anoche, incluso meter algo al carrito y pagar fue una verdadera tortura.
Odio la web, los navegadores, el diseño web, el SEO, las búsquedas, la publicidad y toda la baratija basura que viene con eso. Ya se acabó. Si hay alguna forma de comprar algo sin la web, lo haré así. No es que odie por completo la tecnología en sí, pero la web ya se volvió un huevo podrido.
Ahora esa barra de búsqueda primero manda la consulta a un LLM, te hace esperar 10 a 15 segundos y luego muestra un resumen inútil de que “algunas reseñas decían tal y cual cosa”.
Solo después puedes apretar un botón para ver los elementos que contienen la palabra que buscaste en las reseñas y preguntas reales. Esto probablemente hará que deje Amazon. Si todavía existe una forma de buscar directamente, agradecería que me la dijeran.
Antes, si buscabas un gancho de cambio para una bicicleta Trek, el primer resultado era lo que querías. Ahora tienes que pasar por 5 anuncios que te dicen que compres una bici nueva y un enlace roto de un tercero, y si tienes suerte aparece el enlace a la página de esa pieza al final de la página 1.
La basurización de la web es real.
El producto recomendado es LEEZWOO 15.6" Laptop - 16GB RAM 512GB SSD PC Laptop, Quad-Core N95 Processor Up to 3.1GHz, Laptop Computers with Touch ID, WiFi, BT4.2, for Students/Business.
El nombre se lee fluidísimo, ¿no?
Esa capacidad todavía existe. Durante un tiempo se contaminó demasiado con barras de herramientas y malware, así que retrocedió, pero ahora el malware está del otro lado y las apps nativas volvieron a ponerse interesantes. Solo hay que saber dónde mirar.
Mi cartel está aquí: https://akkartik.name/freewheeling-apps
Aunque parece que aquí, cuando dicen “web”, se refieren solo a lo que se puede acceder mediante motores de búsqueda. Todavía existe la web antigua: no los servicios agregadores con miles de millones de usuarios, sino una web mediada por relaciones y reputación. Como el enlace de arriba, o este sitio heroicamente moderado que estamos usando ahora.
Estoy de acuerdo con eso de que “desde 2021 nadie tiene información confiable sobre el uso del lenguaje humano”.
El texto ya pasó hace rato el punto de inflexión, pero con el video se siente que ahora estamos en una línea divisoria.
Los niños pequeños, en particular, tienen poca intuición sobre qué es real y qué no. Si les pregunto si la persona en un video es real, todavía respondo con bastante seguridad, pero cada día tengo menos confianza.
La tecnología claramente ya está lista y, aunque la mayoría del contenido en video todavía no se ha visto afectado, creo que pronto cambiará.
https://www.nytimes.com/interactive/2024/01/19/technology/artificial-intelligence-image-generators-faces-quiz.html
Es un poco injusto porque compara ejemplos seleccionados cuidadosamente, pero incluso a los expertos les costaría pasar muchas de estas pruebas. La tecnología solo avanza, y parece que además cada vez más rápido.
Lo asombroso es la velocidad del progreso. La humanidad tiene casi 3 millones de años; el Homo sapiens, unos 300 mil; las ciudades, la agricultura y la civilización, unos 10 mil; los metales, unos 4000; la revolución industrial, 500; la democracia, 200; la computación, entre 50 y 100 años.
El intervalo entre revoluciones se está acortando casi de forma exponencial.
Si comparo el mundo de hoy con mi infancia, una de las revoluciones que todavía estoy asimilando es la fabricación automatizada. En AliExpress hay demasiadas cosas que son prácticamente gratis. Compré un cargador de 5 puertos y 120 W por menos de 2 minutos de mi tiempo, y pasé menos tiempo buscándolo que ganando el dinero para pagarlo.
No sé muy bien hacia dónde va todo esto.
A menudo termino marcando como “medio falso” a personas reales que adoptaron los patrones de conducta de creadores de TikTok, Instagram o YouTube.
Mi barba también ya tiene canas, pero en una charla de 2020 ya me burlaba de la cara de miniatura de YouTube. La IA capta muy rápido y con mucha fuerza estos patrones de conducta “medio humanos”.
Circulaba un video con dos mujeres jóvenes a la vez sosteniendo letreros de “This is real”/“This is not real”, pero ambas podrían estar mintiendo por completo y yo no puedo distinguirlo. Todas muestran patrones de conducta un poco “raros”, pero son coherentes con los pocos videos de influencers que he visto.
Decir que “ahora toda la web está llena de slop creado por grandes modelos de lenguaje, que nadie escribió y que no comunica nada” es justo y preciso.
Incluso en el mejor de los casos, la persona que ejecutó el modelo no escribió ese texto, y esa ensalada de palabras no transmite lo que esa persona quería decir.
En muchos casos, el contenido simplemente se produce en masa para SEO, sin intención de aportar valor a nadie.
Tal vez los libros en papel anteriores a 2020 se conviertan en bienes valiosos dentro de 10 o 20 años.
Cuando internet esté lleno de slop y hasta los libros en papel de esa época empiecen a ser sospechosos.
Y también aparecerán humanos como cabezas parlantes que finjan ser autores de libros escritos por una IA muy inteligente. ¿Por qué diablos estamos haciendo esto?
Advertencia: desinformación de IA patrocinada por un Estado
Tengo sentimientos muy encontrados sobre este problema.
Por un lado, estoy totalmente de acuerdo con Robyn Speer. La web abierta murió, y la web está en un estado realmente triste. Hace unos días decidí poner mi blog personal en gopher. Simplemente porque en gopher hay mucha menos basura; claro que eso no significa que gopher sea la respuesta.
Pero hace unas semanas tuve que enviarle un archivo de video al abuelo de mi esposa, que tiene 97 años, vive en otro país y no usa computadora ni teléfono móvil. Al final confirmé que tenía un reproductor de DVD, y usé x264 para convertir un video moderno 4K HDR a un formato reproducible en cualquier reproductor de DVD antiguo, intentando conservar la mayor calidad posible.
El problema es que x264 no tiene documentación. A diferencia de x265, que tuvo patrocinadores corporativos dispuestos a pagar por documentación decente, x264 prácticamente fue desarrollado por miembros del foro doom9 a base de prueba y error. Tiene cientos de flags crípticos, y algunos se comportan distinto a como lo hacían hace 20 años.
Podría haber revisado decenas de hilos de doom9 de hace 20 años para entender qué hacía cada flag, pero en la práctica le pregunté a un LLM, en este caso Claude.
Claude no fue perfecto y mezcló algunos flags de ffmpeg con flags de x264, pero sumando búsqueda tradicional y prueba y error pude terminar el trabajo en unos 30 minutos. La calidad del resultado fue bastante satisfactoria y se reprodujo incluso en un reproductor de DVD muy antiguo.
Antes de los LLM, no habría contratado a un experto en x264 para esto. Habría invertido varias horas más o, más probablemente, ese hombre de 97 años no habría podido ver a su bisnieta bailar. Me dijeron que el video le sacó una gran sonrisa.
Los LLM, como todo lo anterior, son solo herramientas. No son inherentemente buenos ni malos. Lo que importa es qué hacemos con ellos y cómo los usamos.
En esa época habría usado Nero Burning ROM o Handbrake. Tal vez la calidad no habría quedado optimizada al nivel deseado, pero para ojos de 97 años seguramente habría sido un video más que aceptable.
¿Será que nosotros, los humanos, contaminamos tanto internet con IA que ahora casi no se puede usar?
Creo que internet puede considerarse una especie de entorno natural, como la Tierra. Porque es un espacio donde la gente comparte, se encuentra y conversa.
Es sorprendente que, después de contaminar el entorno natural, ahora hayamos contaminado incluso internet.
La mayor parte de la información registrada por humanos ya fue digitalizada, y una gran parte de ella está generando contenido no humano a una velocidad enorme. Es como si hubiéramos inyectado una cantidad enorme de ruido en los datos que podemos usar.
No sé si la respuesta será más contenido humano o nuevo contenido generado, pero esta transición planteará desafíos a mediano plazo.
Me gustaría pensar que la era en la que más tokens en los LLM era siempre mejor está llegando a su fin y que vamos hacia un mejor uso de los datos existentes, pero en realidad estamos ante un punto de inflexión importante.
Pero la internet abierta básicamente ya se volvió inútil, y la causa de fondo es el modelo de negocio basado en publicidad.
Ahora parece una ley natural que cualquier tecnología nueva termine llevando a una amplificación SEO. La IA se convirtió en la Degelman M34 Manure Spreader de internet https://degelman.com/products/manure-spreaders
A los escritores que pronto perderán su trabajo, o que ya lo perdieron y a quienes les resulta prácticamente imposible ser contratados para trabajos anteriores, los gigantes operadores de IA deberían pagarles para que escriban lo que sea
La única condición es que ni una sola frase de ese trabajo haya sido creada con IA
Al principio iba a decir “el gobierno debería pagar”, pero eso sería socializar las pérdidas, y ya lo hemos vivido bastante en el pasado
Pero la gran mayoría de los escritores nunca se ha ganado la vida escribiendo. La barrera de entrada para escribir es demasiado baja, hay demasiada gente a la que le gusta escribir, y la mayoría de la gente casi no lee
Encontrar el siguiente token es un problema resuelto. El pensamiento nuevo lo pueden resolver los humanos, y pronto quizá también la IA, pero agregar más basura a los datos no lo va a mejorar