Los resultados de búsqueda de “producto X vs. Y” ahora son casi todos tonterías de IA.
Ver crecer la internet muerta me dan ganas de suscribirme a Kagi. Siento que algún día vamos a necesitar certificación de contenido creado por personas.
Lamentablemente, Kagi tampoco es una panacea. Pago y lo uso todos los días para apoyar una alternativa a Google, pero el problema de que tanto la búsqueda de imágenes como la de texto se llenen de basura de IA sigue siendo grave.
Las comparaciones de productos son un ejemplo típico, pero lo que más me preocupa son las búsquedas relacionadas con salud. Esta semana intenté encontrar estudios sobre un medicamento que estoy tomando, y los resultados, que hace 5 años ya estaban contaminados por SEO, ahora están mucho peor por cientos de páginas de spam generado con GPT que intentan atraer clics.
Al final abandoné por completo el buscador, encontré en nih.gov un paper más o menos relacionado y tuve que seguir manualmente la lista de citas para buscar información.
Es muy raro recordar la internet que usaba de niño y en mis 20, y saber que esa internet nunca va a volver.
Ver crecer la internet muerta es bastante surrealista.
Creo que la comercialización de internet por la publicidad y su centralización en plataformas hostiles al usuario claramente encendieron la mecha. La vieja internet aún hoy parece mucho mejor, pero en los últimos 15 años perdió a la mayoría de sus usuarios.
Agregar “Reddit” al final de cada búsqueda ayuda, pero parece cuestión de tiempo para que la mayor parte del contenido de Reddit también sea generado por IA.
Si buscas “baby peacock” en Kagi, aparecen resultados casi iguales a los de Google, y la mayoría son imágenes de IA.
Es para volverse loco. Internet murió.
Hace poco compré una casa y busqué tareas de reparación del hogar, como cómo preparar las molduras antes de pintarlas. Casi todos los resultados eran granjas de contenido generado por IA, con anuncios metidos entre cada párrafo, un video con reproducción automática sin relación con el contenido que te sigue por la página, un modal de consentimiento de cookies y enseguida otro modal para suscribirte a un newsletter que te pide “ser amigos”.
Nos guste o no, ahora parece que Reddit es prácticamente el único lugar donde se puede encontrar información real.
Para búsquedas así, YouTube y TikTok son lo mejor. El video todavía no está completamente inundado por IA, y se puede encontrar casi cualquier cosa sobre trabajos manuales.
Prefiero muchísimo el contenido de texto al video, pero el contenido de texto real escrito por personas está casi muerto. Reddit quizá sea una rara excepción por ahora. Todavía quedan foros viejos vivos según el rubro, pero suelen ser extremadamente difíciles de encontrar.
Conviene más comprar un libro general de mantenimiento del hogar.
Por ejemplo, https://archive.org/details/stanleyhomerepai0000fine/page/14... lleva al capítulo “Painting Trim the Right Way” del libro Stanley Home Repairs de 2014.
También vale la pena mirar en librerías de usados. Las reparaciones del hogar no han cambiado mucho.
También puedes abrir Wine y probar el CD-ROM “Black & Decker Everyday Home Repairs” de Broderbund: https://archive.org/details/BlackDeckerEverydayHomeRepairsBr.... Según https://www.goodreads.com/book/show/3424503-everyday-home-re..., guía paso a paso más de 100 problemas comunes del hogar, desde arreglar una llave que gotea hasta reparar pisos de madera maciza, también ofrece animaciones y narración, e incluye tiempo y costo estimados, además de listas de materiales y herramientas necesarias.
De hecho, se ve bastante bien.
Como dueño de una casa construida en 1939 que la arregla por su cuenta, recién armé una biblioteca de libros de referencia sobre viviendas después de haber avanzado bastante con las reparaciones, pero creo que debería haberlo hecho antes de levantar un destornillador.
Renovations de Taunton Press (https://www.bookfinder.com/search_s/?title=Renovation%205th%...) es el primer recurso que consulto al iniciar un proyecto de reparación del hogar. El capítulo 18 trata íntegramente sobre pintura. Los otros libros de Taunton también son excelentes, pero el alcance de Renovations no tiene comparación.
Las molduras planas blancas de MDF que se compran hoy ya vienen con primer, así que están listas para pintar.
Tengo un auto viejo y uno nuevo; como el viejo existía en la época de la internet de antes, puedo encontrar cómo hacer cualquier reparación. En ese entonces la gente dejaba todo tipo de guías de trabajos.
Sobre el auto nuevo casi no hay información de reparaciones, y la mayoría son solo videos de YouTube de gente que no sabe nada filmando arreglos caseros pésimos.
Para reparaciones del hogar, creo que YouTube es el mejor recurso. Aunque entiendo si lo que querías era texto y fotos.
En una economía de internet que gira alrededor de producir y monetizar “contenido”, probablemente era muy probable que esto pasara desde el principio.
Empezó poniendo anuncios junto al contenido existente, y luego pasó a las redes sociales y los medios sociales, que al final eran motores para crowdsourcing de más producción de contenido y mostrar anuncios al lado. Como hay dinero de por medio, la producción de contenido se volvió un negocio importante, y la tecnología está satisfaciendo esa demanda creando contenido por menos de lo que se puede ganar con él.
El problema de moderar contenido indeseable hecho por personas ya estaba empezando a erosionar este modelo de negocio; ahora las herramientas generativas producen contenido no deseado más rápido de lo que se lo puede moderar. Cuando se llegue a cierto nivel de saturación, la gente perderá interés, y las herramientas que antes usaban heurísticas algorítmicas para separar el buen contenido del malo dejarán de servir. La única salida visible es que contenido hecho por humanos sea curado por humanos, pero no sé si existe un modelo de negocio así a la escala que exige la industria.
Mucha gente mira los blogs con nostalgia, pero los blogs fueron uno de los primeros ejemplos de cómo internet pasó de tener contenido duradero a producir artículos al estilo granja de contenido.
La internet temprana se sentía más como recorrer una biblioteca. No se esperaba que la mayoría de los sitios se actualizaran todos los días, ni siquiera todos los meses, y los textos casi siempre estaban organizados por tema, no por orden de publicación.
El enfoque excesivo de los blogs en lo nuevo cambió muchas cosas, y varios sitios empeoraron notablemente al dejar de cultivar bibliotecas de recursos duraderos para empezar a extraer vistas nuevas. Las discusiones en línea pasaron por un proceso parecido al moverse de los foros a estructuras de recomendación tipo Reddit/HN. En foros antiguos todavía quedan discusiones que siguieron durante más de 10 años; en Reddit o HN, después de unas horas una publicación se cae de la página y la conversación muere.
La confianza humana difícilmente escala siquiera más allá de 100 personas, y mucho menos a escala de toda internet, así que no creo que exista ese modelo de negocio. Creo que los humanos volverán al tamaño tribal para el que originalmente están hechos para entender y pertenecer.
Los chats grupales privados son mucho más populares y comunes de lo que admitimos, y en este entorno esa tendencia se acelerará.
En sistemas abiertos, la curaduría humana es posible, pero cuando hay unos pocos silos enormes, la eficiencia algorítmica opera dentro de ellos y produce resultados como los de ahora.
Espero que la gente pierda interés y deje de consumir contenido basura, pero la apuesta del otro lado es que la gente se acostumbre a contenido algorítmico de calidad cada vez más baja y que la industria exprima ganancias sin fin por cualquier medio. Si miramos la historia de la TV por cable, parece haber un punto límite.
Que personas curen contenido hecho por personas es, en la práctica, un retuit.
Un grupo monocultural pequeño, como una minoría de universitarios aburridos, siempre terminará entendiendo el algoritmo, copando la plataforma con porno y spam y drenando recursos. La combinación de mejores herramientas creadas para ayudar a grupos débiles con incentivos económicos, en cambio, agranda la brecha. Esto se vuelve un problema porque los influencers financieros no pagan para ser humillados por una minoría de influencers del mercado de contenido, sino para recibir reconocimiento del público.
¿Pero por qué eso sería un problema? Los productores de “contenido indeseable” simplemente optimizan para lo que el mercado considera más valioso. Si eso es un problema, entonces el problema es la existencia misma del mercado. ¿Qué habría que hacer entonces? Destruirlo sin más también podría tener sentido.
Desde Gutenberg, la publicación quizá siempre se movió hacia la monetización del contenido. Si miramos la historia de la Iglesia católica, es posible que ya fuera así incluso antes.
No son solo imágenes. Si buscas en Google algo que podría considerarse una pregunta común, con frecuencia aparecen ensaladas de palabras generadas por IA entre los primeros 3 a 5 resultados.
Cuando empiezas a leer, no lo notas de inmediato. Luego empiezas a sospechar incluso de cosas que claramente no fueron generadas por IA. Uno tiene una intuición sobre de qué maneras pueden equivocarse las personas, cómo se equivocan cuando lo hacen, qué tono adoptan cuando están equivocadas, qué tan probable es que se equivoquen, en qué formatos y plataformas aparecen los errores, con qué frecuencia se equivocan y cómo reaccionan otras personas. La IA es algo completamente distinto. Ninguna intuición ni experiencia te permite saber cuándo una IA que suena convincente está equivocada.
Que todo el conjunto de heurísticas con las que evaluábamos inconscientemente la calidad de la información transmitida quede inutilizado de la noche a la mañana puede ser una receta para la locura y la desdicha. Pocas veces en mi vida me sentí tan genuinamente triste por culpa de la tecnología.
Sinceramente, creo que este es el fin de la internet pública. Lo que falló no fue Google, sino la realidad de la internet pública.
Si necesito ayuda con algo o tengo una pregunta, no uso Google ni publico en un foro abierto. Pregunto en un chat grupal privado donde todos son personas reales, nadie gana dinero y nadie copia y pega ChatGPT para acumular puntos de internet y vender la cuenta más adelante.
Solo hay una vía para que esto cambie, y a la gente no le va a gustar: que todo el contenido de internet esté vinculado a una identificación legal. Cada publicación y cada comentario en Facebook debería poder atribuirse a una persona real.
No creo que las heurísticas sean tan distintas. El spam de SEO y el contenido basura ya existían antes, y tanto Google como YouTube estaban llenos de “creadores de contenido” humanos que optimizaban para clics y manipulaban el sistema de recomendaciones de YouTube.
El contenido de IA no es tan diferente. Solo que ahora crear ese contenido es 100 veces más fácil, así que se ve muchísimo más. En el fondo no es un problema de IA, sino de incentivos y modelos de negocio basados en publicidad. La IA hizo que el problema del deterioro de los servicios fuera mucho más visible, pero el problema ya existía.
No sé cuál es la solución. Supongo que, a medida que el contenido de baja calidad inunde todo, la internet pública se volverá menos importante con el tiempo, y mucha comunicación se moverá a comunidades pequeñas que dependen mucho de verificar la identidad y las credenciales de las personas.
No quiero echar un balde de agua fría, pero aun así la pérdida de privacidad me parece mucho más triste.
Es difícil explicar por qué, pero quizá porque no sabía cómo se ve una cría de pavo real, este ejemplo me hizo sentir con mucha fuerza el lado oscuro de la IA.
Estaba acostumbrado a confiar en cierta medida en los resultados de búsqueda. Sí había resultados raros o casi absurdos, pero aparecían de vez en cuando dentro de un mar de imágenes relevantes. Ahora puedo quedar completamente a ciegas sobre algo que no conozco. Como alguien que creció con Google como algo que “simplemente existía”, de verdad me asusta.
¿Google no debería resolver este problema de alguna manera si quiere seguir siendo relevante? Si buscar imágenes y generar imágenes producen el mismo resultado, ¿qué sentido tiene ya la búsqueda de imágenes?
Se puede decir exactamente lo mismo de la búsqueda general. Busques lo que busques, aparece una página de anuncios, luego varias páginas de granjas de contenido, y después páginas que “suenan a expertas, pero al final son granjas de contenido”
Financiar internet con publicidad hizo que encontrar contenido de buena calidad se volviera realmente difícil. Si no eres creador de contenido ni Google, los incentivos están completamente desalineados
El objetivo parece ser el watermarking, pero dudo que alguien pueda pensar que la web está en un estado que no sea de decadencia gestionada. La estructura en la que la IA alimenta a la IA terminará acabándolo todo. Creo que Platformer lo explicó mejor: https://www.platformer.news/google-io-ai-search-sundar-picha...
La pregunta es qué viene después, y parece que nadie tiene la respuesta
No sé qué significa “resolver”. Esto ya está resolviendo el problema. Si la gente lo considera suficientemente aceptable, ahí termina todo
La evidencia es todo el resto de las noticias y redes sociales del planeta
Es más probable que Google lo resuelva haciendo que la gente no note que los pavitos reales bebés son generados por IA
Creo que esta es una de las razones por las que las grandes tecnológicas hacen lobby por una regulación de IA más estricta. No temen la dominación de la IA, sino que la IA destruya su negocio
Lo peor es el resultado que copió el título de Snopes “Video Genuinely Shows White ‘Baby Peacock’?” pero le quitó el signo de interrogación. Esa página dice que la foto no es de un pavito real bebé real
Si buscas con el término más preciso, peachick, parece que salen imágenes 100% reales. Aunque la mitad de las páginas igual los llaman “baby peacocks”
El primer resultado es Adobe Stock. Uno pensaría que tendría estándares más altos que Pinterest o TikTok, pero esta es la realidad
En un futuro cercano, es muy probable que una parte considerable de los videos de YouTube y de los podcasts sea generada por IA. Por ejemplo, mediante herramientas como Notebook LM.
Aun así, no estoy seguro de que la audiencia realmente disfrute ese contenido generado por IA. Personalmente prefiero el contenido creado por personas. Se siente más auténtico y envolvente.
Las herramientas de IA necesitan, sí o sí, mecanismos de detección sólidos, como marcas de agua confiables, para que otras plataformas puedan identificar el contenido generado por IA. Lamentablemente, las herramientas actuales para detectar audio generado por IA todavía son insuficientes: https://www.npr.org/2024/04/05/1241446778/deepfake-audio-det...
También acabo de compilar una lista de “podcasts” generados por Notebook LM: https://github.com/ListenNotes/notebooklm-generated-fake-pod...
Hay que pensar si uno quiere escuchar podcasts creados por IA. La gente quizá acepte bien los programas que creó ella misma, pero creo que le gustarán menos los “podcasts” generados con IA por otras personas.
Me gustaría creer que el contenido creado por personas se siente más auténtico y envolvente, pero me pregunto cuánto tiempo seguirá siendo cierto.
“Quiero” preferir el contenido producido por humanos, pero parece probable que la IA pueda optimizar mejor la atención de las personas. En especial con contenido simple que dispara dopamina, como los videos de TikTok. Somos menos complejos de lo que creemos.
Lamentablemente, los mecanismos de detección de las herramientas de IA nunca van a funcionar bien. No hay forma de excluir a los actores maliciosos, y hay mucho dinero en juego para que la IA se haga pasar por humana. Tal vez más bien haya que poner marcas de agua o firmas al contenido creado por personas.
Dividir esto en una dicotomía no ayuda mucho.
Por ejemplo, hace 10 años ya veía videos de YouTube cuya narración era completamente TTS. El creador no quería usar su propia voz, así que escribía un guion y lo metía en un sistema TTS. Con el nivel de la tecnología de entonces, sonaba horrible, pero la gente disfrutaba los videos y tenían muchas reproducciones. ¿A eso lo llamaríamos generado por IA?
Hoy existe TTS mucho mejor incluso sin IA generativa. Esos videos ahora se verían mejor. Tal vez se podría notar que no es una persona por la poca variación de tono, pero probablemente habría que escuchar más de un minuto para distinguirlo. ¿Eso es generado por IA?
Ahora, con IA generativa, es posible obtener voces que quizá no podamos identificar como IA. Pero si una persona escribió el guion, ¿está bien? ¿Eso es generado por IA?
Por último, imaginemos que en ese mismo video el creador escribe el guion, pero siente que no escribe bien, o que el inglés no es su lengua materna y comete muchos errores gramaticales. Entonces le pasa el guion a GPT para que no solo corrija la gramática, sino que lo mejore con un objetivo como “convertirse en el guion de un video popular”. Luego revisa si se transmitió la idea central que quería comunicar y procede con la generación de voz. ¿Eso es generado por IA?
Para mí, todos esos casos están bien y no son inferiores a un flujo de trabajo completamente humano. Si el creador es humano y siente que transmite lo que debía transmitir, es suficiente.
Quiero mandar borradores de entradas de blog a GPT para que las escriba por mí. La razón por la que todavía no lo hago es que el resultado no tiene mi “voz”. Puede contener lo que quería decir, pero el estilo es completamente distinto. Si GPT/Claude pudiera imitar mejor mi estilo, lo usaría de inmediato. A casi nadie le gusta editar sin parar, y eso incluye especialmente a los escritores.
La cuestión es cuánto tiempo pasará hasta que ya no se pueda distinguir la diferencia.
En Listen Notes eliminamos más de 500 podcasts falsos generados con Notebook LM solo el fin de semana pasado.
Es decepcionante ver que estafadores y especialistas black hat en optimización para motores de búsqueda ya están aprovechando Notebook LM para producir podcasts falsos en masa y distribuirlos en varias plataformas.
Personalmente, me opongo a las máquinas ilimitadas de contenido basura.
Como Google sigue haciendo cada vez más difícil ir a la imagen real o descargarla desde la búsqueda de imágenes, creé una herramienta de búsqueda de imágenes que permite buscar en el repositorio de Google Imágenes con un atajo del sistema operativo y copiar rápidamente al portapapeles. Usa un Google Search Engine ID personalizado.
Hace aproximadamente un año noté que el 90% de los resultados eran generados por IA, así que agregué una bandera “No AI”. Básicamente es un filtro rápido y burdo que limita los resultados a antes de 2022. No es perfecto, pero funciona como solución temporal. https://github.com/scpedicini/truman-show
1 comentarios
Opiniones de Hacker News
Los resultados de búsqueda de “producto X vs. Y” ahora son casi todos tonterías de IA.
Ver crecer la internet muerta me dan ganas de suscribirme a Kagi. Siento que algún día vamos a necesitar certificación de contenido creado por personas.
Las comparaciones de productos son un ejemplo típico, pero lo que más me preocupa son las búsquedas relacionadas con salud. Esta semana intenté encontrar estudios sobre un medicamento que estoy tomando, y los resultados, que hace 5 años ya estaban contaminados por SEO, ahora están mucho peor por cientos de páginas de spam generado con GPT que intentan atraer clics.
Al final abandoné por completo el buscador, encontré en nih.gov un paper más o menos relacionado y tuve que seguir manualmente la lista de citas para buscar información.
Creo que la comercialización de internet por la publicidad y su centralización en plataformas hostiles al usuario claramente encendieron la mecha. La vieja internet aún hoy parece mucho mejor, pero en los últimos 15 años perdió a la mayoría de sus usuarios.
Es para volverse loco. Internet murió.
Hace poco compré una casa y busqué tareas de reparación del hogar, como cómo preparar las molduras antes de pintarlas. Casi todos los resultados eran granjas de contenido generado por IA, con anuncios metidos entre cada párrafo, un video con reproducción automática sin relación con el contenido que te sigue por la página, un modal de consentimiento de cookies y enseguida otro modal para suscribirte a un newsletter que te pide “ser amigos”.
Nos guste o no, ahora parece que Reddit es prácticamente el único lugar donde se puede encontrar información real.
Prefiero muchísimo el contenido de texto al video, pero el contenido de texto real escrito por personas está casi muerto. Reddit quizá sea una rara excepción por ahora. Todavía quedan foros viejos vivos según el rubro, pero suelen ser extremadamente difíciles de encontrar.
Por ejemplo, https://archive.org/details/stanleyhomerepai0000fine/page/14... lleva al capítulo “Painting Trim the Right Way” del libro Stanley Home Repairs de 2014.
También vale la pena mirar en librerías de usados. Las reparaciones del hogar no han cambiado mucho.
También puedes abrir Wine y probar el CD-ROM “Black & Decker Everyday Home Repairs” de Broderbund: https://archive.org/details/BlackDeckerEverydayHomeRepairsBr.... Según https://www.goodreads.com/book/show/3424503-everyday-home-re..., guía paso a paso más de 100 problemas comunes del hogar, desde arreglar una llave que gotea hasta reparar pisos de madera maciza, también ofrece animaciones y narración, e incluye tiempo y costo estimados, además de listas de materiales y herramientas necesarias.
De hecho, se ve bastante bien.
Renovations de Taunton Press (https://www.bookfinder.com/search_s/?title=Renovation%205th%...) es el primer recurso que consulto al iniciar un proyecto de reparación del hogar. El capítulo 18 trata íntegramente sobre pintura. Los otros libros de Taunton también son excelentes, pero el alcance de Renovations no tiene comparación.
Las molduras planas blancas de MDF que se compran hoy ya vienen con primer, así que están listas para pintar.
Sobre el auto nuevo casi no hay información de reparaciones, y la mayoría son solo videos de YouTube de gente que no sabe nada filmando arreglos caseros pésimos.
En una economía de internet que gira alrededor de producir y monetizar “contenido”, probablemente era muy probable que esto pasara desde el principio.
Empezó poniendo anuncios junto al contenido existente, y luego pasó a las redes sociales y los medios sociales, que al final eran motores para crowdsourcing de más producción de contenido y mostrar anuncios al lado. Como hay dinero de por medio, la producción de contenido se volvió un negocio importante, y la tecnología está satisfaciendo esa demanda creando contenido por menos de lo que se puede ganar con él.
El problema de moderar contenido indeseable hecho por personas ya estaba empezando a erosionar este modelo de negocio; ahora las herramientas generativas producen contenido no deseado más rápido de lo que se lo puede moderar. Cuando se llegue a cierto nivel de saturación, la gente perderá interés, y las herramientas que antes usaban heurísticas algorítmicas para separar el buen contenido del malo dejarán de servir. La única salida visible es que contenido hecho por humanos sea curado por humanos, pero no sé si existe un modelo de negocio así a la escala que exige la industria.
La internet temprana se sentía más como recorrer una biblioteca. No se esperaba que la mayoría de los sitios se actualizaran todos los días, ni siquiera todos los meses, y los textos casi siempre estaban organizados por tema, no por orden de publicación.
El enfoque excesivo de los blogs en lo nuevo cambió muchas cosas, y varios sitios empeoraron notablemente al dejar de cultivar bibliotecas de recursos duraderos para empezar a extraer vistas nuevas. Las discusiones en línea pasaron por un proceso parecido al moverse de los foros a estructuras de recomendación tipo Reddit/HN. En foros antiguos todavía quedan discusiones que siguieron durante más de 10 años; en Reddit o HN, después de unas horas una publicación se cae de la página y la conversación muere.
Los chats grupales privados son mucho más populares y comunes de lo que admitimos, y en este entorno esa tendencia se acelerará.
Espero que la gente pierda interés y deje de consumir contenido basura, pero la apuesta del otro lado es que la gente se acostumbre a contenido algorítmico de calidad cada vez más baja y que la industria exprima ganancias sin fin por cualquier medio. Si miramos la historia de la TV por cable, parece haber un punto límite.
Un grupo monocultural pequeño, como una minoría de universitarios aburridos, siempre terminará entendiendo el algoritmo, copando la plataforma con porno y spam y drenando recursos. La combinación de mejores herramientas creadas para ayudar a grupos débiles con incentivos económicos, en cambio, agranda la brecha. Esto se vuelve un problema porque los influencers financieros no pagan para ser humillados por una minoría de influencers del mercado de contenido, sino para recibir reconocimiento del público.
¿Pero por qué eso sería un problema? Los productores de “contenido indeseable” simplemente optimizan para lo que el mercado considera más valioso. Si eso es un problema, entonces el problema es la existencia misma del mercado. ¿Qué habría que hacer entonces? Destruirlo sin más también podría tener sentido.
No son solo imágenes. Si buscas en Google algo que podría considerarse una pregunta común, con frecuencia aparecen ensaladas de palabras generadas por IA entre los primeros 3 a 5 resultados.
Cuando empiezas a leer, no lo notas de inmediato. Luego empiezas a sospechar incluso de cosas que claramente no fueron generadas por IA. Uno tiene una intuición sobre de qué maneras pueden equivocarse las personas, cómo se equivocan cuando lo hacen, qué tono adoptan cuando están equivocadas, qué tan probable es que se equivoquen, en qué formatos y plataformas aparecen los errores, con qué frecuencia se equivocan y cómo reaccionan otras personas. La IA es algo completamente distinto. Ninguna intuición ni experiencia te permite saber cuándo una IA que suena convincente está equivocada.
Que todo el conjunto de heurísticas con las que evaluábamos inconscientemente la calidad de la información transmitida quede inutilizado de la noche a la mañana puede ser una receta para la locura y la desdicha. Pocas veces en mi vida me sentí tan genuinamente triste por culpa de la tecnología.
Si necesito ayuda con algo o tengo una pregunta, no uso Google ni publico en un foro abierto. Pregunto en un chat grupal privado donde todos son personas reales, nadie gana dinero y nadie copia y pega ChatGPT para acumular puntos de internet y vender la cuenta más adelante.
Solo hay una vía para que esto cambie, y a la gente no le va a gustar: que todo el contenido de internet esté vinculado a una identificación legal. Cada publicación y cada comentario en Facebook debería poder atribuirse a una persona real.
El contenido de IA no es tan diferente. Solo que ahora crear ese contenido es 100 veces más fácil, así que se ve muchísimo más. En el fondo no es un problema de IA, sino de incentivos y modelos de negocio basados en publicidad. La IA hizo que el problema del deterioro de los servicios fuera mucho más visible, pero el problema ya existía.
No sé cuál es la solución. Supongo que, a medida que el contenido de baja calidad inunde todo, la internet pública se volverá menos importante con el tiempo, y mucha comunicación se moverá a comunidades pequeñas que dependen mucho de verificar la identidad y las credenciales de las personas.
Es difícil explicar por qué, pero quizá porque no sabía cómo se ve una cría de pavo real, este ejemplo me hizo sentir con mucha fuerza el lado oscuro de la IA.
Estaba acostumbrado a confiar en cierta medida en los resultados de búsqueda. Sí había resultados raros o casi absurdos, pero aparecían de vez en cuando dentro de un mar de imágenes relevantes. Ahora puedo quedar completamente a ciegas sobre algo que no conozco. Como alguien que creció con Google como algo que “simplemente existía”, de verdad me asusta.
Si no tienes cuenta de Twitter y quieres ver más que una sola publicación, puedes verlo aquí: https://xcancel.com/notengoprisa/status/1842550658102079556
¿Google no debería resolver este problema de alguna manera si quiere seguir siendo relevante? Si buscar imágenes y generar imágenes producen el mismo resultado, ¿qué sentido tiene ya la búsqueda de imágenes?
Financiar internet con publicidad hizo que encontrar contenido de buena calidad se volviera realmente difícil. Si no eres creador de contenido ni Google, los incentivos están completamente desalineados
La pregunta es qué viene después, y parece que nadie tiene la respuesta
La evidencia es todo el resto de las noticias y redes sociales del planeta
Lo peor es el resultado que copió el título de Snopes “Video Genuinely Shows White ‘Baby Peacock’?” pero le quitó el signo de interrogación. Esa página dice que la foto no es de un pavito real bebé real
Si buscas con el término más preciso, peachick, parece que salen imágenes 100% reales. Aunque la mitad de las páginas igual los llaman “baby peacocks”
En un futuro cercano, es muy probable que una parte considerable de los videos de YouTube y de los podcasts sea generada por IA. Por ejemplo, mediante herramientas como Notebook LM.
Aun así, no estoy seguro de que la audiencia realmente disfrute ese contenido generado por IA. Personalmente prefiero el contenido creado por personas. Se siente más auténtico y envolvente.
Las herramientas de IA necesitan, sí o sí, mecanismos de detección sólidos, como marcas de agua confiables, para que otras plataformas puedan identificar el contenido generado por IA. Lamentablemente, las herramientas actuales para detectar audio generado por IA todavía son insuficientes: https://www.npr.org/2024/04/05/1241446778/deepfake-audio-det...
También acabo de compilar una lista de “podcasts” generados por Notebook LM: https://github.com/ListenNotes/notebooklm-generated-fake-pod...
Hay que pensar si uno quiere escuchar podcasts creados por IA. La gente quizá acepte bien los programas que creó ella misma, pero creo que le gustarán menos los “podcasts” generados con IA por otras personas.
“Quiero” preferir el contenido producido por humanos, pero parece probable que la IA pueda optimizar mejor la atención de las personas. En especial con contenido simple que dispara dopamina, como los videos de TikTok. Somos menos complejos de lo que creemos.
Lamentablemente, los mecanismos de detección de las herramientas de IA nunca van a funcionar bien. No hay forma de excluir a los actores maliciosos, y hay mucho dinero en juego para que la IA se haga pasar por humana. Tal vez más bien haya que poner marcas de agua o firmas al contenido creado por personas.
Por ejemplo, hace 10 años ya veía videos de YouTube cuya narración era completamente TTS. El creador no quería usar su propia voz, así que escribía un guion y lo metía en un sistema TTS. Con el nivel de la tecnología de entonces, sonaba horrible, pero la gente disfrutaba los videos y tenían muchas reproducciones. ¿A eso lo llamaríamos generado por IA?
Hoy existe TTS mucho mejor incluso sin IA generativa. Esos videos ahora se verían mejor. Tal vez se podría notar que no es una persona por la poca variación de tono, pero probablemente habría que escuchar más de un minuto para distinguirlo. ¿Eso es generado por IA?
Ahora, con IA generativa, es posible obtener voces que quizá no podamos identificar como IA. Pero si una persona escribió el guion, ¿está bien? ¿Eso es generado por IA?
Por último, imaginemos que en ese mismo video el creador escribe el guion, pero siente que no escribe bien, o que el inglés no es su lengua materna y comete muchos errores gramaticales. Entonces le pasa el guion a GPT para que no solo corrija la gramática, sino que lo mejore con un objetivo como “convertirse en el guion de un video popular”. Luego revisa si se transmitió la idea central que quería comunicar y procede con la generación de voz. ¿Eso es generado por IA?
Para mí, todos esos casos están bien y no son inferiores a un flujo de trabajo completamente humano. Si el creador es humano y siente que transmite lo que debía transmitir, es suficiente.
Quiero mandar borradores de entradas de blog a GPT para que las escriba por mí. La razón por la que todavía no lo hago es que el resultado no tiene mi “voz”. Puede contener lo que quería decir, pero el estilo es completamente distinto. Si GPT/Claude pudiera imitar mejor mi estilo, lo usaría de inmediato. A casi nadie le gusta editar sin parar, y eso incluye especialmente a los escritores.
Es decepcionante ver que estafadores y especialistas black hat en optimización para motores de búsqueda ya están aprovechando Notebook LM para producir podcasts falsos en masa y distribuirlos en varias plataformas.
Como Google sigue haciendo cada vez más difícil ir a la imagen real o descargarla desde la búsqueda de imágenes, creé una herramienta de búsqueda de imágenes que permite buscar en el repositorio de Google Imágenes con un atajo del sistema operativo y copiar rápidamente al portapapeles. Usa un Google Search Engine ID personalizado.
Hace aproximadamente un año noté que el 90% de los resultados eran generados por IA, así que agregué una bandera “No AI”. Básicamente es un filtro rápido y burdo que limita los resultados a antes de 2022. No es perfecto, pero funciona como solución temporal.
https://github.com/scpedicini/truman-show