1 puntos por GN⁺ 2023-10-04 | 1 comentarios | Compartir por WhatsApp
  • El experimento de devolver las canciones parodia de Weird Al Yankovic a la voz de los artistas originales muestra que la clonación de voz no es solo una tecnología para cambiar la voz, sino que también deja ver pronunciación, entonación y hábitos de canto
  • La comunidad de covers con A.I. creció rápido alrededor de A.I. Hub Discord y Hugging Face, donde circulan modelos, herramientas y consejos, en una mezcla de experimentación no comercial y zona gris de derechos de autor
  • Incluso usando modelos de Michael Jackson, Madonna, Kurt Cobain, Lady Gaga y Lorde, el rango vocal de la voz de entrada y la exagerada forma de cantar característica de Weird Al permanecen, así que el resultado se parece más a la sombra de Weird Al que al artista original
  • Google Colab y AICoverGen permiten crear covers con A.I. incluso a usuarios sin GPU, y apps como Kits AI, Voicify AI, Voiceflip, voicemy.ai y covers.ai están bajando la barrera de uso
  • La presión de copyright de la RIAA y el bloqueo permanente de A.I. Hub por parte de Discord muestran que la clonación de voz ya va más allá de un experimento divertido de internet y se está convirtiendo en un choque legal entre la gestión de comunidades y la industria musical

Experimento para devolver canciones de Weird Al a los artistas originales

  • Partiendo de la premisa de la película Weird: The Al Yankovic Story, se probó con clonación de voz por A.I. cómo sonarían las canciones parodia de Weird Al Yankovic si fueran los originales y los cantantes reales las estuvieran versionando
  • El primer caso fue imaginar a Michael Jackson cantando “Eat It” de Weird Al
    • La canción original de Michael Jackson está afinada más grave que la parodia de Weird Al, mientras que la voz está cantada más aguda, así que se intentó ajustarla subiendo la voz una octava y bajando toda la canción medio tono
    • Incluso dejando de lado los artefactos, el resultado sonaba más como un Michael Jackson imitando a Weird Al que como Michael Jackson, y seguía presente la pronunciación exagerada pensada para que los remates se entendieran bien
  • Se probaron 6 modelos de voz A.I. de Michael Jackson, pero la diferencia en los resultados no fue grande
    • Un modelo había sido entrenado con 7 horas de voces durante 300 epochs, aunque en general se considera que para un buen modelo no hace falta más de 15 minutos de audio limpio
    • Para el experimento con “Fat” se usó un modelo entrenado con canciones de Destiny, Off The Wall y Thriller
  • La voz y pronunciación tan distintivas de Weird Al no desaparecen fácilmente aunque se cubran con otras voces generadas por A.I., dejando un eco inquietante en todo el experimento

La comunidad de covers con A.I. y la estructura de distribución de modelos

  • En el centro de la comunidad de canciones versionadas con A.I. estaba el Discord de A.I. Hub, con más de 500 mil miembros, donde la gente intercambiaba consejos, herramientas, técnicas y enlaces a canciones originales y covers
  • La comunidad agregaba cada día cientos de nuevos modelos de voz a una base de datos en hilos de Discord
    • Las categorías populares abarcaban no solo músicos, sino también personajes virtuales, personajes de anime, YouTubers y streamers, y celebridades
    • Entre ejemplos recientes de modelos aparecían Francoise Hardy, Donald Duck, todos los miembros de VCHA, Markiplier, Tom Waits, LeBron James, Knuckles y Adolf Hitler
  • Aunque las conversaciones y enlaces sobre modelos circulaban en Discord, casi todos los archivos estaban alojados en Hugging Face
    • En agosto de 2023, Hugging Face recaudó 235 millones de dólares en una Series D con participación de Google, Amazon, Nvidia, Salesforce, AMD, Intel, IBM y Qualcomm, con una valuación de 4.5 mil millones de dólares
    • A.I. Hub exigía enlaces de Hugging Face para registrar modelos, y AICoverGen también recomendaba usar enlaces directos a modelos de Hugging Face en su UI y ejemplos
  • Algunos usuarios reunían cientos o miles de modelos creados por otras personas en enormes repositorios
    • Una cuenta tenía casi 4,000 modelos de voz de celebridades, músicos, personajes de caricatura y figuras de YouTube

Presión por copyright y bloqueo de A.I. Hub

  • La RIAA sabía de la existencia de A.I. Hub y cuestionó la subida de datasets de canciones originales con copyright usados para entrenar modelos de voz
  • En junio de 2023, la RIAA exigió a Discord el cierre de A.I. Hub, la eliminación de enlaces a archivos infractores y la revelación de la identidad de quienes los subieron
  • Después de eso, A.I. Hub impuso reglas estrictas sobre los enlaces a datasets con copyright, especialmente archivos de separación vocal procesados con A.I. que se usan para entrenar nuevos modelos de voz
  • Al momento de publicarse el artículo, no se había confirmado ningún caso en que la RIAA hubiera actuado directamente contra los modelos de A.I. o sus creadores
  • Dos días después de la publicación, Discord bloqueó permanentemente A.I. Hub
    • Ernesto Van der Sar, de TorrentFreak, fue quien lo reportó primero
    • Según reportes no verificados del nuevo servidor, alguien editó una publicación para agregar enlaces a contenido con copyright, y por eso Discord no habría tenido otra opción más allá de aplicar el proceso DMCA

Resultados de los covers de Weird Al hechos con varios modelos de cantantes

  • En el experimento de hacer que Madonna cantara “Like A Surgeon”, se usó un modelo entrenado durante 500 epochs con 13 minutos de acapellas limpias con calidad de estudio del álbum de 1984 Like a Virgin
    • Como el rango vocal de Madonna es mucho más alto que el de Weird Al, se aplicó un pitch shift de una octava
    • El resultado suena como una voz femenina, pero solo recuerda vagamente a la Madonna de los años 80
  • En el experimento de hacer que Kurt Cobain cantara “Smells Like Nirvana”, se probaron varios modelos, y el mejor modelo fue uno creado por el YouTuber @Cleberslk
    • El creador escribió que “hizo el modelo rápido desde el celular”
    • En el resultado se cuela un acento europeo difícil de explicar
  • Para el experimento de Lady Gaga cantando “Perform This Way”, se usó un modelo RVC creado por @udrivemecrazy
    • Ese modelo solo usa 5 minutos de “acapellas muy limpias”
  • También se hizo un experimento con Lorde cantando “Foil
    • Esa canción forma parte de Mandatory Fun, el decimocuarto y último álbum de estudio de Weird Al
    • El resultado fue de los pocos que realmente gustaron durante las pruebas, aunque también se admite que el juicio ya podía estar nublado

Herramientas de producción y barreras de uso cada vez más bajas

  • Para correr inferencia de modelos en local normalmente hace falta una PC con una GPU adecuada, pero Google Colab permite ejecutar flujos de trabajo de A.I. generativa en servidores incluso a usuarios sin una GPU compatible o que se sienten intimidados por la terminal
  • Como en Mac no hay GPU Nvidia necesaria para esa inferencia, se usó el notebook de Colab de AICoverGen
    • AICoverGen es un paquete que se encarga de los pasos para generar covers con A.I. a partir de modelos existentes y ofrece una web UI
    • Arrancar tomaba unos minutos y generar cada canción tardaba menos de un minuto
  • Como Colab y las WebUI pueden resultar pesados para usuarios no técnicos, varias startups están ofreciendo generación de covers vocales con A.I. y entrenamiento de modelos en forma de apps simples
  • El músico de Dallas Dustin Ballard, del canal There I Ruined It, tiene 3.1 millones de seguidores en TikTok y 700 mil suscriptores en YouTube, y lleva 4 meses experimentando con clonación de voz
    • Entre los ejemplos están un video donde The Beach Boys cantan “Hurt” de Nine Inch Nails con la melodía de “Surfin’ USA”, una versión al estilo Hank Williams de “Straight Outta Compton”, y una reelaboración de “Snow (Hey Oh)” de Red Hot Chili Peppers
    • Ballard graba él mismo nuevas pistas vocales imitando hasta cierto punto el rango y estilo de cada cantante, y luego aplica la clonación de voz con A.I.
    • Ese enfoque es más adecuado para trabajos que cambian bastante la letra, melodía, ritmo y entonación con respecto al original
  • Con la tecnología actual, si se quisiera hacer más convincente el proyecto de Weird Al, sería mejor que alguien cantara primero las letras de Weird Al adaptándolas al rango y estilo del artista parodiado, y luego aplicar encima la clonación de voz
  • Singing Voice Synthesis y Singing Voice Conversion son áreas de investigación que avanzan rápido
    • so-vits-svc, usado por Ghostwriter en abril de 2023 para imitar a Drake y The Weeknd en “Heart on My Sleeve”, ya fue archivado por el propietario del repositorio, y RVC se volvió una herramienta de uso extendido
    • Los investigadores han mostrado posibilidades para “embellecer” el timbre y la entonación vocal, sintetizar nuevas voces de forma natural a partir de texto y transferirlas al estilo de otros artistas

Parodia de estilo y modelos ausentes

  • Weird Al Yankovic es conocido como cantante de parodias y acordeonista, pero también es un compositor original
  • Muchas de sus canciones más queridas no parodian directamente una canción específica, sino que hacen riff sobre el estilo de otros artistas: son parodias de estilo
  • También habría interés en escuchar versiones sintéticas de Mark Mothersbaugh de Devo cantando “Dare to Be Stupid”, de David Byrne cantando “Dog Eat Dog” o de James Taylor cantando “Good Old Days”, pero no había modelos existentes de esos cantantes en A.I. Hub
  • Tras pasar un tiempo en A.I. Hub, da la impresión de que la comunidad está sesgada hacia gente más joven, y algunos artistas de más edad apenas aparecen en modelos, covers o pedidos
  • La mayor parte de la actividad en A.I. Hub es no comercial
    • Los modelos se distribuyen gratis
    • La gente sigue compartiendo covers con A.I. subidos a YouTube
    • Aun así, en el canal #request-a-model también había personas que aceptaban encargos pagados para entrenar modelos de voz

Ética y choque legal alrededor de la clonación de voz

  • Igual que en el debate sobre la A.I. generativa, las herramientas de clonación de voz difícilmente pueden esquivar los problemas de ética y legalidad
  • Las posturas de los artistas son dispares
    • Holly Herndon ve con buenos ojos que su voz se use de esta manera
    • Grimes permite incluso uso comercial si hay reparto de ingresos
    • Otros artistas no lo quieren aunque sea gratis
  • En abril de 2020, Jay-Z pidió a YouTube que bajara varias parodias de audio deepfake hechas con su voz
    • En ese momento eran parodias evidentes, pero si sin permiso se hace que Jay-Z aparezca en un nuevo sencillo o recomiende un producto en publicidad, eso podría constituir una infracción de copyright o del derecho de publicidad
  • Creadores anónimos como Ghostwriter usan el nombre y la voz de artistas famosos para atraer atención hacia sus canciones, creando música sin conocimiento, consentimiento ni compensación para esos artistas
    • En el caso de “Heart on My Sleeve”, la industria musical pidió el retiro de la canción en todas las plataformas de streaming
    • Después, Ghostwriter publicó en X y TikTok otra canción usando versiones A.I. de Travis Scott y 21 Savage; TikTok la borró rápidamente, pero en X seguía disponible
  • Es probable que la industria discográfica siga persiguiendo el uso comercial de voces A.I., pero parece más difícil detener la creación misma de voces A.I.

1 comentarios

 
GN⁺ 2023-10-04
Comentarios de Hacker News
  • Me sorprende bastante que estas herramientas, cada vez que se ejecutan, transfieran una copia del modelo. Ya sea en un notebook de Google Colab o en una máquina local, si funciona igual, los costos de ancho de banda de Hugging Face deben ser enormes; me pregunto si me estoy perdiendo de algo.
    Tal vez tengan acuerdos de peering o usen caché de forma muy agresiva.

    • El módulo de Python cachea las descargas y revisa primero antes de volver a bajarlas. Aun así, probablemente sea cierto que los costos de ancho de banda deben ser enormes. Parece que recibieron bastante financiamiento de VC, incluso con el clima actual.
    • Hace más de 10 años, cuando cotizaba CDNs a medida, las líneas ilimitadas de 10 gigabits o más ya rondaban, al por mayor, alrededor de $1/mbit/mes.
      Con lo que cuesta transferir 100 TB hacia afuera en AWS, podrías sostener 10 Gbit/s las 24 horas, y con 100% de uso superarías los 3 PB al mes. El ancho de banda siempre fue ridículamente barato.
    • Hugging Face tiene una alianza estratégica con AWS.
      1. AWS está muy por detrás de Azure y GCP en IA, así que necesita socios para ganar credibilidad.
      2. Hugging Face probablemente tenga costos enormes comparado con GitHub. Aun así, si es AWS, seguramente puede crear optimizaciones para reducir costos de ancho de banda, y seguro también están desarrollando algo como un almacenamiento diferencial genérico para modelos de IA.
    • Me pregunto si Hugging Face es simplemente un repositorio de modelos, como GitHub lo es para código. Parece que también puedes alquilar recursos de cómputo de CPU y GPU, aunque da la impresión de que la mayoría de los modelos se ejecutan en otros lugares.
    • Ojalá se pudiera configurar para que estas cosas se cacheen en algún lugar que no sea la unidad C:.
      Mejor todavía, que primero preguntaran dónde guardar el modelo.
  • Este artículo solo cubre el aspecto musical de la clonación de voz con IA, pero el terreno más complejo es el reemplazo de actores de voz comunes en películas, juegos y animación. Ej.: https://www.axios.com/2023/07/24/ai-voice-actors-victoria-at...
    Para reemplazar a un cantante se necesita bastante posproducción, y además tienen suficiente dinero y poder legal como para no verse tan golpeados por la competencia; con los actores de voz es distinto. Con la configuración básica de ElevenLabs o de alternativas open source como Bark y VALL-E X ya se puede hacer una clonación más o menos aceptable; además ya están mal pagados y trabajan por contrato, así que no tienen propiedad legal sobre su propia voz. El trabajo de voz normalmente pertenece al cliente, y ese cliente puede no tener muchos incentivos para proteger la voz.
    Me gustaría escribir una entrada de blog sobre el impacto de la cultura de los actores de voz de Persona 5 y Genshin Impact, pero creo que a la mayoría de los lectores de Hacker News no les interesaría mucho.

    • Al final, las empresas probablemente van a contratar a universitarios que necesiten unos miles de dólares y una pizza, hacerles leer un guion razonable, ponerlos a firmar un contrato que ceda todos los derechos y luego usar esa voz para siempre.
      De forma más discreta, también podrían ofrecer un asistente de voz y meter en los términos de uso que “podemos usar una copia de tu voz para cualquier propósito”. Los actores de voz actuales perderán sus trabajos, y solo quedará un pequeño grupo que quiera voces de personas reales. Para algunos proyectos eso no va a importar, así que creo que esto se va a poner bastante caótico.
    • HN no es el único lugar donde se puede escribir. Aquí parece haber poca empatía con este tipo de problemas laborales, pero a veces artículos de nicho llegan a la portada.
      En cualquier caso, me gustaría leerlo.
    • La voz no está sujeta a copyright, pero eso no significa que la imitación sea legal. Hay un caso famoso, Midler v. Ford, así que no diría que la situación sea completamente clara.
    • Algo interesante es que muchos Vocaloid, en particular Hatsune Miku, no surgieron de muestras de cantantes sino de actores de voz.
      Los cantantes no querían que los replicaran con software, pero las voces de actores de voz fueron tratadas como algo que podía usarse libremente.
    • La voz con IA es más barata, pero al mismo tiempo también es una actuación más aburrida y genérica. No parece haber ningún avance hacia una IA creativa capaz de producir buen trabajo distintivo.
      Este mercado probablemente se abra para pequeños negocios que no pueden pagar actores de voz profesionales. Creo que la IA abre un mercado nuevo, no que destruya los empleos de personas realmente talentosas.
  • Vaya, ahora me doy cuenta de que cualquiera puede tomar las letras de Weird Al tal como están y rehacerlas con la voz del cantante original. Para la hora del almuerzo quizá ya podamos escuchar a Michael Jackson cantando Just Eat It.
    Me sigue sorprendiendo cómo se pueden usar las nuevas tecnologías de IA. Claro que probablemente sea ilegal bajo la ley de copyright de la mayoría de los países.

    • También está I Think I'm a Clone Now de Weird Al, que encajaría perfecto con una interpretación vocal clonada por IA. La original es I Think We're Alone Now de Tommy James and the Shondells, pero parece que Weird Al parodió el cover de Tiffany de los años 80.
      Weird Al sí pide permiso, pero está bien establecido que la parodia no es infracción de copyright. Si un buen abogado lo argumentara, debería haber margen también para interpretaciones paródicas con voces de IA.
    • No entiendo por qué eso sería sorprendente. Suena simplemente tonto y una pérdida de tiempo.
  • De los usos que he visto hasta ahora de esta tecnología, el que más me gusta es The Beach Boys cantando Hurt. Por primera vez casi no sentí artefactos de forma seria, y aunque originalmente es una combinación que no tendría sentido, encaja demasiado bien
    Escúchenlo: https://youtu.be/gmNSFqyg_Z8

    • No sé qué esperaba, pero eso no es Hurt; se parece más a Surfin' USA con la letra de Hurt, y el sonido se oye súper tembloroso y áspero
      Aun así, me da curiosidad si pronto alguna IA podrá sintetizar el estilo de Beach Boys sobre los acordes y la melodía reales del original de NIN, y sumarle además un poco de la solemnidad de Johnny Cash
    • Where Is My Mind cantada por Sinatra: https://youtu.be/BO4cKQ8DxYU?si=uzF_TdrQoZOAOlEc
    • Esta cuenta está en la cima entre la gente que hace mezclas musicales raras. Sus trabajos recientes de música deepfake fueron sorprendentemente buenos
      Si se resolvieran todos los derechos de artistas, compositores y demás, esto podría verse como un uso “aceptable” de la IA. Siempre es más divertido cuando gente talentosa juega con esto directamente, pero sin duda escucharía un álbum de mashups extraños como estos
    • La textura áspera de la grabación oculta muchos posibles problemas. Aun así, viendo que este intento mantiene el tempo y la pronunciación de Beach Boys, con la misma técnica una versión de Michael Jackson haciendo un cover de Eat It probablemente sonaría mucho más convincente
  • La muestra de voz no suena ni a Michael Jackson ni a Weird Al. Es un buen intento, pero un imitador profesional probablemente lo habría hecho mejor en cualquiera de los dos casos

    • Suena como Weird Al fingiendo ser Michael Jackson, y ese Michael Jackson fingiendo otra vez ser Weird Al
    • Hasta el mejor imitador de Michael Jackson de una ciudad de 50 mil habitantes lo haría mejor que esto. Esto es... flojo
    • Entiendo a qué te refieres. Se nota más del lado de Michael, pero definitivamente tiene esa sensación. Las partes que suenan raras parecen deberse en parte a la corrección de tono
  • Los covers de canciones con IA son increíbles. Van desde Goku cantando Don't Stop Me Now hasta el elenco de SpongeBob cantando Ocean Man

  • No sabía de esto. “El centro de la comunidad de covers con IA es un Discord de más de 500 mil personas llamado A.I. Hub, donde los miembros intercambian nuevos consejos, herramientas, técnicas y enlaces a canciones originales y covers”

    • Yo tampoco lo sabía. Internet es raro justo por cosas como esta
      Si imaginas a 500 mil personas juntas en la calle, sin duda te darías cuenta, pero en línea pueden existir comunidades enormes así y no enterarte para nada hasta que te las cruzas por casualidad o alguien te las menciona
    • Creo que poco a poco estoy aceptando que los entusiastas de la tecnología de esta generación, especialmente quienes tienen tiempo para ajustar modelos durante horas y compartir resultados, prefieren mucho más Discord que estas comunidades tipo foro de la Web 2.0
      Incluso Reddit está quedando detrás de Discord o TikTok entre la Gen Z, y al leer /r/LocalLLMs se nota de inmediato que una buena parte de esa comunidad son menores de edad. Para ser claro, creo que eso es algo bueno
      Hubo una generación que prefería las listas de correo, otra que prefería IRC y BBS, y mi generación gusta de los foros y los hilos largos de comentarios. Sería ingenuo pensar que la forma en que usamos las cosas ahora va a durar para siempre
      Las críticas a Discord, especialmente los problemas de búsqueda y descubrimiento, son muy reales, pero a estas alturas parece que la suerte ya está echada. La gente joven ya eligió
    • Estuve mirando un rato y, en general, me dio la impresión de que el nivel era bajo, así que quizá por eso sea relativamente menos conocido
      Aunque no sé si eso se debe a limitaciones de la tecnología o simplemente a que “el material de origen es demasiado poco interesante”. Hay muchísimo del tipo “canciones clásicas cantadas por raperos populares de hoy”, y como fan del hip hop viejo, diría que hay muy poco interesante en las voces de los artistas populares de hip hop actuales
  • Es un artículo relacionado de hace un año sobre cómo la voz de Darth Vader se generará con IA en adelante
    https://arstechnica.com/information-technology/2022/09/james...

  • Si se trata de “imitar voces de famosos”, escuchen Light My Fire en YouTube Music
    https://music.youtube.com/watch?v=lN3v3EfA6_A&si=_hcG3Wjakxd...