- El experimento de devolver las canciones parodia de Weird Al Yankovic a la voz de los artistas originales muestra que la clonación de voz no es solo una tecnología para cambiar la voz, sino que también deja ver pronunciación, entonación y hábitos de canto
- La comunidad de covers con A.I. creció rápido alrededor de A.I. Hub Discord y Hugging Face, donde circulan modelos, herramientas y consejos, en una mezcla de experimentación no comercial y zona gris de derechos de autor
- Incluso usando modelos de Michael Jackson, Madonna, Kurt Cobain, Lady Gaga y Lorde, el rango vocal de la voz de entrada y la exagerada forma de cantar característica de Weird Al permanecen, así que el resultado se parece más a la sombra de Weird Al que al artista original
- Google Colab y AICoverGen permiten crear covers con A.I. incluso a usuarios sin GPU, y apps como Kits AI, Voicify AI, Voiceflip, voicemy.ai y covers.ai están bajando la barrera de uso
- La presión de copyright de la RIAA y el bloqueo permanente de A.I. Hub por parte de Discord muestran que la clonación de voz ya va más allá de un experimento divertido de internet y se está convirtiendo en un choque legal entre la gestión de comunidades y la industria musical
Experimento para devolver canciones de Weird Al a los artistas originales
- Partiendo de la premisa de la película Weird: The Al Yankovic Story, se probó con clonación de voz por A.I. cómo sonarían las canciones parodia de Weird Al Yankovic si fueran los originales y los cantantes reales las estuvieran versionando
- El primer caso fue imaginar a Michael Jackson cantando “Eat It” de Weird Al
- La canción original de Michael Jackson está afinada más grave que la parodia de Weird Al, mientras que la voz está cantada más aguda, así que se intentó ajustarla subiendo la voz una octava y bajando toda la canción medio tono
- Incluso dejando de lado los artefactos, el resultado sonaba más como un Michael Jackson imitando a Weird Al que como Michael Jackson, y seguía presente la pronunciación exagerada pensada para que los remates se entendieran bien
- Se probaron 6 modelos de voz A.I. de Michael Jackson, pero la diferencia en los resultados no fue grande
- La voz y pronunciación tan distintivas de Weird Al no desaparecen fácilmente aunque se cubran con otras voces generadas por A.I., dejando un eco inquietante en todo el experimento
La comunidad de covers con A.I. y la estructura de distribución de modelos
- En el centro de la comunidad de canciones versionadas con A.I. estaba el Discord de A.I. Hub, con más de 500 mil miembros, donde la gente intercambiaba consejos, herramientas, técnicas y enlaces a canciones originales y covers
- La comunidad agregaba cada día cientos de nuevos modelos de voz a una base de datos en hilos de Discord
- Las categorías populares abarcaban no solo músicos, sino también personajes virtuales, personajes de anime, YouTubers y streamers, y celebridades
- Entre ejemplos recientes de modelos aparecían Francoise Hardy, Donald Duck, todos los miembros de VCHA, Markiplier, Tom Waits, LeBron James, Knuckles y Adolf Hitler
- Aunque las conversaciones y enlaces sobre modelos circulaban en Discord, casi todos los archivos estaban alojados en Hugging Face
- En agosto de 2023, Hugging Face recaudó 235 millones de dólares en una Series D con participación de Google, Amazon, Nvidia, Salesforce, AMD, Intel, IBM y Qualcomm, con una valuación de 4.5 mil millones de dólares
- A.I. Hub exigía enlaces de Hugging Face para registrar modelos, y AICoverGen también recomendaba usar enlaces directos a modelos de Hugging Face en su UI y ejemplos
- Algunos usuarios reunían cientos o miles de modelos creados por otras personas en enormes repositorios
- Una cuenta tenía casi 4,000 modelos de voz de celebridades, músicos, personajes de caricatura y figuras de YouTube
Presión por copyright y bloqueo de A.I. Hub
- La RIAA sabía de la existencia de A.I. Hub y cuestionó la subida de datasets de canciones originales con copyright usados para entrenar modelos de voz
- En junio de 2023, la RIAA exigió a Discord el cierre de A.I. Hub, la eliminación de enlaces a archivos infractores y la revelación de la identidad de quienes los subieron
- Después de eso, A.I. Hub impuso reglas estrictas sobre los enlaces a datasets con copyright, especialmente archivos de separación vocal procesados con A.I. que se usan para entrenar nuevos modelos de voz
- Al momento de publicarse el artículo, no se había confirmado ningún caso en que la RIAA hubiera actuado directamente contra los modelos de A.I. o sus creadores
- Dos días después de la publicación, Discord bloqueó permanentemente A.I. Hub
- Ernesto Van der Sar, de TorrentFreak, fue quien lo reportó primero
- Según reportes no verificados del nuevo servidor, alguien editó una publicación para agregar enlaces a contenido con copyright, y por eso Discord no habría tenido otra opción más allá de aplicar el proceso DMCA
Resultados de los covers de Weird Al hechos con varios modelos de cantantes
- En el experimento de hacer que Madonna cantara “Like A Surgeon”, se usó un modelo entrenado durante 500 epochs con 13 minutos de acapellas limpias con calidad de estudio del álbum de 1984 Like a Virgin
- Como el rango vocal de Madonna es mucho más alto que el de Weird Al, se aplicó un pitch shift de una octava
- El resultado suena como una voz femenina, pero solo recuerda vagamente a la Madonna de los años 80
- En el experimento de hacer que Kurt Cobain cantara “Smells Like Nirvana”, se probaron varios modelos, y el mejor modelo fue uno creado por el YouTuber @Cleberslk
- El creador escribió que “hizo el modelo rápido desde el celular”
- En el resultado se cuela un acento europeo difícil de explicar
- Para el experimento de Lady Gaga cantando “Perform This Way”, se usó un modelo RVC creado por @udrivemecrazy
- Ese modelo solo usa 5 minutos de “acapellas muy limpias”
- También se hizo un experimento con Lorde cantando “Foil”
- Esa canción forma parte de Mandatory Fun, el decimocuarto y último álbum de estudio de Weird Al
- El resultado fue de los pocos que realmente gustaron durante las pruebas, aunque también se admite que el juicio ya podía estar nublado
Herramientas de producción y barreras de uso cada vez más bajas
- Para correr inferencia de modelos en local normalmente hace falta una PC con una GPU adecuada, pero Google Colab permite ejecutar flujos de trabajo de A.I. generativa en servidores incluso a usuarios sin una GPU compatible o que se sienten intimidados por la terminal
- Como en Mac no hay GPU Nvidia necesaria para esa inferencia, se usó el notebook de Colab de AICoverGen
- AICoverGen es un paquete que se encarga de los pasos para generar covers con A.I. a partir de modelos existentes y ofrece una web UI
- Arrancar tomaba unos minutos y generar cada canción tardaba menos de un minuto
- Como Colab y las WebUI pueden resultar pesados para usuarios no técnicos, varias startups están ofreciendo generación de covers vocales con A.I. y entrenamiento de modelos en forma de apps simples
- Se mencionan como ejemplos Kits AI, Voicify AI, Voiceflip, voicemy.ai y covers.ai
- El músico de Dallas Dustin Ballard, del canal There I Ruined It, tiene 3.1 millones de seguidores en TikTok y 700 mil suscriptores en YouTube, y lleva 4 meses experimentando con clonación de voz
- Entre los ejemplos están un video donde The Beach Boys cantan “Hurt” de Nine Inch Nails con la melodía de “Surfin’ USA”, una versión al estilo Hank Williams de “Straight Outta Compton”, y una reelaboración de “Snow (Hey Oh)” de Red Hot Chili Peppers
- Ballard graba él mismo nuevas pistas vocales imitando hasta cierto punto el rango y estilo de cada cantante, y luego aplica la clonación de voz con A.I.
- Ese enfoque es más adecuado para trabajos que cambian bastante la letra, melodía, ritmo y entonación con respecto al original
- Con la tecnología actual, si se quisiera hacer más convincente el proyecto de Weird Al, sería mejor que alguien cantara primero las letras de Weird Al adaptándolas al rango y estilo del artista parodiado, y luego aplicar encima la clonación de voz
- Singing Voice Synthesis y Singing Voice Conversion son áreas de investigación que avanzan rápido
- so-vits-svc, usado por Ghostwriter en abril de 2023 para imitar a Drake y The Weeknd en “Heart on My Sleeve”, ya fue archivado por el propietario del repositorio, y RVC se volvió una herramienta de uso extendido
- Los investigadores han mostrado posibilidades para “embellecer” el timbre y la entonación vocal, sintetizar nuevas voces de forma natural a partir de texto y transferirlas al estilo de otros artistas
Parodia de estilo y modelos ausentes
- Weird Al Yankovic es conocido como cantante de parodias y acordeonista, pero también es un compositor original
- Muchas de sus canciones más queridas no parodian directamente una canción específica, sino que hacen riff sobre el estilo de otros artistas: son parodias de estilo
- También habría interés en escuchar versiones sintéticas de Mark Mothersbaugh de Devo cantando “Dare to Be Stupid”, de David Byrne cantando “Dog Eat Dog” o de James Taylor cantando “Good Old Days”, pero no había modelos existentes de esos cantantes en A.I. Hub
- Tras pasar un tiempo en A.I. Hub, da la impresión de que la comunidad está sesgada hacia gente más joven, y algunos artistas de más edad apenas aparecen en modelos, covers o pedidos
- La mayor parte de la actividad en A.I. Hub es no comercial
- Los modelos se distribuyen gratis
- La gente sigue compartiendo covers con A.I. subidos a YouTube
- Aun así, en el canal #request-a-model también había personas que aceptaban encargos pagados para entrenar modelos de voz
Ética y choque legal alrededor de la clonación de voz
- Igual que en el debate sobre la A.I. generativa, las herramientas de clonación de voz difícilmente pueden esquivar los problemas de ética y legalidad
- Las posturas de los artistas son dispares
- Holly Herndon ve con buenos ojos que su voz se use de esta manera
- Grimes permite incluso uso comercial si hay reparto de ingresos
- Otros artistas no lo quieren aunque sea gratis
- En abril de 2020, Jay-Z pidió a YouTube que bajara varias parodias de audio deepfake hechas con su voz
- En ese momento eran parodias evidentes, pero si sin permiso se hace que Jay-Z aparezca en un nuevo sencillo o recomiende un producto en publicidad, eso podría constituir una infracción de copyright o del derecho de publicidad
- Creadores anónimos como Ghostwriter usan el nombre y la voz de artistas famosos para atraer atención hacia sus canciones, creando música sin conocimiento, consentimiento ni compensación para esos artistas
- En el caso de “Heart on My Sleeve”, la industria musical pidió el retiro de la canción en todas las plataformas de streaming
- Después, Ghostwriter publicó en X y TikTok otra canción usando versiones A.I. de Travis Scott y 21 Savage; TikTok la borró rápidamente, pero en X seguía disponible
- Es probable que la industria discográfica siga persiguiendo el uso comercial de voces A.I., pero parece más difícil detener la creación misma de voces A.I.
1 comentarios
Comentarios de Hacker News
Me sorprende bastante que estas herramientas, cada vez que se ejecutan, transfieran una copia del modelo. Ya sea en un notebook de Google Colab o en una máquina local, si funciona igual, los costos de ancho de banda de Hugging Face deben ser enormes; me pregunto si me estoy perdiendo de algo.
Tal vez tengan acuerdos de peering o usen caché de forma muy agresiva.
Con lo que cuesta transferir 100 TB hacia afuera en AWS, podrías sostener 10 Gbit/s las 24 horas, y con 100% de uso superarías los 3 PB al mes. El ancho de banda siempre fue ridículamente barato.
Mejor todavía, que primero preguntaran dónde guardar el modelo.
Este artículo solo cubre el aspecto musical de la clonación de voz con IA, pero el terreno más complejo es el reemplazo de actores de voz comunes en películas, juegos y animación. Ej.: https://www.axios.com/2023/07/24/ai-voice-actors-victoria-at...
Para reemplazar a un cantante se necesita bastante posproducción, y además tienen suficiente dinero y poder legal como para no verse tan golpeados por la competencia; con los actores de voz es distinto. Con la configuración básica de ElevenLabs o de alternativas open source como Bark y VALL-E X ya se puede hacer una clonación más o menos aceptable; además ya están mal pagados y trabajan por contrato, así que no tienen propiedad legal sobre su propia voz. El trabajo de voz normalmente pertenece al cliente, y ese cliente puede no tener muchos incentivos para proteger la voz.
Me gustaría escribir una entrada de blog sobre el impacto de la cultura de los actores de voz de Persona 5 y Genshin Impact, pero creo que a la mayoría de los lectores de Hacker News no les interesaría mucho.
De forma más discreta, también podrían ofrecer un asistente de voz y meter en los términos de uso que “podemos usar una copia de tu voz para cualquier propósito”. Los actores de voz actuales perderán sus trabajos, y solo quedará un pequeño grupo que quiera voces de personas reales. Para algunos proyectos eso no va a importar, así que creo que esto se va a poner bastante caótico.
En cualquier caso, me gustaría leerlo.
Los cantantes no querían que los replicaran con software, pero las voces de actores de voz fueron tratadas como algo que podía usarse libremente.
Este mercado probablemente se abra para pequeños negocios que no pueden pagar actores de voz profesionales. Creo que la IA abre un mercado nuevo, no que destruya los empleos de personas realmente talentosas.
Vaya, ahora me doy cuenta de que cualquiera puede tomar las letras de Weird Al tal como están y rehacerlas con la voz del cantante original. Para la hora del almuerzo quizá ya podamos escuchar a Michael Jackson cantando Just Eat It.
Me sigue sorprendiendo cómo se pueden usar las nuevas tecnologías de IA. Claro que probablemente sea ilegal bajo la ley de copyright de la mayoría de los países.
Weird Al sí pide permiso, pero está bien establecido que la parodia no es infracción de copyright. Si un buen abogado lo argumentara, debería haber margen también para interpretaciones paródicas con voces de IA.
De los usos que he visto hasta ahora de esta tecnología, el que más me gusta es The Beach Boys cantando Hurt. Por primera vez casi no sentí artefactos de forma seria, y aunque originalmente es una combinación que no tendría sentido, encaja demasiado bien
Escúchenlo: https://youtu.be/gmNSFqyg_Z8
Aun así, me da curiosidad si pronto alguna IA podrá sintetizar el estilo de Beach Boys sobre los acordes y la melodía reales del original de NIN, y sumarle además un poco de la solemnidad de Johnny Cash
Si se resolvieran todos los derechos de artistas, compositores y demás, esto podría verse como un uso “aceptable” de la IA. Siempre es más divertido cuando gente talentosa juega con esto directamente, pero sin duda escucharía un álbum de mashups extraños como estos
La muestra de voz no suena ni a Michael Jackson ni a Weird Al. Es un buen intento, pero un imitador profesional probablemente lo habría hecho mejor en cualquiera de los dos casos
Los covers de canciones con IA son increíbles. Van desde Goku cantando Don't Stop Me Now hasta el elenco de SpongeBob cantando Ocean Man
https://www.youtube.com/watch?v=CkQ-44PvTs8
https://www.youtube.com/watch?v=tJjhObngcxI
No sabía de esto. “El centro de la comunidad de covers con IA es un Discord de más de 500 mil personas llamado A.I. Hub, donde los miembros intercambian nuevos consejos, herramientas, técnicas y enlaces a canciones originales y covers”
Si imaginas a 500 mil personas juntas en la calle, sin duda te darías cuenta, pero en línea pueden existir comunidades enormes así y no enterarte para nada hasta que te las cruzas por casualidad o alguien te las menciona
Incluso Reddit está quedando detrás de Discord o TikTok entre la Gen Z, y al leer /r/LocalLLMs se nota de inmediato que una buena parte de esa comunidad son menores de edad. Para ser claro, creo que eso es algo bueno
Hubo una generación que prefería las listas de correo, otra que prefería IRC y BBS, y mi generación gusta de los foros y los hilos largos de comentarios. Sería ingenuo pensar que la forma en que usamos las cosas ahora va a durar para siempre
Las críticas a Discord, especialmente los problemas de búsqueda y descubrimiento, son muy reales, pero a estas alturas parece que la suerte ya está echada. La gente joven ya eligió
Aunque no sé si eso se debe a limitaciones de la tecnología o simplemente a que “el material de origen es demasiado poco interesante”. Hay muchísimo del tipo “canciones clásicas cantadas por raperos populares de hoy”, y como fan del hip hop viejo, diría que hay muy poco interesante en las voces de los artistas populares de hip hop actuales
Es un artículo relacionado de hace un año sobre cómo la voz de Darth Vader se generará con IA en adelante
https://arstechnica.com/information-technology/2022/09/james...
Si se trata de “imitar voces de famosos”, escuchen Light My Fire en YouTube Music
https://music.youtube.com/watch?v=lN3v3EfA6_A&si=_hcG3Wjakxd...