- Nightshade es una herramienta que, ante el uso de imágenes en línea para entrenar IA generativa sin consentimiento, convierte las obras en muestras de poison no aptas para el entrenamiento del modelo
- Las listas de exclusión voluntaria y
do-not-scrape/robots.txtson difíciles de verificar y hacer cumplir, y también es difícil identificar a los infractores con un alto nivel de certeza, por lo que los creadores tienen pocos medios reales de control - La imagen transformada no se ve muy distinta del original para el ojo humano, pero hace que un modelo de IA aprenda una composición diferente y produzca resultados impredecibles
- Si Glaze es una herramienta defensiva para impedir la imitación del estilo de un artista individual, Nightshade es una herramienta ofensiva selectiva que eleva el costo de entrenamiento para modelos que hacen scraping sin consentimiento
- Actualmente, Nightshade v1.0 es una herramienta independiente y no ofrece protección contra la imitación como Glaze, por lo que no debe usarse por sí sola en obras cuyo estilo pueda ser motivo de preocupación
Respuesta ante la recolección de datos de entrenamiento sin consentimiento
- Los modelos de IA generativa y quienes los entrenan han demostrado la capacidad de descargar contenido en línea para usarlo en el entrenamiento de modelos
- Los dueños del contenido y los creadores casi no tienen herramientas para impedir que sus obras entren en modelos de IA generativa contra su voluntad
- Las listas de exclusión voluntaria ya han sido ignoradas en el pasado por quienes entrenan modelos, y pueden ser ignoradas fácilmente sin mayores consecuencias
- Las instrucciones
do-not-scrapetambién son difíciles de verificar y hacer cumplir, y es complicado identificar a los infractores con alta certeza
Cómo funciona Nightshade
- Nightshade convierte imágenes en muestras de poison no aptas para el entrenamiento del modelo
- Un modelo entrenado sin consentimiento con estas imágenes puede aprender comportamientos impredecibles que se desvían del funcionamiento esperado
- Por ejemplo, al pedir una imagen de “una vaca volando por el espacio”, podría generar una imagen de un bolso flotando en el espacio
- El objetivo no es simplemente arruinar el modelo, sino elevar el costo de entrenarlo con datos no autorizados para que licenciar imágenes de los creadores se vuelva una alternativa realista
Imágenes que humanos y modelos ven de forma distinta
- Nightshade funciona de manera similar a Glaze, pero no es una defensa contra la imitación de estilo, sino una herramienta ofensiva que distorsiona las representaciones de características internas de los modelos generativos de imágenes con IA
- La transformación se calcula mediante una optimización multiobjetivo que minimiza los cambios visibles en la imagen original
- Para el ojo humano, una imagen con shade se ve en gran medida similar a la original, pero un modelo de IA puede ver una composición dramáticamente distinta dentro de la imagen
- Una persona puede seguir viendo prácticamente la misma imagen de una vaca en un campo verde
- Un modelo de IA puede verla como una gran cartera de cuero sobre el pasto
- Si aprende suficientes imágenes con shade que incluyan vacas, el modelo puede convencerse cada vez más de que las vacas tienen asas de cuero café, bolsillos laterales lisos, cierres y logotipos de marca
Un efecto que persiste incluso con transformaciones comunes de imagen
- El efecto de Nightshade es robusto incluso ante cambios comunes aplicados a una imagen
- El efecto de poison permanece después de recortes, remuestreo, compresión, suavizado de píxeles y adición de ruido
- El efecto shade también se mantiene aunque se tome una captura de pantalla de la imagen mostrada en un monitor o se le tome una foto
- Esto no es una marca de agua ni un mensaje oculto de esteganografía, por lo que no se rompe fácilmente
Diferencias de rol entre Nightshade y Glaze
- Glaze es una herramienta defensiva que permite a artistas individuales protegerse de ataques de imitación de estilo
- Nightshade es una herramienta ofensiva para que los artistas, de forma colectiva, interfieran con modelos que hacen scraping de imágenes sin consentimiento
- Se recomienda aplicar Glaze a todas las obras que se publiquen en línea para proteger al artista
- Nightshade es una función selectiva para disuadir a quienes entrenan modelos sin escrúpulos
- Idealmente, un artista que publica su trabajo en línea debería aplicar tanto Glaze como Nightshade
- Se está trabajando en un lanzamiento integrado de ambas herramientas
Puntos a considerar al usarlo
- Los cambios que hace Nightshade pueden notarse más en obras con colores planos y fondos suaves
- Como Nightshade busca interferir con el modelo, usar una intensidad baja o un nivel bajo de poison no genera resultados negativos para el propietario de la imagen
- Se incluyen ajustes de baja intensidad para usuarios que priorizan la calidad visual de la imagen original
- Como ocurre con los ataques y defensas de seguridad, no puede asumirse que Nightshade seguirá siendo eficaz a largo plazo
- Como herramienta ofensiva, Nightshade puede evolucionar con facilidad frente a posibles contramedidas o defensas
Forma de distribución y manejo de datos
- El objetivo de Nightshade es descubrir y aprender cosas nuevas a través de la investigación, y generar un impacto positivo en el mundo
- Nightshade, al igual que Glaze, está diseñado para ejecutarse sin red
- No se envían datos ni obras al equipo de Nightshade ni a ningún otro lugar
- Nightshade v1.0 está diseñado como una herramienta independiente
- La versión actual no ofrece protección contra la imitación como Glaze, así que debe usarse con cuidado
- Si existe aunque sea una mínima preocupación por la imitación de estilo, no se deben publicar imágenes de obras procesadas solo con Nightshade
- Se está probando la forma en que Nightshade y Glaze funcionarán juntos
- Cuando esté listo, Nightshade se lanzará como un complemento de WebGlaze para que los usuarios de WebGlaze puedan aplicar Nightshade y Glaze a una sola imagen al mismo tiempo
Artículo técnico y materiales de referencia
- La guía de usuario explica cómo instalar, ejecutar, configurar y eliminar Nightshade
- El título del artículo técnico es Nightshade: Prompt-Specific Poisoning Attacks on Text-to-Image Generative Models
- Los autores son Shawn Shan, Wenxin Ding, Josephine Passananti, Haitao Zheng y Ben Y. Zhao
- El artículo será publicado en el 45th IEEE Symposium on Security and Privacy, que se celebrará en San Francisco en mayo de 2024
- El preprint publicado en febrero de 2024 es arxiv/2310.13828
1 comentarios
Comentarios en Hacker News
El artículo está aquí: https://arxiv.org/abs/2310.13828
Parece que este método produce demasiados artefactos como para que muchos artistas lo acepten: https://twitter.com/sini4ka111/status/1748378223291912567
Por lo que se dice, a) apenas funciona en procedimientos de entrenamiento de generaciones anteriores, b) no sirve en absoluto con procesos más recientes como GPT-4V, LLaVA o incluso etiquetado con BLIP2, y c) aunque su efecto aumente y se use ampliamente, no sería muy difícil contrarrestarlo
Como el trabajo previo de los autores, Glaze, tampoco parece muy efectivo pese a sus afirmaciones exageradas, esto podría ser un caso de resultados académicamente interesantes pero poco prácticos en la realidad, presentados con más bombo del que merecen
[1]: capturas aportadas por /u/b3sn0w en Reddit: https://imgur.com/cI7RLAq https://imgur.com/eqe3Dyn https://imgur.com/1BMASL4
Meter imágenes en GPT-4V, Stable Diffusion img2img, etc., no equivale a entrenar a la IA, y el modelo queda completamente fijo, sin cambiar en absoluto[0]
No sé si todavía existe algún lugar que raspe imágenes nuevas para meterlas en el entrenamiento de generadores. Escuché que OpenAI dejó de hacer scraping alrededor de 2021 por temor a volver a entrenar con salidas de sus propios modelos[1], y Adobe Firefly afirma haberse entrenado con imágenes de Adobe Stock, pero no está claro cuál fue el punto de corte interno de Adobe[2]
Si lo que quieres es hacer que GPT-4V o Stable Diffusion fallen en la etapa de inferencia, lo que necesitas son imágenes adversarias. No sé si se puede hacer entrenamiento adversario contra un modelo sin pesos accesibles, pero he oído que si se generaliza contra varios modelos independientes sí se les puede perjudicar bastante[3]
[0] La capacidad que parece entrenamiento en generadores de texto proviene de la ventana de contexto, pero eso es solo memoria de corto plazo de unas 2048 tokens, sin otras capacidades de memoria
[1] A este escenario, en broma, le llaman Habsburg AI. El modelo aprende de sus propios sesgos, los refuerza en sesgos más fuertes y se olvida del resto
[2] Sería especialmente irónico si el único generador de IA al que Nightshade perjudica fuera el que al menos intentaba hacerlo de una forma un poco más ética
[3] En el extremo, las imágenes adversarias también engañan a las personas. Pero ese tipo de investigaciones mostraban las imágenes por muy poco tiempo, bajo la idea de que una exposición breve se parece a una red neuronal feed-forward sin rutas de cómputo recurrente. Si se observan durante más tiempo, queda claro que la foto fue editada para hacer que un objeto parezca otro
De todos modos, el desruido probablemente ya sea una buena etapa de preprocesamiento
La gente de LLM no parece tener ninguna intención real de pagar legítimamente los costos, y en la práctica el resumen de su plan de negocio es “robar todo lo que se pueda agarrar”
Aquí hay un mercado enorme para los productos fraudulentos. Mientras el arte tenga que ser visible para el ojo humano, no hay forma de que herramientas así ganen, y aunque funcionaran, por principio se podrían eludir de inmediato
Para artistas o para cualquiera, la única forma realista de evitar que los modelos se entrenen con producción humana es la ley, es decir, usar la coerción respaldada por el Estado para disuadir lo no deseado. Ni siquiera eso es perfecto, y podría incluso incentivar el desarrollo de redes de entrenamiento distribuidas para “lavar” infracciones de copyright castigables
Al final, como mínimo es una batalla perdida y, en el peor caso, una batalla tonta. Si subes una imagen para que las personas la vean libremente, no puedes impedir que una computadora la observe; por eso estos modelos se pueden hacer fácilmente y terminarán haciéndose
Además de la ley, sí hay otros métodos. Puedes ofrecer la obra solo para visualización privada y no permitir que el público en el lugar lleve dispositivos de grabación. Puede sonar absurdo, pero es una práctica común en actividades como el sexo
En el peor de los casos, solo es una pérdida de tiempo, y no es una situación donde alguien sea engañado para comprar algo
Ahora, la única forma de sobrevivir como artista es tener un estilo propio y único, y no subirlo jamás a internet
Hace unos meses hice una prueba de concepto según la cual, si haces fine-tuning de Stable Diffusion XL con imágenes erróneas o inconsistentes, al usar esas imágenes como prompts negativos el modelo puede producir imágenes aún “mejores”: https://news.ycombinator.com/item?id=37211519
Es decir, sirve para señalar regiones de alta dimensionalidad del espacio latente que la generación del modelo debe evitar. No es imposible que fomentar la creación masiva de datasets manipulados termine, paradójicamente, mejorando los modelos de arte generativo por IA, porque el modelo podría reconocer los datos manipulados y hacer que el proceso de entrenamiento los esquive
Esto parece una carrera armamentista bastante inútil, o un juego del gato y el ratón. Si a quien quiere entrenar modelos generativos de imágenes no le importan en absoluto las opiniones de los artistas, bastaría con un posprocesamiento básico que rompa los cambios finamente ajustados por el algoritmo de Nightshade
Por ejemplo, si se vuelve a muestrear a una resolución un poco más baja y luego se reescala con otro modelo de superresolución, parece que ese ajuste fino podría arruinarse sin una gran diferencia para el ojo humano
Creo que en el futuro es probable que los tribunales se pongan mayormente del lado de los artistas por la presión social. Los artistas podrían objetar imágenes detectadas, y otro modelo de machine learning podría determinar rápidamente si una imagen generada es “demasiado similar” al estilo de ese artista. Claro, para que haya una reclamación legal razonable, ese estilo tendría que ser lo bastante distinto del de otras personas
O quizá los artistas terminen renunciando a monetizar la imagen en sí y se concentren en producir objetos físicos. Algo parecido a cómo hoy muchos músicos independientes ganan la mayor parte de su dinero con giras, venta de mercancía en conciertos y Patreon. Si un cambio tan fundamental ocurre tan rápido, de verdad es muy difícil predecir el futuro
En un futuro cínico, podría haber aún más de los llamados “artistas furry”. Igual que con otras big tech, es muy probable que varias figuras de poder bloqueen con fuerza el ámbito para adultos. Entonces el trabajo NSFW quedaría algo protegido del avance, y habría que buscar modelos entrenados en la clandestinidad o volver a recurrir a artistas
The Grateful Dead implementó este modelo de forma muy sofisticada y, a veces, evitó deliberadamente reclamar propiedad intelectual sobre su obra. Lo hacían porque creían que esas reclamaciones obstaculizaban el éxito, y finalmente formalizaron esa postura dándole el nombre de “The Electronic Frontier Foundation”. No es casualidad que la EFF haya surgido de la cultura deadhead
Lo mismo pasa con que no exista un OpenArt equivalente a OpenSource. Claro, entiendo la diferencia de que el código fuente no está pensado para el público general y se puede ocultar si uno quiere, mientras que el arte no. Solo es un subproducto de pensar en lo generativo
Siento que entrenar con estas imágenes en realidad hará que los modelos de IA mejoren en vez de empeorar. Es como si los artistas estuvieran creando gratis datos de entrenamiento que muestran qué clase de ruido no cambia el significado de la imagen que pretendían
En un futuro cercano habrá una cantidad difícil de creer de personas capaces de hacer arte de alta calidad usando solo herramientas estándar
Es algo bastante emocionante. Darles a miles de millones de personas el poder de mezclar estilos que les gustan, aplicarlos a nuevos sujetos y crear obras propias, únicas y personalizadas, es una capacidad increíblemente genial
Basta con que los modelos de IA se alimenten de contenido generado por IA para que colapsen por sí solos. Ahí está el colapso del modelo asociado con la IA generativa
Quiero tarifas progresivas para el uso de copyright, propiedad intelectual y patentes, además de cooperación e legislación gubernamental a escala mundial. Quizá incluso podría existir alguna forma de permitir el uso global de obras protegidas sin permiso previo, pero mejor no irnos hasta esa idea tan disparatada
Me gustaría que se aplicaran tarifas de licencia escalables, como un porcentaje vinculado a los ingresos. Hay un problema indirecto en que los márgenes de ganancia difieren según la industria, pero aun así me parece lo más justo
Me gustaría que el copyright en manos de individuos se redujera gradualmente, en todo el mundo o empezando por la UE, hasta 0 años después de la muerte del autor, y el copyright corporativo a un máximo de 20 a 30 años
Las sanciones para empresas que no declaren el uso o no paguen las tarifas deberían ser muy altas. Algo como 50% de los ingresos brutos del año correspondiente o 50% de las ganancias netas, para que no sea un simple golpecito en la muñeca ni algo de lo que se pueda salir fácilmente, sino un incentivo real para no robar desde el principio
[*] O el período que la sociedad considere apropiado
[**] Hasta que la detección automática, para bien o para mal, sea lo bastante buena
Creo que esto permitiría el uso personal, fomentaría nuevas entradas al mercado, impulsaría la innovación y empujaría a lugares como OpenAI a comportarse mejor
Que los derechos expiren poco después del fallecimiento se siente incómodo, también es malo que la duración del copyright varíe mucho según la edad del autor, y tampoco conviene que demasiadas obras queden con copyright excesivamente largo
No habría ningún problema con que el copyright expirara en vida del autor. Bastan 20 a 30 años para todo
Al ver esta “solución”, parece que el mundo del arte también está entrando en el juego del gato y el ratón que los bloqueadores de anuncios llevan librando desde hace 10 o 20 años
Sigo sintiendo que es claramente incorrecto recorrer internet sin consentimiento, raspar imágenes y usarlas en una IA monetizada propia. Ojalá haya más formas de proteger obras de arte, incluido audio y otros formatos, y que sean más accesibles
Sería una forma de hacer que un modelo adicional intente engañar al modelo principal para aumentar su resistencia a filtros del tipo Nightshade
El artículo no muestra que este método arruine los detalles finos de la imagen. Basta con ver la miniatura del paper de referencia: https://arxiv.org/pdf/2310.13828.pdf
Y quizás yo esté siendo ingenuo, pero parece bastante fácil de esquivar con un filtro rápido de preprocesamiento. No sé si bastaría con una eliminación de ruido tradicional, pero en el peor de los casos se puede correr una difusión img2img