4 puntos por GN⁺ 2024-01-21 | 1 comentarios | Compartir por WhatsApp
  • Nightshade es una herramienta que, ante el uso de imágenes en línea para entrenar IA generativa sin consentimiento, convierte las obras en muestras de poison no aptas para el entrenamiento del modelo
  • Las listas de exclusión voluntaria y do-not-scrape/robots.txt son difíciles de verificar y hacer cumplir, y también es difícil identificar a los infractores con un alto nivel de certeza, por lo que los creadores tienen pocos medios reales de control
  • La imagen transformada no se ve muy distinta del original para el ojo humano, pero hace que un modelo de IA aprenda una composición diferente y produzca resultados impredecibles
  • Si Glaze es una herramienta defensiva para impedir la imitación del estilo de un artista individual, Nightshade es una herramienta ofensiva selectiva que eleva el costo de entrenamiento para modelos que hacen scraping sin consentimiento
  • Actualmente, Nightshade v1.0 es una herramienta independiente y no ofrece protección contra la imitación como Glaze, por lo que no debe usarse por sí sola en obras cuyo estilo pueda ser motivo de preocupación

Respuesta ante la recolección de datos de entrenamiento sin consentimiento

  • Los modelos de IA generativa y quienes los entrenan han demostrado la capacidad de descargar contenido en línea para usarlo en el entrenamiento de modelos
  • Los dueños del contenido y los creadores casi no tienen herramientas para impedir que sus obras entren en modelos de IA generativa contra su voluntad
  • Las listas de exclusión voluntaria ya han sido ignoradas en el pasado por quienes entrenan modelos, y pueden ser ignoradas fácilmente sin mayores consecuencias
  • Las instrucciones do-not-scrape también son difíciles de verificar y hacer cumplir, y es complicado identificar a los infractores con alta certeza

Cómo funciona Nightshade

  • Nightshade convierte imágenes en muestras de poison no aptas para el entrenamiento del modelo
  • Un modelo entrenado sin consentimiento con estas imágenes puede aprender comportamientos impredecibles que se desvían del funcionamiento esperado
    • Por ejemplo, al pedir una imagen de “una vaca volando por el espacio”, podría generar una imagen de un bolso flotando en el espacio
  • El objetivo no es simplemente arruinar el modelo, sino elevar el costo de entrenarlo con datos no autorizados para que licenciar imágenes de los creadores se vuelva una alternativa realista

Imágenes que humanos y modelos ven de forma distinta

  • Nightshade funciona de manera similar a Glaze, pero no es una defensa contra la imitación de estilo, sino una herramienta ofensiva que distorsiona las representaciones de características internas de los modelos generativos de imágenes con IA
  • La transformación se calcula mediante una optimización multiobjetivo que minimiza los cambios visibles en la imagen original
  • Para el ojo humano, una imagen con shade se ve en gran medida similar a la original, pero un modelo de IA puede ver una composición dramáticamente distinta dentro de la imagen
    • Una persona puede seguir viendo prácticamente la misma imagen de una vaca en un campo verde
    • Un modelo de IA puede verla como una gran cartera de cuero sobre el pasto
    • Si aprende suficientes imágenes con shade que incluyan vacas, el modelo puede convencerse cada vez más de que las vacas tienen asas de cuero café, bolsillos laterales lisos, cierres y logotipos de marca

Un efecto que persiste incluso con transformaciones comunes de imagen

  • El efecto de Nightshade es robusto incluso ante cambios comunes aplicados a una imagen
  • El efecto de poison permanece después de recortes, remuestreo, compresión, suavizado de píxeles y adición de ruido
  • El efecto shade también se mantiene aunque se tome una captura de pantalla de la imagen mostrada en un monitor o se le tome una foto
  • Esto no es una marca de agua ni un mensaje oculto de esteganografía, por lo que no se rompe fácilmente

Diferencias de rol entre Nightshade y Glaze

  • Glaze es una herramienta defensiva que permite a artistas individuales protegerse de ataques de imitación de estilo
  • Nightshade es una herramienta ofensiva para que los artistas, de forma colectiva, interfieran con modelos que hacen scraping de imágenes sin consentimiento
  • Se recomienda aplicar Glaze a todas las obras que se publiquen en línea para proteger al artista
  • Nightshade es una función selectiva para disuadir a quienes entrenan modelos sin escrúpulos
  • Idealmente, un artista que publica su trabajo en línea debería aplicar tanto Glaze como Nightshade
  • Se está trabajando en un lanzamiento integrado de ambas herramientas

Puntos a considerar al usarlo

  • Los cambios que hace Nightshade pueden notarse más en obras con colores planos y fondos suaves
  • Como Nightshade busca interferir con el modelo, usar una intensidad baja o un nivel bajo de poison no genera resultados negativos para el propietario de la imagen
  • Se incluyen ajustes de baja intensidad para usuarios que priorizan la calidad visual de la imagen original
  • Como ocurre con los ataques y defensas de seguridad, no puede asumirse que Nightshade seguirá siendo eficaz a largo plazo
  • Como herramienta ofensiva, Nightshade puede evolucionar con facilidad frente a posibles contramedidas o defensas

Forma de distribución y manejo de datos

  • El objetivo de Nightshade es descubrir y aprender cosas nuevas a través de la investigación, y generar un impacto positivo en el mundo
  • Nightshade, al igual que Glaze, está diseñado para ejecutarse sin red
  • No se envían datos ni obras al equipo de Nightshade ni a ningún otro lugar
  • Nightshade v1.0 está diseñado como una herramienta independiente
  • La versión actual no ofrece protección contra la imitación como Glaze, así que debe usarse con cuidado
    • Si existe aunque sea una mínima preocupación por la imitación de estilo, no se deben publicar imágenes de obras procesadas solo con Nightshade
  • Se está probando la forma en que Nightshade y Glaze funcionarán juntos
  • Cuando esté listo, Nightshade se lanzará como un complemento de WebGlaze para que los usuarios de WebGlaze puedan aplicar Nightshade y Glaze a una sola imagen al mismo tiempo

Artículo técnico y materiales de referencia

  • La guía de usuario explica cómo instalar, ejecutar, configurar y eliminar Nightshade
  • El título del artículo técnico es Nightshade: Prompt-Specific Poisoning Attacks on Text-to-Image Generative Models
  • Los autores son Shawn Shan, Wenxin Ding, Josephine Passananti, Haitao Zheng y Ben Y. Zhao
  • El artículo será publicado en el 45th IEEE Symposium on Security and Privacy, que se celebrará en San Francisco en mayo de 2024
  • El preprint publicado en febrero de 2024 es arxiv/2310.13828

1 comentarios

 
GN⁺ 2024-01-21
Comentarios en Hacker News
  • El artículo está aquí: https://arxiv.org/abs/2310.13828

  • Parece que este método produce demasiados artefactos como para que muchos artistas lo acepten: https://twitter.com/sini4ka111/status/1748378223291912567
    Por lo que se dice, a) apenas funciona en procedimientos de entrenamiento de generaciones anteriores, b) no sirve en absoluto con procesos más recientes como GPT-4V, LLaVA o incluso etiquetado con BLIP2, y c) aunque su efecto aumente y se use ampliamente, no sería muy difícil contrarrestarlo
    Como el trabajo previo de los autores, Glaze, tampoco parece muy efectivo pese a sus afirmaciones exageradas, esto podría ser un caso de resultados académicamente interesantes pero poco prácticos en la realidad, presentados con más bombo del que merecen
    [1]: capturas aportadas por /u/b3sn0w en Reddit: https://imgur.com/cI7RLAq https://imgur.com/eqe3Dyn https://imgur.com/1BMASL4

    • Las capturas de [1] muestran inferencia, no entrenamiento. Para que haya efecto, las imágenes procesadas con Nightshade tendrían que entrar en el dataset de entrenamiento del generador de imágenes
      Meter imágenes en GPT-4V, Stable Diffusion img2img, etc., no equivale a entrenar a la IA, y el modelo queda completamente fijo, sin cambiar en absoluto[0]
      No sé si todavía existe algún lugar que raspe imágenes nuevas para meterlas en el entrenamiento de generadores. Escuché que OpenAI dejó de hacer scraping alrededor de 2021 por temor a volver a entrenar con salidas de sus propios modelos[1], y Adobe Firefly afirma haberse entrenado con imágenes de Adobe Stock, pero no está claro cuál fue el punto de corte interno de Adobe[2]
      Si lo que quieres es hacer que GPT-4V o Stable Diffusion fallen en la etapa de inferencia, lo que necesitas son imágenes adversarias. No sé si se puede hacer entrenamiento adversario contra un modelo sin pesos accesibles, pero he oído que si se generaliza contra varios modelos independientes sí se les puede perjudicar bastante[3]
      [0] La capacidad que parece entrenamiento en generadores de texto proviene de la ventana de contexto, pero eso es solo memoria de corto plazo de unas 2048 tokens, sin otras capacidades de memoria
      [1] A este escenario, en broma, le llaman Habsburg AI. El modelo aprende de sus propios sesgos, los refuerza en sesgos más fuertes y se olvida del resto
      [2] Sería especialmente irónico si el único generador de IA al que Nightshade perjudica fuera el que al menos intentaba hacerlo de una forma un poco más ética
      [3] En el extremo, las imágenes adversarias también engañan a las personas. Pero ese tipo de investigaciones mostraban las imágenes por muy poco tiempo, bajo la idea de que una exposición breve se parece a una red neuronal feed-forward sin rutas de cómputo recurrente. Si se observan durante más tiempo, queda claro que la foto fue editada para hacer que un objeto parezca otro
    • Incluso en el peor de los casos, parece que podría mitigarse con una simple etapa de difusión img2img, y por los ejemplos da la impresión de que hasta un desruidador tradicional bastaría
      De todos modos, el desruido probablemente ya sea una buena etapa de preprocesamiento
    • Viéndolo en móvil, casi no puedo notar la diferencia entre las imágenes de ejemplo de Twitter
    • Puede que se parezca más a un uso para “proteger” imágenes que el artista quiere compartir públicamente para promocionar su trabajo, pero que no son adecuadas como medio digital final
    • Es obvio que quienes roban seguirán ajustando sus procedimientos para neutralizar este tipo de contramedidas. No parece que los artistas vayan a ganar esta carrera armamentista
      La gente de LLM no parece tener ninguna intención real de pagar legítimamente los costos, y en la práctica el resumen de su plan de negocio es “robar todo lo que se pueda agarrar”
  • Aquí hay un mercado enorme para los productos fraudulentos. Mientras el arte tenga que ser visible para el ojo humano, no hay forma de que herramientas así ganen, y aunque funcionaran, por principio se podrían eludir de inmediato
    Para artistas o para cualquiera, la única forma realista de evitar que los modelos se entrenen con producción humana es la ley, es decir, usar la coerción respaldada por el Estado para disuadir lo no deseado. Ni siquiera eso es perfecto, y podría incluso incentivar el desarrollo de redes de entrenamiento distribuidas para “lavar” infracciones de copyright castigables
    Al final, como mínimo es una batalla perdida y, en el peor caso, una batalla tonta. Si subes una imagen para que las personas la vean libremente, no puedes impedir que una computadora la observe; por eso estos modelos se pueden hacer fácilmente y terminarán haciéndose

    • Solo por el nivel de las afirmaciones, acompañado del entusiasmo de una audiencia con poca alfabetización técnica, ya se ve y se siente como un producto fraudulento sin necesidad de investigar mucho
      Además de la ley, sí hay otros métodos. Puedes ofrecer la obra solo para visualización privada y no permitir que el público en el lugar lleve dispositivos de grabación. Puede sonar absurdo, pero es una práctica común en actividades como el sexo
    • A diferencia de la frase “si el arte debe ser visible para la percepción humana, no hay forma de que estas herramientas ganen”, también resulta interesante que un entorno adversario podría empujar a los modelos hacia un aprendizaje de representaciones más alineado con la percepción humana
    • Es el viejo problema del agujero analógico: https://en.m.wikipedia.org/wiki/Analog_hole
    • Esta herramienta es gratuita y, por lo que parece, se ejecuta en local. Si no está vendiendo nada ni hay un incentivo de lucro, cuesta llamarla razonablemente un producto fraudulento
      En el peor de los casos, solo es una pérdida de tiempo, y no es una situación donde alguien sea engañado para comprar algo
    • Esa es la cruda realidad. No se puede volver a meter al genio en la botella
      Ahora, la única forma de sobrevivir como artista es tener un estilo propio y único, y no subirlo jamás a internet
  • Hace unos meses hice una prueba de concepto según la cual, si haces fine-tuning de Stable Diffusion XL con imágenes erróneas o inconsistentes, al usar esas imágenes como prompts negativos el modelo puede producir imágenes aún “mejores”: https://news.ycombinator.com/item?id=37211519
    Es decir, sirve para señalar regiones de alta dimensionalidad del espacio latente que la generación del modelo debe evitar. No es imposible que fomentar la creación masiva de datasets manipulados termine, paradójicamente, mejorando los modelos de arte generativo por IA, porque el modelo podría reconocer los datos manipulados y hacer que el proceso de entrenamiento los esquive

  • Esto parece una carrera armamentista bastante inútil, o un juego del gato y el ratón. Si a quien quiere entrenar modelos generativos de imágenes no le importan en absoluto las opiniones de los artistas, bastaría con un posprocesamiento básico que rompa los cambios finamente ajustados por el algoritmo de Nightshade
    Por ejemplo, si se vuelve a muestrear a una resolución un poco más baja y luego se reescala con otro modelo de superresolución, parece que ese ajuste fino podría arruinarse sin una gran diferencia para el ojo humano
    Creo que en el futuro es probable que los tribunales se pongan mayormente del lado de los artistas por la presión social. Los artistas podrían objetar imágenes detectadas, y otro modelo de machine learning podría determinar rápidamente si una imagen generada es “demasiado similar” al estilo de ese artista. Claro, para que haya una reclamación legal razonable, ese estilo tendría que ser lo bastante distinto del de otras personas
    O quizá los artistas terminen renunciando a monetizar la imagen en sí y se concentren en producir objetos físicos. Algo parecido a cómo hoy muchos músicos independientes ganan la mayor parte de su dinero con giras, venta de mercancía en conciertos y Patreon. Si un cambio tan fundamental ocurre tan rápido, de verdad es muy difícil predecir el futuro

    • El arte ya no es una profesión sostenible para la mayoría de quienes no consiguen trabajo en la industria. La forma más común de monetización son las comisiones o esconder contenido adicional detrás de un muro de pago
      En un futuro cínico, podría haber aún más de los llamados “artistas furry”. Igual que con otras big tech, es muy probable que varias figuras de poder bloqueen con fuerza el ámbito para adultos. Entonces el trabajo NSFW quedaría algo protegido del avance, y habría que buscar modelos entrenados en la clandestinidad o volver a recurrir a artistas
    • Si esto tiene algún “sentido”, sería que empuja a los modelos de IA a captar mejor la manera en que las personas ven las cosas
    • El modelo en el que los músicos hoy ganan la mayor parte de su dinero con giras y mercancía en conciertos ha sido la norma, y siempre lo ha sido, en la tradición que llegó a llamarse música “tradicional”, “Americana” y “Appalachian”
      The Grateful Dead implementó este modelo de forma muy sofisticada y, a veces, evitó deliberadamente reclamar propiedad intelectual sobre su obra. Lo hacían porque creían que esas reclamaciones obstaculizaban el éxito, y finalmente formalizaron esa postura dándole el nombre de “The Electronic Frontier Foundation”. No es casualidad que la EFF haya surgido de la cultura deadhead
    • Desde cierta perspectiva extraña, resulta bastante gracioso ver a artistas furiosos por perder el monopolio de robar y copiar elementos de composición de otros artistas para rearmarlos en algo parecido pero nuevo
      Lo mismo pasa con que no exista un OpenArt equivalente a OpenSource. Claro, entiendo la diferencia de que el código fuente no está pensado para el público general y se puede ocultar si uno quiere, mientras que el arte no. Solo es un subproducto de pensar en lo generativo
    • El punto clave es que, aunque Nightshade por sí solo pueda eludirse, mientras el juego del gato y el ratón continúe pueden aparecer más contramedidas
  • Siento que entrenar con estas imágenes en realidad hará que los modelos de IA mejoren en vez de empeorar. Es como si los artistas estuvieran creando gratis datos de entrenamiento que muestran qué clase de ruido no cambia el significado de la imagen que pretendían

  • En un futuro cercano habrá una cantidad difícil de creer de personas capaces de hacer arte de alta calidad usando solo herramientas estándar
    Es algo bastante emocionante. Darles a miles de millones de personas el poder de mezclar estilos que les gustan, aplicarlos a nuevos sujetos y crear obras propias, únicas y personalizadas, es una capacidad increíblemente genial

    • En el arte, el público tiende a valorar más el origen y el proceso que el resultado en sí. En unos años, cuando lo generado por IA sea común, la gente mirará por encima del hombro al arte hecho con IA
    • En ese proceso, herramientas como Nightshade dejarán de ser necesarias
      Basta con que los modelos de IA se alimenten de contenido generado por IA para que colapsen por sí solos. Ahí está el colapso del modelo asociado con la IA generativa
    • Será una herramienta tan genial como la capacidad de conectarse a internet. Es decir, se volverá un producto básico, transaccional y aburrido
    • Para que eso ocurriera, millones de personas tuvieron que quedar alienadas de su trabajo
    • No necesariamente. Hay una razón por la que nos siguen pareciendo más interesantes las pinturas realistas que las fotografías, y por la que todavía hay gente que sigue pintándolas. El esfuerzo que otro artista invirtió influye en nuestra apreciación
  • Quiero tarifas progresivas para el uso de copyright, propiedad intelectual y patentes, además de cooperación e legislación gubernamental a escala mundial. Quizá incluso podría existir alguna forma de permitir el uso global de obras protegidas sin permiso previo, pero mejor no irnos hasta esa idea tan disparatada
    Me gustaría que se aplicaran tarifas de licencia escalables, como un porcentaje vinculado a los ingresos. Hay un problema indirecto en que los márgenes de ganancia difieren según la industria, pero aun así me parece lo más justo
    Me gustaría que el copyright en manos de individuos se redujera gradualmente, en todo el mundo o empezando por la UE, hasta 0 años después de la muerte del autor, y el copyright corporativo a un máximo de 20 a 30 años
    Las sanciones para empresas que no declaren el uso o no paguen las tarifas deberían ser muy altas. Algo como 50% de los ingresos brutos del año correspondiente o 50% de las ganancias netas, para que no sea un simple golpecito en la muñeca ni algo de lo que se pueda salir fácilmente, sino un incentivo real para no robar desde el principio
    [*] O el período que la sociedad considere apropiado
    [**] Hasta que la detección automática, para bien o para mal, sea lo bastante buena
    Creo que esto permitiría el uso personal, fomentaría nuevas entradas al mercado, impulsaría la innovación y empujaría a lugares como OpenAI a comportarse mejor

    • No entiendo por qué habría que tomar como referencia el momento de la muerte
      Que los derechos expiren poco después del fallecimiento se siente incómodo, también es malo que la duración del copyright varíe mucho según la edad del autor, y tampoco conviene que demasiadas obras queden con copyright excesivamente largo
      No habría ningún problema con que el copyright expirara en vida del autor. Bastan 20 a 30 años para todo
    • Pensar que algo así podría hacerse cumplir a un nivel suficiente es extremadamente ingenuo. El copyright está roto de raíz, y ponerle una curita con décadas de retraso no va a servir de mucho
  • Al ver esta “solución”, parece que el mundo del arte también está entrando en el juego del gato y el ratón que los bloqueadores de anuncios llevan librando desde hace 10 o 20 años

    • Acabo de probarlo con la clasificación de imágenes de Azure AI y funcionó. Así que este gato todavía no se adapta a la idea más reciente del ratón
      Sigo sintiendo que es claramente incorrecto recorrer internet sin consentimiento, raspar imágenes y usarlas en una IA monetizada propia. Ojalá haya más formas de proteger obras de arte, incluido audio y otros formatos, y que sean más accesibles
    • Puede que se me esté escapando algo porque no conozco bien la estructura de Nightshade ni la de los generadores de arte por IA, pero me pregunto si no se podría probar una arquitectura tipo GAN en la parte del etiquetado de imágenes dentro del generador
      Sería una forma de hacer que un modelo adicional intente engañar al modelo principal para aumentar su resistencia a filtros del tipo Nightshade
  • El artículo no muestra que este método arruine los detalles finos de la imagen. Basta con ver la miniatura del paper de referencia: https://arxiv.org/pdf/2310.13828.pdf
    Y quizás yo esté siendo ingenuo, pero parece bastante fácil de esquivar con un filtro rápido de preprocesamiento. No sé si bastaría con una eliminación de ruido tradicional, pero en el peor de los casos se puede correr una difusión img2img

    • Las imágenes contaminadas no son para ser vistas, sino para ser scrapeadas y pasar una revisión humana básica. Como habría que quitar el ruido de todo el dataset, en la práctica eso es difícil de hacer, y el punto clave es que estas imágenes son casi indistinguibles de ejemplos normales del set de entrenamiento, pero aun así, con solo unas pocas muestras contaminadas, pueden empujar a voluntad la frecuencia de los prompts