No despidas a tu ilustrador
(sambleckley.com)- La IA generativa de imágenes produce resultados plausibles mediante latent space, eliminación de ruido y conexión entre texto e imagen, pero tiene limitaciones estructurales para obtener con precisión una imagen específica deseada
- Stable Diffusion se entrena añadiendo ruido a millones de imágenes y restaurándolas de forma gradual, para generar imágenes plausibles a partir de ruido puro
- Los prompts de texto deben transformarse varias veces desde el espacio de palabras al espacio de imágenes, y normalmente solo pueden manejar unas 75 palabras a la vez, lo que dificulta el control detallado
- Las tareas donde el resultado no importa demasiado, como un header simple para un blog o textos para SEO, pueden ser reemplazadas rápidamente por IA generativa, pero las restricciones precisas como composición, pose, estilo y color requieren la intervención de un ilustrador
- En la ilustración comercial, es más realista un flujo de trabajo colaborativo donde una persona define el lineart, la composición y la idea principal, la IA completa detalles menos importantes como color, iluminación y fondo, y luego se vuelve a corregir
El latent space para entender Stable Diffusion
- Los colores, las palabras y las imágenes pueden representarse como listas de números, y una buena forma de representación hace que los elementos similares tengan números cercanos
- En el espacio de color hay varias formas, como RGB, Lch y CMYK, y cada una define de manera distinta qué significa “ser parecido”
- Los números no se parecen tanto a un archivo que guarda el color en sí, sino más bien a una etiqueta e instrucción que apunta a ese color
- Las palabras también pueden representarse con cientos de números; “mom” y “dad” pueden quedar cerca, mientras que “mom” y “prestidigitation” pueden quedar más lejos
- Las imágenes son más complejas que las palabras y los colores, pero se puede construir un espacio de imágenes con miles de números
- Si se enumeraran los valores RGB de cada píxel, harían falta millones de números
- Incluso imágenes semánticamente parecidas, como un gato negro y un gato blanco, pueden quedar muy alejadas si solo se observan los valores de píxeles
El image latent space toma prestado de los captions
- Muchas imágenes tienen captions, etiquetas o texto alrededor, así que se puede construir un espacio de imágenes a partir de la relación entre imagen y texto
- Las fotos etiquetadas como “cat” pueden colocarse cerca entre sí, y las etiquetadas como “car” también pueden agruparse cerca
- Una etiqueta como “Miyizaki cat-bus” podría ubicarse en algún punto entre gato y automóvil
- En la investigación sobre IA generativa, este tipo de espacio se conoce como image latent space
- El latent space puede aproximar con listas de números no solo casi cualquier imagen que uno quiera ver, sino también imágenes aleatorias e imposibles de interpretar
- Este espacio se compara con una Biblioteca de Babel para imágenes
Cómo funciona Stable Diffusion
- Stable Diffusion no es la única forma de generar imágenes, pero sí una de las más utilizadas
- El entrenamiento consiste en añadir un poco de ruido a millones de imágenes y enseñar a la computadora a restaurarlas limpiamente
- Después se agrega más ruido y se la vuelve a entrenar para regresar a una imagen menos ruidosa
- Si este proceso se repite hasta que la imagen casi desaparece, la computadora aprende a volver paso a paso hacia cualquier imagen
- También se entrena la conexión entre texto e imagen
- Es más probable que una foto de gato tenga un caption como “my cute kitty mister french fry”
- Y menos probable que tenga uno como “the engine from a 1959 Austin Healey”
- La cross attention conecta varios sistemas de IA para empujar la imagen, mientras se elimina ruido, hacia algo más cercano a un caption específico
- La IA generativa combina otros objetivos dentro del proceso de eliminación de ruido para orientar la imagen en una dirección determinada
Por qué los dedos y las caras salen mal
- El latent space no es un espacio que contenga tal cual las imágenes de entrenamiento, sino un espacio que representa todas las imágenes posibles
- La fuerza que aleja del ruido prioriza la nitidez de la imagen, y la fuerza que empuja hacia la etiqueta de texto se concentra en satisfacer imágenes que podrían recibir esa etiqueta
- Los captions de imágenes no suelen tratar con precisión las manos humanas o la cantidad de dedos
- Etiquetas negativas como “no deformed hands” tienen efecto limitado si hay pocas imágenes etiquetadas como “deformed hands”
- “polydactyly” puede funcionar mejor porque es una etiqueta más fuertemente asociada con dedos extra
- Con las caras pasa algo similar, y muchos sistemas generativos incluyen componentes separados para corregir rostros
- El sistema principal puede considerar suficiente que algo simplemente parezca una cara
- El ojo humano es muy sensible a la precisión facial, como la dirección de ambos ojos
- Incluir en el prompt el nombre de un autor como James Gurney puede mejorar la coherencia general de la imagen
- Los captions comunes suelen enfocarse sobre todo en sustantivos y sujetos principales
- El estilo de un autor es una gestalt distribuida por todos los píxeles de la imagen, no por una sola parte, y eso puede llevar a resultados más consistentes
Trabajos que la IA generativa puede reemplazar con facilidad
- Es poco probable que desaparezca el deseo humano por medios físicos como pintura real, escultura, grabado en madera o bordado
- Los resultados de esos medios físicos pueden seguir utilizándose para entrenar IA generativa
- Puede sentirse invasivo que una obra se use sin permiso para entrenamiento y para reemplazar medios de vida
- Pero la imagen no está dentro del latent space de una forma específica; en el mejor de los casos se puede recuperar una imagen parecida con cierto prompt y algo de suerte
- No está claro cómo permitir el uso justo por parte de artistas humanos y al mismo tiempo restringir legalmente solo los usos de ML
- La IA generativa sí puede reemplazar ilustraciones y parte de textos cuyo contenido en realidad no importa mucho
- Imágenes de header para blog vagamente relacionadas, puestas solo para completar el layout de la página
- Publicaciones semanales de blog tipo spam para SEO
- Estos resultados se parecen más a contenido-mueble que realmente no le importa mucho a nadie hasta llegar al consumidor final
- Ese trabajo ya de por sí no estaba bien pagado, está desapareciendo rápido y no se ve una salida clara ni siquiera con regulación legal fuerte
Por qué es difícil obtener una imagen específica
- Crear imágenes impactantes con IA generativa es relativamente fácil, pero crear una imagen específica a veces es casi imposible
- Tal vez 1 de cada 10 imágenes pueda parecer “genial”, pero eso no significa que sea realmente la imagen que se pidió
- En vitrinas de imágenes generadas como civitai se pueden comparar prompts muy largos con las imágenes resultantes
- Ese sitio puede ser NSFW
- A veces muchos elementos del prompt no aparecen para nada en la imagen
- Un concepto global como “a mystical dragon” puede destacar en el prompt y aun así no estar presente en la imagen
- Esta forma de uso se parece más a un gacha o a una tragamonedas para hacer dibujos
- Se mete un prompt con muchas ideas interesantes y se repite hasta que salga algo satisfactorio
- El resultado puede ser atractivo, pero quizá no sea la imagen solicitada
- Como el texto debe transformarse desde el prompt real al text latent space y luego a una función del image latent space, funciona mal como medio de control de imagen
- Normalmente solo se pueden procesar unas 75 palabras a la vez
- Si el texto es más largo, hay que dividirlo mediante sistemas de guía separados dentro de la cross attention
La entrada de imagen es un medio de control más fuerte
- Como las imágenes se traducen bien al image latent space, pueden servir como una restricción más directa que el texto
- Los prompts basados en imágenes permiten controlar con más detalle el contenido y la composición del resultado generado
- Crear una imagen reducida al mismo lineart que otra imagen
- Crear una imagen con el mismo mapa de profundidad extraído de otra imagen
- Crear una imagen que coincida con la pose tomada de otra imagen
- Crear una imagen con contenido distinto pero con el estilo de otra imagen
- Hacer que coincida con las líneas de perspectiva de otra imagen
- Hacer que coincida con la paleta de colores de otra imagen
- El problema es de dónde salen esas imágenes guía
- El rol de entender el concepto de ilustración deseado y traducirlo a lineart, boceto de pose y estilo se superpone con el del ilustrador tradicional
- Los trabajos de imagen generativa con requisitos sofisticados son difíciles de usar de forma útil sin ilustrador
Un posible flujo de trabajo con IA en la ilustración comercial
- Es muy probable que los ilustradores comerciales conserven su trabajo, pero tengan que aprender a usar IA como parte del flujo para ajustarse a una mayor velocidad de producción
- Eso no significa dejar de dibujar y convertirse en prompt engineer
- Hacer eso desperdicia una enorme cantidad de entrenamiento y ofrece poco a cambio
- Un posible proceso de pintura digital sería el siguiente
- Crear el lineart de forma tradicional, concentrándose en la composición y la idea principal
- Pedir a la IA generativa que proponga unas 12 opciones de color e iluminación
- Elegir 1 o 2 de ellas
- Repintar casi por completo sobre los píxeles creados por la IA, ajustando y corrigiendo el color según la intención
- Este método puede no encajar con autores que ponen mucho cuidado y emoción en la elección del color
- No existe una sola forma válida para todo el mundo, y quienes trabajan con fechas de entrega pueden usar IA para cubrir las etapas menos importantes y más tediosas
- Escenas con multitudes
- Paisajes urbanos
- Vegetación
- Muchas imágenes también tienen elementos necesarios pero no importantes, como la imagen de encabezado de una página, y ese espacio se está convirtiendo en el terreno de la IA generativa
La brecha entre producto e investigación
- La investigación en IA generativa avanza cada vez más hacia métodos para indicar la generación de imágenes a partir de entradas visuales
- Los productos que salen al mercado son difíciles de integrar fácilmente en el flujo de trabajo de un ilustrador
- Los experimentos para obtener un nivel de control realmente útil se han hecho ejecutando modelos con datos abiertos en computadoras personales
- La visión de futuro para la ilustración comercial se parece más a un proceso donde el ilustrador define lo esencial, la IA generativa completa las partes menos importantes y luego una persona vuelve a corregir
- Los productos de IA generativa también necesitan evolucionar para apoyar ese tipo de flujo de trabajo
1 comentarios
Opiniones de Hacker News
Otra opinión que a nadie le va a gustar, pero creo que el impacto de la IA en los artistas será como el impacto de Spotify en la industria musical. Es decir, es muy probable que mate los flujos de ingresos de todos salvo los publishers y los grandes artistas/jugadores
Spotify prácticamente eliminó el dinero que venía de la distribución física, y fue peor que la piratería, que en ese momento era inevitable. Al menos con la piratería uno no recibía dinero, pero tampoco tenía que pagar abogados para renegociar con los sellos
Lugares como Adobe y OpenAI parecen querer pagarles migajas a los artistas para que hagan ilustraciones para entrenar modelos, luego hacerles firmar una renuncia diciendo “estoy de acuerdo con no cobrar por este arte de IA”, y revender los resultados caro en sitios como Splice: https://splice.com/features/sounds
Al final, el modelo en sí casi no importará; el verdadero diferenciador será con obras de quién fue entrenado. Pero terminará siendo: “como esta imagen la hizo una IA, no tengo que pagarte”
Antes, las máquinas reemplazaban una o dos funciones laborales, pero si los humanos hacen que el entrenamiento de IA sea realmente eficiente, reemplazará cientos de funciones de una sola vez. Además, la IA también tiene el efecto de aumentar el aislamiento al reducir cuánto necesitamos a otros humanos
Por estas razones, creo que el mundo estaría mucho mejor sin IA, y que las empresas tecnológicas están arruinando el mundo con productos monstruosos
Spotify tomó la estructura económica de la piratería y le puso encima una capa delgada que parece legal
Primero, las imágenes generadas por IA son aleatorias y casi desechables. Obtendrás una imagen genial que puedes usar una vez, ¿pero después qué? Es difícil construir una campaña con eso
Segundo, el arte generado por IA no tiene protección de copyright, así que un competidor imitador puede usar libremente imágenes de marketing creadas con IA
Como mínimo, puedes usar el trabajo de un artista gráfico pago como semilla para la IA, y las imágenes de IA basadas en una semilla pueden tener protección de copyright. Pero ese artista lo hará mejor que un pasante no remunerado
Cuando era chico, los domingos por la tarde mi padre ponía un álbum y simplemente lo escuchaba. De verdad, solo escuchaba. Hoy muy poca gente hace eso
Ahora hay una gran demanda de música incidental que se escucha mientras se maneja, se lee, se navega por internet, se programa o se limpia. Desde que la música se volvió portátil hubo un cambio fundamental en la forma de consumirla, y Spotify simplemente ganó esa competencia
Comparado con los primeros tiempos de la música digital, tengo la impresión de que la distribución de medios físicos más bien está creciendo. Esto tiene más que ver con la digitalización de la música en sí que con Spotify
A mi alrededor veo mucha gente que compra merch o medios físicos para apoyar a sus artistas favoritos, más que para escuchar música en un formato físico real
Este tipo de textos suele asumir generación de texto a imagen y prompt engineering, normalmente porque falta experiencia usando directamente esos modelos. Salvo que sea para divertirse, ese enfoque no es, en esencia, la respuesta correcta
Los trabajos que requieren previsibilidad y control se parecen más a “dibuja el resto de los búhos de una forma similar a estos otros búhos que dibujé a mano”, combinado con photobashing y corrección/composición manual. Para crear resultados que no sean aburridos, es un terreno híbrido que exige tanto capacidad artística como técnica, parecido al CGI 3D
Esto no es un problema causado por la falta de comprensión del lenguaje natural del modelo, y aun si apareciera algo que razonablemente pudiera llamarse AGI, quizá ni siquiera entonces cambiaría mucho. Un prompt de texto no tiene capacidad suficiente para contener significado
Un prompt detallado y varios ejemplos del estilo deseado parecen suficientes. Claro que eso no significa que sea algo muy fácil, pero no parece requerir una innovación fundamental. Los componentes necesarios ya existen
Es parecido a llevar la IA a la escuela o hacer que aprenda rápidamente conceptos nuevos con una carga de datos al estilo Matrix. Los expertos aprenderán ese método, y el mercado también se formará alrededor de la gente que quiera hacer ese trabajo
Hace poco intenté hacer “un robot sentado frente a un humano jugando Magic: The Gathering”, y ya fue difícil lograr que incluyera al humano en la imagen; además, el modelo no conoce lo suficiente MTG y solo hace pattern matching con algo como “juego de mesa” o “juego de cartas”
Algunas imágenes generadas son mucho mejores que otras, así que me gustaría tomar la disposición de la mesa de una imagen y el robot de otra, pero por ahora eso es prácticamente imposible. “blend” tampoco sirve para ese uso
No dudo de que mejorará, pero me pregunto si hay una limitación más general por debajo. Quizá simplemente faltan datos. Incluso buscar Magic: The Gathering en Google Imágenes resulta bastante decepcionante
Como otro ejemplo, si pides un logo azul brillante grabado en un monolito de piedra, a veces el logo aparece grabado, pero rara vez, y nunca brillaba en azul. Normalmente todo el monolito, o una parte, se vuelve azul
Me gustó especialmente la parte que dice que “los ilustradores comerciales conservarán sus trabajos, pero en general tendrán que aprender a usar IA como parte de su flujo de trabajo si quieren mantener un ritmo de trabajo más rápido”.
A veces hago ilustraciones, pero mi estilo es bastante distinto de lo que hace la IA generativa. Hace poco publiqué la versión 1.1 de un manual de juego que usaba imágenes de Midjourney, y ahora estoy invirtiendo en un ilustrador de verdad, porque a las imágenes de Midjourney les falta personalidad.
Aunque eso podría cambiar en unos meses. Seguiré trabajando con un ilustrador por la consistencia de las imágenes, pero también es posible que la IA produzca resultados más vistosos.
El punto de “esto cambia en 2 meses” también es válido, pero eso se viene diciendo desde hace año y medio y todavía no ha cambiado cualitativamente. La calidad de las imágenes generadas mejoró, pero no al punto de ser un salto cualitativo.
Por cierto, el enlace de civitai lleva a https://sambleckley.com/writing/civitai.com/images, pero es un enlace muerto.
Enlace: https://youtu.be/FQ6z90MuURM?t=329
Junto con mi pareja manejo algunos pequeños negocios secundarios en Internet. Uno de ellos, un negocio D2C basado en contenido, dependía mucho de ilustraciones personalizadas para piezas de anuncios display; el CTR era decente y promedio, pero el CPC era demasiado alto y el ROAS realmente malo.
Hace unos meses hicimos una prueba A/B entre nuestro ilustrador habitual y Stable Diffusion, y el resultado fue bastante dramático. El CTR subió casi 20% y el CVR también mejoró de forma sostenida.
No estoy de acuerdo con la afirmación del artículo de que las imágenes generadas por IA funcionan mejor en negocios donde el contenido no importa realmente. Este negocio fue un gran contraejemplo. En nuestro caso, las imágenes generadas por IA conectaron mejor con el público objetivo y permitieron una personalización mucho más detallada a menor costo que antes.
El CPA también bajó mucho, y como podemos controlar de forma granular las variaciones de las piezas, se volvió posible optimizar en tiempo real según el segmento de audiencia. El tiempo de lanzamiento de nuevas campañas también se redujo a la mitad, y desaparecieron las discusiones sobre matices de diseño, los retrasos por fechas de entrega y los bloqueos creativos.
Me genera sentimientos encontrados que haya menos toque humano en el proceso creativo, pero desde una perspectiva puramente de growth hacking, cambió las reglas del juego, y tenemos los números para demostrarlo.
En general, lo veo como una ganancia neta. No tiene por qué ser el fin de los ilustradores humanos, pero los obligará a adaptarse de forma más sensible a las necesidades de los clientes. No tiene sentido que incluso un negocio de contenido sufra tanta fricción para conseguir piezas creativas.
En cualquier caso, hay eficiencia y hay alma. Los robots hicieron bastante bien lo primero y, a veces, sorprenden también con lo segundo.
Me pregunto si la reducción de idas y vueltas viene de la respuesta inmediata e interactiva, es decir, de tratar menos con personas, o de la confianza y delegación en la máquina.
Si es algo como “la máquina hizo este ícono a partir de mi descripción, así que no hace falta cuestionar la elección del color”, entonces es el clásico problema de considerar a la máquina infalible y más experta que un humano. Probablemente sea una mezcla de ambas cosas.
La importancia de los muebles en un espacio va en un espectro que va desde una sala de espera donde la gente se queda poco tiempo hasta el estudio de un arquitecto, y el arte comercial no es distinto. Si esa imagen fuera realmente irrelevante, tampoco habría razón para ponerla ahí.
Los gráficos no informativos que aparecen en la mayoría de las presentaciones de PowerPoint diseñadas de forma no profesional pueden ser todavía menos importantes. En cambio, diría que la imagen inicial de una apertura a doble página en un reportaje destacado de una revista tiene casi 0% de probabilidad de hacerse con IA, salvo que el artículo trate sobre imágenes generadas por IA. Incluso en ese caso, es muy probable que profesionales hayan pasado más tiempo refinando la forma que en casi todo lo demás.
En los flujos de trabajo gráficos profesionales, la especificidad y el control a nivel de píxel son demasiado importantes. Digan lo que digan quienes no son diseñadores profesionales, las herramientas actuales no encajan fundamentalmente con ese trabajo. La interfaz en sí está mal planteada.
Adobe o algún otro actor de la industria que entienda lo que se necesita podría resolverlo, pero eso no se parecerá a Midjourney.
“Ser más sensible a las necesidades del cliente” no es lo mismo que tener que leerle la mente al cliente. Si crees que esto no es una señal del fin para los ilustradores humanos en este mercado específico, te estás engañando.
Probé hacer que la IA escribiera mis textos y fue horrible. En cambio, cuando ignoré herramientas de IA como correctores gramaticales, resumidores, herramientas de reescritura y apps de voz a texto, el proceso de escritura se sintió lento.
Para mí, el punto medio funciona mejor. Uso IA generativa solo en la etapa intermedia del trabajo, no para la entrada —las ideas— ni para la salida —el borrador real—.
Mi forma de escribir es así. Las ideas surgen de reflexionar o de conversaciones en redes sociales. Los temas que se discuten ahí tienen al menos cierta relevancia validada.
Luego me siento unos 10 minutos y dicto mis pensamientos en una herramienta como AudioPen, que resume esos 10 minutos en 5 o 6 párrafos. Esa es la etapa de IA. Cuando la herramienta sugiere algunas estructuras de párrafos, las voy cambiando hasta encontrar una buena.
Después escribo yo mismo el borrador siguiendo ese esquema. Salvo por la revisión gramatical del final, ya no uso más herramientas de IA. La IA es una gran compañera de escritura, pero una escritora terrible.
La frase “los ilustradores comerciales conservarán sus trabajos, pero en general tendrán que aprender a usar IA como parte de su flujo de trabajo para mantener un ritmo de trabajo más rápido” coincide exactamente con la realidad que he visto.
Fuera de la comunidad de generación de medios con IA, todavía se piensa que es algo como ingresar texto y recibir un resultado. En realidad, se configura todo un flujo de trabajo para obtener el tipo exacto de imagen que se quiere.
Por ejemplo: https://old.reddit.com/r/StableDiffusion/comments/14ye2eg/co...
La segunda imagen es el resultado, pero la primera es más interesante. Es una interfaz basada en nodos, similar a la que se ve comúnmente en herramientas de desarrollo de juegos como Unreal Engine: https://docs.unrealengine.com/5.2/en-US/nodes-in-unreal-engi...
Es parecido a conectar APIs para obtener la imagen final. Creo que la generación de imágenes en el futuro se acercará más a la programación backend que a dibujar de verdad. Porque la parte de dibujar propiamente dicha se automatiza, y la creatividad queda en el flujo de trabajo en sí.
Por supuesto, algún día también se automatizará la parte del flujo de trabajo, pero como las computadoras aún no pueden leer la mente lo suficiente como para conocer la intención del usuario, eso todavía está lejos.
El artículo parece estar demasiado centrado en el presente. Los sistemas tipo Stable Diffusion han tenido mucho éxito con una técnica específica, pero sería ingenuo pensar que ese método mejorará infinitamente.
La “IA” generativa tomará muchas formas. Al final, probablemente elimine una parte importante del componente de técnica en la creación, quitándoles ingresos y relevancia a artistas y propietarios de contenido.
No ocurrirá de la noche a la mañana, pero durante más o menos la próxima década creo que la IA será más una herramienta útil que una amenaza.
En algún momento, espero que la IA generativa se convierta en un sistema multisensorial que incluya vista, sonido y tacto. Un sistema así creará representaciones nuevas y precisas usando descripciones ricas y una profunda conciencia contextual de la cultura, con base en modelos físicos de objetos y entornos.
Pensará en objetos y relaciones, no en píxeles, y los simulará, renderizará y filtrará para ajustarlos a los deseos del usuario.
Apoyo los esfuerzos de escritores y actores por protegerse de la competencia, pero creo que al final serán inútiles. La evolución legal en este ámbito será interesante.
Los sistemas generativos del futuro quizá necesiten una trazabilidad de auditoría que muestre cómo obtuvieron su comprensión del mundo, para demostrar que no hubo entrenamiento no autorizado. Pero eso solo elevará un poco el listón, y no impedirá derivar relaciones importantes por otros medios, como descripciones de alto nivel hechas en un entorno de clean room.
Por ejemplo, entrenar una IA con obras protegidas de Harrison Ford o con imágenes tomadas en lugares públicos podría ser ilegal, pero si se reduce a Harrison Ford a una serie de características y se las entrega a un sistema generativo, se podría crear algo indistinguible del Harrison Ford real. Si ese procedimiento puede documentarse, no parece que el sistema legal tenga muchas formas de impedirlo. Claro, no soy especialista en este campo.
Para que conste, no me gusta la “IA” actual. Los LLM me parecen especialmente poco confiables y, en general, inútiles. El arte generado por IA también suele resultarme aburrido, impreciso o de algún modo poco convincente. Aun así, creo que la tendencia se vuelve cada vez más clara.
No entiendo por qué se considera impopular la idea de que “los ilustradores comerciales conservarán sus trabajos, pero en general tendrán que aprender a usar IA como parte de su flujo de trabajo para mantener un ritmo de trabajo más rápido”. Me parece el camino lógico hacia adelante.
Es como CoPilot: no me reemplaza, pero hace que cierto código repetitivo sea mucho menos doloroso y me ayuda a evitar la página en blanco o el bloqueo al escribir cuando intento crear una función.
Es mejor partir de algo y modificarlo hasta que tenga la forma necesaria que empezar desde cero. Incluso si al final termino rehaciendo el 80–99%.
A un artista también podría servirle ver algunos ejemplos de cómo podría verse su line art para estimular su creatividad, y después trabajar como quiera.
Los ilustradores con los que más me gustaría trabajar son quienes aprovechan todas las herramientas disponibles para crear la mejor imagen posible.
Estoy de acuerdo con la mayor parte, pero no con lo de generar una imagen específica. Eso claramente es una habilidad que se puede desarrollar.
He enseñado mucho a la gente cómo simplificar prompts para IA generadora de imágenes y elegir el lenguaje adecuado. Curiosamente, la gente mete muchas cosas innecesarias, probablemente casi como una superstición del tipo “este fragmento de frase funcionó bien varias veces la vez pasada”.
Como dice el texto, el camino a seguir es un enfoque híbrido que lo use como herramienta dentro de una cadena de varias herramientas.
También hay conceptos que la IA directamente no entiende. Por ejemplo, ahora Midjourney sufre muchísimo con cosas como “bulldozer”, “centauro” o “arquero de fantasía”. Estas cosas inevitablemente se corregirán en nuevas versiones de modelos con mejores datos de entrenamiento, y en el pasado se han corregido así.
La verdadera dificultad viene de los detalles pequeños o de la información semántica. Por ejemplo, es difícil pedir una escena realista/fotográfica en la que incluso el fondo esté enfocado, y ni siquiera funciona bien usando palabras clave como “focus stacking”. “selfie” fue la mejor palabra que encontramos, pero lamentablemente tiene muchos efectos secundarios.
Puede que no haya suficientes ejemplos en los datos de entrenamiento que describan específicamente ese atributo, pero, sinceramente, aprender las palabras en inglés para expresar ese concepto ya es difícil de por sí.
En el caso de los detalles pequeños, el enfoque actual no va a escalar para manejar pedidos como “seis cubos azules, cada uno con un triángulo rojo pegado, dispuestos en forma de pirámide, con una pelota amarilla balanceada encima”. Pero, como dice el autor, es probable que ese tipo de cosas se resuelva con recursos creados por separado y un mínimo de habilidad en Photoshop.
Al hablar de los problemas técnicos de los prompts, omitió por completo esa parte.
El problema de los prompts no son los cubos apilados. Si le pides a 10 ingenieros de software, 10 personas de ventas y 3 altos directivos que propongan ideas visuales para un anuncio, saldrán imágenes basura sobre fondo negro, robots, animación, malas copias de algo que vieron en alguna parte y recuerdan inconscientemente, y 0 ideas visuales que realmente funcionen.
Los diseñadores e ilustradores tienen que enfrentarse constantemente a esos clichés e ideas pésimas y darles la vuelta para crear un producto decente.
Lo veo casi igual con GPT y el código. He visto a gente inteligente que no programa pedirle cosas a GPT y obtener algo que funciona, pero pasar de “escríbeme algo que presione una tecla automáticamente con un temporizador” a “actualiza el repositorio para que el cliente maneje esta lógica de negocio y esta funcionalidad” es un salto enorme.
Desde mi punto de vista, todavía tiene que hacer el trabajo alguien con mentalidad de desarrollador, y la IA solo hace la vida un poco más fácil en ese proceso.
Creo que en el arte pasa lo mismo. Es fácil obtener una imagen que parezca aceptable, pero obtener una imagen específica y significativa normalmente requiere mucho posprocesamiento que una persona común no puede hacer.
Ya vimos avances enormes. Las herramientas de codificación basadas en LLM están mejorando, los propios LLM están mejorando y el tamaño del contexto está creciendo. El interés en los LLM también está impulsando el desarrollo de nuevos enfoques más efectivos.
En unos años, ya sea algo tipo JEPA de Lecun, algún supercoder híbrido que esté creando DeepMind, o un LLM open source, va a aplastar a GPT-4 en programación.