La mayoría de los catálogos de modelos de imagen reúnen solo los buenos resultados. Lo que realmente hace falta —“esto no funciona”—
no suele estar. Por eso generé 561 imágenes, conservé 475 y publiqué también las 65 descartadas, junto con la explicación de por qué fallaron. Tanto las conservadas como las descartadas tienen sus seeds, así que se pueden reproducir tal cual.
El coreano funciona. Pero las palabras que se equivoca las escribe mal siempre igual
Al principio, viendo una sola imagen, escribí que “aunque le pidas texto en coreano, lo escribe mal”, pero tras probar seis casos vi que era una afirmación exagerada. Cuatro salieron correctamente. Fideos, biblioteca, “salida 3” (número + coreano),
“menú recomendado de hoy” (tres palabras, 6 sílabas).
La longitud no es la variable. Puede con 2 sílabas y con 6, pero falló con 4.
Los dos errores son interesantes. “Fideos honestos” salió como “fideos estáticos”, y aunque cambié la seed,
salió exactamente igual (1167746582, 1910572019). El mismo typo dos veces. No fue suerte de la seed,
sino un problema de esa palabra. “Restaurante Hanbat” se convirtió en una sílaba inexistente más “restaurante”.
Ambos se rompieron en la consonante final, pero también hay consonantes finales en las palabras “guk”, “neul” y “cheon”, y esas salieron bien, así que no voy a concluir la causa a partir de solo dos casos.
Así que, si se equivoca, no vuelvas a probar otra seed: cambia la frase. Aunque lo intentes de nuevo,
falla en el mismo lugar.
Dibuja las letras que le das. No puede dibujar las letras que tiene que inventar
Durante tres tandas pensé erróneamente que “el número de cadenas de texto era el límite”. Para encontrar ese límite, subí solo la cantidad de textos en la misma placa de 1→8 y los ocho salieron correctos.
La cantidad no era la variable. Al revisar los fallos anteriores, el punto de quiebre queda claro.
- Menú de cafetería: los tres ítems escritos en el prompt salieron correctos; el resto, CAPEME, CABIELO
- Línea de tiempo: al definir solo el rango de años, aparecieron los años, pero fallaron las etiquetas
- Mockup de kanban: como no di los nombres de las columnas, las tres columnas dijeron “Kanban”
Escribe en el prompt, tal cual, todo el texto que debe aparecer en pantalla. Ocho no es el límite; simplemente fue el punto donde dejé de probar.
Aun así, escribirlo no siempre basta. Volví a ejecutar los tres casos que habían fallado originalmente, esta vez indicando solo los textos: en el menú acertó las diez líneas, en los lomos de libros acertó 10 de 12, pero en el mapa de rutas acertó 4 de 9. Si el texto es pequeño y está rotado en varios ángulos, aparece una segunda restricción.
Escribí “las manos en general salen bien” y lo retiré tres horas después
Fijé la iluminación y la composición, aumenté la dificultad de manos en 8 niveles, las amplié 1.5~2 veces y escribí que “7 de 8 son anatómicamente razonables”. Era la frase que más se iba a difundir, porque iba contra la opinión común.
Dos horas después de publicarlo en r/StableDiffusion, llegó un comentario: “La de tres dedos tiene seis dedos”.
La amplié 4 veces y tenía razón. 20 minutos después, otra persona señaló las manos superpuestas.
“Esa también está mal: solo hay cuatro.”
Dos personas encontraron 3 de las 8 imágenes haciendo una cosa que yo no hice. Contarlas.
Así que bajé toda la categoría. No volví a calificar una por una. La herramienta que falló fueron mis ojos; si juzgaba las cinco restantes con los mismos ojos, cometería el mismo error por tercera vez. Moví las 8 imágenes completas a la sección de fallos, con sus seeds.
Otros resultados de medición
- Cuenta objetos, pero no atributos. “Exactamente N” huevos salió bien de 2 a 8, pero
“exactamente dos colores” produjo cuatro colores. Si puedes señalar cada cosa una por una, puedes pedir una cantidad; si estás contando colores, zonas o fuentes de luz, cuenta tú mismo el resultado. - Si llamas a la iluminación por el nombre del equipo, el equipo aparece en la imagen. En los dos prompts donde escribí “softbox”,
el softbox apareció como sujeto. Escribe lo que debe hacer la luz. - Aunque escribas “seamless”, no queda tileable. De 8 patrones, solo 1 encajó, y aun así
fue un caso de rayas verticales donde los bordes coincidieron automáticamente. - “straight down” es una solicitud, no una instrucción. De 8 tomas aéreas, cinco salieron en diagonal. Si hay algo vertical, como una grúa o una casa, la cámara baja para mostrarlo.
- Las comparaciones de tamaño cambian el sujeto. Pedí “un escarabajo del tamaño de un pony” y salió un pony con arnés. No había escarabajo.
- No se puede insertar a la misma persona en otra foto. Con strength 0.45 se conserva la cara, pero también se arrastra toda la composición; con 0.72 se convierte en otra persona. No hay un valor intermedio que funcione.
- image-to-image no puede agregar ni quitar objetos. En cambio, la conversión de medio (foto→gouache, etc.) es estable. Rango de strength 0.50~0.60.
El costo total fue de $4.54 (fal.ai, $0.008 por megapíxel).
README en coreano: https://github.com/sjh9714/awesome-krea-2/blob/main/README_KO.md
Ver todas las imágenes: https://sjh9714.github.io/awesome-krea-2/
Recetas de edición extraídas como skill de agente: https://github.com/sjh9714/same-frame
Aún no hay comentarios.