2 puntos por GN⁺ 3 시간 전 | 1 comentarios | Compartir por WhatsApp
  • Modelo base de generación de imágenes de tercera generación de la serie Qwen-Image, con el objetivo central de Real(实) para ir más allá de imágenes atractivas y servir en tareas de productividad
  • Procesa hasta 4.5k tokens de entrada, generando de una sola vez layouts con mucha información y múltiples conceptos en paralelo o superpuestos, como periódicos, storyboards y exámenes
  • Renderiza texto de 10 px, fórmulas LaTeX y anotaciones manuscritas legibles, y también reproduce texturas finas como poros, cabello, piel y pinceladas
  • Soporta 12 idiomas, varias tipografías, más de 100 estilos artísticos y UI de web, juegos y livestreaming; además puede buscar información reciente en internet e incorporarla en la imagen
  • Es un modelo que busca ampliar la generación de imágenes hasta convertirla en una herramienta de productividad desplegable para diseño, creación de contenido, educación y comercio electrónico, incluyendo PDF de periódicos, storyboards de dramas cortos y UI complejas

Un modelo de tercera generación orientado a “Real”

  • Qwen-Image-3.0 es el modelo base de generación de imágenes de tercera generación de la serie Qwen-Image
  • La dirección clave de cada generación es la siguiente
    • Qwen-Image-1.0: Precision
    • Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
    • Qwen-Image-3.0: Real(实)
  • “Real” se compone de tres capacidades
    • Contenido rico: entrada de hasta 4.5k tokens y soporte para layouts complejos
    • Detalles realistas: reproducción de texto de 10 px y elementos finos como poros y cabello
    • Conocimiento profundo: generación apoyada en 12 idiomas, diversas UI y conocimiento del mundo
  • Su objetivo es llevar la generación de imágenes de “usable” a “práctica”, y de “agradable a la vista” a verdaderamente útil

Contenido abundante y disposición compleja

  • Puede renderizar en una diapositiva de matemáticas las relaciones espaciales, símbolos matemáticos, explicaciones de teoremas y la posición relativa de cada elemento
  • Con una instrucción de unas 3.7k tokens, genera en una sola pasada una cuadrícula 3×3 sin unir varias imágenes
    • Cada celda consiste en una infografía compleja que combina oraciones en chino e inglés, fórmulas, gráficos y personajes de cómic
    • En una sola imagen coloca un cómic de seguridad en túneles, una clase de geometría espacial, un análisis de estilo de «Chu Shi Biao», movimiento parabólico, parasitología, un diagrama médico de dolor torácico derecho, el teorema de Sylow, control interno bancario y una comparación de estructuras de ADN celular
  • Acepta instrucciones de hasta 4.5k tokens y entiende y renderiza layouts visuales de alta densidad informativa
  • Expansión horizontal

    • Se refiere a la capacidad de colocar múltiples elementos en paralelo dentro de un solo lienzo
    • Usa yuxtaposición semántica y control espacial para ordenar múltiples conceptos sin que interfieran entre sí
  • Profundidad vertical

    • Es la capacidad de descomponer el significado y representar por etapas interfaces superpuestas de forma lógica
    • Con una sola instrucción genera una estructura multipantalla con una vista de programación de VSCode, Qwen Chat, WeChat y un póster de café de goteo manual superpuestos
    • Cada capa mantiene el estilo y los detalles de su UI correspondiente

Desde texto pequeño hasta restauración pictórica

  • Texto pequeño y composición compleja

    • Renderiza texto pequeño de 10 px de forma legible
    • Puede generar áreas con mucho texto e ilustraciones, como una infografía de conocimiento sobre el tiburón ballena
    • Reproduce en una página de un artículo de geometría algebraica fórmulas LaTeX, superíndices y subíndices, letras griegas, numeración de teoremas, llaves, líneas de fracción y alineación en varias líneas
    • Mantiene la legibilidad de fórmulas y cuerpo de texto incluso con tipografía pequeña
    • Combina una textura de papel realista con texto denso para generar imágenes con formato de periódico
  • Edición y escritura a mano

    • Puede añadir anotaciones manuscritas en rojo sobre una página de libro
    • Incluye subrayados, líneas onduladas, círculos, flechas y notas cortas
    • Implementa un estilo de escritura natural, como los apuntes de clase de un estudiante de preparatoria
  • Expresión de texturas y restauración

    • En retratos describe elementos finos como poros, cabello y textura de la piel, y también puede expresar texturas delicadas de otros objetos
    • Restaura pinturas tradicionales dañadas o parcialmente perdidas de acuerdo con el estilo pictórico original y las pinceladas
    • En una pintura de combate de águilas, elimina manchas de moho y rastros de daño, y completa las partes faltantes manteniendo la intensidad de la tinta, la textura de las plumas y el equilibrio compositivo

Uso de idioma, UI y conocimiento del mundo

  • Soporta 12 idiomas, varias tipografías, más de 100 estilos artísticos y diversas interfaces de UI
  • Incluye ejemplos de renderizado preciso de japonés, coreano y español
  • Puede generar pantallas de UI realistas de varios tipos, como páginas web, juegos y livestreaming
  • Infografías basadas en conocimiento

    • Mantiene el sujeto principal de una foto real de un insecto y la amplía a una infografía de investigación
    • Incluye información taxonómica, anotaciones de características morfológicas, vistas ampliadas de detalle y barra de escala
    • Organiza el resultado en formato de figura de investigación utilizable directamente en publicaciones académicas
  • Información reciente y uso de IP

    • Además del conocimiento que ya posee, el modelo puede conectarse a internet para buscar información reciente
    • Busca el clima de Hangzhou del 21 de julio y genera una imagen de pronóstico del tiempo
    • Puede encontrar personajes de una IP específica y crear imágenes a partir de ellos
    • Genera una escena en la que Qi Baishi y Van Gogh presentan Qwen-Image-3.0 en una sala de livestreaming

Expansión hacia tareas de productividad

  • Con base en sus tres capacidades clave, soporta tareas de alto valor como PDF de periódicos, storyboards de dramas cortos e interfaces de UI complejas
  • Su meta es conectar la capacidad de generación de imágenes con valor de productividad en más campos, como diseño, creación de contenido, educación y comercio electrónico

1 comentarios

 
GN⁺ 3 시간 전
Comentarios en Hacker News
  • Se siente raro empujar este tipo de modelos al comercio en línea. Ajustan la ropa para que se vea bien en el cuerpo y hasta mejoran la iluminación, así que sigue siendo difícil saber cómo se siente y cómo queda realmente la ropa igual que antes de que se adoptaran

    • El objetivo a corto plazo es vender productos, pero el objetivo más ambicioso a largo plazo es cambiar las normas culturales para difuminar la frontera entre la publicidad y la realidad, de modo que al momento de comprar la gente común ni siquiera se haga esta clase de preguntas
      Dentro de 50 años, la misma “veracidad de la publicidad” podría verse como un pasado idealizado imposible de recuperar
    • Puede que lo que algunos quieren no sea tanto la IA generativa en sí, sino una transformación de imagen a imagen tipo “haz que se vea como si lo hubiera fotografiado un fotógrafo competente”
      Pero en una plataforma donde suben 1,000 productos nuevos al mes, parece que las fotos reales e imperfectas podrían incluso convertir mejor. En especial, las imágenes con aspecto 3D donde todas las variantes de color se ven iguales más bien generan rechazo
    • En los anuncios de muebles usados de Facebook Marketplace pasa algo parecido. La mayoría de las imágenes están arregladas con IA para parecer un catálogo de Pottery Barn, y solo al final muestran la foto del objeto real, lleno de rayones y daños, puesto en un garaje desordenado
    • Dudo que realmente distorsione menos que la forma tradicional de fotografiar a una modelo con la camisa puesta bajo iluminación perfecta por un fotógrafo profesional
  • Es curioso que en las meta keywords de HTML haya más de 100 términos relacionados con contenido adulto como hentai, nudes, etc.

    • Estas palabras clave se aplican globalmente incluso en páginas como https://qwen.ai/usagepolicy donde piden no usar el producto para contenido sexual
      Si ejecutas document.querySelector('meta[name="keywords"]').content en la consola puedes ver la etiqueta completa
    • Parece que alguna herramienta de optimización para buscadores agregó automáticamente las meta keywords. Puede que haya recopilado búsquedas comunes que incluyen qwen, incluso errores tipográficos como gwen o ben en contexto de contenido adulto
    • No sé qué valor tenga hoy la meta tag keywords, y solo le está agregando a la página más de 77 KB de datos inútiles
    • El equipo de Qwen seguramente también sabe que las comunidades de contenido adulto adoptan rápido los nuevos modelos de generación de imágenes, como se ve en Civitai. Parece una estrategia de SEO para exponer el modelo en resultados de búsqueda que ellos ya están revisando
  • Parece entrenado con salidas de GPT Image 1, y su característico tono amarillento es evidente
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...

    • GPT Image 1 también desarrolló un tono amarillento sin haber sido entrenado con salidas de otros modelos de generación de imágenes. Como la gente prefiere fotos suaves con luz de atardecer y los modelos de preferencia captan eso fácilmente, si optimizas el atractivo estético, todas las imágenes terminan con un leve tinte a menos que lo suprimas intencionalmente
    • Los tintes amarillos y rojizos son un problema muy común sin importar de dónde vengan las fotos de entrenamiento. Incluso startups de fotografía que entrenaron con imágenes originales tuvieron ese tinte, y siguió siendo difícil evitarlo
    • Como las imágenes generadas por IA ya forman parte de la web, con el web scraping normal no se pueden evitar las imágenes generadas dentro de los datos de entrenamiento
  • El árabe en el título de la imagen principal está claramente roto, pero al usar el modelo de verdad no pasa eso. Puede que la imagen principal no haya sido generada con Qwen Image 3.0

    • Es una buena prueba para evaluar modelos nuevos. Al probar GPT Image 2 y Nano Banana Pro con tamil y versos del Corán en árabe, sí los generaron correctamente, probablemente gracias a datos de entrenamiento muy amplios
  • Dijeron que “se necesitan 3,700 tokens para describir con precisión toda una cuadrícula de 3×3”, pero no publicaron el prompt, así que la demostración pierde fuerza

  • No dicen nada sobre si publicarán los pesos ni cuándo, así que me pregunto si eso aparece en algún otro lado

    • Como tampoco publicaron los pesos de Qwen-Image-2.0, esta vez también parece poco probable
    • Después de Z-Image y del primer Qwen-Image, parece que se pasaron por completo a un modelo cerrado. Solo por las imágenes publicadas, Qwen-Image 3.0 parece apenas una alternativa inferior frente a modelos propietarios como gpt-image-2 o nb-pro
    • Aunque los publiquen, Cursor, Azure y Amazon serían quienes los monetizarían, así que no hay mucha razón para hacerlo. A menos que OpenAI realmente se abra, las probabilidades son bajas
  • Les di 2 logos reales, una especificación completa del lenguaje de diseño y 3 capturas de pantalla de la aplicación, pero solo salieron 3 imágenes horribles, y ninguna coincidía con los logos originales que proporcioné

  • Probándolo en chat.qwen.ai, tanto la composición como la precisión anatómica ni siquiera llegan al nivel de Qwen Image 1. Salen resultados con tres piernas o ojos brillantes; la calidad es como la de Microsoft Lens antes de que lo retiraran

  • Ojalá hubiera existido este tipo de modelo cuando estaba en la universidad. Como aprendiz visual, habría entendido algunos temas mucho más fácilmente mediante diagramas e ilustraciones explicativas que con textos largos

    • Pero los diagramas generados no son más que imitaciones. Aunque pidas un póster que explique correctamente los componentes de un átomo, en vez de algo relacionado con nubes de probabilidad sale un dibujo de pelotas de ping-pong rojas, azules y grises orbitando en trayectorias circulares, y con suerte obtendrás un diagrama de capas electrónicas
      Le pedí a Nano Banana 2 un “póster infográfico para universitarios que explique cómo funciona el átomo” y generó un modelo de Bohr como de libro de ciencias de secundaria
    • Mi esposa metió todas sus recetas en la generación de imágenes de ChatGPT para convertirlas en páginas estilo revista, y el resultado quedó excelente. Está haciendo un recetario familiar para que los niños sepan qué comían cuando eran pequeños
  • Todavía queda un filtro amarillento por toda la imagen