1 puntos por GN⁺ 2 시간 전 | 1 comentarios | Compartir por WhatsApp
  • Es un modelo fundacional multimodal que busca integrar generación, comprensión y predicción de acciones entrenando imagen, video y audio en una sola arquitectura; se ofrece en Early Access empezando por FLUX 3 Video
  • Aprende la estructura espacial de las imágenes, la dinámica temporal y física del video, y las relaciones entre eventos y sonidos del audio como restricciones mutuas, y escala datos y recursos de cómputo con base en Self-Flow
  • Genera videos con audio nativo de hasta 20 segundos en una sola pasada y, en evaluaciones iniciales, fue preferido en comparaciones hasta un 69% frente a Grok Imagine Video, 77% frente a Runway Gen-4.5 y 93% frente a Luma Ray 3.2
  • Soporta síntesis y edición de imágenes, además de renderizado de texto multilingüe, y puede usarse como modelo de acciones robóticas al ajustar finamente un backbone de video preentrenado con datos limitados específicos de la tarea
  • Lanzará de forma secuencial Video, Image, Action y FLUX 3 Dev con pesos abiertos; a largo plazo, el objetivo es unificar la predicción de percepción, acción y lenguaje en un solo modelo

Un modelo multimodal que aprende la realidad de forma conjunta

  • FLUX 3 trata imágenes, video y audio no como elementos separados, sino como observaciones de una misma realidad mediante distintos sensores
    • Las imágenes capturan la estructura espacial y las relaciones en un momento específico
    • El video restaura la dimensión temporal y revela movimiento, dinámica temporal y leyes físicas
    • El audio muestra fenómenos mecánicos y relaciones causales acústicas que son difíciles de detectar solo con visión
    • El lenguaje conecta esas percepciones con objetivos, abstracciones e instrucciones
  • Al aprender varias modalidades juntas, puede aprovechar restricciones mutuas: los sonidos deben coincidir con las colisiones, el movimiento debe seguir la masa y el futuro debe continuar desde el pasado
  • FLUX 3 es el primer modelo construido solo con estos principios, orientado a una inteligencia visual del mundo real que percibe, predice y actúa en entornos físicos y digitales
  • Los primeros resultados en creación de contenido y IA física muestran el potencial de este enfoque

Arquitectura unificada basada en Self-Flow

  • Self-Flow es un enfoque para alinear de forma eficiente la generación y comprensión multimodal en una sola arquitectura base
  • Con Self-Flow como base, FLUX 3 amplía de manera importante el cómputo y los recursos de datos para entrenar video, imagen y audio simultáneamente
  • Las comparaciones públicas usan Fréchet distance, normalizada con Flow Matching como referencia 100 para los errores de generación por modalidad, y la tasa de éxito en manipulación de cuatro grupos de tareas después del ajuste fino

Generación de video y audio nativo

  • FLUX 3 puede crear videos y audio variados de hasta 20 segundos de duración en una sola generación
  • El alcance soportado incluye:
    • Generación de texto a video
    • Generación de imagen a video, continuando un fotograma inicial o usando una imagen como referencia visual
    • Generación de video a video, trasladando elementos clave como un personaje original a una nueva escena o contexto
    • Continuación generativa de video y audio a partir de video y audio de entrada
    • Generación de keyframe a video, controlando la transición entre escenas especificadas
    • Diálogos multilingües
    • Diversos estilos visuales y relaciones de aspecto que van más allá de los formatos cinematográficos tradicionales
    • Encadenamiento agentivo que conecta clips individuales en secuencias multishot más largas
    • Una amplia variedad de estilos, desde grabaciones de videocámara hasta animación y video cinematográfico
    • Generación de tipografía y diseño de animación
  • Todas las salidas de video incluyen generación de audio nativo

Evaluación inicial de video

  • La evaluación preliminar se realizó con clips de texto a video de 10 segundos en 720p con audio
  • En evaluaciones comparativas, las tasas en las que FLUX 3 fue preferido fueron las siguientes:
    • Hasta 69% frente a Grok Imagine Video
    • 60% frente a Kling v3 Pro
    • 59% frente a Happy Horse v1 y 57% frente a Happy Horse 1.1
    • 52% frente a Seedance 2.0 y Gemini Omni Flash, respectivamente
    • 77% frente a Runway Gen-4.5
    • 93% frente a Luma Ray 3.2
  • Como el modelo y el harness que lo rodea aún están en desarrollo, los resultados son preliminares y se espera que mejoren durante el periodo de Early Access
  • Las áreas actualmente más sólidas son la captura de expresiones faciales humanas, la conexión entre eventos físicos y sonido, y el procesamiento multilingüe
  • Usando referencias visuales, puede combinar varios clips para crear secuencias de varios minutos mientras mantiene la consistencia de los personajes a lo largo de toda la escena
  • FLUX 3 Video está disponible en Early Access

Síntesis y edición de imágenes

  • FLUX 3 puede sintetizar y editar imágenes en diversos estilos, relaciones de aspecto y resoluciones
  • En evaluaciones preliminares de una etapa intermedia de entrenamiento, mejoró de forma notable respecto a versiones anteriores de FLUX en el manejo de prompts complejos y la generación de texto
  • Puede generar diversos estilos de salida y renderizar texto en varios idiomas con alta precisión
  • Los resultados de evaluación aún son preliminares y se seguirán mejorando antes del lanzamiento oficial
  • El Early Access de FLUX 3 Image está planeado para comenzar en las próximas semanas

Predicción de acciones y aprendizaje robótico

  • Para extender la comprensión del mundo real hacia la predicción de acciones, se usan dos rutas:
    • Ampliar el trabajo inicial de Self-Flow para integrar predicción de acciones nativa en FLUX 3
    • Usar el backbone de video preentrenado como base que entiende la dinámica y ajustar finamente modelos de acción especializados con datos limitados específicos de la tarea
  • Junto con mimic robotics, socio de acceso inicial, se desarrolló FLUX-mimic

Lanzamiento secuencial por función

  • Cada función estará disponible durante las próximas semanas y meses tras pasar por Early Access, para un lanzamiento fluido, recolección de feedback y pruebas estrictas de seguridad
  • Todas derivan del mismo modelo multimodal basado en Flow Matching
    • FLUX 3 Video: generación y edición de video y audio mediante API y acceso a pesos privados
    • FLUX-mimic·FLUX 3 Action: predicción de acciones para socios de investigación y comerciales seleccionados, empezando por mimic robotics
    • FLUX 3 Image: síntesis y edición de imágenes mediante API y acceso a pesos privados
    • FLUX 3 Dev: pesos abiertos del backbone multimodal para generación de contenido de video, audio e imagen y predicción de acciones
  • También se publicarán más detalles técnicos del enfoque base, y se puede solicitar Early Access

Integración de percepción, acción y lenguaje

  • Entre sus futuras aplicaciones destacan la edición interactiva de imágenes y video, simulación, uso de computadoras e IA física
  • Mientras se lanzan gradualmente las funciones actuales, también avanza el desarrollo de modelos de próxima generación
  • El objetivo final es combinar la predicción de percepción, acción y lenguaje en un solo modelo unificado

1 comentarios

 
GN⁺ 2 시간 전
Opiniones de Hacker News
  • Esperan que la versión con pesos abiertos sea de máximo rendimiento (SOTA).
    Dicen que en las próximas semanas o meses ofrecerán FLUX 3 Dev, un modelo base multimodal para creación de contenido y predicción de comportamiento, con pesos abiertos, y que también publicarán los detalles técnicos del enfoque base.

    • La promesa de pesos abiertos es bienvenida, pero se comentó que promesas similares en el pasado no se cumplieron.
      Si el modelo base sale como versión Dev, solo con la publicación es difícil saber qué se queda afuera.
  • Casi no hay ejemplos con personas, usan a la ligera el término modelo del mundo, y aunque hablan de videos de 20 segundos, en realidad solo muestran jump cuts.
    Al final, todo lo importante queda en “próximamente”.

    • En /r/stablediffusion hay muchos ejemplos de video publicados.
    • Parece que el término modelo del mundo, usado en aprendizaje por refuerzo basado en modelos, ahora puede referirse incluso a cosas tan simples como una regresión lineal.
      Es posible que el campo del aprendizaje por refuerzo también haya tomado prestado ese término de las ciencias del comportamiento, así que quizá sea mejor aceptarlo. Es parecido a cómo filósofos y artistas visuales han usado mal orientado a objetos cada uno a su manera.
    • La forma de publicación fue muy rara, al punto de que me pregunté dónde se suponía que había que ver los videos.
  • La reacción aquí es sorprendentemente negativa y cínica, pero a mis ojos el rendimiento de este modelo es bastante impresionante.
    También se dice que la gente negativa siempre es la primera en dejar comentarios hirientes, así que pienso esperar y ver.

    • Sería interesante analizar en series temporales el tono de HN.
      Últimamente siento que hay mucho ambiente negativo en HN, y espero estar equivocado.
    • Es muy probable que realmente sea un buen modelo, pero después de que Qwen-Image-3 mostrara imágenes que parecen renderizadas con LaTeX y la capacidad de componer varios elementos en paralelo o con profundidad, me pregunto si enfocarse solo en la calidad visual es del todo correcto.
    • Estoy usando activamente los LLM de alto rendimiento más recientes para programar y crear herramientas de automatización, encargándoles el trabajo pesado de conectar distintos proyectos open source para crear nuevos proyectos.
      Si tienes un entorno de ejecución adecuado y entiendes lo suficiente del área como para detectar cuando el modelo cae en razonamientos erróneos o produce resultados sutilmente incorrectos, soy bastante optimista. En cambio, al ver cómo las redes sociales se llenan de imágenes y videos horribles generados por IA, soy mucho más pesimista sobre la posibilidad de que los generadores de imágenes y videos totalmente sintéticos sean útiles en la realidad. En manos de millones de personas, parecen usarse más de forma dañina que beneficiosa para la sociedad.
    • Comparado con el holodeck de Star Trek, esto no me parece tan interesante.
    • Como Martin Scorsese ahora participa como asesor, parece que BFL seguirá posicionándose como un laboratorio para cineastas.
      Si este modelo de video está a un nivel similar a Seedance 2.0, su costo sería demasiado alto para generar contenido de baja calidad, y es más probable que entre en el pipeline de VFX de proyectos.
  • Me pregunto si hay alguien entrenando modelos con datos táctiles.
    Lo que más quiero de los robots es que toquen objetos, pero solo se les da audio, video e imágenes, así que un modelo que nunca ha tocado nada tiene que aprender cómo hacer contacto. Tal vez por eso los robots parecen dudar cuando tocan objetos.

    • Es más rápido simular el contacto que darles datos táctiles reales, y así aprenden mucho más rápido.
  • Flux 2 Dev Klein fue, en la práctica, el mejor modelo disponible para hardware comercial común.
    Espero que Flux 3 incluya un modelo actualizado equivalente con pesos abiertos; si no, será una gran pérdida para muchos usuarios aficionados.

  • Es el primer proyecto de IA surgido de Europa que me genera grandes expectativas.

  • Dicen que están contratando en Freiburg im Breisgau; me pregunto si allí pueden conseguir talento localmente.

    • Freiburg es un lugar muy hermoso.
      Un amigo que vive allí disfruta salir en bicicleta de ruta por las montañas cercanas, y otro en invierno hace esquí de fondo durante la hora de almuerzo.
    • Vivo cerca y es una de las zonas con más sol y mejores paisajes de Alemania.
      No sé mucho sobre el pool de talento, pero hay una universidad.
    • La University of Freiburg es bastante reconocida.
      Para una startup fuera de SF, contratar en una ciudad universitaria es una estrategia común.
    • Hay una razón por la que la gente le dice Flyburg im Nicegau.
    • Hoy en día, no estar en Estados Unidos puede ser más bien una ventaja para muchos posibles candidatos.
  • Pensé que era un video real hasta que empezaron a bailar en una habitación inundada.

  • La versión 2.3 fue excelente, y por los videos y evaluaciones publicados por quienes recibieron acceso anticipado, parece que este modelo será el nuevo máximo rendimiento para uso doméstico, así que tengo muchas expectativas.

  • Si el modelo debe aprender a representar los sonidos del mundo y de los eventos, espero que, por diversión, le metan al entrenamiento una cantidad irrealmente grande de Wilhelm scream.

    • Si colocas una junta de goma con demasiada brusquedad, puede gritar, así que habrá que tratarla con cuidado.