- Black Forest Labs y mimic robotics desarrollaron FLUX-mimic combinando la columna vertebral FLUX 3, entrenada conjuntamente con imagen, video y audio, con predicción de acciones robóticas, y lo probaron y desplegaron en líneas de producción de Audi
- Mediante predicción de video, que representa más del 95% del cómputo total de entrenamiento, aprende contacto, movimiento, peso y causalidad, y también trata las acciones robóticas de baja dimensión como otra modalidad que representa la misma realidad física
- Justo después de añadir la predicción de acciones, la calidad de generación de video cayó hasta un 10%, pero se recuperó al nivel previo tras 3,500 pasos, confirmando que un solo backbone puede encargarse tanto de la generación como de la predicción de acciones
- Al integrar aprendizaje generativo y de representación con Self-Flow y conectar un decodificador de acciones liviano, logró menos de 80 ms de procesamiento del backbone y un tiempo total de respuesta del robot de 101 ms en una sola NVIDIA RTX 5090
- El modelo del mundo entrenado a gran escala con video general y tareas de manipulación puede adaptarse a nuevas tareas con pocas demostraciones y reintentar tras fallos, por lo que se aplica a trabajos de producción donde la automatización tradicional era costosa, como componentes flexibles y manipulación de precisión
Un solo backbone para generar contenido y controlar robots
- Después de que FLUX 1 y FLUX 2 se centraran en la generación de imágenes, FLUX 3 entrena imagen, video y audio juntos desde el inicio para generar contenido audiovisual de forma conjunta
- Black Forest Labs proporcionó una versión inicial de FLUX 3 a mimic robotics y desarrolló FLUX-mimic combinando la experiencia de ambas compañías en aprendizaje y despliegue robótico, junto con modelos fundacionales
- mimic se encarga de sus propios robots y del aprendizaje robótico, la manipulación avanzada y el despliegue en entornos de producción
- Black Forest Labs aporta modelos basados en visión y capacidades de aprendizaje y modelado multimodal
- FLUX-mimic es un modelo de video-acción para manipulación general basado en el backbone de FLUX 3, e integrado en el sistema full-stack de despliegue de mimic
- El mismo backbone genera contenido de imagen, video y audio, y al mismo tiempo ejecuta acciones en Physical AI
Aprender el mundo físico con predicción de video
- Más del 95% del cómputo de entrenamiento de FLUX 3 se usa en predicción de video
- Para crear video realista, debe aprender contacto, movimiento, peso, causa y efecto; si maneja mal estos elementos, el video resultante también se vuelve poco natural
- El proceso de renderizar con precisión el mundo está conectado con aprender cómo funciona ese mundo
- El audio es una modalidad de baja dimensión que representa menos del 0.5% de los tokens en video con audio a 720p
- Un modelo que entiende video puede aprender la causalidad entre habla sincronizada con movimiento labial y efectos de sonido vinculados a eventos físicos
- La acción robótica también es una representación de estado de baja dimensión estrechamente acoplada a la observación visual
- Acción, audio y cuadros de video representan parcialmente una misma realidad física
- La predicción de acciones no crea un modelo fundacional aparte, sino que conecta otra forma de observación al modelo del mundo ya existente
Calidad generativa recuperada tras aprender acciones
- Al añadir predicción de acciones al entrenamiento a gran escala, las puntuaciones de evaluación humana para generación de texto a video e imagen a video cayeron inicialmente hasta 10%
- La calidad se recuperó a medida que el modelo aprendió la estructura del espacio de acciones y alineó su representación interna del mundo, y tras 3,500 pasos volvió al nivel previo de generación de video mientras también predecía acciones
- Hubo una confusión temporal al integrar la acción en entradas y salidas, pero no se sacrificó de forma permanente la capacidad de las habilidades existentes
- No se necesitan modelos fundacionales separados para generación de video y predicción de acciones; el mismo backbone único realiza ambas tareas
Una arquitectura que decodifica acciones desde la representación del mundo
- FLUX-mimic decodifica acciones robóticas desde la representación interna del mundo que FLUX 3 aprendió para generar video
- Siguiendo el método usado antes en mimic-video, extrae características intermedias de la ruta de predicción de video de FLUX y entrena encima un decodificador de acciones liviano
- El rendimiento depende de dos elementos conectados entre sí
- Calidad del modelo del mundo: si no entiende cómo se mueve el mundo, también es difícil una simulación precisa, y eso se conecta directamente con la calidad generativa
- Calidad de la representación: si las relaciones causales entre modalidades están entrelazadas de forma no lineal en el espacio de características, el decodificador de acciones debe interpretarlas con una dificultad similar a la de las entradas crudas
- Los modelos generativos ofrecen simulación de alta calidad y leyes de escalado predecibles al aumentar el cómputo, pero pueden producir representaciones menos disentangladas que los métodos especializados de aprendizaje de representación, lo que puede limitar su utilidad en tareas posteriores que requieren comprensión del mundo
Self-Flow integra aprendizaje generativo y de representación
- Self-Flow integra el aprendizaje generativo y el aprendizaje de representación en un solo framework
- Tras aplicarlo, mejoran tanto la calidad del modelo del mundo como la de la representación
- Mejora el rendimiento del modelo del mundo medido por la calidad de generación de video, imagen y audio
- También mejora la calidad de la representación medida por la tasa de éxito en tareas de control robótico simulado
- FLUX 3 amplía Self-Flow para aprender desde el principio dinámicas amplias del mundo y capacidades de manipulación
- Decenas de millones de horas de contenido general de video
- Cientos de miles de horas de contenido de video enfocado en manipulación humana y robótica
- Este entrenamiento a gran escala extiende los resultados de Self-Flow del laboratorio a entornos reales de producción y logística
Tareas de fábrica y rendimiento en benchmarks
- mimic desplegó FLUX-mimic en tareas reales de fábrica
- kitting de componentes en bandejas estructuradas
- inserción de unidades de control electrónico en fijaciones con poco margen
- ensamblaje de componentes
- manejo de materiales blandos y flexibles como hilos y cables
- Incluso con el backbone de FLUX completamente congelado, el decodificador de acciones mostró mejor rendimiento que los anteriores modelos visión-lenguaje-acción, mientras que los modelos previos no lograron completar la tarea en esa configuración
- Al afinar conjuntamente el backbone y el decodificador de acciones, FLUX-mimic registró tasas de éxito de primer nivel
- El entrenamiento a gran escala aporta al backbone conocimiento sobre el mundo y la acción, y Self-Flow permite decodificar fácilmente ese conocimiento desde la representación de características
Aprende con pocas demostraciones y se recupera de fallos
- Si las leyes físicas ya están contenidas en una representación accesible, adaptarse a una tarea nueva pasa a ser conectar esa tarea específica con conocimiento existente, en lugar de volver a aprender cómo funciona el mundo
- En los experimentos con Self-Flow, los pasos de entrenamiento de predicción de acciones necesarios para alcanzar la misma tasa de éxito se redujeron a la mitad frente a un modelo de video sin Self-Flow
- En el paper de mimic-video, el modelo de video-acción mostró una eficiencia muestral hasta 10 veces mayor que un modelo visión-lenguaje-acción, y FLUX-mimic combina ambos efectos
- Si el robot falla al agarrar un objeto, puede corregir su postura, volver a intentarlo y completar la tarea, lo que permite una recuperación natural ante fallos
- Como no es posible incluir todos los tipos de fallo en los datos de demostración, las conductas de recuperación no demostradas provienen de un modelo que ya aprendió cómo funciona el mundo
Un sistema robótico que responde en 101 ms
- En entornos reales, el modelo debe actuar al ritmo de los cambios del entorno, y la mayor parte del costo computacional de FLUX-mimic proviene del backbone, su componente más grande
- Una representación del mundo bien estructurada permite lograr el mismo rendimiento con menos parámetros, lo que hace posible usar un backbone más pequeño y rápido
- El backbone optimizado corre en menos de 80 ms desde la entrada hasta la generación de la representación del mundo en una sola NVIDIA RTX 5090, una escala comparable al tiempo de reacción visual humano
- mimic optimizó los siguientes elementos en toda la pila de despliegue para reducir latencia adicional
- decodificador de acciones
- latencia entre procesos entre sensores, modelo y actuadores
- chunking en tiempo real que solapa predicción y ejecución para evitar interrupciones del robot
- Con todas las optimizaciones aplicadas, el tiempo final de respuesta del sistema robótico autónomo es de 101 ms
Aplicación en la producción de Audi
- A pesar de su alto nivel de automatización, Audi seguía manejando manualmente componentes flexibles y tareas de manipulación de precisión
- La producción de productos premium tiene muchas variantes, por lo que rediseñar celdas robóticas programadas de forma tradicional para cada caso tiene un costo alto
- Los sistemas basados en aprendizaje cambian esa estructura de costos
- Audi Production Lab colaboró con mimic para probar y desplegar FLUX-mimic
- Realiza manipulación compleja de objetos blandos que antes era imposible con robots convencionales
- Puede utilizarse para apoyar al personal, mejorar la eficiencia y ampliar la automatización flexible en producción y logística
- La eficiencia muestral y la robustez de FLUX-mimic no provienen de ingeniería específica por tarea, sino del backbone FLUX 3 y de una representación decodificable, lo que facilita la transferencia entre tareas, industrias y hardware
- Un único modelo basado en inteligencia visual genera imagen, video y audio al mismo tiempo que impulsa robots en la línea de producción
1 comentarios
Comentarios de Hacker News
Parece que dentro de un modelo multimodal de generación de video bien entrenado se forma un modelo de representación del mundo, y que al extraerlo y aplicarlo a robots también funciona bien
La idea de que un modelo de video entiende la materia, la luz y el mundo no es nueva, pero es raro ver que un laboratorio de video se convierta en un laboratorio de robótica. Podría ser una ruta de negocio donde primero escalan con generación de video y luego usan esa capacidad para entrenar robots
También es interesante la mano de BFL, que parece ocultar varios dispositivos dentro de un guante. Robotics-1 de Xiami crea videos de entrenamiento con un gripper común y un guante tipo gripper, pero el modelo de BFL parece no necesitar ese equipo. Como el hardware es un campo difícil, da curiosidad ver qué enfoque tomarán en adelante
https://waymo.com/blog/2026/02/the-waymo-world-model-a-new-f...
Luma Labs https://lumalabs.ai/news/luma-open-physical-ai-lab
Runway https://runway.com/product/robotics
Cerca del minuto 3:30 fue bastante sorprendente la escena donde el brazo robótico vuelve a encajar el marco de la ventana después de intentarlo tres veces. Es la primera vez que veo una resolución de problemas tras un fallo así, y me pregunto si es una técnica nueva
En la explicación de que “para tareas que requieren comprensión del mundo, las representaciones menos separadas son menos útiles”, da risa que usen la expresión representaciones menos disentangladas para referirse a algo “más entrelazado”. Al explicar el mundo real, el concepto mismo termina más enredado; suena muy a redacción de LLM
Es triste que la tecnología haya avanzado tanto y, sin embargo, las películas parezcan peores que nunca. A veces termino viendo cine de hace décadas para encontrar algo decente, y aunque usaban marionetas ridículas, la construcción de la historia era 1,000 veces mejor
Esto no es solo un problema del venture capital, también se relaciona con el llamado Hollywood No. Por otro lado, quizá el problema sea el propio Hollywood No, y en la industria de los videojuegos esto se ha llamado positividad tóxica
Da gusto ver colaboración entre startups europeas
Esto es el futuro, pero también ya es el presente. Ojalá compartan esto incluso con conocidos que están fuera del desarrollo de software y la ingeniería
Vamos directo hacia una crisis en la que el valor de los humanos que no poseen los medios de producción caerá todavía más. Parece que se vienen tiempos sombríos