- Un modelo base que mitiga la escasez de datos en modelos de políticas robóticas al preentrenarse con 100 mil horas de trayectorias UMI independientes del robot y luego afinarse con datos de robots reales
- Se anotaron automáticamente más de 1,700 escenarios para aprender capacidades generales de generación de acciones, y en el ajuste posterior se alineó con distintas morfologías robóticas y comandos en lenguaje natural
- A medida que crecieron los datos y el modelo de preentrenamiento, disminuyó el error de acción en validación, y tras el ajuste posterior también aumentó de forma sostenida la tasa de éxito en robots reales medida en entornos y objetos desconocidos, sin señales de saturación
- Con menos de 10 horas de demostraciones por tarea en promedio, logró una tasa de éxito global de 75% en empaquetado de teléfonos, reabastecimiento de impresoras, carga de ropa para lavar y empaquetado de cajas; con menos de 40 horas en promedio alcanzó 85%
- Logró el mejor rendimiento en RoboCasa, RoboCasa365, VLABench y RoboDojo, mostrando que el efecto de generalización del preentrenamiento UMI a gran escala se traslada tanto a la adaptación en robots reales como a evaluaciones estándar
Aprendizaje en dos etapas para superar la barrera de datos en robótica
- Los modelos basados en lenguaje y visión han mejorado conforme aumentan los datos, los parámetros y el cómputo, pero los modelos de políticas robóticas han estado limitados en su escalabilidad por la falta de datos de gran escala y alta calidad
- Xiaomi-Robotics-1 usa un método de aprendizaje en dos etapas: preentrenamiento con datos UMI a gran escala independientes del robot y ajuste posterior con una cantidad relativamente pequeña de datos de robots reales
- Con ello evalúa si los patrones de escalado de los modelos de políticas robóticas y las mejoras del preentrenamiento se transfieren al rendimiento en robots reales
Composición de los datos de preentrenamiento y ajuste posterior
- Los datos de preentrenamiento están compuestos por 100 mil horas de trayectorias UMI
- Cubren más de 1,700 escenarios y diversas tareas, incluyendo hogares, instalaciones comerciales, entornos industriales y espacios al aire libre
- Se desarrolló un pipeline de anotación automática que divide las trayectorias en segmentos de longitud fija y registra en lenguaje los cambios de estado de la escena en cada segmento
- Para el ajuste posterior se usa un conjunto de datos que abarca múltiples morfologías robóticas
- Datos de robots reales recopilados internamente
- Datos robóticos open source filtrados
- Datos UMI de alta calidad cuidadosamente seleccionados
- Los datos propios incluyen más de 7,200 horas de tareas reales con robots recopiladas en hogares reales
- Incluyen tareas como ordenar sofás, clasificar zapateras y guardar utensilios de cocina
- Los datos UMI para el ajuste posterior se anotan manualmente con intervalos de tiempo y prompts de instrucciones
- Es un enfoque distinto de las descripciones automáticas de transiciones de estado usadas en los datos de preentrenamiento
Preentrenamiento UMI y anotación automática
- El preentrenamiento es la etapa en la que el modelo se expone a diversos entornos y tareas reales para aprender representaciones generales de generación de acciones
- Como la escala de los datos dificulta la anotación manual, se construyó un pipeline automatizado usando un potente modelo de visión-lenguaje (VLM)
- Divide videos largos en clips de longitud fija
- El VLM describe en cada clip los cambios de estado del gripper y de los objetos con los que interactúa
- Genera un corpus a gran escala que combina trayectorias reales de manipulación con descripciones lingüísticas precisas
- El modelo se entrena para generar acciones que transformen la escena de acuerdo con las transiciones de estado descritas en lenguaje
- A medida que aumentan el tamaño de los datos y del modelo, se observa un claro patrón de escalado en el que el error de acción en validación disminuye de forma continua
Alineación con robots reales y comandos en lenguaje natural
- El ajuste posterior alinea la capacidad de generación de acciones adquirida en el preentrenamiento en dos ejes
- Alineación con la morfología robótica: mapea la capacidad general de generar acciones a robots físicos mediante datos reales de alta calidad y múltiples morfologías
- Alineación con instrucciones: transforma un modelo que recibía descripciones de transiciones de estado para que entienda y ejecute directamente comandos en lenguaje natural
- El modelo ajustado puede usarse en diversas tareas reales de movilidad y manipulación sin ajuste adicional
- Para verificar si el efecto de escalado del preentrenamiento se transfiere, se evalúa el rendimiento en robots reales con entornos y objetos nunca vistos
- A medida que crecen los datos y el tamaño del modelo de preentrenamiento, la tasa de éxito en robots reales también aumenta de forma sostenida y predecible
- Los modelos de preentrenamiento más fuertes mantienen un mayor rendimiento en robots reales incluso después del ajuste posterior
- No hubo señales de saturación en la mejora de la tasa de éxito conforme crecían los datos y el tamaño del modelo
Aprender nuevas tareas con pocos datos
- Xiaomi-Robotics-1 se adapta a tareas nuevas y complejas con solo unas pocas horas de demostraciones en robots reales por tarea
- Se usaron como tareas de evaluación el empaquetado de teléfonos, el reabastecimiento de impresoras, la carga de ropa para lavar y el empaquetado de cajas
- Con un promedio de menos de 10 horas de demostraciones por tarea, obtuvo una tasa de éxito global de 75%, superando ampliamente el 40% del modelo base Ï0.5 con el mismo presupuesto de datos
- Empaquetado de teléfonos: XR-1 70%, Ï0.5 30%
- Reabastecimiento de impresoras: XR-1 70%, Ï0.5 20%
- Carga de ropa para lavar: XR-1 80%, Ï0.5 40%
- Empaquetado de cajas: XR-1 80%, Ï0.5 70%
- Al aumentar a un promedio de menos de 40 horas por tarea, la tasa de éxito global sube a XR-1 85% y Ï0.5 53%
- Empaquetado de teléfonos: XR-1 80%, Ï0.5 40%
- Reabastecimiento de impresoras: XR-1 60%, Ï0.5 20%
- Carga de ropa para lavar: XR-1 100%, Ï0.5 50%
- Empaquetado de cajas: ambos modelos 100%
Rendimiento en cuatro benchmarks de simulación
- Logró el mejor rendimiento en los 4 principales benchmarks de simulación centrados en generalización
- RoboCasa: tasa de éxito promedio de 74.5%, una mejora de 2.6% frente al 72.6% del segundo lugar
- RoboCasa365: 57.4%, una mejora de 23.2% frente al 46.6% del segundo lugar
- VLABench: 59.1%, una mejora de 11.1% frente al 53.2% del segundo lugar
- RoboDojo: 13.93%, una mejora de 58.3% frente al 8.80% del segundo lugar
- Los efectos de generalización y escalado obtenidos en el preentrenamiento también se trasladan a evaluaciones estándar en simulación
Resultados de escalado y alcance de uso
- El preentrenamiento UMI a gran escala alivia el cuello de botella de datos en robótica, y la alineación con robots reales e instrucciones transfiere la capacidad general de generación de acciones a robots físicos
- La mejora de rendimiento según la escala de los datos de preentrenamiento y del modelo se refleja directamente en el desempeño listo para usar del robot real tras el ajuste posterior
- El modelo fundacional resultante se adapta a nuevas tareas con pocos datos y, al mismo tiempo, alcanza el mejor rendimiento en 4 benchmarks de simulación que evalúan generalización
- Como caso de uso real, también se publicó un video sin editar de empaquetado de maletas de viaje
1 comentarios
Opiniones en Hacker News
No entiendo las reacciones pesimistas aquí; vi el video con una sonrisa de oreja a oreja. ¿No significa que por fin llegó un robot que lava la ropa y que al menos el modelo se publicó gratis? Es el futuro que queríamos, y la robótica debería usarse precisamente para esto.
Este video incluye varias tareas clásicamente muy difíciles, así que si no te parece impresionante, deberías agradecer no haber tenido que construirlo tú mismo hace 10 años.
Incluye coordinación bimanual, un cuerpo móvil, objetos deformables, puntos de manipulación delgados como el cierre de una bolsa, y acciones de tomar varios objetos a la vez. Cada una de esas cosas se ha investigado por separado en percepción o manipulación, y son problemas que podrían dar para varias tesis doctorales.
Al ver un robot de dos manos, parece que muchas tareas serían más fáciles si tuviera una tercera mano con otras capacidades, como un agarre tipo tentáculo. Mientras más extremidades hay, también aumentan los problemas, pero la ventaja de tener más formas de sujetar y girar objetos es grande.
Quisiera llamar Slopfold a la forma en que aceptamos que un robot doble la ropa algo arrugada y de manera desprolija porque aun así es más cómodo que doblarla e plancharla con precisión.
El ritmo de avance es muy rápido y la inteligencia artificial dominará el futuro. Creo que apenas hemos arañado la superficie de lo posible, pero desde una mirada pesimista, pienso que las predicciones de Bill Joy fueron visionarias.
https://www.wired.com/2000/04/joy-2/
La parte que más me entusiasma del futuro esperado de la inteligencia artificial es la automatización del trabajo doméstico. En Oriente, las empleadas domésticas son relativamente baratas y fáciles de conseguir, pero en Occidente contratar a alguien para limpiar o hacer tareas de casa es casi un lujo. Paso una enorme cantidad de tiempo cada semana manteniendo la casa, y espero el día en que pueda recuperar ese tiempo.
Es aún más excelente porque el video no está editado. Se pueden mencionar muchas cosas que todavía no puede hacer, como escaleras o puertas estrechas, pero lo que ya puede hacer es sorprendente, y el panel de chat también mejora la interactividad.
Tiene sentido diseñar robots no humanoides. En el futuro, las herramientas y electrodomésticos también cambiarán para que humanos y robots los usen juntos, y la tirita del cierre de una bolsa de zapatos exige demasiada precisión.
Es más probable que la destreza, la duración de batería y la fuerza de humanoides baratos sigan mejorando gracias a enormes inversiones en aprendizaje de tareas reales, que rediseñar millones de objetos cotidianos para los robots especializados actuales.
Quiero enjambres de robots insecto que eliminen mosquitos, robots serpiente que reparen tuberías y robots araña que limpien superficies.
En unos años, Home Assistant y los LLM podrían coordinar las tareas del hogar mientras uno está fuera. Un LLM podría hacer un inventario de los objetos de la casa y enviar la aspiradora y el robot para ordenar.
Un LLM multimodal podría analizar fotos para distinguir qué va en el lavavajillas o la lavadora y qué necesita pulido, además de ordenar el clóset, tender la cama y cuidar las plantas. Podría trabajar todo el día mientras los paneles solares le suministran energía.
Me dedico a tiempo completo a las tareas del hogar y realmente quiero este robot. Odio doblar la ropa, así que siempre lo pospongo; aunque no tuviera la función de meterla en la lavadora, con que la doble me basta.