- Google DeepMind presentó la familia de modelos Gemini Robotics 2, que convierte entradas visuales y de lenguaje en acciones para controlar humanoides desde los pies hasta las puntas de los dedos, y admite manipulación precisa y colaboración entre robots
- La familia está compuesta por Gemini Robotics 2, un VLA para control de cuerpo completo; Gemini Robotics ER 2, que planifica y supervisa tareas de largo plazo; y Gemini Robotics On-Device 2, que se ejecuta localmente en robots
- Los humanoides pueden combinar caminar, inclinarse y transportar objetos; atar nudos o sellar bolsas con cierre usando una mano de 5 dedos y 22 grados de libertad; y varios robots pueden colaborar en tareas difíciles de resolver por separado
- On-Device 2 se ejecuta sin conexión de red y, por lo general, puede aplicarse a nuevos robots de dos brazos con formas, sensores y grados de libertad muy distintos con menos de 200 ejemplos y solo unas horas de adaptación
- ER 2 está disponible como vista previa privada en Google AI Studio y Gemini Enterprise Agent Platform, y los modelos VLA y On-Device están abiertos a socios de acceso anticipado, aunque la velocidad de desplazamiento y la precisión todavía necesitan mejoras
Tres modelos robóticos con roles distintos
- Los robots existentes se basan principalmente en secuencias de tareas estrechas y repetitivas preprogramadas o en teleoperación, lo que dificulta que se adapten por sí mismos a entornos impredecibles o transfieran las habilidades de un robot a otra forma
- Gemini Robotics 2 es un modelo de visión-lenguaje-acción (VLA) que convierte entradas visuales y de lenguaje en control de motores
- Controla humanoides completos y robots de dos brazos
- Admite manipulación precisa con ambas manos y grippers
- Gemini Robotics ER 2 es un modelo de razonamiento incorporado (ER) que cumple el rol de agente del robot
- Se comunica con personas y comprende el entorno físico
- Planifica tareas de varios pasos que se extienden durante minutos
- Admite trabajo en equipo entre varios robots
- Gemini Robotics On-Device 2 es un VLA eficiente optimizado para ejecutarse localmente en el dispositivo robótico
- Puede adaptarse a formas de robot completamente nuevas con datos de apenas unas horas
- El alcance de disponibilidad varía según el modelo
- ER 2 está disponible en Google AI Studio y se ofrece como vista previa privada en Gemini Enterprise Agent Platform
- Los modelos VLA y On-Device están disponibles para socios de acceso anticipado
- La forma de aplicarlos al hardware puede consultarse en el Developer blog
Control de cuerpo completo en humanoides, más allá de la parte superior
- Mientras que el modelo anterior se enfocaba en controlar la parte superior del cuerpo de humanoides para tareas de mesa, Gemini Robotics 2 amplía su alcance de control a movimientos de cuerpo completo
- Apptronik Apollo 2 puede procesar la instrucción “coloca la regadera en la caja verde del estante inferior”
- Camina hasta la mesa y toma la regadera
- Se desplaza hasta el estante y la deja con precisión en la ubicación indicada
- Conecta caminar, inclinarse, mantener el equilibrio y manipular objetos para realizar tareas en espacios estrechos y desordenados, aunque la velocidad de desplazamiento aún debe mejorar
Manipulación precisa con manos y grippers
- Controla los cinco dedos y 22 grados de libertad de la mano SharpaWave instalada en Apollo 2
- Realiza movimientos delicados como atar un nudo
- Puede sellar bolsas con cierre
- También maneja tareas complejas como empacar objetos de forma compacta con los grippers paralelos estándar de 2 dedos de Franka Duo
- Para alcanzar una destreza manual de nivel humano, todavía debe seguir aumentando la precisión y la velocidad
Razonamiento para tareas de largo plazo y colaboración multirrobot
- Gemini Robotics ER 2 actúa como el cerebro de alto nivel del robot: procesa instrucciones de usuarios y se comunica con personas
- Observa el espacio e infiere los pasos necesarios
- Se coordina con el VLA para ejecutar acciones reales
- Da seguimiento al progreso hasta completar la tarea
- Al ejecutar tareas complejas de varios pasos, se autocorrige si una etapa falla y puede generalizar a situaciones y objetivos nuevos
- Toma cientos de decisiones en una sola tarea y maneja con más estabilidad que antes secuencias de tareas que duran varios minutos
- Comprende el inicio y el final de una tarea, identifica el momento en que ocurren eventos clave y da seguimiento al estado de avance
- Al comunicarse y cooperar, robots de distintos tipos pueden manejar flujos de trabajo complejos que serían difíciles de realizar con un solo robot
Adaptación rápida a nuevas formas de robot
- Gemini Robotics On-Device 2 se ejecuta localmente en el dispositivo robótico para entornos que deben operar sin latencia de red ni conexión a internet
- Admite de base varias formas de robot y hereda la tecnología de transferencia de acciones de Gemini Robotics 1.5
- Por lo general, puede aplicarse a un nuevo robot de dos brazos con menos de 200 ejemplos y unas pocas horas de adaptación
- Se adapta incluso a robots con apariencia, sensores y grados de libertad muy distintos, y realiza diversas tareas en las plataformas Dexmate, SO101 y Trossen
Seguridad robótica que también maneja la incertidumbre
- A medida que crecen las capacidades físicas de los robots, se aplica un enfoque de seguridad multicapa que combina medidas tradicionales de seguridad física con frameworks de seguridad de IA
- ASIMOV-Agentic es un nuevo benchmark para evaluar la coordinación de seguridad en agentes y el manejo de la incertidumbre
- Mide si un agente de razonamiento incorporado puede rechazar llamadas inseguras a herramientas solicitadas por el VLA
- Evalúa si predice la viabilidad de una tarea y solicita de forma proactiva la intervención humana cuando hay incertidumbre
- Gemini Robotics ER 2 muestra el desempeño más seguro entre los modelos robóticos existentes de Google DeepMind en benchmarks de cumplimiento de restricciones de seguridad y proximidad humana
- Detecta mejor a las personas cercanas
- Si una persona se acerca demasiado, llama a herramientas de seguridad y detiene el robot de forma segura
- Es una capacidad exigida por los estándares de seguridad colaborativa para trabajar junto a personas
- La evaluación detallada puede consultarse en Gemini Robotics 2: Safety Technical Report
- Su objetivo es construir la inteligencia central de una IA física de propósito general que vaya más allá de automatizar tareas individuales y resuelva problemas complejos junto con las personas
1 comentarios
Opiniones de Hacker News
Como investigador de DeepMind que participó en el desarrollo de este modelo, DeepMind es un gran lugar para trabajar. Es uno de esos pocos laboratorios únicos donde puedes moverte por casi todos los campos relacionados con la inteligencia, como Gemini·Gemma, robótica y ciencias como clima y biología; además hay muchos colegas excelentes, así que vale la pena considerar unirse
Anthropic y OpenAI se llevan el 80% de la atención, pero es impresionante el alcance de Google, desde modelos frontier, rápidos y de pesos abiertos hasta generación de imágenes, video y música, además de robótica
Los movimientos del robot son lentos y poco fluidos, pero el ChatGPT inicial también se veía muy torpe. Si avanza tan rápido como los LLM, en pocos años su rango de uso podría crecer enormemente
Los movimientos robóticos lentos y estáticos y los movimientos rápidos y flexibles son problemas de dificultad completamente distinta. Si se mueve rápido, hay que calcular cientos o miles de veces por segundo la inercia rotacional de varias articulaciones y masas, y los cambios de equilibrio. Doblar una camiseta desde el reposo con 90% de probabilidad es fácil, pero una tasa de éxito del 99% o doblado rápido es increíblemente complejo
No hay que esperar que imite tal cual los movimientos de cinemática inversa como un muñeco digital. Si el objetivo de optimización es reducir el consumo de energía, el movimiento de un brazo eléctrico multiarticulado puede verse algo extraño
Perdí las expectativas en los robots humanoides por las limitaciones de los actuadores. Desde Honda ASIMO casi no hubo innovación, y no creo que mucha gente quiera tener en su casa o trabajo una masa metálica tambaleante de 80 kg
La revolución robótica final podría usar cuerpos de humanos o animales genéticamente modificados a los que se les reemplace el cerebro. Creo que controlar con Neuralink y LLM a un oso hecho para no tener conciencia sería más adecuado como trabajador de construcción; animales rápidos podrían servir para entregas, y jirafas para almacenes
Al ver trabajos interesantes en impresión 3D, pensaba que los actuadores también estaban avanzando mucho, así que quisiera saber más sobre la afirmación de que se quedaron atrás
Basta con construir una caja enorme que procese entradas y entregue resultados, como un lavavajillas. En vez de imitar manos humanas, sería mucho más eficiente crear un dispositivo para doblar ropa equivalente a la lavadora y la secadora, o una cocina robótica integrada
Se necesita alguien que evalúe honestamente el nivel real de esta tecnología. Me interesa saber qué equipamiento de medición hace falta, la calidad de la interacción y el rendimiento en tareas cotidianas no estructuradas como girar picaportes, recuperarse de caídas y evitar colisiones.
También faltan datos de precisión confiables; benchmarks como LIBERO están saturados, con casi todos marcando 95%, y cada empresa e investigador usa sus propias evaluaciones. Muchas empresas incluso manipulan demostraciones o hacen operar robots de forma peligrosa cerca de personas.
Más que los picaportes y la recuperación de caídas en sí, lo difícil en un proceso de fabricación es alinear con precisión ladrillos o piezas. En lugar de humanoides complejos con muchas articulaciones que gestionar, parecen más adecuados los brazos robóticos con ruedas como Mobile ALOHA para ordenar habitaciones de hotel o cocinar en restaurantes con tareas repetitivas.
Tal como se argumenta en https://rodneybrooks.com/why-todays-humanoids-wont-learn-dex..., la destreza también es un problema de hardware, y un gripper no es una mano. Incluso la manipulación con manos de varios dedos sigue siendo difícil, y los sensores tampoco son suficientes.
La robótica, salvo en el área de los cobots, es una industria de nicho; la excepción son los drones, que tienen un gran potencial si se resuelve el problema del tiempo de vuelo. A los humanoides todavía les falta mucho para ser útiles en entornos reales, y la mayoría de los vehículos terrestres no tripulados ni siquiera pueden retroceder en una escalera.
La robótica con IA sí es la verdadera revolución. Hoy, quienes poseen capital necesitan trabajo humano para obtener más capital, pero si el costo de inferencia de los robots cae por debajo del costo de la mano de obra, el trabajo humano dejará de ser necesario. La IA también afecta al trabajo no físico, pero una parte importante de la población mundial realiza trabajo físico.
Como hombre de 47 años sin hijos, espero la posibilidad de recibir ayuda de robots de cuidado en la vejez.
Muchas tareas domésticas pueden automatizarse sin humanoides. Roomba limpia el piso, y una vivienda podría incorporar sistemas automáticos de eliminación de basura y de ingreso, clasificación y almacenamiento de comestibles.
Los humanoides son inquietantes y difíciles de confiar. Me pregunto si uno podría dormir tranquilo teniendo dentro de casa un robot así incluso en situaciones en las que uno se opone a las posturas políticas de sus creadores.
En un planeta finito, me pregunto por qué querríamos sumar cuerpos robóticos además de una población humana que sigue creciendo. La IA en centros de datos al menos no compite físicamente hombro con hombro conmigo, pero no entiendo por qué, habiendo humanos, alguien querría robots sofisticados.
Si se usa un LLM completo para accionar un robot, sería demasiado pesado y probablemente tendría una latencia mínima de 1 a 2 segundos incluso con una GPU potente, lo que no sirve para robots prácticos.
La visión artificial debería quedar a cargo del machine learning, pero el accionamiento debería dejarse al control lineal y no lineal basado en PID tradicional; usar un LLM completo como controlador parece chocar con los límites del hardware.
Empresas como Physical Intelligence también están logrando buenos resultados con arquitecturas jerárquicas que combinan capas rápidas y lentas para resolver al mismo tiempo inteligencia y latencia.