1 puntos por GN⁺ 2 시간 전 | 1 comentarios | Compartir por WhatsApp
  • Google DeepMind presentó la familia de modelos Gemini Robotics 2, que convierte entradas visuales y de lenguaje en acciones para controlar humanoides desde los pies hasta las puntas de los dedos, y admite manipulación precisa y colaboración entre robots
  • La familia está compuesta por Gemini Robotics 2, un VLA para control de cuerpo completo; Gemini Robotics ER 2, que planifica y supervisa tareas de largo plazo; y Gemini Robotics On-Device 2, que se ejecuta localmente en robots
  • Los humanoides pueden combinar caminar, inclinarse y transportar objetos; atar nudos o sellar bolsas con cierre usando una mano de 5 dedos y 22 grados de libertad; y varios robots pueden colaborar en tareas difíciles de resolver por separado
  • On-Device 2 se ejecuta sin conexión de red y, por lo general, puede aplicarse a nuevos robots de dos brazos con formas, sensores y grados de libertad muy distintos con menos de 200 ejemplos y solo unas horas de adaptación
  • ER 2 está disponible como vista previa privada en Google AI Studio y Gemini Enterprise Agent Platform, y los modelos VLA y On-Device están abiertos a socios de acceso anticipado, aunque la velocidad de desplazamiento y la precisión todavía necesitan mejoras

Tres modelos robóticos con roles distintos

  • Los robots existentes se basan principalmente en secuencias de tareas estrechas y repetitivas preprogramadas o en teleoperación, lo que dificulta que se adapten por sí mismos a entornos impredecibles o transfieran las habilidades de un robot a otra forma
  • Gemini Robotics 2 es un modelo de visión-lenguaje-acción (VLA) que convierte entradas visuales y de lenguaje en control de motores
    • Controla humanoides completos y robots de dos brazos
    • Admite manipulación precisa con ambas manos y grippers
  • Gemini Robotics ER 2 es un modelo de razonamiento incorporado (ER) que cumple el rol de agente del robot
    • Se comunica con personas y comprende el entorno físico
    • Planifica tareas de varios pasos que se extienden durante minutos
    • Admite trabajo en equipo entre varios robots
  • Gemini Robotics On-Device 2 es un VLA eficiente optimizado para ejecutarse localmente en el dispositivo robótico
    • Puede adaptarse a formas de robot completamente nuevas con datos de apenas unas horas
  • El alcance de disponibilidad varía según el modelo

Control de cuerpo completo en humanoides, más allá de la parte superior

  • Mientras que el modelo anterior se enfocaba en controlar la parte superior del cuerpo de humanoides para tareas de mesa, Gemini Robotics 2 amplía su alcance de control a movimientos de cuerpo completo
  • Apptronik Apollo 2 puede procesar la instrucción “coloca la regadera en la caja verde del estante inferior”
    • Camina hasta la mesa y toma la regadera
    • Se desplaza hasta el estante y la deja con precisión en la ubicación indicada
  • Conecta caminar, inclinarse, mantener el equilibrio y manipular objetos para realizar tareas en espacios estrechos y desordenados, aunque la velocidad de desplazamiento aún debe mejorar

Manipulación precisa con manos y grippers

  • Controla los cinco dedos y 22 grados de libertad de la mano SharpaWave instalada en Apollo 2
    • Realiza movimientos delicados como atar un nudo
    • Puede sellar bolsas con cierre
  • También maneja tareas complejas como empacar objetos de forma compacta con los grippers paralelos estándar de 2 dedos de Franka Duo
  • Para alcanzar una destreza manual de nivel humano, todavía debe seguir aumentando la precisión y la velocidad

Razonamiento para tareas de largo plazo y colaboración multirrobot

  • Gemini Robotics ER 2 actúa como el cerebro de alto nivel del robot: procesa instrucciones de usuarios y se comunica con personas
    • Observa el espacio e infiere los pasos necesarios
    • Se coordina con el VLA para ejecutar acciones reales
    • Da seguimiento al progreso hasta completar la tarea
  • Al ejecutar tareas complejas de varios pasos, se autocorrige si una etapa falla y puede generalizar a situaciones y objetivos nuevos
  • Toma cientos de decisiones en una sola tarea y maneja con más estabilidad que antes secuencias de tareas que duran varios minutos
  • Comprende el inicio y el final de una tarea, identifica el momento en que ocurren eventos clave y da seguimiento al estado de avance
  • Al comunicarse y cooperar, robots de distintos tipos pueden manejar flujos de trabajo complejos que serían difíciles de realizar con un solo robot

Adaptación rápida a nuevas formas de robot

  • Gemini Robotics On-Device 2 se ejecuta localmente en el dispositivo robótico para entornos que deben operar sin latencia de red ni conexión a internet
  • Admite de base varias formas de robot y hereda la tecnología de transferencia de acciones de Gemini Robotics 1.5
  • Por lo general, puede aplicarse a un nuevo robot de dos brazos con menos de 200 ejemplos y unas pocas horas de adaptación
  • Se adapta incluso a robots con apariencia, sensores y grados de libertad muy distintos, y realiza diversas tareas en las plataformas Dexmate, SO101 y Trossen

Seguridad robótica que también maneja la incertidumbre

  • A medida que crecen las capacidades físicas de los robots, se aplica un enfoque de seguridad multicapa que combina medidas tradicionales de seguridad física con frameworks de seguridad de IA
  • ASIMOV-Agentic es un nuevo benchmark para evaluar la coordinación de seguridad en agentes y el manejo de la incertidumbre
    • Mide si un agente de razonamiento incorporado puede rechazar llamadas inseguras a herramientas solicitadas por el VLA
    • Evalúa si predice la viabilidad de una tarea y solicita de forma proactiva la intervención humana cuando hay incertidumbre
  • Gemini Robotics ER 2 muestra el desempeño más seguro entre los modelos robóticos existentes de Google DeepMind en benchmarks de cumplimiento de restricciones de seguridad y proximidad humana
    • Detecta mejor a las personas cercanas
    • Si una persona se acerca demasiado, llama a herramientas de seguridad y detiene el robot de forma segura
    • Es una capacidad exigida por los estándares de seguridad colaborativa para trabajar junto a personas
  • La evaluación detallada puede consultarse en Gemini Robotics 2: Safety Technical Report
  • Su objetivo es construir la inteligencia central de una IA física de propósito general que vaya más allá de automatizar tareas individuales y resuelva problemas complejos junto con las personas

1 comentarios

 
GN⁺ 2 시간 전
Opiniones de Hacker News
  • Como investigador de DeepMind que participó en el desarrollo de este modelo, DeepMind es un gran lugar para trabajar. Es uno de esos pocos laboratorios únicos donde puedes moverte por casi todos los campos relacionados con la inteligencia, como Gemini·Gemma, robótica y ciencias como clima y biología; además hay muchos colegas excelentes, así que vale la pena considerar unirse

    • Me da curiosidad saber en concreto qué diferencia hay entre desarrollar modelos frontier y desarrollar modelos abiertos. Los modelos abiertos suelen ser más pequeños y pasar por más pruebas de seguridad, pero en esencia se parecen, y creo que la mayor parte de la investigación general en IA aplica a ambos
    • Me pregunto seriamente cómo están evitando el abuso por parte de gobiernos, empresas y ejércitos. También quisiera saber cuánto se usará esta tecnología para mejorar la vida de la gente común y cuánto para reforzar la vigilancia y el control
    • La expresión “el único laboratorio” es exagerada. Allen Institute for AI (AI2) también cubre la mayoría de las áreas, aunque en menor medida a nivel frontier, y también generan expectativas el apoyo de USD 152 millones de la NSF y la colaboración con Nvidia. En robótica tienen MolmoBot, MolmoSpaces, MolmoAct, etc.: https://allenai.org/embodied-ai
    • Como director ejecutivo de AGI Society, que organiza la AGI Conference desde 2007, quisiera invitarte a presentar tu investigación en el evento del próximo año. Este año la presentación de Alexander Lerchner fue excelente; si me indicas tu correo preferido, me pondré en contacto
  • Anthropic y OpenAI se llevan el 80% de la atención, pero es impresionante el alcance de Google, desde modelos frontier, rápidos y de pesos abiertos hasta generación de imágenes, video y música, además de robótica

    • Google actúa como una empresa discretamente competente en la vanguardia de varias tecnologías nuevas, mientras que los chatbots más recientes de OpenAI y Anthropic reciben coberturas exageradas como “IA fuera de control” o “demasiado peligrosa, debería prohibirse”. Este ciclo de hype sostiene valoraciones absurdas de competidores emergentes
    • Google DeepMind está desarrollando conceptos nuevos en la frontera de la IA, mientras que otros están persiguiendo unos cuantos puntos porcentuales en benchmarks
    • Tampoco se puede dejar fuera la investigación sobre plegamiento de proteínas y el Nobel
  • Los movimientos del robot son lentos y poco fluidos, pero el ChatGPT inicial también se veía muy torpe. Si avanza tan rápido como los LLM, en pocos años su rango de uso podría crecer enormemente

    • Para las tareas domésticas no importa que tarde más que una persona. Basta con que termine de limpiar antes de que uno vuelva del trabajo
    • Tanto de GPT-2 a GPT-3 como de Gemini Robotics 1 a 2 pasaron 15 meses, pero lo primero fue un salto enorme, mientras que lo segundo casi no cambió: https://blog.google/products-and-platforms/products/gemini/h...
      Los movimientos robóticos lentos y estáticos y los movimientos rápidos y flexibles son problemas de dificultad completamente distinta. Si se mueve rápido, hay que calcular cientos o miles de veces por segundo la inercia rotacional de varias articulaciones y masas, y los cambios de equilibrio. Doblar una camiseta desde el reposo con 90% de probabilidad es fácil, pero una tasa de éxito del 99% o doblado rápido es increíblemente complejo
    • Es el primer video promocional que se ve razonable incluso a velocidad real. Sin embargo, no queda claro si la tasa de éxito del 50 al 75% en otros materiales se refiere al primer intento o al éxito final
    • Es bastante audaz que Google enfrente directamente la paradoja de Moravec: https://en.wikipedia.org/wiki/Moravec%27s_paradox
    • Los movimientos son fluidos, pero lentos, probablemente por seguridad. Un robot con motores potentes realmente puede lastimar a una persona, por eso los robots industriales también operan dentro de cercas de seguridad
      No hay que esperar que imite tal cual los movimientos de cinemática inversa como un muñeco digital. Si el objetivo de optimización es reducir el consumo de energía, el movimiento de un brazo eléctrico multiarticulado puede verse algo extraño
  • Perdí las expectativas en los robots humanoides por las limitaciones de los actuadores. Desde Honda ASIMO casi no hubo innovación, y no creo que mucha gente quiera tener en su casa o trabajo una masa metálica tambaleante de 80 kg
    La revolución robótica final podría usar cuerpos de humanos o animales genéticamente modificados a los que se les reemplace el cerebro. Creo que controlar con Neuralink y LLM a un oso hecho para no tener conciencia sería más adecuado como trabajador de construcción; animales rápidos podrían servir para entregas, y jirafas para almacenes

    • Las jirafas solo son altas, pero casi no pueden levantar peso, así que dudo de su utilidad en almacenes. También me cuesta creer que no haya habido innovación en actuadores; los actuadores del MIT Cheetah son completamente distintos de los de ASIMO en retroaccionabilidad y rigidez variable, y también hay mucha investigación que combina elementos elásticos
    • Cortical Labs investiga esta área y en su momento también publicó una demo de Doom. Lo biológico tiene generalidad, pero para muchas tareas lo metálico es más resistente, y como el cerebro tiene poco ancho de banda y alta latencia, para inferencia son mejores los chips de silicio
      Al ver trabajos interesantes en impresión 3D, pensaba que los actuadores también estaban avanzando mucho, así que quisiera saber más sobre la afirmación de que se quedaron atrás
    • No estoy para nada de acuerdo con que los actuadores no hayan avanzado. Desde la investigación del MIT Mini Cheetah de Ben Katz, la densidad de torque y el precio mejoraron mucho, y los actuadores Unitree G1 basados en eso son pequeños pero potentes, y cercanos a una transmisión cuasi directa. Los motores de BD E-Atlas también parecen tener buena densidad de torque aun con enfriamiento completamente pasivo, y nunca habían avanzado tan rápido como ahora
    • Ese futuro es horrible, pero por la dificultad técnica y las barreras para obtener permisos experimentales parece muy lejano. Aun así, estoy de acuerdo en que la forma humanoide es un callejón sin salida
      Basta con construir una caja enorme que procese entradas y entregue resultados, como un lavavajillas. En vez de imitar manos humanas, sería mucho más eficiente crear un dispositivo para doblar ropa equivalente a la lavadora y la secadora, o una cocina robótica integrada
    • Modificar organismos vivos parece varios órdenes de magnitud más difícil que fabricar robots humanoides. Todavía no podemos hacer una hamburguesa sin vacas a un precio viable para el mercado
  • Se necesita alguien que evalúe honestamente el nivel real de esta tecnología. Me interesa saber qué equipamiento de medición hace falta, la calidad de la interacción y el rendimiento en tareas cotidianas no estructuradas como girar picaportes, recuperarse de caídas y evitar colisiones.

    • Trabajo en este campo y escribí mi tesis de licenciatura sobre modelos visión-lenguaje-acción (VLA) no humanoides, es decir, conectar ChatGPT a un brazo robótico. Todavía no está en una etapa práctica, y como las piezas de ensamblaje a veces ni siquiera tienen nombres precisos, el robot puede no ser capaz de procesar instrucciones ambiguas que una persona sí entendería.
      También faltan datos de precisión confiables; benchmarks como LIBERO están saturados, con casi todos marcando 95%, y cada empresa e investigador usa sus propias evaluaciones. Muchas empresas incluso manipulan demostraciones o hacen operar robots de forma peligrosa cerca de personas.
      Más que los picaportes y la recuperación de caídas en sí, lo difícil en un proceso de fabricación es alinear con precisión ladrillos o piezas. En lugar de humanoides complejos con muchas articulaciones que gestionar, parecen más adecuados los brazos robóticos con ruedas como Mobile ALOHA para ordenar habitaciones de hotel o cocinar en restaurantes con tareas repetitivas.
    • Todavía está en un nivel GPT-1, pero se siente que el momento equivalente a GPT-2 está muy cerca.
    • El verdadero criterio de validación será si una startup que venda robots domésticos como servicio logra realmente usuarios recurrentes. He construido profesionalmente varios prototipos de robots, y el avance es claro, pero aún están muy lejos de ser algo que un consumidor común pueda usar de forma confiable para las tareas domésticas.
      Tal como se argumenta en https://rodneybrooks.com/why-todays-humanoids-wont-learn-dex..., la destreza también es un problema de hardware, y un gripper no es una mano. Incluso la manipulación con manos de varios dedos sigue siendo difícil, y los sensores tampoco son suficientes.
    • En la industria robótica hay muchísimo engaño, desde videos cuidadosamente preparados solo para una demostración específica hasta fraudes en los que se afirma que algo funciona de forma autónoma cuando en realidad fue teleoperado. Los perros robot y los vehículos terrestres no tripulados también son mucho menos prácticos de lo que promete el hype.
      La robótica, salvo en el área de los cobots, es una industria de nicho; la excepción son los drones, que tienen un gran potencial si se resuelve el problema del tiempo de vuelo. A los humanoides todavía les falta mucho para ser útiles en entornos reales, y la mayoría de los vehículos terrestres no tripulados ni siquiera pueden retroceder en una escalera.
  • La robótica con IA sí es la verdadera revolución. Hoy, quienes poseen capital necesitan trabajo humano para obtener más capital, pero si el costo de inferencia de los robots cae por debajo del costo de la mano de obra, el trabajo humano dejará de ser necesario. La IA también afecta al trabajo no físico, pero una parte importante de la población mundial realiza trabajo físico.

    • Si se ignoran los costos distintos de la inferencia y se acepta ese estado final, sería muy positivo si el capital se democratiza, pero si sigue concentrado en una pequeña élite, el resultado sería casi apocalíptico.
    • No es solo una cuestión de costo de inferencia. En el mundo real, el daño causado por manipular mal objetos o seres vivos es totalmente distinto al de las aplicaciones no materiales, por lo que podrían hacer falta mecanismos de seguridad ante fallas y limitadores independientes.
    • Dudo que ese cambio sea realmente algo bueno.
  • Como hombre de 47 años sin hijos, espero la posibilidad de recibir ayuda de robots de cuidado en la vejez.

    • Es sorprendente que haya aumentado la probabilidad de ver droides como los de Star Wars durante nuestra vida, pero parece que todos lo toman como si fuera algo totalmente normal.
    • Como alguien en sus 50 con padres en sus 80, serían muy útiles ahora mismo. Muchos amigos a mi alrededor están en una situación parecida.
  • Muchas tareas domésticas pueden automatizarse sin humanoides. Roomba limpia el piso, y una vivienda podría incorporar sistemas automáticos de eliminación de basura y de ingreso, clasificación y almacenamiento de comestibles.
    Los humanoides son inquietantes y difíciles de confiar. Me pregunto si uno podría dormir tranquilo teniendo dentro de casa un robot así incluso en situaciones en las que uno se opone a las posturas políticas de sus creadores.

    • En departamentos existentes, casas adosadas y viviendas semiindependientes, incorporar ese tipo de instalaciones es prácticamente imposible, y aun en casas unifamiliares nuevas es una solución cara. Como los entornos humanos existentes están adaptados a los humanoides, la forma humanoide resulta útil.
    • Roomba solo limpia entre 80% y 90% del piso, y ni siquiera deja todo tan limpio como una aspiradora real. Si además se considera recoger juguetes del perro y vaciar el depósito de polvo, en la práctica llega a algo así como 60%, por lo que para encargarse del 100% hace falta una forma humana completa.
    • No debería existir una situación en la que haya que confiar en un robot. Si un Roomba o un lavavajillas falla, no puede cortarte un dedo ni escuchar a escondidas o vigilarte; eso es lo que es un buen robot.
  • En un planeta finito, me pregunto por qué querríamos sumar cuerpos robóticos además de una población humana que sigue creciendo. La IA en centros de datos al menos no compite físicamente hombro con hombro conmigo, pero no entiendo por qué, habiendo humanos, alguien querría robots sofisticados.

    • Hay muchas señales de que la expansión humana infinita se está deteniendo. La razón evidente para necesitar robots sofisticados es encargarles trabajos que los humanos no quieren hacer porque destrozan la espalda, son sucios, peligrosos o aburridos.
  • Si se usa un LLM completo para accionar un robot, sería demasiado pesado y probablemente tendría una latencia mínima de 1 a 2 segundos incluso con una GPU potente, lo que no sirve para robots prácticos.
    La visión artificial debería quedar a cargo del machine learning, pero el accionamiento debería dejarse al control lineal y no lineal basado en PID tradicional; usar un LLM completo como controlador parece chocar con los límites del hardware.

    • El problema actual de latencia es real, pero hay mucho margen para optimizar la inferencia, así que es muy probable que esto cambie en el futuro cercano. Mientras los controles basados en análisis y optimización, como PID, llevan décadas estancados, el control de extremo a extremo ha mostrado un rendimiento excelente en eficiencia energética al caminar y en robustez para no caerse incluso al pisar montones de hojas, y además es mucho más fácil de aplicar a robots nuevos.
      Empresas como Physical Intelligence también están logrando buenos resultados con arquitecturas jerárquicas que combinan capas rápidas y lentas para resolver al mismo tiempo inteligencia y latencia.
    • Nvidia ejecuta en sus chips un VLA de 2.000 millones de parámetros a 10 Hz, y tengo entendido que el modelo público de 500 millones de parámetros también funciona a 10 Hz.