Google DeepMind's Gemini Robotics 2 controla humanos completos
Google DeepMind quiere que un cerebro de IA controle cada robot, y acaba de enseñarle a ese cerebro a usar todo su cuerpo. Ha lanzado Gemini Robotics 2, una familia de modelos que pueden controlar un humanoide desde sus pies hasta sus dedos. El sistema también puede coordinar varias máquinas a la vez y adaptarse a un nuevo cuerpo robótico en pocas horas.
Es la señal más clara hasta ahora de lo que la industria llama "IA física", y Wired lo enmarcó como un verdadero paso hacia la "AGI física". La propuesta es simple. El mismo tipo de modelo que escribe tus correos electrónicos ahora está aprendiendo a caminar por una habitación desordenada y a ordenarla.
De brazos a todo el cuerpo
El cambio principal es el control. Los modelos de robots anteriores de DeepMind principalmente movían la parte superior del cuerpo para realizar tareas en mesas. Gemini Robotics 2 controla toda la máquina. Puede hacer que un humanoide camine, se agache, se estire y mantenga el equilibrio mientras manipula objetos en espacios reducidos diseñados para humanos.
En una demostración, el robot Apollo 2 de Apptronik escuchó una sola instrucción: poner la regadera en el contenedor verde en la estantería inferior. Caminó hacia una mesa, recogió la regadera, se acercó a las estanterías, se agachó y la colocó. Eso suena trivial. Coordinar piernas, torso, brazos y manos a partir de un solo aviso no lo es.
La destreza también ha mejorado. El modelo puede controlar la mano de cinco dedos y 22 articulaciones de Apollo para atar nudos y sellar una bolsa ziplock, y puede operar pinzas más simples de dos dedos en otras plataformas. "Nuestro objetivo es llevar la IA al mundo físico y luego construir la capa de inteligencia que pueda ser utilizada por cada robot", dijo Carolina Parada, jefa de robótica de DeepMind.
Tres modelos, un sistema
El lanzamiento es en realidad tres modelos. Gemini Robotics 2 es el modelo de visión-lenguaje-acción que convierte lo que un robot ve y escucha en comandos motores. Se encarga de la acción física.
Gemini Robotics ER 2 es la capa de razonamiento, un cerebro de alto nivel que planifica trabajos de múltiples pasos. En su presentación para desarrolladores, Google mostró cómo seguía su propio progreso en una transmisión de video en vivo. Puede llamar herramientas como Google Search, e incluso dirigir un robot Spot de Boston Dynamics para buscar un bocadillo. También permite que diferentes robots trabajen en equipo, una máquina con ruedas y un humanoide dividiendo una tarea. Está disponible ahora para desarrolladores a través de la API de Gemini y Google AI Studio.
El tercero, On-Device 2, funciona localmente sin conexión a internet. Puede adaptarse a un cuerpo robótico completamente nuevo con menos de 200 ejemplos y unas pocas horas de entrenamiento. Ese último punto es importante, porque mover una habilidad aprendida de una máquina a otra ha sido durante mucho tiempo uno de los problemas más difíciles de la robótica.
Impresionante, y aún lento
DeepMind fue inusualmente franco sobre los límites. Sus propios números muestran la brecha. Bloomberg informó que el sistema podía desenroscar una bombilla el 92 por ciento de las veces, pero trabajos más complicados se quedaban atrás. El Chosun Daily colocó el atado de bolsas de basura en un 44 por ciento y el sellado de ziplock en un 40 por ciento.
Los robots también son lentos. Se detienen para pensar en movimientos que una persona realiza sin pensarlo dos veces. Kanishka Rao, director de robótica de DeepMind, dijo que la verdadera destreza sigue siendo un objetivo lejano, y que los robots aún aprenden de manera mucho menos eficiente que los humanos, quienes se ajustan después de uno o dos errores.
Este es un patrón en todo el campo. Los esfuerzos rivales de startups de modelos de fundación de robótica y trabajos de destreza en humanoides rivales siguen chocando contra la misma pared. Las demostraciones deslumbran, pero las máquinas aún están lejos de estar listas para el hogar.
La seguridad avanza en la jerarquía
A medida que los robots adquieren la capacidad de moverse entre personas, DeepMind puso más énfasis en la seguridad. Gemini Robotics ER 2 es su modelo más seguro hasta ahora, dice, mejor en detectar cuando una persona está cerca y detenerse hasta que el área esté despejada. Se reanuda solo cuando el espacio está vacío nuevamente.
La compañía también lanzó un estándar, ASIMOV-Agentic, que prueba si el modelo de razonamiento rechazará un comando inseguro del modelo de acción, y si señala cuando una tarea es imposible o pide ayuda a un humano. Nombrar un estándar de seguridad robótica en honor a Isaac Asimov es muy apropiado. La preocupación subyacente, máquinas actuando según instrucciones defectuosas, no lo es.
Un problema de hardware que Google no puede resolver
Hay un trasfondo incómodo. Google hace el software, no los robots, y el suministro de hardware se está volviendo político. Como señaló Axios, EE. UU. acaba de moverse para prohibir las futuras ventas de robots fabricados en China por motivos de seguridad. Muchos de los cuerpos en los que este software podría funcionar se construyen en China.
Google está trabajando con socios occidentales, incluidos Apptronik, Boston Dynamics y Agile Robots, y más de 100 probadores de confianza. Sus rivales están acechando el mismo premio. OpenAI y Nvidia están construyendo modelos de robots, y todos persiguen la misma idea: un modelo, cualquier cuerpo.
DeepMind tiene cuidado de llamar a esto un hito, no la línea de meta. Gemini Robotics 2 hace que los robots sean más generales y útiles que antes. También deja claro cuán lejos está una máquina de la competencia fácil de un humano ordenando una habitación.
Otros artículos
Google DeepMind's Gemini Robotics 2 controla humanos completos
Google DeepMind’s Gemini Robotics 2 otorga a un modelo de IA control total del cuerpo de los humanoides y permite que los robots trabajen en equipo, aunque la destreza aún se queda atrás.
