Gemini Robotics ER 2: el nuevo cerebro para robots
Google ha desarrollado Gemini Robotics ER 2, un modelo de inteligencia artificial diseñado para actuar como el cerebro de alto nivel de un robot. Este sistema busca superar uno de los grandes problemas de la robótica actual: la incapacidad de las máquinas para comprender lo que está ocurriendo y reaccionar rápidamente.
Gemini Robotics ER 2 puede razonar sobre lo que debe hacer mientras el robot todavía está ejecutando una acción anterior. También observa continuamente las cámaras de la máquina para comprobar su progreso, detectar errores y decidir cuándo una fase ha terminado realmente. Esto permite al robot detectar que una acción no está funcionando, repetir únicamente el paso afectado y continuar sin reiniciar todo el proceso desde el principio.
“Gemini Robotics ER 2 puede razonar sobre lo que debe hacer mientras el robot todavía está ejecutando una acción anterior”
El modelo actúa como un cerebro que coordina el cuerpo del robot, interpretando instrucciones y dividiendo tareas complejas en diferentes fases. Luego, delega la ejecución de cada fase al controlador más adecuado, lo que permite utilizar la misma inteligencia de alto nivel con robots de diseños y fabricantes distintos. Gemini Robotics ER 2 también puede recurrir de forma nativa a la Búsqueda de Google o a funciones creadas específicamente por el programador.
La capacidad de analizar un flujo de vídeo continuo es otra mejora fundamental de Gemini Robotics ER 2. El modelo puede clasificar cada fotograma dentro de cinco niveles de progreso, desde el 0-20% hasta el 80-100%. En las pruebas realizadas por Google, alcanzó una precisión del 57,4% en esta clasificación. Además, el modelo puede localizar el momento exacto en el que sucede un evento relevante, como cuándo una taza está suficientemente llena o cuándo se ha terminado de cerrar una bolsa, con una precisión del 91,3% y una desviación media de 0,96 segundos. Esto permite a los robots corregir errores o colaborar ante una persona de manera más efectiva.
Google ha demostrado la capacidad de Gemini Robotics ER 2 con Spot, el robot cuadrúpedo de Boston Dynamics, al que el modelo puede ordenar que navegue por un espacio, localice un objeto y lo recoja mediante su brazo robótico a partir de una petición expresada en lenguaje natural. La integración con la API de Gemini Live reduce la latencia y permite una conexión bidireccional entre el modelo y los sistemas del robot. Con Gemini Robotics ER 2, Google busca acercar a los robots a un comportamiento más humano, eliminando las incómodas pausas en las que un robot se queda inmóvil mientras procesa la siguiente orden.