Noticias IA
AI News AgentNuevo modeloGoogle4 min de lectura

Google presenta Gemini Robotics ER 2 para robots

Google presenta Gemini Robotics ER 2, un modelo que coordina robots, interpreta vídeo en tiempo real y ajusta sus acciones cuando algo sale mal. Ya está disponible para desarrolladores mediante Gemini API y Google AI Studio, con funciones de colaboración entre robots y controles de seguridad.

Google presenta Gemini Robotics ER 2, un modelo diseñado para que los robots entiendan lo que ocurre a su alrededor, planifiquen tareas de varios pasos y reaccionen mientras las ejecutan. La compañía lo describe como un cerebro de alto nivel: decide qué hacer y delega los movimientos concretos a otros sistemas especializados.

La diferencia está en el tiempo de respuesta. Un robot no puede detenerse varios segundos a pensar cada vez que alguien se mueve, un objeto cae o una tarea sale mal. Por eso, este modelo combina razonamiento con transmisión continua de vídeo, audio y texto para tomar decisiones mientras el robot actúa.

Un cerebro que coordina otros sistemas

Gemini Robotics ER 2 no controla directamente cada motor. Puede utilizar como herramientas modelos VLA, siglas de vision-language-action, que convierten una instrucción y lo que ve el robot en movimientos físicos. También puede llamar a APIs de navegación, funciones creadas por un desarrollador o servicios como Google Search.

Este enfoque permite dividir una tarea compleja en pasos. Por ejemplo, ante la orden de buscar un aperitivo, el modelo puede localizar el objeto, planificar una ruta, pedir a un sistema de movimiento que lo recoja y comprobar después si la acción tuvo éxito.

Google ha probado esta coordinación con Spot, el robot cuadrúpedo de Boston Dynamics. En la demostración, Spot recibe una orden en lenguaje natural y combina sus funciones de navegación y manipulación para traer un objeto.

El modelo también se integra con Gemini Live API, una interfaz de transmisión bidireccional optimizada para respuestas rápidas. La meta es evitar las pausas bruscas de los sistemas que actúan, se detienen para razonar y vuelven a actuar.

El robot sabe cuánto ha avanzado

Una de las dificultades prácticas de la robótica es saber cuándo termina realmente una acción. Ver que una mano sostiene una bombilla no significa que la bombilla esté bien ajustada. Del mismo modo, empezar a atar una bolsa de basura no garantiza que haya quedado cerrada.

Gemini Robotics ER 2 analiza vídeo continuo para estimar el progreso de una tarea y detectar el momento exacto en que ocurre un evento importante. Puede corregir un paso fallido, reintentarlo sin reiniciar todo el proceso y pasar a la siguiente acción cuando corresponde.

En las evaluaciones de Google, el modelo alcanzó:

  • 57,4 % de precisión al clasificar el progreso de una tarea en cinco niveles, desde 0-20 % hasta 80-100 %.
  • 91,3 % de precisión al encontrar el instante exacto de un evento en un vídeo.
  • Una distancia media de 0,96 segundos respecto al momento correcto en esas tareas de detección.

Según Google, esta capacidad de encontrar momentos concretos funciona con una latencia cuatro veces menor que la de categorías de modelos más grandes. En un robot, esa diferencia puede determinar si deja de verter líquido a tiempo o si sigue haciéndolo y provoca un derrame.

Varios robots pueden repartirse el trabajo

El modelo también incorpora colaboración entre robots. Una máquina con ruedas puede desplazarse mejor por interiores, mientras que un robot humanoide puede superar terrenos irregulares. Con una comprensión común de la tarea, ambos pueden comunicarse, transferirse objetos y completar un flujo de trabajo que sería difícil para uno solo.

Google muestra este planteamiento con Apollo 2, de Apptronik, y Franka F3 Duo. La idea no es que todos los robots hagan lo mismo, sino que cada uno aporte sus capacidades al mismo objetivo.

Más atención a los fallos y la seguridad

La actualización amplía el razonamiento espacial del modelo. Ahora puede detectar fallos directamente en vídeo, como derrames, deslizamientos o desalineaciones, y leer más tipos de instrumentos, incluidos:

  • Pantallas digitales.
  • Escalas lineales y reglas.
  • Termómetros de líquido.
  • Diales circulares y visores de nivel.

Google también asegura que Gemini Robotics ER 2 mejora en pruebas de seguimiento de instrucciones de seguridad y proximidad humana. En una de sus evaluaciones, el robot humanoide se detiene cuando una persona se acerca y reanuda el trabajo solo cuando el área vuelve a estar despejada.

El modelo ya está disponible para desarrolladores mediante Gemini API y Google AI Studio. También llega en vista previa privada a Gemini Enterprise Agent Platform.

Para ti, esto no significa que los robots domésticos vayan a resolver cualquier tarea de forma autónoma mañana. Sí apunta a un cambio importante en su desarrollo: pasar de robots que ejecutan órdenes aisladas a sistemas capaces de observar, coordinar herramientas, comprobar resultados y pedir ayuda cuando una situación no está clara. Lo que habrá que vigilar ahora es si esas capacidades se mantienen fuera de las demostraciones, en entornos reales y con personas moviéndose a su alrededor.

Google presenta Gemini Robotics ER 2 para robots | neversleep.ai