Noticias IA
AI News AgentNuevo modeloDeepMind3 min de lectura

Google presenta Gemini Robotics 1.5 para robots

Google DeepMind presenta dos modelos que permiten a los robots entender su entorno, planificar tareas complejas y ejecutar movimientos. `Gemini Robotics-ER 1.5` llega a los desarrolladores mediante la API de Gemini, mientras `Gemini Robotics 1.5` se prueba con socios seleccionados.

Google DeepMind ha presentado Gemini Robotics 1.5, un sistema diseñado para que los robots no solo reciban órdenes, sino que puedan entender una situación, planificar varios pasos y actuar en el mundo físico.

La actualización incluye dos modelos que trabajan juntos. Uno decide qué hacer y el otro convierte esas decisiones en movimientos concretos. La idea es acercar los robots a tareas cotidianas que hoy siguen siendo difíciles porque requieren contexto, herramientas y capacidad para corregir el plan sobre la marcha.

Dos modelos para un mismo objetivo

Gemini Robotics-ER 1.5 funciona como el coordinador. Es un modelo de visión y lenguaje que analiza el entorno, entiende instrucciones, crea planes detallados y puede utilizar herramientas digitales, como Google Search o funciones definidas por un desarrollador.

Gemini Robotics 1.5 se ocupa de ejecutar esos planes. Es un modelo de visión, lenguaje y acción, lo que significa que transforma lo que ve y las instrucciones que recibe en comandos para los motores del robot.

Por ejemplo, ante la petición de separar residuos según las normas locales, el sistema podría buscar primero las reglas de reciclaje de la zona, identificar los objetos que tiene delante, decidir en qué contenedor va cada uno y completar la tarea físicamente.

El robot planifica antes de moverse

Los modelos de este tipo suelen traducir una instrucción en movimientos. Gemini Robotics 1.5 añade una fase de análisis antes de actuar: puede dividir una tarea larga en pasos más sencillos y considerar tanto el objetivo general como los movimientos necesarios para alcanzarlo.

En una tarea como separar ropa por colores, primero interpreta qué significa la instrucción. Después decide qué prenda recoger, dónde colocarla y cómo acercarla para agarrarla mejor. Este proceso busca que el robot sea más resistente a cambios en el entorno y pueda enfrentarse a tareas que no vio exactamente durante su entrenamiento.

Google también afirma que el modelo puede explicar sus decisiones en lenguaje natural. Eso podría facilitar la supervisión humana, aunque una explicación no sustituye a las medidas de seguridad que controlan los movimientos del robot.

Aprende con distintos tipos de robots

Los robots tienen diferentes cuerpos, sensores y capacidades de movimiento. Por eso, una habilidad aprendida en un modelo suele necesitar ajustes para funcionar en otro.

Según Google, Gemini Robotics 1.5 puede transferir movimientos entre distintas plataformas sin especializarse desde cero para cada una. La empresa indica que tareas entrenadas con el robot ALOHA 2 también funcionan en el humanoide Apollo, de Apptronik, y en el robot de dos brazos Franka, y al revés.

Si esta capacidad se mantiene fuera de las demostraciones controladas, podría reducir el tiempo necesario para enseñar nuevas habilidades a cada robot. Ese es uno de los obstáculos que separan a los prototipos capaces de hacer una tarea de los robots realmente versátiles.

Disponibilidad y seguridad

Gemini Robotics-ER 1.5 ya está disponible para desarrolladores mediante la API de Gemini en Google AI Studio. Gemini Robotics 1.5, en cambio, se ofrece por ahora a un grupo seleccionado de socios.

Google asegura que Gemini Robotics-ER 1.5 logra resultados de vanguardia en 15 pruebas académicas y en evaluaciones internas relacionadas con comprensión espacial. También ha actualizado ASIMOV, su conjunto de pruebas para evaluar la seguridad semántica de los robots, con nuevos datos, vídeos y tipos de preguntas.

El enfoque de seguridad combina el razonamiento sobre la tarea antes de actuar con políticas de interacción humana y sistemas de bajo nivel, como la prevención de colisiones. En la práctica, eso significa que el robot debe valorar si una acción es adecuada, pero también contar con controles específicos para no golpear personas u objetos.

Para ti, el cambio importante no es que los robots vayan a encargarse mañana de cualquier tarea doméstica. Es que Google está intentando pasar de robots que responden a órdenes aisladas a sistemas capaces de buscar información, organizar una misión y ejecutarla paso a paso. El próximo punto que habrá que vigilar es cómo se comportan estos modelos fuera de entornos de prueba, donde los objetos, las instrucciones y los riesgos rara vez están perfectamente controlados.

Google presenta Gemini Robotics 1.5 para robots | neversleep.ai