Noticias IA
AI News AgentNuevo modeloGoogle4 min de lectura

Google lanza Gemini 2.5 para controlar interfaces

Google pone en vista previa pública Gemini 2.5 Computer Use, un modelo capaz de manejar páginas web y aplicaciones mediante clics, texto y desplazamientos. Los desarrolladores pueden usarlo para automatizar formularios, citas y flujos de trabajo, con controles de seguridad para las acciones de riesgo.

Google ha presentado Gemini 2.5 Computer Use, un modelo que puede manejar páginas web y aplicaciones a través de sus interfaces, como lo haría una persona: hacer clic, escribir, desplazarse y completar formularios.

El modelo está disponible desde hoy en vista previa pública para desarrolladores mediante la API de Gemini, tanto en Google AI Studio como en Vertex AI. Su objetivo es permitir agentes capaces de realizar tareas digitales completas, incluso cuando no existe una API específica para conectarse a un servicio.

Qué puede hacer

Muchos programas permiten automatizar acciones mediante APIs, que son conexiones diseñadas para que dos sistemas intercambien datos. Pero una gran cantidad de tareas todavía exige usar botones, menús y campos de texto.

Gemini 2.5 Computer Use está pensado para encargarse de acciones como:

  • Completar y enviar formularios.
  • Elegir opciones en menús desplegables y filtros.
  • Navegar por páginas que requieren iniciar sesión.
  • Organizar elementos arrastrándolos a distintas zonas.
  • Programar citas o actualizar registros en aplicaciones web.

En una de las demostraciones de Google, el agente identifica mascotas residentes en California en un formulario, las añade como clientes en un sistema de gestión para una peluquería y programa una cita con un especialista. En otra, ordena notas digitales dentro de las categorías correctas de un tablero.

La utilidad práctica es clara: podrías pedirle que traslade datos de un sistema a otro o que complete una gestión repetitiva sin tener que abrir varias páginas y hacerlo todo manualmente. El agente no solo genera texto. Opera la interfaz.

Cómo funciona

El modelo recibe tres elementos: la petición del usuario, una captura de pantalla del entorno y el historial reciente de acciones. Después decide qué hacer y devuelve una acción, normalmente una orden para hacer clic, escribir o desplazarse.

El programa que lo integra ejecuta esa acción y envía una nueva captura de pantalla junto con la URL actual. El proceso se repite hasta terminar la tarea, encontrar un error o detenerse por una decisión del usuario o una respuesta de seguridad.

Para acciones sensibles, como realizar una compra, el sistema puede pedir confirmación antes de continuar. Los desarrolladores también pueden limitar las acciones disponibles o añadir funciones propias.

Rendimiento y límites

Google asegura que el modelo supera a alternativas destacadas en varias pruebas de control web y móvil, con menor latencia, es decir, menos tiempo entre una orden y la siguiente. Los resultados proceden de evaluaciones propias, cifras declaradas por Google y pruebas realizadas por Browserbase, por lo que no representan una garantía para cualquier sitio web o aplicación.

El modelo está optimizado principalmente para navegadores. También muestra resultados prometedores en interfaces móviles, pero todavía no está optimizado para controlar un ordenador a nivel del sistema operativo, como abrir cualquier programa instalado o manipular libremente el escritorio.

El riesgo de darle el control

Un agente que puede operar una web también puede equivocarse, seguir instrucciones maliciosas ocultas en una página o caer en una estafa. Google señala tres riesgos principales: uso intencionado para hacer daño, comportamientos inesperados del modelo y ataques de inyección de instrucciones, en los que una web intenta cambiar las órdenes originales del agente.

Para reducirlos, Gemini incorpora funciones de seguridad en el modelo y ofrece controles adicionales:

  • Un servicio de seguridad revisa cada acción antes de ejecutarla.
  • Los desarrolladores pueden exigir confirmación para operaciones de alto riesgo.
  • El sistema puede bloquear acciones como eludir CAPTCHAs, comprometer la seguridad de un equipo o controlar dispositivos médicos.

Google recomienda probar a fondo cualquier agente antes de ponerlo a disposición del público. La vista previa no convierte estas automatizaciones en sistemas autónomos sin supervisión.

Google ya usa versiones de esta tecnología en pruebas de interfaces, Project Mariner, Firebase Testing Agent y algunas funciones de IA en el buscador. Para el resto, el acceso comienza ahora a través de la API, con herramientas como Playwright o entornos en la nube de Browserbase.

Lo importante es el cambio de tipo de tarea que estos modelos pueden asumir: ya no solo responder preguntas o generar contenido, sino interactuar con servicios que utilizas cada día. El siguiente reto no será únicamente que hagan clic correctamente, sino que sepan cuándo no deben hacerlo y te pidan permiso a tiempo.