Google presenta Gemini 2.0 para agentes de IA
Google lanza Gemini 2.0 Flash experimental, un modelo capaz de usar herramientas, generar texto, imágenes y audio, y planificar tareas bajo supervisión. También presenta Deep Research y prototipos de agentes para navegar por webs, programar y asistir en el mundo real.

Google presenta Gemini 2.0, una nueva familia de modelos diseñada para que la IA no solo responda preguntas, sino que también pueda planificar tareas, usar herramientas y actuar con tu supervisión.
El primer lanzamiento es Gemini 2.0 Flash experimental, un modelo rápido que Google ofrece desde el 11 de diciembre de 2024 a desarrolladores y usuarios de Gemini. La compañía asegura que supera a Gemini 1.5 Pro en pruebas clave y que responde al doble de velocidad, aunque la disponibilidad de sus funciones cambia según el tipo de acceso.
De contestar a hacer cosas
La idea central de Gemini 2.0 es la de los agentes de IA. Son sistemas capaces de entender una situación, dividir una tarea en pasos y ejecutar algunas acciones en tu nombre, sin dejar de pedirte permiso cuando sea necesario.
Por ejemplo, un agente podría consultar información, escribir código o interactuar con una página web para completar un proceso. No se trata de darle control total sobre tu ordenador: Google afirma que sus prototipos mantienen al usuario dentro del circuito y solicitan confirmación antes de acciones sensibles, como realizar una compra.
Gemini 2.0 Flash también incorpora capacidades multimodales. Eso significa que puede recibir texto, imágenes, vídeo y audio, y que el modelo está preparado para generar distintos tipos de respuesta:
- Texto combinado con imágenes generadas.
- Audio multilingüe mediante conversión de texto a voz.
- Uso directo de Google Search, ejecución de código y funciones creadas por desarrolladores.
- Interacción en tiempo real con audio y vídeo a través de una nueva API.
La generación de imágenes, el audio y algunas funciones avanzadas comienzan con acceso limitado para socios seleccionados. Google prevé ampliar la disponibilidad en enero de 2025 junto con otros tamaños de modelo.
Qué puedes probar ahora
La versión experimental de Gemini 2.0 Flash está disponible para desarrolladores mediante la API de Gemini en Google AI Studio y Vertex AI. En la aplicación Gemini, los usuarios de todo el mundo pueden seleccionarla desde el menú de modelos en la web para ordenador y móvil, mientras que su llegada a la aplicación móvil se anuncia como inminente.
Google también activa Deep Research para los suscriptores de Gemini Advanced. Esta función actúa como asistente de investigación: explora temas complejos y prepara informes usando razonamiento avanzado y una ventana de contexto extensa, es decir, la capacidad de trabajar con grandes cantidades de información en una misma tarea.
En el buscador, Google está probando las capacidades de razonamiento de Gemini 2.0 dentro de AI Overviews, sus resúmenes generados por IA. La compañía dice que esta función ya llega a 1.000 millones de personas y que la nueva versión podrá abordar preguntas de varios pasos, matemáticas avanzadas, consultas con imágenes y programación. El despliegue más amplio está previsto para comienzos de 2025.
Los agentes que Google está probando
Google DeepMind también presenta varios prototipos que todavía no son productos generales:
- Project Astra explora un asistente universal capaz de conversar en varios idiomas, usar Search, Lens y Maps, y recordar hasta 10 minutos de una sesión. También busca responder con una latencia parecida a una conversación humana.
- Project Mariner funciona como una extensión experimental de Chrome que interpreta lo que aparece en una página y puede hacer clic, escribir o desplazarse para completar tareas. En la prueba WebVoyager obtuvo un 83,5%, según Google, aunque la compañía reconoce que todavía puede ser lento e impreciso.
- Jules es un agente para programación que se integra con GitHub, analiza un problema, propone un plan y ejecuta cambios bajo la dirección del desarrollador.
Google también investiga agentes para videojuegos y robótica. En ambos casos, la tecnología sigue en una fase temprana y se presenta como experimento, no como una función lista para el uso cotidiano.
El límite sigue siendo la confianza
Cuanto más puede hacer un sistema por ti, más importante es controlar sus errores. Google dice que está probando estos agentes con usuarios seleccionados, expertos externos y evaluaciones de seguridad. También trabaja para que detecten instrucciones maliciosas ocultas en páginas, correos o documentos, un riesgo conocido como prompt injection.
Para ti, el cambio inmediato es limitado: puedes probar un modelo más rápido y funciones de investigación, pero los agentes capaces de navegar por webs o ejecutar tareas todavía están en pruebas. Lo importante es la dirección que marca Gemini 2.0: la IA deja de ser solo una herramienta para conversar y empieza a convertirse en una interfaz que puede actuar. La cuestión que habrá que vigilar es si aprende a hacerlo con suficiente precisión, transparencia y control humano.