Google lanza Gemini 3 Flash, rápido y más barato
Google presenta Gemini 3 Flash, un modelo que combina razonamiento avanzado, análisis visual y programación con una velocidad hasta tres veces mayor que Gemini 2.5 Pro, según sus pruebas. Su precio parte de 0,50 dólares por millón de tokens de entrada y ya llega a varias herramientas para desarrolladores y empresas.

Google ha lanzado Gemini 3 Flash, un modelo de inteligencia artificial diseñado para responder con rapidez, manejar tareas complejas y costar mucho menos que Gemini 3 Pro. La compañía afirma que supera a Gemini 2.5 Pro en varios benchmarks y que funciona tres veces más rápido según las mediciones de Artificial Analysis.
La idea es sencilla: ofrecer capacidades avanzadas de razonamiento, programación y análisis visual sin obligar a los desarrolladores a pagar el precio o esperar los tiempos de un modelo más grande.
Qué ofrece Gemini 3 Flash
Google presenta el modelo como una alternativa para aplicaciones que necesitan inteligencia y velocidad al mismo tiempo. En sus pruebas, Gemini 3 Flash obtuvo:
- 90,4% en GPQA Diamond, una prueba de razonamiento científico de nivel doctoral.
- 33,7% en Humanity’s Last Exam, sin utilizar herramientas externas.
- Un rendimiento superior al de
Gemini 2.5 Proen varios benchmarks, según Google.
El modelo también incorpora las capacidades multimodales de la familia Gemini. Eso significa que puede trabajar con texto, imágenes y vídeo, además de analizar relaciones espaciales. Google destaca una función especialmente práctica: puede ejecutar código para ampliar, contar o editar elementos dentro de una imagen.
Por ejemplo, una aplicación podría analizar una fotografía de un inventario, contar objetos concretos y devolver el resultado sin que una persona tenga que revisarlo manualmente.
Cuánto cuesta
En la API de Gemini y en Vertex AI, los precios anunciados son de 0,50 dólares por cada millón de tokens de entrada y 3 dólares por cada millón de tokens de salida. Los tokens son las unidades de texto que el modelo procesa, como fragmentos de palabras o signos.
El audio de entrada tiene un precio de 1 dólar por cada millón de tokens. Google también incluye varias opciones para reducir el coste en determinados escenarios:
- El almacenamiento temporal de contexto puede recortar el precio hasta un 90% cuando se reutiliza información.
- La Batch API ofrece un 50% de ahorro para tareas asíncronas, es decir, trabajos que no necesitan una respuesta inmediata.
- Los clientes de pago reciben límites de uso preparados para producción y aplicaciones casi en tiempo real.
En la práctica, esto puede hacer viable utilizar el modelo para revisar grandes volúmenes de documentos, procesar imágenes o generar código de forma repetida sin que cada consulta resulte demasiado cara.
Dónde se puede usar
Gemini 3 Flash se está incorporando a la API de Gemini mediante Google AI Studio, Google Antigravity, Gemini CLI, Android Studio y Vertex AI para empresas.
Google también ha compartido varios usos tempranos:
- Programación: asistencia para crear y modificar código con ciclos de trabajo más rápidos.
- Videojuegos: análisis de vídeo y generación de planes y código jugable a partir de una instrucción.
- Detección de deepfakes: Resemble AI afirma que analiza contenido multimodal cuatro veces más rápido que con
Gemini 2.5 Pro. - Documentos legales: Harvey lo utiliza para analizar textos complejos manteniendo el foco en la velocidad.
Estas experiencias proceden de clientes y socios citados por Google, no de una evaluación independiente común para todos los casos.
Para los desarrolladores, el cambio principal es económico y operativo: pueden probar tareas que antes requerían un modelo más caro, con más solicitudes por minuto y menor latencia. Para ti, eso puede traducirse en aplicaciones que responden antes, asistentes capaces de revisar imágenes o documentos y herramientas de programación más accesibles.
Google está empujando Gemini 3 Flash hacia un punto concreto: que la inteligencia avanzada no tenga que implicar respuestas lentas o costes elevados. Lo importante ahora será comprobar cómo se comporta fuera de los benchmarks, especialmente en precisión, estabilidad y tareas reales a gran escala.