Google presenta Gemini 3.1 Flash-Lite para escala
Google presenta Gemini 3.1 Flash-Lite, un modelo en preview diseñado para cargas de trabajo con muchas solicitudes. Promete más velocidad y menor coste, con precios desde 0,25 dólares por millón de tokens de entrada.

Google presenta Gemini 3.1 Flash-Lite, un modelo diseñado para procesar grandes volúmenes de tareas con menor coste y respuesta más rápida. Desde hoy, llega en versión preliminar para desarrolladores a través de Gemini API, Google AI Studio y Vertex AI para empresas.
El modelo está pensado para productos que necesitan responder muchas veces al día, como traducción automática, moderación de contenido o asistentes en tiempo real. Su precio es de 0,25 dólares por cada millón de tokens de entrada y 1,50 dólares por cada millón de tokens generados. Los tokens son las pequeñas unidades de texto que el modelo procesa.
Más velocidad por menos coste
Según Google, Gemini 3.1 Flash-Lite supera a Gemini 2.5 Flash en velocidad y mantiene una calidad similar o superior. En el benchmark de Artificial Analysis, tarda 2,5 veces menos en entregar el primer token de respuesta y genera texto un 45 % más rápido.
Ese primer resultado importa en aplicaciones interactivas. Por ejemplo, si una herramienta revisa cientos de mensajes o genera respuestas para usuarios, una menor latencia puede hacer que la espera sea más corta y que el coste total sea más fácil de controlar.
Google también cita un resultado de 1432 puntos Elo en la clasificación de Arena.ai. En otras pruebas, el modelo obtuvo un 86,9 % en GPQA Diamond, que mide razonamiento avanzado, y un 76,8 % en MMMU Pro, centrado en comprensión de texto e imágenes.
El desarrollador decide cuánto razona
Gemini 3.1 Flash-Lite incluye niveles de razonamiento configurables en AI Studio y Vertex AI. En la práctica, el desarrollador puede elegir cuánto esfuerzo dedica el modelo a una tarea: menos para respuestas rápidas y económicas, o más para problemas que necesitan análisis detallado.
Esa opción permite usar el mismo modelo en trabajos muy distintos:
- Traducir grandes cantidades de contenido.
- Clasificar y moderar publicaciones.
- Crear interfaces y paneles a partir de instrucciones.
- Generar simulaciones o resolver tareas con varios pasos.
La diferencia es importante porque no todas las solicitudes necesitan el mismo nivel de análisis. Una moderación rutinaria puede priorizar velocidad, mientras que la generación de un dashboard funcional puede requerir más razonamiento.
Qué cambia para ti
Si utilizas una aplicación que integre Gemini, este lanzamiento no significa que el modelo vaya a aparecer automáticamente en todos los servicios. Por ahora, está disponible en preview para desarrolladores y empresas, que deberán decidir si encaja en sus productos y asumir las condiciones de esta fase.
Para quienes construyen herramientas de IA, la propuesta es concreta: ejecutar más solicitudes con un modelo de la familia Gemini 3 sin tener que pagar el precio de una opción más grande. Google afirma que probadores iniciales, entre ellos Latitude, Cartwheel y Whering, ya lo usan para resolver tareas complejas a escala.
Lo que habrá que vigilar es si esa combinación de precio, velocidad y calidad se mantiene cuando el modelo salga de la preview y se enfrente a cargas reales. El movimiento confirma una tendencia clara: la competencia ya no se centra solo en crear modelos más capaces, sino en hacer que puedan utilizarse miles o millones de veces sin que el coste y la espera se disparen.