Google presenta Nano Banana 2 para crear imágenes con IA
Google presenta Nano Banana 2, un modelo basado en Gemini 3.1 Flash Image que genera y edita imágenes con más precisión, texto más fiable y nuevos controles de formato y resolución. Está disponible para desarrolladores mediante una API de pago en Google AI Studio, Vertex AI, Google Antigravity y Firebase.

Google ha presentado Nano Banana 2, un modelo de generación y edición de imágenes basado en Gemini 3.1 Flash Image. La compañía lo orienta a desarrolladores que necesitan crear imágenes con rapidez, controlar mejor el resultado y llevar esas funciones a productos que trabajan a gran escala.
El modelo ya está disponible mediante la API de Gemini en Google AI Studio, aunque se necesita una clave de API de pago. También puede utilizarse para despliegues empresariales en Vertex AI y está integrado en Google Antigravity y Firebase.
Imágenes con información del mundo real
Nano Banana 2 puede apoyarse en el conocimiento de Gemini y en imágenes obtenidas mediante búsquedas web para generar representaciones más detalladas de lugares y situaciones reales. Esto permite crear imágenes basadas en referencias concretas, en lugar de depender únicamente de una descripción textual.
Google muestra esta función con Window Seat, una aplicación que genera vistas fotorrealistas desde la ventana de un avión. La imagen se inspira en distintas ubicaciones del mundo y puede incorporar datos meteorológicos actuales.
En la práctica, una aplicación turística podría mostrar cómo se ve una ciudad en un momento concreto, o una herramienta educativa podría crear escenas basadas en lugares históricos reales.
Mejor texto dentro de las imágenes
Uno de los problemas habituales de los generadores de imágenes es que producen letras deformadas, palabras incompletas o carteles ilegibles. Google afirma que Nano Banana 2 mejora la precisión con la que representa texto dentro de una imagen.
El modelo también permite generar o traducir texto directamente en la imagen y adaptarlo a distintos idiomas. La demostración Global Ad Localizer traduce un anuncio para varios mercados y ajusta tanto las palabras como los elementos visuales para cada idioma.
Esto puede servir para crear campañas publicitarias localizadas, interfaces visuales, material educativo o catálogos sin tener que rehacer manualmente cada versión.
Más control sobre el resultado
La nueva versión añade varias opciones pensadas para flujos de trabajo profesionales:
- Más formatos nativos: además de los formatos ya disponibles, incorpora relaciones de aspecto de 4:1, 1:4, 8:1 y 1:8, útiles para banners, cabeceras y composiciones panorámicas.
- Resolución de 512 píxeles: se suma a las opciones de 1K, 2K y 4K para reducir la latencia durante pruebas rápidas o procesos que generan muchas imágenes.
- Mejor seguimiento de instrucciones: el modelo interpreta con más precisión indicaciones complejas con varias condiciones.
- Niveles de razonamiento configurables: el desarrollador puede elegir entre
Minimal, que es el nivel predeterminado, yHigh/Dynamic, que permiten dedicar más razonamiento a instrucciones difíciles antes de generar la imagen.
También busca mantener una mayor consistencia entre imágenes. En la demostración Pet Passport, una sola fotografía de una mascota se utiliza para colocarla en distintos lugares famosos sin perder sus rasgos principales.
Qué cambia para ti
Si utilizas una aplicación que genera imágenes, estas mejoras pueden traducirse en menos correcciones manuales, traducciones más útiles y resultados adaptados a formatos concretos. Para una empresa, la posibilidad de crear cientos o miles de variantes con texto localizado puede reducir trabajo de diseño y acelerar campañas.
El acceso está dirigido a desarrolladores y requiere una API de pago, por lo que no equivale a una nueva función gratuita para todos los usuarios de Gemini. El siguiente paso será comprobar cómo rinde fuera de las demostraciones: especialmente en la consistencia de personajes, la precisión de las traducciones y el coste de generar imágenes a gran escala.