Google presenta Veo 2 e Imagen 3 para crear contenido
Google lanza Veo 2 para generar vídeos con más control cinematográfico y presenta una versión mejorada de Imagen 3 para crear imágenes en más de 100 países. También estrena Whisk, una herramienta que combina imágenes de referencia para generar nuevas ideas visuales.

Google actualiza sus herramientas de creación con Veo 2, un modelo para generar vídeos, e Imagen 3, una versión mejorada de su sistema para crear imágenes. Ambos llegan con más control sobre el resultado y, según evaluaciones de personas, se colocan entre los modelos con mejores resultados de su categoría.
La diferencia práctica es que ya no tienes que limitarte a describir una escena de forma general. Con Veo 2 puedes pedir un tipo de plano, una lente o un efecto cinematográfico concreto. Por ejemplo, una toma en contrapicado que siga a un personaje por una escena, un primer plano de una científica frente a un microscopio o una imagen con poca profundidad de campo para desenfocar el fondo.
Veo 2 busca vídeos más realistas
Google afirma que Veo 2 entiende mejor la física del mundo real, los movimientos humanos y las expresiones faciales. Eso debería reducir errores habituales de los generadores de vídeo, como dedos adicionales, objetos que aparecen de la nada o movimientos poco naturales.
El modelo puede generar vídeos de hasta 4K de resolución y con una duración que llega a varios minutos, según la descripción de Google. También interpreta indicaciones técnicas de cinematografía: una lente de 18 mm para una perspectiva más amplia o una profundidad de campo reducida para concentrar la atención en un sujeto.
En comparaciones directas realizadas con evaluadores humanos, Google dice que Veo 2 obtuvo mejores resultados que otros modelos líderes. Es una afirmación basada en las pruebas de la compañía, no una garantía de que cada vídeo generado vaya a ser perfecto.
Por ahora, Veo 2 se incorpora a VideoFX, la herramienta de vídeo de Google Labs, con una ampliación progresiva del acceso. Para probarlo hay que apuntarse a una lista de espera. Google también planea llevarlo a YouTube Shorts y a otros productos durante 2025.
Como ocurre con los modelos de generación de imágenes y vídeo de Google, las creaciones incluyen una marca de agua invisible SynthID. Su objetivo es ayudar a identificar que un contenido fue generado por IA y reducir el riesgo de que se atribuya erróneamente a una persona o acontecimiento real.
Imagen 3 mejora el control sobre las imágenes
La nueva versión de Imagen 3 genera imágenes más luminosas, con composiciones más cuidadas y mayor nivel de detalle en las texturas. También sigue las instrucciones con más fidelidad y admite una gama más amplia de estilos, desde el fotorrealismo y el impresionismo hasta el anime y el arte abstracto.
La actualización se despliega globalmente en ImageFX, la herramienta de imágenes de Google Labs, en más de 100 países. En las comparaciones realizadas por evaluadores humanos, Google afirma que Imagen 3 también alcanzó resultados líderes frente a otros modelos.
Para ti, esto puede significar una herramienta más útil para crear bocetos visuales, ilustraciones, conceptos de producto o material para redes sociales sin tener que dominar programas de diseño. Aun así, el resultado depende mucho de lo precisa que sea la descripción y de los límites del sistema en cada caso.
Whisk convierte imágenes en instrucciones
Google también presenta Whisk, un experimento que permite usar imágenes como punto de partida en lugar de escribirlo todo. Puedes aportar imágenes que representen el personaje, la escena y el estilo que buscas, y después combinarlas para crear algo nuevo, como un peluche digital, una pegatina o un pin esmaltado.
La herramienta utiliza Gemini para analizar las imágenes y redactar una descripción detallada. Después, esa descripción sirve como instrucción para Imagen 3. En la práctica, Whisk traduce referencias visuales a texto y usa ese texto para generar una nueva mezcla.
El siguiente punto a vigilar es el acceso. Google está ampliando estas herramientas poco a poco, especialmente Veo 2, mientras evalúa su calidad y seguridad. La tecnología ya permite crear vídeos e imágenes con instrucciones mucho más concretas, pero su disponibilidad, sus controles y la forma de distinguir estos contenidos de los reales serán tan importantes como la calidad visual.