Google lanza Gemini Omni para crear y editar vídeos
Google presenta Gemini Omni Flash, un modelo que crea y edita vídeos a partir de texto, imágenes, audio y otros vídeos. La herramienta llega primero a Gemini, Google Flow, YouTube Shorts y YouTube Create, con avatares y marca de agua SynthID.

Google presenta Gemini Omni, un nuevo modelo capaz de convertir texto, imágenes, audio y vídeo en nuevas piezas de vídeo. También permite editarlas mediante instrucciones escritas, como si estuvieras dando indicaciones a un editor.
El primer modelo de esta familia es Gemini Omni Flash. Desde el 19 de mayo de 2026, comienza a llegar a la aplicación de Gemini y a Google Flow para suscriptores de Google AI Plus, Pro y Ultra en todo el mundo. También se incorpora sin coste a YouTube Shorts y YouTube Create durante esta semana.
Editar un vídeo hablando con la IA
La principal diferencia está en que puedes modificar un vídeo por turnos, sin empezar de cero cada vez. Por ejemplo, podrías pedir que una escultura se convierta en burbujas, cambiar el escenario, añadir personajes o transformar la acción de una escena.
Gemini Omni intenta conservar la continuidad entre instrucciones: los personajes mantienen su apariencia, la escena recuerda lo ocurrido antes y los cambios se aplican sobre el resultado anterior. En la práctica, puedes pedir algo como:
- Cambiar el ángulo de la cámara.
- Sustituir el entorno.
- Aplicar otro estilo visual.
- Añadir objetos o personajes.
- Modificar una acción concreta.
Esto convierte la edición de vídeo en una conversación. Aun así, el anuncio describe las capacidades del modelo y su despliegue inicial, no garantiza que todos los resultados sean perfectos en cada escena.
Vídeos con referencias y conocimiento del mundo
Omni puede combinar referencias de distintos formatos para crear un vídeo coherente. Puedes partir de una imagen de un personaje, un dibujo, un vídeo existente, un texto o una referencia de voz, y usar esos elementos para guiar el resultado.
Google también afirma que el modelo puede apoyarse en el conocimiento de Gemini sobre historia, ciencia y cultura. La idea es que no solo genere imágenes plausibles, sino que produzca escenas con una lógica más consistente. Entre los ejemplos mostrados están una reacción en cadena con una canica, una explicación visual del plegamiento de proteínas y un vídeo educativo con objetos para representar las 26 letras del alfabeto.
El modelo también busca representar mejor fenómenos como la gravedad, la energía cinética y la dinámica de los fluidos. Eso puede ayudar en vídeos donde el movimiento importa, aunque la precisión seguirá dependiendo de la escena y de las instrucciones.
Avatares y señales para identificar el contenido
Gemini Omni incluye una función de avatares que permite crear vídeos con una versión digital de ti, usando tu voz. Google señala que todavía está probando otras funciones relacionadas con la edición de audio y del habla para incorporarlas de forma responsable.
Todos los vídeos creados con Omni incluyen una marca de agua digital imperceptible llamada SynthID. Google dice que podrá verificarse desde Gemini, Gemini en Chrome y Google Search. La marca no se ve a simple vista, pero sirve para ayudar a identificar que un contenido fue generado con IA.
La disponibilidad para desarrolladores y empresas mediante API llegará en las próximas semanas. Para ti, el cambio más inmediato es que crear o rehacer un vídeo puede depender menos de saber editar y más de explicar con claridad qué quieres. El siguiente reto será comprobar cuánto mantiene Omni esa promesa cuando las escenas se vuelven largas, complejas o difíciles de distinguir de una grabación real.