Genie 3: la IA de Google crea mundos interactivos
Google DeepMind presenta Genie 3, un modelo capaz de generar mundos virtuales navegables desde texto a 24 fotogramas por segundo y 720p. La tecnología puede cambiar el entorno mediante instrucciones y servir para entrenar agentes, aunque por ahora solo está disponible para un grupo limitado de investigadores y creadores.

Google DeepMind presentó Genie 3, un modelo de IA capaz de generar mundos virtuales interactivos a partir de una descripción escrita. Puedes recorrerlos en tiempo real, cambiar sus condiciones y mantener cierta continuidad durante varios minutos.
El modelo produce 24 fotogramas por segundo con una resolución de 720p. En la práctica, eso significa que una frase como "un bosque tropical al atardecer" puede convertirse en un entorno por el que un usuario o un agente de IA se mueve, mientras el sistema genera cada imagen y responde a sus acciones.
De los vídeos a los mundos que responden
Un modelo de vídeo crea una secuencia de imágenes. Un modelo del mundo intenta hacer algo más: representar cómo funciona un entorno y anticipar qué ocurre cuando alguien actúa sobre él.
Si caminas hacia un río, Genie 3 debe actualizar lo que ves. Si vuelves al mismo sitio un minuto después, necesita recordar suficientes detalles para que el lugar siga siendo reconocible. Google DeepMind afirma que el modelo conserva esa coherencia visual durante varios minutos y que su memoria del entorno puede extenderse hasta un minuto atrás.
La diferencia importa porque estos mundos no son solo vídeos que se reproducen. Se generan fotograma a fotograma según la descripción inicial y las decisiones del usuario. El resultado puede incluir fenómenos como agua, iluminación, animales, plantas y cambios en el entorno.
Qué puedes hacer dentro de estos entornos
Genie 3 combina navegación con una función que Google DeepMind llama eventos activables mediante texto. Puedes modificar el mundo escribiendo instrucciones, por ejemplo:
- Cambiar el tiempo de soleado a lluvioso.
- Añadir objetos, animales o personajes.
- Crear escenarios fantásticos o animados.
- Explorar lugares y épocas históricas imaginadas.
- Probar situaciones hipotéticas para observar qué sucede.
Esta capacidad también puede servir para entrenar sistemas de IA. Un agente recibe un objetivo, como encontrar un objeto o desplazarse hasta un punto, y aprende a conseguirlo enviando acciones de navegación al entorno. Genie 3 simula las consecuencias sin conocer directamente cuál es la meta del agente.
Por qué interesa para robots y agentes de IA
Entrenar un robot en el mundo real es caro, lento y puede ser peligroso. Un mundo generado por IA permite crear muchos escenarios y repetirlos sin construir físicamente cada uno.
Google DeepMind ya probó esta idea con una versión reciente de SIMA, su agente generalista para entornos virtuales en 3D. Según la compañía, la mayor consistencia de Genie 3 permite ejecutar secuencias de acciones más largas y trabajar con objetivos más complejos.
Esto podría utilizarse para:
- Preparar agentes para situaciones poco frecuentes.
- Evaluar qué tan bien resuelven una tarea.
- Detectar sus puntos débiles.
- Crear simulaciones para educación y formación.
- Investigar el comportamiento de robots y sistemas autónomos.
Para ti, el impacto inmediato no es una nueva aplicación disponible para todo el público. El modelo se ha lanzado como vista previa de investigación limitada, con acceso inicial para un grupo reducido de académicos y creadores.
Genie 3 todavía tiene límites
Google DeepMind reconoce que el sistema está lejos de simular el mundo sin errores. Sus principales restricciones son:
- Los agentes solo pueden realizar un conjunto limitado de acciones directas.
- Las interacciones complejas entre varios agentes siguen siendo difíciles.
- Las ubicaciones reales no se representan con precisión geográfica perfecta.
- El texto dentro de las escenas puede resultar ilegible si no se especifica claramente en la descripción.
- La interacción continua dura unos minutos, no horas.
Además, que un mundo parezca coherente no significa que reproduzca con exactitud todas las leyes físicas o los detalles de un lugar real. La propia empresa está tratando esta tecnología como un área de investigación, no como un simulador definitivo.
Genie 3 apunta a una dirección concreta: agentes de IA que no solo respondan a instrucciones, sino que aprendan probando acciones dentro de entornos que reaccionan. Lo que habrá que vigilar ahora es si esa coherencia se mantiene durante periodos más largos, con más agentes y con tareas menos controladas.