Overworld lanza Waypoint-1, IA de mundos en tiempo real
Overworld presenta Waypoint-1, un modelo que genera mundos de vídeo interactivos y responde en tiempo real a tus movimientos, al teclado, al ratón y al texto. Su versión Small puede alcanzar hasta 60 FPS en una RTX 5090, según las pruebas de la empresa.

Overworld ha presentado Waypoint-1, un modelo de IA que genera mundos de vídeo interactivos en tiempo real a partir de texto, imágenes y controles de teclado y ratón. En lugar de limitarse a crear un vídeo para mirar, intenta construir un entorno en el que puedas entrar y moverte.
Puedes darle unas imágenes iniciales, escribir una instrucción como "un juego donde pastoreas cabras en un valle" y controlar la cámara con el ratón o pulsar teclas. El sistema genera nuevos fotogramas teniendo en cuenta cada acción.
Un mundo que responde a tus movimientos
La diferencia frente a muchos modelos de vídeo es que Waypoint-1 se ha entrenado desde el principio para experiencias interactivas. Overworld utilizó 10.000 horas de imágenes de videojuegos, combinadas con controles y descripciones de texto.
En otros sistemas, los controles suelen aplicarse cada varios fotogramas. Eso provoca retraso y limita la sensación de estar dentro del entorno. Waypoint-1 está diseñado para aceptar movimientos continuos de cámara y cualquier tecla del teclado, con una respuesta que la empresa describe como de latencia cero.
El resultado no es un videojuego creado con escenarios, personajes y reglas programadas de antemano. Es una secuencia de imágenes generadas por el modelo mientras juegas. Cada fotograma nuevo se produce usando como contexto los anteriores y las acciones que acabas de realizar.
Cómo consigue generar vídeo al momento
El modelo utiliza una técnica de difusión, el mismo tipo de tecnología empleada por muchos generadores de imágenes y vídeo. En términos simples, aprende a convertir información ruidosa en fotogramas coherentes.
Su arquitectura procesa los fotogramas en orden: cada uno puede utilizar la información de su propio momento y de los anteriores, pero no mirar los que todavía no existen. Así puede crear un flujo continuo de nuevas imágenes en lugar de generar todo el vídeo antes de enseñártelo.
Overworld también aplicó un entrenamiento posterior llamado self-forcing. La idea es preparar al modelo para las mismas condiciones que encontrará al funcionar: generar un fotograma, usarlo como contexto y repetir el proceso. Esto busca reducir la acumulación de errores y el deterioro de la imagen durante sesiones largas.
Rendimiento en un ordenador de consumo
El modelo disponible es Waypoint-1-Small, con 2.300 millones de parámetros. Overworld afirma que, ejecutado en una tarjeta gráfica RTX 5090 mediante su biblioteca WorldEngine, alcanza:
- 30 fotogramas por segundo usando cuatro pasos de generación.
- 60 fotogramas por segundo usando dos pasos.
- Un rendimiento aproximado de 30.000 pasadas de tokens por segundo en una sola pasada de eliminación de ruido.
Estas cifras corresponden a las condiciones de prueba de la empresa y a una RTX 5090, no a cualquier ordenador. Aun así, apuntan a un cambio importante: los modelos de mundos virtuales empiezan a acercarse a una interacción inmediata, en vez de limitarse a demostraciones de vídeo pregrabado.
Qué puedes hacer con Waypoint-1
WorldEngine ofrece una biblioteca en Python para conectar el modelo con aplicaciones propias. El sistema recibe imágenes de contexto, instrucciones de texto y entradas del teclado o el ratón, y devuelve nuevos fotogramas para transmitirlos en tiempo real.
Por ahora, Overworld ha anunciado Waypoint-1-Small. La versión Waypoint-1-Medium llegará más adelante. También ha abierto Overworld Stream para probar la experiencia y ha organizado un hackathon para desarrollar aplicaciones sobre WorldEngine.
Para ti, la importancia está en que la IA deja de ser solo una herramienta para generar escenas cerradas. Si estos modelos mejoran su estabilidad y mantienen el rendimiento, podrán servir para crear prototipos de juegos, simuladores, entornos educativos o espacios virtuales que respondan a tus acciones sin que cada escenario tenga que construirse manualmente.
El siguiente reto no será únicamente generar más fotogramas por segundo. Será mantener reglas consistentes, recordar lo que ocurre en el mundo y evitar que el entorno se deforme después de varios minutos de interacción. Ahí se verá si Waypoint-1 es una demostración rápida o el principio de una nueva forma de crear mundos digitales.