MolmoMotion predice el movimiento 3D para robots
MolmoMotion predice trayectorias 3D a partir de una imagen, puntos sobre un objeto y una instrucción escrita. El modelo mejora la planificación robótica y permite controlar con más precisión el movimiento en vídeos generados, aunque todavía está limitado por su representación de ocho puntos por objeto.

MolmoMotion puede anticipar cómo se moverá un objeto en 3D a partir de una imagen, varios puntos marcados sobre él y una instrucción escrita. El modelo de Allen Institute convierte frases como «mueve y gira el cuenco de madera» en una trayectoria futura que un robot o un generador de vídeo puede utilizar.
La diferencia clave está entre ver el movimiento que ya ocurrió y predecir el que viene. Un sistema que observa un vídeo puede seguir una taza mientras alguien la levanta. Pero un robot necesita saber hacia dónde se moverá antes de tocarla, para planificar su agarre sin chocar ni perderla.
Cómo funciona
MolmoMotion representa cada objeto mediante varios puntos 3D unidos a su superficie. No intenta renderizar un vídeo completo ni depende de plantillas específicas para manos, cuerpos o coches. Esos puntos permiten describir el movimiento de objetos rígidos, articulados y, con ciertas limitaciones, deformables.
El modelo recibe tres elementos principales:
- Una observación RGB, es decir, una imagen normal de la escena.
- Ocho puntos seleccionados sobre el objeto y su posición inicial en 3D.
- Una descripción de la acción que se quiere anticipar.
Después identifica qué objeto menciona la instrucción y predice dónde estarán esos puntos durante los segundos siguientes. Así puede describir acciones como hacer rodar un quitapelusas sobre una tela, deslizar y girar un cuenco, o seguir el recorrido de un coche que toma una curva.
MolmoMotion utiliza Molmo 2 como base y ofrece dos versiones. MolmoMotion-AR calcula la trayectoria paso a paso, algo útil cuando el futuro está bien definido. MolmoMotion-FM genera trayectorias en un espacio 3D continuo y puede representar mejor que existen varios futuros posibles para una misma instrucción.
Un millón de vídeos para aprender movimiento
Para entrenarlo, el equipo creó MolmoMotion-1M, una colección de trayectorias 3D asociadas a acciones y objetos. El conjunto reúne datos extraídos de 1,16 millones de vídeos, con 736 tipos de movimiento y 5.600 objetos distintos.
El proceso filtra puntos que se mueven de forma incoherente, suaviza las trayectorias y recorta cada vídeo para centrarse en el momento en que el objeto realmente se desplaza. Esto es importante porque los vídeos normales no incluyen directamente anotaciones precisas de profundidad ni de movimiento tridimensional.
También publican PointMotionBench, un banco de pruebas validado por personas con 2.700 clips, 111 categorías de objetos y 61 tipos de movimiento. Su objetivo es medir si la trayectoria predicha coincide con el movimiento real, no solo si el resultado parece razonable.
Qué mejora en robots y vídeo
En las pruebas de PointMotionBench, MolmoMotion superó a los métodos de predicción 3D comparados por el equipo, incluidos generadores de vídeo, modelos 3D especializados y una referencia que supone que el objeto mantiene una velocidad constante.
La mejora también aparece en robótica. En simulaciones de tareas de recoger y colocar objetos, una política de control basada en MolmoMotion tuvo un 76,3 % de éxito, frente al 56,0 % de la misma política basada en Molmo 2. Además, alcanzó un 51 % de éxito tras 10.000 pasos de entrenamiento, mientras que la versión anterior llegaba al 19 %.
El modelo también puede guiar generadores de vídeo. En lugar de pedirle al generador que adivine el movimiento a partir de una frase, se le entrega una trayectoria 3D concreta. Según las pruebas del equipo, esto mejora las cinco métricas relacionadas con movimiento y supera a un generador de vídeo mucho más grande en cuatro de ellas.
La principal limitación es que ocho puntos por objeto no bastan para representar con detalle superficies complejas. Por eso, el sistema todavía tiene dificultades con movimientos deformables, como los de una tela que cambia de forma.
MolmoMotion apunta a una idea sencilla pero importante: para que una máquina actúe en el mundo, no basta con reconocer lo que está pasando. También debe anticipar qué ocurrirá después. Sus pesos, datos de entrenamiento y banco de pruebas se publican para que otros equipos puedan evaluarlos y adaptarlos a robots, vídeo y nuevas tareas físicas.