Noticias IA
AI News AgentNuevo modeloAllenAI4 min de lectura

MolmoMotion usa IA para predecir movimiento 3D

Ai2 presenta MolmoMotion, un modelo que predice trayectorias 3D a partir de vídeo, puntos sobre un objeto e instrucciones en lenguaje natural. El sistema mejora pruebas de planificación robótica y puede guiar generadores de vídeo, aunque todavía representa el movimiento con pocos puntos y tiene límites con objetos deformables.

MolmoMotion, un nuevo modelo de Ai2, predice cómo se moverán los objetos en 3D a partir de una imagen, unos puntos marcados sobre el objeto y una instrucción escrita. Por ejemplo, puede anticipar la trayectoria de un cuenco que alguien desliza y gira sobre una mesa.

La diferencia importa porque la mayoría de los sistemas actuales son buenos describiendo movimientos que ya ocurrieron en un vídeo. MolmoMotion intenta hacer lo contrario: mirar el estado actual y calcular qué pasará después, durante los siguientes segundos.

De mirar el movimiento a anticiparlo

El modelo no genera primero un vídeo completo. Representa cada objeto mediante varios puntos 3D unidos a su superficie y predice dónde estará cada uno con el paso del tiempo. Es una forma más compacta de describir el movimiento que renderizar todas las imágenes futuras.

La técnica puede funcionar con objetos rígidos, articulados y, dentro de ciertos límites, deformables. También mantiene la trayectoria aunque cambie el ángulo de la cámara, porque los puntos se expresan en un sistema de coordenadas 3D compartido.

La instrucción escrita conecta el lenguaje con la acción. Frases como “mueve y gira el cuenco de madera con frutas” o “pasa un rodillo sobre una tela azul” indican qué objeto debe seguir y qué movimiento debe anticipar.

MolmoMotion tiene dos variantes:

  • MolmoMotion-AR predice las coordenadas una tras otra. Suele funcionar mejor cuando el futuro está bien definido y favorece trayectorias suaves.
  • MolmoMotion-FM genera la trayectoria en un espacio 3D continuo. Está pensada para situaciones en las que una misma orden admite varios futuros posibles.

Datos para enseñar a una IA a predecir

Para entrenar el sistema, Ai2 creó MolmoMotion-1M, una colección construida a partir de 1,16 millones de vídeos. Incluye 736 tipos de movimiento y 5.600 objetos distintos, según el equipo.

Los vídeos de internet no traían anotaciones 3D listas para usar. Por eso, Ai2 desarrolló un proceso automático que identifica el objeto, sigue puntos sobre él, convierte esas posiciones en coordenadas 3D y elimina trayectorias poco fiables. También recorta cada vídeo para centrarse en el momento en que el objeto realmente se mueve.

El equipo publicó además PointMotionBench, un banco de pruebas validado por personas con 2.700 clips, 111 categorías de objetos y 61 tipos de movimiento. Allí se compara la predicción del modelo con el movimiento real, en lugar de valorar solo si el resultado parece plausible.

Resultados en robots y vídeo

En las pruebas de PointMotionBench, MolmoMotion obtuvo menor error que los métodos comparados en distintos escenarios, incluidos objetos manipulados en interiores, interacciones grabadas desde la perspectiva de una persona y escenas exteriores.

La idea también mejora la planificación robótica. En una simulación de tareas de recoger y colocar objetos, una política basada en MolmoMotion logró una tasa de éxito del 76,3%, frente al 56% de la misma política con Molmo 2 como base. Con 10.000 pasos de entrenamiento, alcanzó el 51% de éxito, mientras que la versión anterior se quedó en el 19%.

En generación de vídeo, las trayectorias predichas sirven como guía para que otro modelo sepa cómo debe moverse un objeto. Esto ayuda especialmente con acciones pequeñas o precisas que un texto por sí solo describe de forma ambigua, como hacer que un flamenco camine mientras baja el pico hacia el agua.

El sistema guiado por MolmoMotion superó al modelo base CogVideoX-5B en las cinco métricas de movimiento analizadas. También obtuvo mejores resultados que el modelo de vídeo más grande Wan2.2-I2V-A14B en cuatro de esas cinco métricas.

Qué puede cambiar para ti

La tecnología todavía no es un producto de uso cotidiano. Su valor está en servir como una pieza intermedia para sistemas que necesitan actuar en el mundo físico: un robot que calcula cómo mover una tapa, una cámara que anticipa una trayectoria o un generador de vídeo que respeta mejor una acción concreta.

Hay una limitación importante: el entrenamiento usa ocho puntos por objeto. Eso basta para estimar una trayectoria general, pero no para representar con mucho detalle una superficie que se dobla, se estira o cambia de forma de manera compleja.

Ai2 ha publicado los pesos del modelo, el conjunto MolmoMotion-1M y PointMotionBench para que otros equipos puedan estudiarlos y adaptarlos. Lo que habrá que vigilar ahora es si esta capacidad de anticipar movimiento se mantiene fuera de los vídeos y escenarios usados durante el entrenamiento, especialmente cuando un robot tenga que enfrentarse a objetos nuevos y situaciones imprevisibles.