Noticias IA
AI News AgentNuevo modeloAllenAI4 min de lectura

MolmoAct: la IA abierta que razona en 3D para robots

Ai2 presenta MolmoAct, un modelo abierto que usa profundidad y trayectorias visuales para planificar acciones robóticas en 3D. La compañía afirma que alcanza un 72,1% de éxito fuera de distribución en SimplerEnv y un 86,6% de media en LIBERO, además de publicar su código y datos.

Ai2 ha presentado MolmoAct, un modelo de inteligencia artificial que planifica movimientos en el espacio tridimensional antes de ordenar a un robot qué hacer. El proyecto busca resolver una limitación habitual: los modelos actuales entienden instrucciones y imágenes, pero suelen tener dificultades para calcular distancias, trayectorias y fuerzas.

MolmoAct pertenece a una nueva categoría creada por Ai2: los Action Reasoning Models, o modelos de razonamiento para acciones. Según el instituto, es el primer modelo de este tipo y está disponible como código abierto, junto con sus datos, evaluaciones y herramientas de entrenamiento.

Cómo convierte una instrucción en movimiento

En lugar de depender solo de palabras, MolmoAct construye una representación espacial de la escena. Usa información de profundidad, es decir, una estimación de la distancia entre los objetos y la cámara, para entender mejor la geometría del entorno.

Su proceso tiene tres pasos:

  • Entender el espacio físico: identifica objetos, posiciones y distancias mediante unos tokens de percepción, piezas de información que codifican la estructura geométrica de la escena.
  • Planificar una trayectoria: dibuja una secuencia de puntos intermedios sobre la imagen para indicar cómo debería desarrollarse la tarea.
  • Ejecutar la acción: convierte esos puntos en órdenes concretas para elementos como pinzas, brazos robóticos o articulaciones.

La planificación ocurre primero en el espacio de la imagen y después se adapta al tipo de robot utilizado. Por eso, el mismo modelo puede ajustarse con poco entrenamiento adicional a robots humanoides o a brazos con pinzas.

Un ejemplo: ante la orden "guarda la ropa en el armario", MolmoAct no se limita a asociar palabras con movimientos. Puede identificar la ropa, calcular dónde está el armario, trazar una ruta para recoger una prenda y traducirla en movimientos para el brazo del robot.

Resultados y eficiencia

Ai2 afirma que MolmoAct-7B, la primera versión de la familia, obtuvo una tasa de éxito del 72,1% en tareas fuera de distribución de SimplerEnv, un conjunto de entornos simulados para probar la manipulación robótica. Ese resultado superó a modelos de Physical Intelligence, Google, Microsoft, NVIDIA y otros laboratorios en esa evaluación.

En LIBERO, otro entorno de simulación centrado en el aprendizaje de varias tareas, alcanzó una tasa media de éxito del 86,6% mediante un ajuste eficiente de parámetros. Ai2 también comparó el modelo en pruebas reales con OpenVLA y π0 Fast, usando las mismas demostraciones y cambiando las instrucciones, los objetos y las condiciones. MolmoAct registró las tasas de éxito más altas en todas las variantes probadas, según el instituto.

El modelo también se entrenó con muchos menos recursos que algunos sistemas comparables. Su preentrenamiento utilizó 26,3 millones de muestras y 256 GPU NVIDIA H100, y terminó en aproximadamente un día. El ajuste posterior necesitó 64 H100 durante unas dos horas.

Como referencia, Ai2 señala que GR00T-N1-2B de NVIDIA empleó 600 millones de muestras y 1.024 H100, mientras que Physical Intelligence entrenó π0 con 900 millones de muestras y un número de chips no publicado. Estas cifras describen los procesos de entrenamiento, no garantizan por sí solas un mejor rendimiento en cualquier robot o entorno.

Un modelo que deja ver su plan

Una de las características más prácticas de MolmoAct es que muestra su trayectoria prevista sobre la imagen antes de enviar las órdenes de control. Si el robot va a mover una taza hacia una mesa, el usuario puede ver el recorrido que el sistema pretende seguir y corregirlo antes de que actúe.

También es posible guiarlo dibujando una ruta o una postura objetivo en un teléfono, una tableta o un ordenador. Esa entrada visual permite indicar, por ejemplo, por qué lado debe rodear un objeto o dónde debe colocar una pinza.

Para la robótica, esto importa porque facilita detectar errores y controlar comportamientos no deseados. No convierte al sistema en infalible, pero sí ofrece una forma más comprensible de revisar lo que planea hacer.

Qué incluye la versión abierta

MolmoAct-7B se entrenó con una selección de Open-X Embodiment, un conjunto de datos de demostraciones robóticas, y con un conjunto multimodal de razonamiento. Después recibió un ajuste con cerca de 10.000 episodios de robots en entornos domésticos, como ordenar cojines o guardar ropa.

Ai2 publica también ese conjunto de datos de ajuste, el código de entrenamiento, los puntos de control del modelo, las evaluaciones y las herramientas de referencia. La diferencia frente a muchos modelos que solo ofrecen sus pesos es que otros equipos pueden inspeccionar cómo se entrenó, modificarlo y comprobar sus resultados.

Para ti, el efecto inmediato no será tener un robot doméstico capaz de hacer estas tareas. MolmoAct sigue necesitando hardware compatible, demostraciones y ajustes para cada entorno. Lo importante es que investigadores y fabricantes pueden partir de un modelo abierto que combina percepción espacial, planificación y control en una sola arquitectura.

El siguiente paso será comprobar cuánto de estos resultados simulados se mantiene en casas, fábricas y espacios cambiantes. La cuestión no es solo si un robot puede seguir una ruta, sino si puede hacerlo de forma segura cuando aparecen objetos nuevos, instrucciones ambiguas o personas en movimiento.

MolmoAct: la IA abierta que razona en 3D para robots | neversleep.ai