MolmoAct 2 lleva la IA abierta a robots reales
Ai2 presenta MolmoAct 2, un modelo abierto para robots que interpreta escenas en 3D y ejecuta tareas con uno o dos brazos. La organización publica también más de 720 horas de datos y reporta una media del 87,1% de éxito en pruebas reales, aunque el sistema todavía tiene límites fuera de entornos controlados.

El Allen Institute for AI (Ai2) ha presentado MolmoAct 2, un modelo abierto que permite a los robots interpretar su entorno en 3D y ejecutar tareas físicas con menos entrenamiento específico. La organización también publica un conjunto de datos con más de 720 horas de demostraciones de robots con dos brazos.
La propuesta apunta a un problema que todavía limita a la robótica: un robot puede completar una tarea en una demostración, pero suele fallar cuando cambian la posición de un objeto, las instrucciones o las condiciones de la escena. MolmoAct 2 intenta que la máquina entienda la intención y se adapte mejor.
Un modelo que razona antes de moverse
MolmoAct 2 combina un modelo visual y lingüístico especializado, Molmo 2-ER, con un componente que genera las acciones del robot. Antes de actuar, el sistema analiza objetos, posiciones y relaciones espaciales, como qué pieza debe recoger o dónde tiene que colocarla.
Su base de razonamiento se entrenó con unos 3 millones de ejemplos sobre detección de objetos, señalamiento visual, razonamiento espacial y comprensión de imágenes y vídeos. En 13 pruebas de razonamiento para robots obtuvo una media de 63,8 sobre 100, según las evaluaciones de Ai2.
El sistema también incorpora una versión abierta de un tokenizador de acciones. Dicho de forma sencilla, es la pieza que convierte los movimientos continuos del robot en instrucciones que el modelo puede producir y procesar con rapidez.
Esa rapidez es una de sus mejoras más visibles. En las pruebas de Ai2, una acción tardó unos 180 milisegundos con el modelo base y 790 milisegundos cuando utilizó razonamiento adaptativo. Su antecesor, MolmoAct, necesitaba unos 6.700 milisegundos en el mismo entorno de prueba. Menos espera significa movimientos más fluidos y una respuesta más cercana a la de un sistema operativo en tiempo real.
Dos brazos y tareas más cercanas al mundo real
El nuevo conjunto de datos, MolmoAct 2-Bimanual YAM, reúne más de 720 horas de demostraciones con dos brazos robóticos coordinados. Incluye tareas como:
- Doblar una toalla.
- Escanear productos de una compra.
- Cargar un teléfono.
- Recoger y ordenar objetos de una mesa.
A diferencia del primer MolmoAct, que necesitaba ajustes por tarea para trabajar con dos brazos, Ai2 afirma que esta capacidad ya forma parte del modelo base. El conjunto de datos se complementa con ejemplos de otros robots, cámaras y métodos de control para que el sistema no dependa de una única configuración.
Qué resultados consigue
En pruebas reales con un brazo Franka y sin entrenamiento específico para cada tarea, MolmoAct 2 logró estos resultados en 15 intentos por tarea, según Ai2:
- 100% al mover una manzana a un plato.
- 86,7% al colocar una pipeta en una bandeja.
- 93,3% al introducir un cubo rojo en el centro de un rollo de cinta.
- 93,3% al guardar un cuchillo en una caja.
- 62% al trasladar varios objetos a un bol.
La media fue del 87,1%, frente al 48,4% de MolmoBot y el 45,2% de π0.5 en esa misma evaluación. En otra prueba realizada por Cortex AI, MolmoAct 2 obtuvo la mejor puntuación media entre cinco sistemas, con 0,51 frente a 0,36 de OpenVLA-OFT.
En el laboratorio de Ai2, el modelo también alcanzó un 97,2% de éxito en LIBERO después de un entrenamiento adicional. La versión MolmoAct 2-Think, que utiliza información explícita de profundidad para algunas tareas, llegó al 98,1%.
Qué cambia para ti
La publicación incluye los pesos del modelo, los datos y una arquitectura actualizada para que otros equipos puedan estudiarlos y adaptarlos. Eso reduce una de las barreras habituales de la robótica: muchos sistemas funcionan, pero sus datos y métodos permanecen cerrados.
Ai2 está probando MolmoAct 2 con brazos robóticos en un laboratorio de Stanford que trabaja en edición genética. Allí el sistema mueve muestras entre estaciones y opera equipos de sobremesa, tareas repetitivas en las que un error puede afectar a todo un experimento.
Todavía no es un robot autónomo para cualquier casa o fábrica. Puede fallar si su propia pinza tapa la cámara, si necesita movimientos muy precisos o si el sistema de control no responde a tiempo. Las instrucciones visuales trazadas por una persona también pueden producir errores de profundidad.
Lo importante es el enfoque: MolmoAct 2 no se presenta solo como un robot que obtiene buenas cifras en una prueba, sino como una base abierta para que otros investigadores midan, corrijan y amplíen sus capacidades. El siguiente reto será comprobar cuánto de ese rendimiento se mantiene cuando las escenas cambian, las tareas duran más y los errores dejan de ocurrir en condiciones controladas.