MolmoBot entrena robots solo con datos simulados
MolmoBot es una suite abierta de modelos robóticos entrenados exclusivamente con millones de trayectorias simuladas. Según las evaluaciones de sus creadores, realiza tareas como recoger objetos y abrir puertas en dos robots reales sin ajuste fino, incluso con objetos y entornos no vistos.

El robot MolmoBot aprende a agarrar objetos, abrir cajones y manipular puertas sin haber visto demostraciones humanas reales. Sus creadores lo han entrenado únicamente con datos generados en simulación y aseguran que puede trasladar esas habilidades a robots físicos sin ajustes adicionales.
El proyecto, desarrollado por el Allen Institute for AI, pone a prueba una idea que hasta ahora parecía difícil de sostener: que un robot pueda aprender manipulación directamente en mundos virtuales y funcionar después en entornos reales. La clave está en no crear una sola simulación, sino millones de escenarios con objetos, cámaras, luces y condiciones físicas diferentes.
Qué es MolmoBot
MolmoBot es una suite de modelos para manipulación robótica. Incluye políticas, datos de entrenamiento, código para generar esos datos y las herramientas necesarias para reproducir el proceso.
La suite funciona con dos plataformas físicas distintas:
- Rainbow Robotics RB-Y1, un robot móvil capaz de desplazarse y manipular objetos.
- Franka FR3, un brazo robótico de sobremesa usado para tareas de precisión.
Los modelos pueden recibir instrucciones en lenguaje natural, como «recoge el objeto y colócalo en la bandeja», o comandos basados en puntos, por ejemplo indicar dónde recoger, colocar o cerrar.
MolmoBot se centra en manipulación y no en navegación. Sus tareas incluyen recoger y colocar objetos, abrir y cerrar cajones o microondas, y abrir puertas mediante empuje o tracción.
Millones de trayectorias virtuales
El entrenamiento utiliza MolmoBot-Data, un conjunto de millones de trayectorias expertas generadas en simulación. Una trayectoria es la secuencia completa de movimientos que lleva a un robot a terminar una tarea.
Para reducir la diferencia entre lo que el robot ve en una simulación y lo que encuentra en el mundo real, el sistema cambia constantemente las condiciones de entrenamiento:
- Posición y tipo de objetos.
- Ángulo y movimiento de las cámaras.
- Iluminación, texturas y fondos.
- Propiedades físicas y colocación de los objetos.
- Tipos de entornos y superficies.
Este proceso se conoce como aleatorización de dominio: exponer al modelo a muchas variaciones para que no memorice una escena concreta. Aunque la simulación también puede producir profundidad y otros datos internos, MolmoBot aprende sus políticas usando imágenes RGB, como las que captan cámaras convencionales.
Cómo rinde frente a modelos entrenados con humanos
El equipo evaluó MolmoBot tanto en simulación como con robots reales. También cambió durante las pruebas elementos que el modelo no había visto durante el entrenamiento, como la cámara, la iluminación y el motor de renderizado.
Según sus evaluaciones, el mejor modelo logra transferencia directa de simulación a realidad en los dos robots, con objetos y entornos no vistos y sin ajuste fino en el mundo real. En las pruebas de recoger y colocar, supera a π0.5, un modelo entrenado con grandes cantidades de demostraciones reales. Los resultados también se comparan de forma competitiva con métodos como π0 y π0.5 bajo protocolos de evaluación similares.
La suite incluye tres arquitecturas, es decir, tres diseños distintos de modelo:
- MolmoBot, basado en el modelo de visión y lenguaje
Molmo2, con el mejor rendimiento de la evaluación. - MolmoBot-SPOC, una versión más ligera que necesita menos capacidad de cómputo.
- MolmoBot-Pi0, basado en
PaliGemmay diseñado para comparar de forma directa el efecto de usar datos sintéticos frente a datos reales.
Qué cambia para la robótica
Entrenar robots con personas es caro y lento. Proyectos anteriores han reunido cientos de horas de teleoperación o más de un millón de trayectorias reales para enseñar a los modelos cómo actuar. Además, muchos de esos datos no están disponibles públicamente.
Con un enfoque como MolmoBot, un laboratorio podría generar nuevas tareas y escenarios usando ordenadores, sin montar desde el principio una infraestructura de teleoperación. Eso reduce el coste de experimentar y facilita que otros equipos comprueben qué funciona y dónde falla.
El problema no desaparece: cambia de lugar. En vez de recopilar manualmente cada demostración, los investigadores deben construir simulaciones que representen mejor el contacto, el peso, el rozamiento y las irregularidades de los objetos reales. Un cajón que se atasca o una taza que resbala siguen siendo difíciles de modelar.
MolmoBot no demuestra que la simulación pueda resolver toda la robótica, pero sí ofrece una prueba abierta y reproducible de que puede cubrir tareas de manipulación variadas sin datos reales durante el entrenamiento. Lo siguiente será comprobar hasta dónde llega esa transferencia cuando aumentan la complejidad, la incertidumbre y los errores físicos del mundo real.