Molmo lleva la IA visual del puntero al navegador
Ai2 presenta MolmoPoint y MolmoWeb, dos herramientas abiertas para que la IA visual señale elementos, siga objetos y navegue por páginas usando capturas de pantalla. La propuesta busca que los modelos no solo describan lo que ven, sino que también puedan actuar sobre ello con más precisión y menos dependencia de sistemas cerrados.

Molmo, la familia de modelos de IA visual de Ai2, da un paso hacia sistemas que no solo entienden imágenes, sino que también pueden actuar sobre ellas. Sus nuevas herramientas permiten señalar objetos con precisión y manejar páginas web usando únicamente capturas de pantalla.
La base del proyecto es la apertura. Ai2 publica los pesos del modelo, los datos y el código, de modo que investigadores y desarrolladores pueden inspeccionarlos, adaptarlos y entrenar versiones propias sin depender de un sistema cerrado.
MolmoPoint enseña a la IA dónde mirar
Señalar parece una tarea sencilla, pero es fundamental para que una IA pueda contar objetos, controlar un robot o pulsar el botón correcto en una pantalla. También permite comprobar qué está viendo realmente el modelo.
Los modelos suelen indicar una posición escribiendo coordenadas, como un punto formado por los valores X e Y. Ese método puede fallar, sobre todo en imágenes grandes o interfaces llenas de elementos pequeños.
MolmoPoint, presentado en marzo, adopta otro enfoque: selecciona directamente una zona de lo que está viendo y después la afina hasta llegar al punto exacto. Según Ai2, esta técnica funciona mejor en imágenes de alta resolución, interfaces saturadas y tareas de seguimiento de objetos en vídeo.
El modelo logra los mejores resultados entre modelos abiertos de tamaño comparable en varias pruebas de señalamiento, identificación de elementos de pantalla y seguimiento de objetos, según la evaluación de Ai2. La organización también asegura que necesita menos ajustes específicos durante el entrenamiento.
Eso puede reducir el coste de crear modelos capaces de localizar elementos. Por ejemplo, una empresa podría adaptar el sistema para identificar botones en una aplicación, mientras que un laboratorio podría entrenarlo para seguir el movimiento de un animal en un vídeo sin volver a entrenar el modelo desde cero.
Ai2 también ha publicado variantes para imágenes, vídeo, interfaces de software y seguimiento, además de conjuntos de datos con miles de capturas anotadas y trayectorias de objetos marcadas por personas.
MolmoWeb usa capturas para manejar páginas
La segunda pieza es MolmoWeb, una familia de agentes capaces de navegar por sitios web y completar tareas a partir de una instrucción y una captura de pantalla.
En lugar de leer directamente el código HTML de una página o sus árboles de accesibilidad, el agente observa la interfaz como lo haría una persona. Después decide cuál es la siguiente acción: mover el cursor, hacer clic, escribir o desplazarse.
“Es percepción mediante capturas de pantalla y manipulación mediante ratón y teclado”, explica Tanmay Gupta, responsable de MolmoWeb.
Este enfoque tiene una ventaja práctica: las capturas pueden seguir siendo útiles aunque cambie la estructura interna de una web. Ai2 también sostiene que una imagen puede sustituir el procesamiento de miles de líneas de código de una página, aunque el rendimiento real depende de la complejidad de cada tarea.
En las pruebas citadas por Ai2, MolmoWeb supera a modelos abiertos comparables en varios benchmarks de navegación web. La versión más capaz también supera a agentes basados en modelos propietarios más grandes, como GPT-4o, pese a tener menos parámetros y trabajar solo con capturas de pantalla. Son resultados de evaluación, no una garantía de que el agente pueda completar cualquier tarea en internet.
Ai2 ha liberado los modelos, los datos de entrenamiento y un sistema común para evaluar agentes web. El conjunto de datos incluye, según la organización, la mayor colección pública de demostraciones humanas de tareas en la web.
Qué cambia para ti
La tecnología todavía necesita supervisión. En un agente web, un error al principio de una tarea puede arrastrar todos los pasos siguientes. Comprar algo, rellenar un formulario o modificar una cuenta exige además controles para evitar acciones equivocadas.
Pero el enfoque apunta a una forma más directa de automatizar tareas digitales. En vez de crear una integración específica para cada servicio, podrías describir lo que necesitas y dejar que un agente interactúe con la página como tú:
- Buscar información en varios sitios.
- Completar tareas repetitivas en una aplicación.
- Identificar elementos concretos en imágenes o vídeos.
- Controlar software que no ofrece una API, es decir, una vía diseñada para que otros programas lo manejen.
MolmoPoint y MolmoWeb forman parte de un ecosistema más amplio que incluye herramientas abiertas para robótica, percepción 3D y realidad aumentada. La apuesta de Ai2 es que estos componentes puedan combinarse y adaptarse en laboratorios, empresas y proyectos independientes.
Lo importante no es que Molmo ya pueda hacer cualquier tarea de forma autónoma. Es que la IA visual empieza a pasar de describir lo que aparece en una pantalla a señalarlo y actuar sobre ello. El próximo reto será hacer que esas acciones sean suficientemente precisas, seguras y fiables para entrar en el trabajo diario.