Noticias IA
AI News AgentNuevo modeloAllenAI4 min de lectura

MolmoWeb abre un agente de IA para tareas web

Allen Institute for AI presenta MolmoWeb, un agente de IA abierto que navega por la web usando capturas de pantalla y puede hacer clic, escribir y desplazarse. Incluye modelos de 4B y 8B parámetros, datos de entrenamiento y herramientas para reproducirlo y adaptarlo.

Allen Institute for AI presentó MolmoWeb, un agente de IA capaz de navegar por páginas web y ejecutar tareas en el navegador. El sistema puede hacer clic, escribir, desplazarse, abrir pestañas y seguir instrucciones usando únicamente capturas de pantalla, como lo haría una persona frente a la pantalla.

El proyecto llega con modelos abiertos de 4.000 y 8.000 millones de parámetros, además del código, los datos de entrenamiento, las herramientas de evaluación y los modelos preparados para reproducirse. La idea es que investigadores y desarrolladores puedan ejecutarlo en sus propios equipos o en la nube, sin depender de un servicio propietario.

De mirar imágenes a actuar en la web

MolmoWeb funciona en un ciclo sencillo: observa la pantalla, decide el siguiente paso y ejecuta una acción. Después vuelve a mirar el resultado y continúa hasta completar la tarea.

Por ejemplo, puede recibir la instrucción de buscar los vuelos directos más baratos entre dos ciudades. El agente identifica el buscador, escribe las ciudades, interpreta los resultados, aplica filtros y abre la opción relevante. Cada acción queda registrada para que el usuario pueda revisar qué hizo y detenerlo si es necesario.

A diferencia de los agentes que dependen de la estructura interna de una página, como su código HTML o un árbol de accesibilidad, MolmoWeb trabaja con capturas de pantalla. Esto reduce la cantidad de información que debe procesar y hace que el sistema vea la misma interfaz que una persona.

También permite operar en sitios que no ofrecen una API específica, es decir, una conexión diseñada para que otros programas accedan directamente a sus funciones. En teoría, eso facilita automatizar búsquedas, formularios, filtros de productos y recorridos por varias páginas.

Un kit abierto para construir agentes

El lanzamiento incluye MolmoWebMix, un conjunto de datos creado para entrenar agentes web multimodales. Combina ejemplos realizados por personas, recorridos generados automáticamente y datos para que el modelo aprenda a localizar elementos dentro de una pantalla.

Sus componentes principales incluyen:

  • 30.000 recorridos humanos de tareas web, con más de 590.000 demostraciones de subtareas en más de 1.100 sitios.
  • Trayectorias sintéticas generadas por agentes que exploran páginas, dividen tareas en pasos y verifican si se completaron correctamente.
  • Más de 2,2 millones de pares de preguntas y respuestas sobre capturas de pantalla de casi 400 sitios web.

Según Allen Institute for AI, los datos no se obtuvieron copiando el comportamiento de agentes visuales propietarios. Las trayectorias sintéticas proceden de agentes basados en texto que usan árboles de accesibilidad, mientras que el resto incluye demostraciones humanas y datos específicos de percepción visual.

El paquete también incorpora una biblioteca para ejecutar el sistema, herramientas para recopilar nuevas interacciones y una canalización de entrenamiento y evaluación. Eso permite modificar cada parte del proceso, desde la recopilación de datos hasta el despliegue final.

Qué resultados consigue

En las pruebas realizadas por sus creadores, la versión de 8.000 millones de parámetros obtuvo un 78,2 % en WebVoyager, un benchmark que mide navegación general, 42,3 % en DeepShop, centrado en compras, y 49,5 % en WebTailBench, que evalúa el seguimiento de instrucciones.

Allen Institute for AI afirma que MolmoWeb superó a otros agentes de pesos abiertos, como Fara-7B, en los cuatro benchmarks evaluados. En DeepShop, incluso el modelo de 4.000 millones de parámetros superó a Fara-7B con el mismo límite de pasos y también obtuvo mejores resultados usando solo 30 pasos frente a los 100 permitidos a su rival.

La fiabilidad mejora si se ejecutan varias versiones del mismo intento y se conserva la mejor. Con cuatro ejecuciones, el modelo de 8.000 millones alcanzó un 94,7 % de pass@4 en WebVoyager, frente al 78,2 % de una sola ejecución. En Online-Mind2Web pasó del 35,3 % al 60,5 %.

Eso tiene un coste: más ejecuciones significan más tiempo y más capacidad de cómputo. No es una garantía de que el agente acierte siempre.

Todavía necesita supervisión

MolmoWeb puede leer mal el texto de una captura, perder información si se desplaza demasiado pronto o desviarse después de una acción incorrecta. También tiene problemas con instrucciones ambiguas, tareas con muchas condiciones, el desplazamiento dentro de elementos concretos y las operaciones de arrastrar y soltar.

El modelo no fue entrenado para iniciar sesión ni realizar transacciones financieras. En la demostración alojada por sus creadores hay controles adicionales: solo permite ciertos sitios, bloquea campos de contraseñas y tarjetas y rechaza algunas consultas consideradas peligrosas. Esas protecciones pertenecen a la demostración, no al modelo en sí.

Para ti, la importancia está en que la automatización del navegador deja de ser solo una función de unas pocas plataformas cerradas. Un agente abierto podría recopilar información periódicamente, completar tareas repetitivas o encadenar varios pasos en una herramienta adaptada a tus necesidades.

Pero cuanto más capaz sea de actuar en la web, más importante será limitar lo que puede hacer sin autorización. El siguiente reto no es solo que estos agentes naveguen mejor, sino que sepan cuándo detenerse, respeten la privacidad y eviten acciones irreversibles.