MolmoPoint mejora cómo la IA señala objetos
Ai2 presenta MolmoPoint, una familia abierta de modelos que señala objetos seleccionando partes de la representación visual en lugar de escribir coordenadas. El sistema usa menos tokens y mejora los resultados en imágenes, interfaces, vídeo y seguimiento.

MolmoPoint cambia la forma en que los modelos de IA señalan objetos dentro de imágenes, vídeos y pantallas. En lugar de escribir coordenadas como texto, el modelo selecciona directamente las partes visuales que contienen la respuesta.
La propuesta llega de Ai2, el Allen Institute for AI, que publica tres modelos abiertos, su código y sus datos de entrenamiento. El objetivo es hacer que una IA no solo describa lo que ve, sino que indique exactamente dónde está.
De escribir coordenadas a seleccionar partes de la imagen
La mayoría de los modelos que apuntan a un objeto convierten su posición en números o en tokens que representan rangos de coordenadas. Es una solución funcional, pero obliga al modelo a aprender un sistema artificial y puede fallar cuando cambia la resolución de la imagen.
MolmoPoint usa tres tokens especiales: <PATCH>, <SUBPATCH> y <LOCATION>. Primero selecciona una zona amplia de la imagen o del vídeo. Después la reduce a una subzona más precisa y, por último, elige una ubicación concreta.
El proceso se parece más a cómo una persona busca algo visualmente: primero mira el área general, luego se acerca y finalmente señala el punto exacto. Cada señal necesita 3 tokens en lugar de 8, lo que reduce la cantidad de información que el modelo debe generar.
El sistema también incorpora una señal para indicar que no quedan más objetos relevantes y mecanismos para mantener un orden coherente al señalar varios elementos. Así evita repetir puntos o seguir apuntando cuando ya terminó la tarea.
Tres modelos y nuevos datos de entrenamiento
Ai2 presenta tres versiones de MolmoPoint:
MolmoPoint-8B, para tareas generales con imágenes y vídeos.MolmoPoint-GUI-8B, especializado en aplicaciones, sitios web y otras interfaces.MolmoPoint-Vid-4B, optimizado para comprender vídeos.
Para entrenar el modelo de interfaces, el equipo creó MolmoPoint-GUISyn, un conjunto de 36.000 capturas de alta resolución de entornos de escritorio, móviles y web. Las pantallas se generaron con HTML y se analizaron con Playwright para identificar cada elemento visible.
El resultado incluye más de 2 millones de puntos anotados, unos 54 por imagen de media. También publicaron MolmoPoint-TrackData, con nuevas trayectorias marcadas por personas y otras generadas artificialmente para cubrir objetos parcialmente ocultos y movimientos complejos.
Mejores resultados en imágenes, interfaces y vídeo
En PointBench, una prueba que mide localización, razonamiento espacial y reconocimiento de usos posibles de los objetos, MolmoPoint-8B alcanza un 70,7% de precisión media, frente al 68,7% de Molmo 2 (8B).
En PixMo-Points obtiene una puntuación F1 de 89,2, frente a 85,2 del modelo anterior. Las mejoras son especialmente visibles en tareas de razonamiento y ubicación espacial, con avances de unos cinco puntos.
En interfaces gráficas, MolmoPoint-GUI-8B logra 61,1 en ScreenSpot-Pro y 70,0 en OSWorldG. Ai2 lo sitúa como el modelo completamente abierto con mejores resultados en esas pruebas. En una comparación controlada con Molmo 2 entrenado con los mismos datos, el nuevo método consigue una ventaja de entre 2 y 9 puntos.
En vídeo, MolmoPoint-8B mejora las tareas de conteo y fue preferido por evaluadores humanos el 59,1% de las veces, sin contar los empates. MolmoPoint-Vid-4B alcanza una precisión de cierre de 58,7 en Molmo2-VideoCount, que pide contar objetos señalando cada uno a lo largo de varios fotogramas.
Para seguimiento de objetos, el modelo consigue resultados de referencia en MeViS y mejora en 5,7 puntos J&F sobre Molmo2-Track. Esta métrica combina la precisión de la ubicación con la calidad del seguimiento a lo largo del vídeo.
Qué cambia para ti
La capacidad de señalar es importante para tareas que ya están llegando a productos reales:
- Un agente que pulsa el botón correcto en una aplicación.
- Un robot que identifica dónde agarrar una taza.
- Un sistema que cuenta personas u objetos en un vídeo.
- Una IA que muestra qué parte de una imagen respalda su respuesta.
Además, el método parece ser más fácil de entrenar. Con solo 8.192 ejemplos, MolmoPoint supera al equivalente basado en coordenadas por unos 20 puntos F1, y durante el entrenamiento completo alcanza antes su mejor rendimiento.
La idea central es sencilla: si el modelo ya representa una imagen mediante tokens visuales, puede ser más natural que seleccione esos tokens a que aprenda a escribir números. Lo que habrá que vigilar ahora es si este enfoque abierto se adopta en agentes de ordenador, robótica y análisis de vídeo fuera de las pruebas de laboratorio.