Liquid AI lanza LFM2.5-VL-3B para visión en el borde
Liquid AI presenta `LFM2.5-VL-3B`, un modelo multimodal de 3.1B parámetros que entiende imágenes, documentos y pantallas y puede ejecutarse en dispositivos con unos 3 GB de memoria. La compañía afirma que alcanza hasta 20 tokens por segundo en un Galaxy S26 Ultra y mejora la localización de objetos, el análisis de varias imágenes y el uso de herramientas.

Liquid AI ha lanzado LFM2.5-VL-3B, un modelo de IA capaz de entender imágenes, documentos y pantallas, diseñado para ejecutarse directamente en dispositivos con recursos limitados. La compañía afirma que puede funcionar con unos 3 GB de memoria y alcanzar hasta 20 tokens por segundo en un Galaxy S26 Ultra.
El modelo pertenece a la categoría de modelos de visión y lenguaje: sistemas que combinan texto e imágenes para responder preguntas, leer documentos o actuar sobre una interfaz. Su tamaño es de 3.1 mil millones de parámetros, mucho menor que el de muchos modelos multimodales alojados en la nube.
Qué puede hacer
Liquid AI destaca cuatro mejoras frente a su modelo anterior, LFM2-VL-3B:
- Entender pantallas y aplicaciones en ordenadores, móviles y páginas web.
- Localizar objetos a partir de instrucciones en lenguaje natural, como señalar dónde aparece una taza o un botón.
- Razonar con varias imágenes al mismo tiempo, por ejemplo para comparar productos o seguir cambios entre fotografías.
- Llamar a herramientas mediante instrucciones estructuradas, tanto cuando recibe texto como cuando analiza imágenes.
Esto permite usarlo para tareas concretas: extraer datos de una factura, identificar un elemento en una captura de pantalla, responder preguntas sobre un gráfico o abrir una función de una aplicación después de interpretar lo que aparece en pantalla.
Un modelo pensado para funcionar sin nube
LFM2.5-VL-3B combina un codificador visual SigLIP2 de 400 millones de parámetros con la base de texto de LFM2.5-2.6B. Liquid AI asegura que lo entrenó con unos 34 billones de tokens y con cuatro veces más datos visuales que en su generación anterior.
El conjunto de entrenamiento incluye imágenes con descripciones, texto extraído de documentos, ejemplos de localización de objetos e instrucciones sintéticas. La empresa también amplió su vocabulario a 128.000 unidades para mejorar la lectura de idiomas con alfabetos no latinos, sin volver a entrenar el tokenizador desde cero.
En sus pruebas internas, el modelo alcanza una puntuación media de 69,4 sobre 100 en el grupo de evaluaciones visuales que compara con otros modelos pequeños. No lidera todas las pruebas, pero destaca especialmente en localización de objetos y comprensión de interfaces.
Por ejemplo, obtuvo un 87,9 en RefCOCO-avg, una prueba de localización guiada por texto. En ScreenSpot-v2, que mide si un modelo identifica elementos de una interfaz, logró 78,7 en escritorio, 81,2 en móvil y 82,2 en web.
Estas cifras proceden de las evaluaciones publicadas por Liquid AI. Se realizaron sin activar modos de razonamiento y con los parámetros de generación recomendados para cada modelo, por lo que no representan necesariamente el rendimiento de todas las aplicaciones reales.
También mejora el uso de herramientas
La capacidad de llamar a funciones es importante porque permite que un modelo no se limite a describir lo que ve. Puede devolver una instrucción estructurada para buscar un producto, consultar una base de datos o ejecutar una acción en una aplicación.
En la prueba ToolSandbox, LFM2.5-VL-3B obtuvo 59,5, frente a 26,4 de su versión anterior. En BFCL V4 alcanzó 32,5. Según Liquid AI, sus resultados en uso de herramientas quedan cerca de modelos como Gemma-4-E2B y Qwen3.5-2B, aunque los resultados varían según la prueba.
Velocidad y disponibilidad
En los equipos probados por la empresa, el modelo genera hasta 228 tokens por segundo en un M5 Max y 116 en un Ryzen AI Max+ 395. En servidores con muchas solicitudes simultáneas llegó a unos 11.000 tokens por segundo, aproximadamente el doble que algunos modelos de la clase de 4.000 millones de parámetros.
El modelo cuenta con soporte desde el lanzamiento para llama.cpp, MLX, vLLM, SGLang y ONNX. También se puede descargar desde Hugging Face, probar en una demo WebGPU desde el navegador y adaptar mediante ajuste fino.
Para ti, la diferencia principal es que una IA capaz de leer imágenes y pantallas puede ejecutarse de forma local, con menos dependencia de una conexión a internet y con mayor control sobre los datos. El siguiente punto que conviene vigilar es si ese rendimiento se mantiene fuera de las pruebas del fabricante, especialmente en móviles y en tareas que requieren actuar de manera fiable sobre aplicaciones reales.