Holotron-12B acelera los agentes de IA en la web
H Company publica Holotron-12B, un modelo multimodal diseñado para que los agentes de IA usen ordenadores con más velocidad. En pruebas con una GPU H100 alcanzó 8.900 tokens por segundo y elevó su resultado en WebVoyager del 35,1% al 80,5%.

Holotron-12B es un nuevo modelo de IA que puede interpretar una pantalla, decidir qué hacer y manejar interfaces digitales. H Company lo ha publicado en Hugging Face con el objetivo de que los agentes que usan ordenadores funcionen más rápido y con menos consumo de memoria.
El modelo parte de Nemotron-Nano-12B-v2-VL-BF16, una base multimodal de NVIDIA capaz de procesar texto e imágenes. H Company lo entrenó después con unos 14.000 millones de tokens y datos propios sobre localización, navegación, comprensión de pantallas e interacción con botones y otros elementos de una interfaz.
Más velocidad cuando trabajan muchos agentes
La principal diferencia de Holotron-12B no está solo en lo que entiende, sino en cómo procesa las solicitudes. Su arquitectura combina atención con un modelo de espacio de estados, conocido como SSM, un sistema que mantiene un estado resumido de la conversación en lugar de guardar todos los detalles de cada token generado.
Eso reduce el uso de memoria cuando el agente trabaja con historiales largos, muchas capturas de pantalla y varias tareas simultáneas. En la práctica, permite ejecutar más agentes en el mismo hardware.
En una prueba con el benchmark WebVoyager, que mide la capacidad de navegar por sitios web, H Company ejecutó Holotron-12B en una sola GPU NVIDIA H100, con vLLM 0.14.1 y hasta 100 trabajadores simultáneos. El modelo alcanzó un rendimiento de 8.900 tokens por segundo, frente a los 5.100 de Holo2-8B en el mismo experimento.
Eso supone más de dos veces el rendimiento de Holo2-8B según la compañía. La ventaja resulta especialmente relevante para tareas que necesitan generar muchos ejemplos, etiquetar datos o entrenar agentes mediante interacción continua con entornos digitales.
También mejora la precisión
La velocidad por sí sola no sirve si el agente hace clic en el lugar equivocado. En WebVoyager, Holotron-12B elevó el resultado del modelo Nemotron original del 35,1% al 80,5%, además de superar a Holo2-8B en esa prueba.
También registró mejoras en evaluaciones de localización y comprensión de interfaces como OS-World-G, GroundUI y WebClick. Estas pruebas miden si el modelo identifica correctamente un elemento en pantalla y ejecuta la acción adecuada, por ejemplo seleccionar un menú, completar un campo o pulsar un botón.
Holotron-12B está optimizado para percibir, decidir y actuar en entornos interactivos.
Qué cambia para ti
El modelo no es un asistente de uso general pensado principalmente para conversar. Está diseñado como el componente que controla un agente capaz de usar un ordenador, algo que puede aplicarse a:
- Automatizar tareas repetitivas en páginas web.
- Probar aplicaciones y detectar fallos en sus interfaces.
- Generar datos para entrenar otros agentes.
- Procesar grandes volúmenes de navegación o anotación.
Al estar disponible en Hugging Face bajo una licencia abierta de NVIDIA, empresas e investigadores pueden probarlo y adaptarlo, aunque necesitarán infraestructura potente para ejecutarlo con buen rendimiento. Los resultados publicados proceden además de condiciones concretas: una GPU H100, vLLM y una concurrencia de hasta 100 solicitudes.
H Company ya prepara una versión basada en Nemotron 3 Omni, la nueva familia multimodal anunciada por NVIDIA. El siguiente paso será comprobar si esta combinación de menor consumo de memoria y mejor navegación puede sostenerse en aplicaciones comerciales reales, donde importan tanto la velocidad como la precisión y la seguridad de cada acción.