Grok-1.5V lleva la IA multimodal a las imágenes
xAI presenta Grok-1.5V, su primer modelo capaz de entender imágenes, documentos, gráficos y capturas de pantalla además de texto. El sistema destaca en comprensión espacial del mundo real, aunque sus resultados varían frente a GPT-4V, Claude 3 y Gemini 1.5 Pro.

xAI presenta Grok-1.5V, una versión de Grok capaz de entender imágenes además de texto. El modelo puede analizar documentos, diagramas, gráficos, capturas de pantalla y fotografías, aunque su acceso inicial será limitado a evaluadores tempranos y usuarios actuales de Grok.
La novedad importa porque permite interactuar con información que no está escrita en un mensaje. Puedes mostrarle una factura para extraer sus datos, una gráfica para identificar tendencias, un esquema científico para explicarlo o una captura de pantalla para detectar qué está fallando.
Un modelo que mira, pero no gana en todo
xAI describe Grok-1.5V como su primer modelo multimodal, es decir, un sistema que combina texto e imágenes en una misma conversación. La empresa lo comparó con modelos como GPT-4V, Claude 3 y Gemini 1.5 Pro en varias pruebas, usando respuestas directas y sin pedirles que mostraran paso a paso su razonamiento.
Los resultados son desiguales, algo importante frente a los anuncios que presentan estos modelos como buenos para cualquier tarea:
- En preguntas sobre matemáticas visuales, obtuvo 52,8%, por encima de
GPT-4Vy Claude 3 Opus, pero apenas por encima de Gemini 1.5 Pro. - En diagramas, alcanzó 88,3%, cerca de Claude 3 Sonnet y Opus, y por delante de
GPT-4Vy Gemini. - En lectura de texto dentro de imágenes, logró 78,1%, prácticamente igual que
GPT-4V. - En gráficos y documentos quedó por debajo de varios competidores, con 76,1% en ChartQA y 85,6% en DocVQA.
La cifra más destacada aparece en RealWorldQA, una prueba creada por xAI para medir si un modelo entiende relaciones espaciales del mundo real. Grok-1.5V obtuvo 68,7%, frente al 67,5% de Gemini 1.5 Pro, el 61,4% de GPT-4V y resultados inferiores de Claude 3.
Qué mide RealWorldQA
El conjunto inicial incluye más de 700 imágenes con una pregunta y una respuesta verificable para cada una. Hay imágenes tomadas desde vehículos, además de otras escenas del mundo real, y las preguntas pueden exigir reconocer posiciones, distancias o relaciones entre objetos.
Por ejemplo, no basta con identificar que hay un coche en una foto. El sistema debe entender si está delante o detrás de otro objeto, qué elemento queda a la izquierda o cuál ocupa una posición concreta. Esa capacidad es relevante para asistentes que algún día deban ayudar en tareas físicas, navegación o interpretación del entorno.
xAI ha publicado el conjunto de datos bajo la licencia CC BY-ND 4.0 y ofrece una descarga de 677 MB. La empresa afirma que planea ampliarlo a medida que mejoren sus modelos multimodales.
Qué cambia para ti
Por ahora, el cambio práctico es limitado: Grok-1.5V todavía no está disponible para todo el mundo. Llegará primero a evaluadores tempranos y a usuarios existentes de Grok, sin una fecha concreta anunciada.
Si el acceso se amplía, Grok podrá competir por tareas que hasta ahora han impulsado a ChatGPT, Claude y Gemini: resumir documentos escaneados, interpretar gráficos, explicar imágenes técnicas o responder preguntas sobre fotografías. Pero las propias cifras muestran que su rendimiento depende mucho del tipo de imagen.
El siguiente paso de xAI será mejorar tanto la comprensión como la generación de contenido en distintas modalidades, incluidas imágenes, audio y vídeo. Lo que conviene vigilar no es solo si Grok puede reconocer una imagen, sino si puede hacerlo de forma fiable cuando la respuesta tiene consecuencias prácticas.