xAI lanza Grok-2 en beta con mejor razonamiento
xAI presenta Grok-2 y Grok-2 mini en beta para los suscriptores Premium y Premium+ de 𝕏. La empresa afirma que Grok-2 supera a Claude 3.5 Sonnet y GPT-4-Turbo en la clasificación LMSYS, mientras prepara una API empresarial para desarrolladores.

xAI presentó Grok-2, una nueva versión de su asistente de inteligencia artificial, junto con Grok-2 mini, un modelo más pequeño que busca equilibrar velocidad y calidad. Ambos llegan primero en fase beta a 𝕏 para suscriptores Premium y Premium+.
La compañía asegura que una versión temprana de Grok-2, probada en la clasificación LMSYS bajo el nombre sus-column-r, superó a Claude 3.5 Sonnet y GPT-4-Turbo en puntuación Elo. Esta métrica resume los resultados de enfrentamientos entre modelos en la Chatbot Arena, una plataforma donde los usuarios comparan respuestas sin saber qué sistema las generó.
El resultado es una afirmación de xAI sobre una prueba concreta, no una victoria general en todas las tareas. En la tabla de evaluaciones publicada por la empresa, Grok-2 queda por encima de GPT-4o en algunas pruebas, pero por debajo de Claude 3.5 Sonnet en otras, como conocimientos científicos de nivel avanzado y programación.
Qué mejora en Grok-2
Grok-2 está diseñado para responder preguntas, escribir, programar y resolver problemas con más precisión que Grok-1.5. xAI también destaca mejoras en el uso de herramientas y en el análisis de información recuperada, es decir, en la capacidad de distinguir qué datos hacen falta, ordenar una secuencia de hechos y descartar publicaciones irrelevantes.
En las pruebas académicas de la compañía, Grok-2 obtuvo estos resultados:
- 56% en GPQA, una prueba de preguntas científicas avanzadas, frente al 48% de GPT-4-Turbo y el 59,6% de Claude 3.5 Sonnet.
- 87,5% en MMLU, que mide conocimientos generales, frente al 88,7% de GPT-4o.
- 76,1% en MATH, centrada en problemas matemáticos, frente al 76,6% de GPT-4o.
- 88,4% en HumanEval, una prueba de generación de código, frente al 92% de Claude 3.5 Sonnet.
- 69% en MathVista, que combina imágenes y matemáticas, por encima de GPT-4o, con 63,8%.
- 93,6% en DocVQA, una prueba de preguntas sobre documentos visuales, frente al 95,2% de Claude 3.5 Sonnet.
Grok-2 mini ofrece resultados inferiores en general, pero necesita menos recursos. En la práctica, eso puede traducirse en respuestas más rápidas y un coste menor cuando se use para tareas sencillas, como resumir textos, redactar mensajes o clasificar información.
Qué cambia para quienes usan 𝕏
Grok-2 y Grok-2 mini se incorporan a la pestaña de Grok en la aplicación de 𝕏. Los usuarios Premium y Premium+ pueden probarlos después de actualizar la app. El asistente combina sus capacidades de texto y visión con información reciente publicada en la plataforma.
Eso permite utilizarlo para tareas como estas:
- Resumir o analizar una publicación y sus respuestas.
- Buscar contexto sobre un tema que circula en 𝕏.
- Ayudar a redactar una respuesta.
- Resolver dudas sobre una imagen o un documento.
- Apoyar tareas de programación y escritura.
xAI también está probando la generación de imágenes con FLUX.1, un modelo desarrollado por Black Forest Labs. La empresa anticipa además una futura función de comprensión multimodal, que permitirá trabajar de forma más integrada con texto, imágenes y otros tipos de contenido.
La API llega después
Los desarrolladores podrán acceder a Grok-2 y Grok-2 mini mediante la API empresarial de xAI, cuyo lanzamiento estaba previsto para finales de agosto de 2024. La plataforma incluirá despliegues en varias regiones para reducir la latencia, además de autenticación multifactor, estadísticas de tráfico, análisis de facturación y herramientas para administrar equipos y usuarios.
Para ti, la diferencia dependerá de cómo llegue el modelo al producto final. En 𝕏, el acceso está limitado a ciertos planes de pago y se ofrece como beta, por lo que sus respuestas y funciones todavía pueden cambiar. Para empresas, la API abre la puerta a integrar Grok en buscadores internos, asistentes de atención al cliente o herramientas de análisis de documentos.
Lo importante ahora es comprobar si las mejoras de Grok-2 se mantienen fuera de las pruebas controladas. El siguiente punto a vigilar será su rendimiento en el uso diario, especialmente al trabajar con información reciente de 𝕏, imágenes y tareas donde un error factual puede tener consecuencias.