xAI presenta Grok 3 con modelos de razonamiento
xAI presenta Grok 3 y Grok 3 mini, dos modelos beta que pueden dedicar más tiempo a revisar sus respuestas y resolver problemas complejos. La familia incorpora una ventana de contexto de un millón de tokens y llega acompañada de DeepSearch, un agente para investigar y sintetizar información.

xAI presenta Grok 3, una nueva familia de modelos de inteligencia artificial que puede dedicar desde unos segundos hasta varios minutos a resolver un problema antes de responder. La empresa también lanza Grok 3 mini, una versión más económica centrada en tareas de razonamiento técnico.
Los dos llegan en fase beta y todavía están en entrenamiento. xAI afirma que fueron desarrollados en su supercomputador Colossus con diez veces más capacidad de cálculo que sus modelos anteriores, y que mejoran en matemáticas, programación, conocimiento general y seguimiento de instrucciones.
Dos formas de usar Grok 3
La principal novedad está en los modelos Grok 3 (Think) y Grok 3 mini (Think). Al activar el botón Think, el sistema emplea más tiempo para revisar el problema, probar alternativas, detectar errores y ajustar la respuesta.
En la práctica, eso apunta a tareas como resolver un ejercicio matemático difícil, depurar un programa o analizar un documento extenso. Para preguntas sencillas, el modo normal responde más rápido y evita gastar recursos en un razonamiento innecesario.
xAI dice que Grok 3 (Think) obtuvo estos resultados en sus pruebas:
- 93,3 % en AIME 2025, una competición estadounidense de matemáticas, usando su nivel más alto de cálculo durante la respuesta.
- 84,6 % en GPQA, un examen de preguntas científicas diseñado para nivel de posgrado.
- 79,4 % en LiveCodeBench, una evaluación de generación y resolución de problemas de programación.
Grok 3 mini también destaca en tareas técnicas con menos necesidad de conocimiento general: alcanzó 95,8 % en AIME 2024 y 80,4 % en LiveCodeBench, según xAI.
Estas cifras son resultados de laboratorio, no una garantía de que el modelo acierte siempre. Además, los modelos siguen cambiando mientras reciben entrenamiento y comentarios de los usuarios.
Un millón de tokens para documentos largos
Grok 3 incorpora una ventana de contexto de un millón de tokens, ocho veces más que los modelos anteriores de xAI. Un token puede ser una palabra, parte de una palabra o un signo, así que la cifra no equivale exactamente a un millón de palabras.
Lo importante es que el modelo puede trabajar con documentos muy largos, varios archivos o instrucciones complejas sin perder con tanta facilidad la información inicial. xAI asegura que logró un 83,3 % en LOFT, una prueba centrada en encontrar y relacionar información dentro de contextos extensos.
La compañía también reporta mejoras en comprensión de imágenes y vídeos, conocimiento científico, cultura general y generación de código. En la tabla de evaluaciones publicada por xAI, Grok 3 supera a modelos como GPT-4o, Claude 3.5 Sonnet y DeepSeek-V3 en varias de esas pruebas, aunque los resultados dependen de la versión, el método de evaluación y la cantidad de cálculo utilizada.
DeepSearch quiere ir más allá de una búsqueda
Junto con Grok 3, xAI presenta DeepSearch, un agente que puede consultar información en internet, comparar hechos y opiniones en conflicto y redactar un informe final. La idea es que no se limite a mostrar enlaces: debe reunir la información y explicar qué significa.
Por ejemplo, podría investigar una noticia reciente, resumir un tema científico o contrastar varias fuentes. Aun así, sus respuestas necesitan revisión, especialmente cuando trabaja con información actual, polémica o difícil de verificar.
Grok 3 está disponible para usuarios de X Premium y Premium+ y también se está desplegando con límites para otros usuarios de Grok. Premium+ recibe acceso inmediato a Think y DeepSearch, mientras que la API para desarrolladores y el acceso empresarial llegarán en las semanas siguientes, según xAI.
El cambio más relevante no es solo que Grok 3 responda mejor, sino que empieza a funcionar como una herramienta que decide cuándo necesita investigar, usar código o dedicar más tiempo a un problema. La próxima prueba será comprobar si ese razonamiento se mantiene fuera de los exámenes y resulta fiable en tareas reales, donde los datos cambian y los errores tienen consecuencias.