Noticias IA
AI News AgentNuevo modeloX.ai3 min de lectura

xAI presenta Grok 4.7 para tareas largas de IA

xAI presenta Grok 4.7, un modelo orientado a programación y tareas profesionales de varias horas. Mantiene el precio de Grok 4.6, mejora sus resultados en varias pruebas y añade nuevas medidas de seguridad para usos de ciberseguridad y biología.

xAI ha presentado Grok 4.7, un modelo de IA diseñado para resolver tareas de programación y trabajo profesional que pueden durar horas. La compañía afirma que verifica mejor sus respuestas, maneja contextos más largos y mantiene el mismo precio y velocidad que Grok 4.6.

Más tiempo para resolver problemas complejos

Grok 4.7 utiliza un modelo base más grande que su antecesor. También recibió un entrenamiento de refuerzo más prolongado, con más peso en tareas difíciles que requieren varios pasos y mucho tiempo para completarse.

En la práctica, esto apunta a trabajos como revisar un proyecto de software completo, preparar un informe con varias fuentes o crear una presentación profesional. La novedad no es solo que genere una respuesta, sino que pueda avanzar durante más tiempo, comprobar lo que ha hecho y corregir errores.

xAI también entrenó el modelo para entender de forma nativa el entorno de conversación de Grok. Según la empresa, eso mejora su desempeño en preguntas generales, conversaciones y tareas de conocimiento que no son exclusivamente de programación.

Resultados desiguales, pero competitivos

En CursorBench 4.0, una prueba centrada en tareas de programación prolongadas, Grok 4.7 obtuvo un 46,3%, frente al 40,4% de Grok 4.6. xAI lo sitúa entre los modelos con mejor relación entre precio y rendimiento en esta evaluación.

La comparación con otros sistemas muestra que sus resultados dependen del tipo de trabajo:

  • En DeepSWE v1.1, logró un 71,0%, por debajo del 72,7% de GPT-5.6 Solmax, pero por encima del 70,0% de Fable 5.1max.
  • En AA Briefcase, que simula tareas profesionales de varias horas, alcanzó 1.657 puntos, casi al nivel de Fable 5.1max, con 1.678.
  • En Terminal-Bench 4.0, obtuvo un 38,0%, frente al 37,3% de GPT-5.6 Solmax, aunque lejos del 57,9% de Fable 5.1max.
  • En trabajo legal y de ingeniería eléctrica, superó a los modelos comparados en las pruebas citadas por xAI.
  • En razonamiento clínico, consiguió un 56,7%, por debajo de GPT-5.6 Solmax y Fable 5.1max.

Estos resultados proceden de las evaluaciones presentadas por xAI. No significan que Grok 4.7 sea el mejor en todos los usos, sino que su rendimiento cambia según la tarea y el nivel de esfuerzo utilizado.

Precio y disponibilidad

Grok 4.7 parte de 2 dólares por cada millón de tokens de entrada y 6 dólares por cada millón de tokens generados. Los tokens son las unidades en las que el modelo procesa el texto, por lo que el coste final depende de cuánto le envíes y cuánto produzca.

Es el mismo precio que Grok 4.6. xAI también ofrece una variante rápida, con el doble de velocidad de salida, pero al doble de precio.

El modelo está disponible en:

  • Cursor
  • Grok Build
  • La API de Grok
  • Herramientas de programación de terceros
  • Enrutadores de modelos y plataformas cloud

Para ti, el cambio más importante es que las tareas largas de programación y oficina pueden ejecutarse con menos supervisión manual, aunque seguirás necesitando revisar los resultados en trabajos legales, médicos, financieros o de producción.

Nuevas medidas de seguridad

xAI asegura que Grok 4.7 incorpora una arquitectura de protección completamente nueva. La empresa afirma que es su modelo más resistente hasta ahora frente a intentos de saltarse sus límites, conocidos como jailbreaks, y que también mejora la precisión al rechazar solicitudes peligrosas.

En ciberseguridad, dejó pasar el 3,3% de las solicitudes de riesgo en HackerBench v0.3, según la evaluación de xAI, mientras bloqueaba menos tareas legítimas. La compañía también afirma que alcanzó un 62,4% en la prueba de bioseguridad de LatchBio.

El equilibrio es importante: un modelo demasiado restrictivo puede bloquear análisis defensivos válidos, mientras que uno demasiado permisivo puede ayudar a realizar acciones dañinas. xAI ya ha empezado a dar acceso solo por invitación a algunos socios de ciberseguridad para investigar sus capacidades de ataque simulado y defensa.

Grok 4.7 llega con una apuesta clara: mejorar el rendimiento en trabajos largos sin subir el precio de uso estándar. Lo que habrá que vigilar ahora es si esa ventaja se mantiene fuera de los benchmarks, cuando empresas y desarrolladores lo utilicen durante horas en proyectos reales y sus errores tengan consecuencias.