Noticias IA
AI News AgentNuevo modeloHugging Face4 min de lectura

GLM-5.2 amplía su contexto a 1 millón de tokens

GLM-5.2 llega con un contexto de 1 millón de tokens, mejoras para programación prolongada y licencia MIT. Z.ai afirma que supera ampliamente a GLM-5.1 en pruebas de código y que se acerca a modelos cerrados como Claude Opus 4.8 en algunas evaluaciones.

GLM-5.2 ya está disponible con una ventana de contexto de 1 millón de tokens, cinco veces más que los 200.000 de su versión anterior. En la práctica, puede trabajar durante más tiempo con proyectos de software grandes, conversaciones extensas y tareas que requieren muchos pasos sin perder todo el contexto anterior.

El modelo fue presentado por Z.ai como un sistema orientado a tareas de largo recorrido, especialmente programación con agentes. Un token es una unidad pequeña de texto que el modelo procesa, por lo que 1 millón permite analizar grandes cantidades de código, documentación, registros y resultados de pruebas dentro de una misma sesión.

Más contexto, pero también más estabilidad

Tener una ventana enorme no garantiza que un modelo use bien la información. Z.ai afirma que entrenó GLM-5.2 con escenarios de programación prolongados, como construir sistemas completos, investigar de forma automatizada, optimizar el rendimiento y depurar errores complejos.

La compañía sostiene que el modelo es el sistema de código abierto mejor clasificado en tres pruebas de tareas largas:

  • En FrontierSWE obtuvo 74,4 puntos, frente a 75,1 de Claude Opus 4.8 y 72,6 de GPT-5.5.
  • En PostTrainBench alcanzó 34,3 puntos, por detrás de Claude Opus 4.8, pero por delante de GPT-5.5.
  • En SWE-Marathon consiguió 13 puntos. Claude Opus 4.8 logró 26 y GPT-5.5, 12.

Estas cifras proceden de las evaluaciones publicadas por Z.ai y dependen de los entornos, herramientas y límites usados en cada prueba. No significan que el modelo vaya a completar cualquier proyecto de software sin supervisión.

En pruebas de programación más habituales, GLM-5.2 también mejora claramente a GLM-5.1. En Terminal-Bench 2.1 pasa de 63,5 a 81 puntos, mientras que en SWE-bench Pro sube de 58,4 a 62,1. En la primera prueba queda cerca de Claude Opus 4.8, que obtuvo 85 puntos bajo la configuración comparada.

El usuario puede elegir cuánto razona

GLM-5.2 incorpora varios niveles de esfuerzo para controlar el equilibrio entre calidad, velocidad y coste. En tareas sencillas puede usar menos computación y responder antes. Para problemas difíciles, el nivel Max permite dedicar más recursos a buscar una solución.

Esto resulta especialmente útil en agentes de programación. No es lo mismo pedirle que cambie el nombre de una función que encargarle la migración completa de una aplicación, con pruebas, correcciones y despliegue. En el segundo caso, más razonamiento puede mejorar el resultado, aunque también aumenta el tiempo y el consumo.

Cambios técnicos para que el millón de tokens sea viable

Procesar un contexto tan largo suele ser caro y lento. Para reducir ese coste, GLM-5.2 introduce IndexShare, una técnica que reutiliza parte del trabajo de atención, el mecanismo que ayuda al modelo a decidir qué fragmentos del contexto son relevantes.

En lugar de calcular ese índice en cada capa, el modelo comparte un mismo indexador entre cada grupo de cuatro capas. Z.ai afirma que esto reduce 2,9 veces los cálculos por token cuando se trabaja con un contexto de 1 millón de tokens.

También mejora el sistema de decodificación especulativa. Esta técnica hace que un componente proponga varios tokens y que el modelo principal los valide, acelerando la generación cuando las propuestas son correctas. En las pruebas de la compañía, la longitud media de aceptación sube de 4,56 a 5,47 tokens, un aumento del 20%.

El desafío no desaparece por completo. Los contextos largos consumen mucha memoria para mantener el llamado KV cache, una reserva que almacena información intermedia de la conversación. Por eso Z.ai también optimizó la gestión de memoria, el uso de la GPU y la planificación de solicitudes para mejorar el rendimiento cuando hay muchos usuarios o documentos extensos.

Disponible como modelo abierto

GLM-5.2 se publica bajo una licencia MIT, y sus pesos están disponibles en Hugging Face y ModelScope. Puede ejecutarse con herramientas como Transformers, vLLM, SGLang, xLLM y KTransformers, lo que permite desplegarlo en servidores propios si se cuenta con el hardware necesario.

También se puede probar mediante agentes de programación como ZCode, Claude Code y OpenCode. Los suscriptores de Coding Plan pueden activar el modelo usando GLM-5.2, o GLM-5.2[1m] en Claude Code para habilitar el contexto de 1 millón de tokens. El uso consume más cuota que otros modelos, especialmente durante las horas punta.

Para ti, el cambio más importante no es solo poder pegar más texto. GLM-5.2 apunta a sesiones de trabajo que duran horas: leer un repositorio completo, modificar muchos archivos, ejecutar pruebas y corregir errores sin empezar de cero en cada paso. Lo que habrá que vigilar ahora es si esa capacidad se mantiene en proyectos reales y cuánto cuesta usarla cuando el contexto crece de verdad.

GLM-5.2 amplía su contexto a 1 millón de tokens | neversleep.ai