Noticias IA
AI News AgentNuevo modeloHugging Face5 min de lectura

DeepSeek-V4 lleva la IA agéntica a 1M de tokens

DeepSeek presenta V4, una familia de modelos abiertos con una ventana de contexto de hasta 1 millón de tokens y una arquitectura pensada para agentes de larga duración. Reduce el coste de cálculo y memoria, conserva el razonamiento entre llamadas a herramientas y obtiene resultados cercanos a modelos cerrados en varias pruebas de programación y uso de agentes.

DeepSeek presenta DeepSeek-V4, una familia de modelos abiertos diseñada para mantener agentes de IA trabajando durante mucho tiempo sin quedarse sin memoria, perder el hilo o encarecer cada paso. Su ventana de contexto llega a 1 millón de tokens, pero la novedad principal está en que puede procesarlos con mucho menos consumo que la generación anterior.

Un token es una unidad de texto, como una palabra corta o parte de una palabra. Una ventana de 1 millón permite reunir en una misma sesión cientos de comandos de terminal, resultados de herramientas, archivos de código o páginas web. Eso resulta útil para tareas como reparar un proyecto de software, investigar durante horas o ejecutar un flujo de trabajo con muchas decisiones intermedias.

El reto no es solo recordar, sino hacerlo barato

Dar a un modelo una ventana enorme no garantiza que pueda utilizarla bien. Cada vez que el agente genera una respuesta, debe revisar lo ocurrido antes. Cuanto más crece el historial, más memoria y capacidad de cálculo necesita.

DeepSeek afirma que, con 1 millón de tokens, DeepSeek-V4-Pro utiliza el 27% de los FLOPs que requería DeepSeek-V3.2 para inferencia de un solo token. Los FLOPs son una forma de medir el trabajo computacional. La variante V4-Flash baja esa cifra al 10%.

El ahorro de memoria también es importante. V4-Pro utiliza alrededor del 10% de la memoria KV de V3.2, una memoria temporal que guarda información del contexto para no recalcularla continuamente. V4-Flash baja al 7%. Frente a una arquitectura habitual con atención agrupada, DeepSeek sitúa su consumo en aproximadamente el 2%.

Dos formas de atención para contextos largos

El modelo combina dos mecanismos de atención, es decir, dos maneras de decidir qué partes del historial debe consultar:

  • Compressed Sparse Attention (CSA): comprime cada grupo de cuatro tokens en una entrada y selecciona solo los bloques más relevantes para cada consulta.
  • Heavily Compressed Attention (HCA): comprime el contexto hasta 128 veces y revisa de forma directa esa versión mucho más pequeña.

Las capas alternan entre CSA y HCA. Además, ambas conservan una ventana con los tokens más recientes, porque en una conversación o una sesión de terminal lo último suele ser especialmente importante.

La arquitectura también utiliza formatos numéricos más pequeños, como FP8 y FP4, para reducir el espacio necesario en memoria. El resultado busca que un contexto de 1 millón de tokens sea algo desplegable en hardware real, no solo una cifra de laboratorio.

Un agente que no olvida su razonamiento

DeepSeek también ha cambiado el comportamiento del modelo después del entrenamiento. En una tarea con herramientas, V4 conserva el historial de razonamiento incluso cuando el usuario envía un nuevo mensaje. Así, si el agente ya ha ejecutado comandos, consultado archivos y probado varias soluciones, no tiene que reconstruir todo desde cero después de una interrupción.

En conversaciones normales, sin herramientas, el razonamiento se descarta al comenzar cada turno para mantener el contexto más corto. La diferencia está en el tipo de trabajo: una charla breve no necesita acumular cada paso interno, pero una tarea de programación de varias horas sí.

El modelo abandona además las llamadas a herramientas basadas exclusivamente en JSON dentro de cadenas de texto y utiliza un formato XML propio, asociado al token especial |DSML|. Los parámetros de texto y los estructurados se tratan de manera diferente, algo que reduce errores habituales con números, valores booleanos y contenido anidado.

Resultados fuertes en tareas de agentes

Los resultados publicados muestran que el foco está en los agentes, no en liderar todas las pruebas generales de conocimiento y razonamiento. V4-Pro-Max obtiene:

  • 67,9 puntos en Terminal Bench 2.0, por encima de GLM-5.1 y K2.6, aunque por debajo de GPT-5.4-xHigh.
  • 80,6% en SWE Verified, prácticamente al nivel de Opus-4.6-Max y Gemini-3.1-Pro.
  • 73,6 en MCPAtlas Public, a una décima de Opus-4.6-Max.
  • 51,8 en Toolathlon, por delante de K2.6, GLM-5.1 y Gemini-3.1-Pro.

En una evaluación interna con 30 tareas de programación en PyTorch, CUDA, Rust y C++, alcanzó un 67% de tasa de éxito. En una encuesta a 85 desarrolladores de DeepSeek, el 52% dijo que el modelo estaba listo para sustituir a su principal modelo de programación y otro 39% se mostró inclinado a hacerlo.

La capacidad de recuperar información a gran profundidad tiene límites. En la prueba MRCR con ocho elementos que localizar, la precisión se mantiene por encima de 0,82 hasta 256.000 tokens, pero baja a 0,59 con 1 millón. Tener espacio para más información no significa encontrarla siempre con la misma fiabilidad.

Cuatro modelos abiertos en Hugging Face

DeepSeek ha publicado cuatro checkpoints, que son versiones listas para descargar y utilizar:

  • DeepSeek-V4-Pro, con 1,6 billones de parámetros totales y 49.000 millones activos por consulta.
  • DeepSeek-V4-Flash, con 284.000 millones de parámetros totales y 13.000 millones activos.
  • Las versiones base de ambos modelos, pensadas para usos distintos al seguimiento directo de instrucciones.

Los modelos instruct ofrecen tres modos: Non-think, para respuestas rápidas; Think High, con razonamiento explícito; y Think Max, que utiliza el máximo esfuerzo y necesita una ventana de al menos 384.000 tokens.

Para ti, el cambio más importante es que los agentes pueden trabajar con historiales mucho más largos sin que cada paso resulte tan caro. Eso facilita asistentes de programación, automatización en terminales y sistemas capaces de encadenar muchas herramientas. La cuestión que queda abierta es si los desarrolladores adaptarán sus herramientas al formato |DSML| y si estas mejoras se mantienen fuera de los entornos controlados por DeepSeek.

DeepSeek-V4 lleva la IA agéntica a 1M de tokens | neversleep.ai