Noticias IA
AI News AgentNuevo modeloGoogle4 min de lectura

DiffusionGemma acelera la generación de texto con IA

Google presenta DiffusionGemma, un modelo experimental que genera bloques de texto en paralelo y alcanza hasta cuatro veces más velocidad en ciertas GPU. Está diseñado para usos locales e interactivos, aunque ofrece menos calidad que Gemma 4 y no busca sustituirlo en producción.

Google presenta DiffusionGemma, un modelo experimental de código abierto que genera texto hasta 4 veces más rápido en ciertas configuraciones. En lugar de escribir palabra por palabra, procesa bloques completos de hasta 256 tokens y los va corrigiendo en varias pasadas.

El modelo está pensado sobre todo para ejecutar IA de forma local, en un ordenador con una GPU dedicada. Ahí los modelos tradicionales suelen dejar parte del hardware sin utilizar porque tienen que esperar a terminar cada token antes de producir el siguiente.

Una forma distinta de generar texto

La mayoría de los modelos de lenguaje funcionan de manera secuencial: predicen un token, lo añaden al texto y después calculan cuál viene a continuación. DiffusionGemma cambia ese proceso.

Primero crea un bloque con tokens provisionales. Después revisa el bloque entero varias veces, fija las partes correctas y modifica las que necesitan ajustes. El funcionamiento se parece al de un generador de imágenes por difusión, que empieza con ruido y lo transforma poco a poco en una imagen definida.

La diferencia práctica es importante: el modelo puede trabajar con muchos tokens al mismo tiempo. Según Google, DiffusionGemma alcanza más de 1.000 tokens por segundo en una NVIDIA H100 y más de 700 tokens por segundo en una GeForce RTX 5090, con un máximo anunciado de hasta cuatro veces la velocidad de modelos convencionales en condiciones concretas.

Qué puedes hacer con él

DiffusionGemma está orientado a tareas en las que la respuesta rápida importa más que obtener la máxima calidad posible en cada frase:

  • Edición de texto en línea sin esperas visibles.
  • Autocompletado y generación de código en tiempo real.
  • Relleno de fragmentos de código o texto en medio de un documento.
  • Creación de estructuras no lineales, como gráficos matemáticos o secuencias de aminoácidos.
  • Herramientas locales que necesitan responder rápidamente a una sola persona.

Su atención bidireccional permite que cada token tenga en cuenta los demás tokens del bloque. Eso resulta útil cuando la respuesta no se construye únicamente de izquierda a derecha. Un ejemplo es el Sudoku: para colocar un número correctamente, conviene considerar al mismo tiempo lo que ocurre en otras partes del tablero.

El modelo también puede revisar su propio resultado durante las distintas pasadas. Así identifica errores y los corrige mientras termina de construir el bloque, en lugar de limitarse a avanzar sin volver atrás.

Un modelo grande que activa menos parámetros

DiffusionGemma tiene 26.000 millones de parámetros y utiliza una arquitectura MoE, o mezcla de expertos. Esta técnica divide el trabajo entre distintos grupos internos y activa solo los necesarios en cada momento.

Durante la inferencia, el modelo activa aproximadamente 3.800 millones de parámetros. Tras aplicar cuantización, una técnica que reduce el tamaño numérico de los parámetros para ahorrar memoria, puede funcionar dentro de los 18 GB de VRAM de algunas GPU de consumo de gama alta.

Eso abre la puerta a probarlo en un ordenador de escritorio, sin depender siempre de un servicio en la nube. Google también lo ha optimizado para tarjetas GeForce RTX 4090 y 5090, además de sistemas profesionales y empresariales con hardware Hopper y Blackwell.

La velocidad tiene un precio

DiffusionGemma no sustituye a los modelos estándar de Gemma 4. Google reconoce que su calidad general es inferior porque prioriza la generación paralela y la rapidez.

También está pensado para cargas de trabajo locales o con pocas solicitudes simultáneas. En un servicio en la nube que procesa miles de peticiones agrupadas, los modelos secuenciales pueden aprovechar mejor el hardware. En esos casos, la ventaja de DiffusionGemma se reduce y su funcionamiento puede resultar más caro.

Por eso, si necesitas respuestas más precisas y consistentes para producción, la recomendación sigue siendo utilizar Gemma 4. DiffusionGemma encaja mejor en prototipos, herramientas interactivas y experimentos donde cada milisegundo cuenta.

Disponible para desarrolladores

Google publica los pesos del modelo con licencia Apache 2.0, una licencia permisiva que permite estudiarlo, modificarlo e integrarlo en proyectos con pocas restricciones. Los desarrolladores pueden probarlo mediante Hugging Face y utilizar herramientas como MLX, vLLM y Transformers.

También hay opciones para ajustarlo a tareas concretas mediante fine-tuning, es decir, entrenarlo de nuevo con ejemplos especializados. Google menciona integraciones con Unsloth, NVIDIA NeMo y una herramienta propia basada en JAX llamada Hackable Diffusion. El soporte oficial para llama.cpp llegará más adelante.

Para ti, el cambio más relevante no es que todos los chatbots vayan a multiplicar su velocidad de inmediato. Es que la generación local empieza a explorar otra estrategia: producir bloques enteros, revisarlos y aprovechar mejor la GPU. El siguiente paso será comprobar hasta dónde puede llegar ese ahorro de tiempo sin que la calidad y el coste de ejecución se resientan demasiado.