Noticias IA
AI News AgentNuevo modeloAllenAI4 min de lectura

Ai2 presenta SERA, un agente de IA abierto

Ai2 lanza SERA, una familia de agentes de código abierto que puede especializarse en repositorios privados. El modelo SERA-32B alcanza hasta un 54,2% en SWE-Bench Verified, mientras que su entrenamiento puede reproducirse desde unos 400 dólares en computación.

Ai2 presenta SERA, una familia de agentes de código abierto que puede aprender las reglas y peculiaridades de cualquier repositorio, incluido el código privado de una empresa. Su propuesta central: entrenar un agente especializado ya no requiere presupuestos millonarios ni una gran infraestructura de investigación.

SERA puede generar código, revisar cambios, encontrar errores, explicar funciones y mantener proyectos. Está disponible en versiones de 8.000 a 32.000 millones de parámetros, basadas en Qwen3, junto con los modelos, datos, código y recetas necesarios para reproducir el entrenamiento.

Un agente que aprende tu código

Los modelos comerciales no conocen de forma nativa las API internas, las convenciones ni la arquitectura de tu organización. Puedes darles contexto en cada consulta, pero eso no es lo mismo que entrenarlos para trabajar con tu repositorio.

Ai2 propone ajustar SERA con datos generados a partir del propio código. El proceso puede producir ejemplos de errores, correcciones y flujos de trabajo para que el agente aprenda cómo se resuelven problemas en un proyecto concreto.

Esto sirve, por ejemplo, para que un agente entienda que tu empresa usa una biblioteca interna, que determinados cambios necesitan una revisión adicional o que una parte antigua del sistema solo puede modificarse siguiendo ciertas convenciones.

La adaptación se probó con Django, SymPy y Sphinx, tres de los repositorios más grandes de SWE-Bench. Con 8.000 trayectorias sintéticas por repositorio, los modelos especializados igualaron o superaron a los modelos generales de más de 100.000 millones de parámetros usados como profesores.

En Django, el modelo especializado obtuvo un 52,23% frente al 51,20% del modelo profesor. En SymPy alcanzó un 51,11%, frente al 48,89% del profesor. Los resultados no garantizan el mismo rendimiento en cualquier código privado, pero apuntan a una ventaja clara de entrenar el agente para un proyecto específico.

Más rendimiento con menos coste

El modelo SERA-32B resolvió el 54,2% de los problemas de SWE-Bench Verified con una ventana de contexto de 64.000 tokens. Esta prueba mide si un agente puede resolver tareas reales de repositorios de software, como corregir errores o implementar cambios.

En una comparación con condiciones alineadas y 32.000 tokens de contexto, SERA-32B logró un 49,5%, frente al 50,0% de Devstral Small 2 y el 50,5% de GLM-4.5-Air. En otras palabras, se acerca a modelos abiertos de referencia sin depender de un entrenamiento complejo basado en refuerzo.

El entrenamiento también busca ser accesible:

  • Reproducir el resultado del mejor modelo abierto anterior cuesta aproximadamente 400 dólares en computación.
  • Alcanzar un rendimiento comparable al de algunos modelos industriales de código abierto cuesta alrededor de 12.000 dólares.
  • SERA-32B necesitó unos 40 días de GPU usando un clúster con dos GPU NVIDIA Hopper o RTX PRO 6000 Blackwell Server Edition.

Ai2 reduce el coste usando una técnica llamada generación con verificación flexible. En vez de comprobar de forma exhaustiva que cada parche sintético sea totalmente correcto, el sistema también aprovecha parches parcialmente correctos si reflejan un proceso útil para resolver el problema.

El método combina esa idea con un catálogo de 51 tipos habituales de errores. Así puede crear muchos escenarios distintos a partir de las funciones de un repositorio, sin tener que esperar a encontrar errores reales en cada parte del código.

Qué cambia para los desarrolladores

Todo el paquete está abierto: modelos, datos generados, integración con Claude Code y recetas de entrenamiento. Ai2 afirma que el despliegue puede iniciarse con unas pocas líneas de código, incluso sin experiencia previa entrenando modelos de lenguaje.

También trabajó con NVIDIA para acelerar la ejecución. En pruebas internas, SERA alcanzó aproximadamente 1.950 tokens de salida por segundo con cuatro GPU H100 en precisión BF16, y unos 3.700 con FP8. En sistemas Blackwell con cuatro B200, llegó a unos 8.600 tokens por segundo usando NVFP4. Son cifras máximas de rendimiento, no una garantía para cualquier equipo o configuración.

Para un desarrollador independiente o una empresa pequeña, la diferencia práctica está en poder adaptar un agente a su propia base de código sin enviar todo el conocimiento interno a un proveedor cerrado ni montar un sistema de entrenamiento especializado. El resultado puede ser un asistente más útil para revisar cambios, depurar módulos antiguos o seguir las reglas de un equipo.

SERA no elimina la necesidad de supervisar el código generado. Sus resultados dependen de la calidad de los datos, del repositorio y de las pruebas disponibles. Pero reduce de forma importante el coste de experimentar con agentes especializados, y hace que esa posibilidad deje de estar reservada a los laboratorios con más recursos.

El siguiente punto a vigilar será si esta receta mantiene sus resultados en repositorios privados grandes, con documentación incompleta y pocas pruebas automatizadas. Si lo consigue, el avance más relevante no será solo tener otro modelo de programación, sino poder construir agentes ajustados a cada proyecto con recursos al alcance de equipos pequeños.