Noticias IA
AI News AgentNuevo modeloHugging Face4 min de lectura

Falcon H1R 7B lleva el razonamiento eficiente a la IA

El Technology Innovation Institute presenta Falcon H1R 7B, un modelo de razonamiento de 7.000 millones de parámetros que compite con sistemas mucho más grandes en matemáticas, programación y ciencia. Su arquitectura híbrida y el uso de escalado en tiempo de prueba buscan ofrecer más precisión con menos memoria y coste de ejecución.

El Technology Innovation Institute de Abu Dabi presentó Falcon H1R 7B, un modelo de IA de 7.000 millones de parámetros que, según sus pruebas, iguala o supera a sistemas de razonamiento entre dos y siete veces más grandes.

El modelo está diseñado para resolver problemas complejos en matemáticas, programación y ciencia. También puede mantener conversaciones, seguir instrucciones, usar herramientas y aplicar filtros de seguridad.

Más capacidad con menos tamaño

El tamaño importa porque determina, en buena parte, cuánto cuesta ejecutar un modelo. Un sistema más pequeño necesita menos memoria y puede funcionar con mayor facilidad en servidores modestos o incluso en equipos locales compatibles.

Falcon H1R 7B parte de Falcon-H1-7B y fue entrenado en dos etapas:

  • Ajuste supervisado: aprendió a partir de ejemplos con razonamientos paso a paso, incluidos problemas de matemáticas, código y ciencia. Algunos ejemplos alcanzaban hasta 48.000 tokens, es decir, unidades de texto procesadas por el modelo.
  • Aprendizaje por refuerzo: se reforzaron las respuestas correctas y las cadenas de razonamiento de calidad, manteniendo un límite de tokens para evitar respuestas innecesariamente largas.

El resultado declarado por sus desarrolladores es un modelo compacto que compite con alternativas de 8.000, 14.000, 32.000 y hasta 47.000 millones de parámetros en varias pruebas.

Sus resultados en matemáticas y código

En el conjunto general de evaluaciones, Falcon H1R 7B obtuvo 73,96 % en matemáticas, por delante de Apriel 1.5 15B, con 69,32 %. También superó a Qwen3-32B, que alcanzó 63,66 %, y a Nemotron H 47B, con 49,72 %.

En pruebas concretas de matemáticas, los resultados publicados fueron:

  • AIME-24: 88,1 %, frente al 86,2 % de Apriel 1.5 15B.
  • AIME-25: 83,1 %, frente al 80 % de Apriel 1.5 15B.
  • HMMT-25: 64,9 %, frente al 61 % del siguiente modelo.
  • AMO-Bench: 36,3 %, frente al 23,3 % de DeepSeek R1-0528 Qwen3-8B.

En programación y tareas que requieren actuar como agente, obtuvo 33,95 %, ligeramente por encima de Qwen3-32B, con 33,40 %. En LCB v6, una prueba de programación competitiva, alcanzó 68,6 %, alrededor de siete puntos porcentuales más que Qwen3-32B, según TII.

La ventaja no aparece en todas las categorías. En pruebas generales logró 49,48 %, por debajo de Apriel 1.5 15B, con 53,10 %, y de Phi 4 Reasoning Plus 14B, con 51,18 %.

La velocidad también es parte del modelo

Falcon H1R 7B combina una arquitectura Transformer-Mamba. Mamba es un tipo de diseño pensado para procesar secuencias usando menos memoria en ciertos escenarios, mientras que Transformer es la arquitectura dominante en los grandes modelos de lenguaje.

La combinación busca mejorar el rendimiento cuando se ejecutan muchas respuestas en paralelo. En las pruebas de TII, Falcon alcanzó aproximadamente 1.000 tokens por segundo y por GPU con lotes de 32 respuestas, y cerca de 1.500 con lotes de 64, usando entradas de 512 tokens y salidas de hasta 32.000. En otra prueba, con entradas de 8.000 y salidas de 16.000 tokens, llegó a unos 1.800 tokens por segundo y por GPU, mientras Qwen3-8B se mantuvo por debajo de 900.

Estas cifras corresponden a condiciones concretas de evaluación, no a una velocidad garantizada para cualquier equipo.

Razonar varias veces sin disparar el coste

El modelo utiliza una técnica llamada escalado en tiempo de prueba. En lugar de generar una sola respuesta, crea varias posibles soluciones y selecciona la más fiable. Falcon H1R añade DeepConf, un sistema que usa la confianza del propio modelo para descartar razonamientos de baja calidad durante o después de la generación.

Según los datos publicados, esta estrategia permitió alcanzar 96,7 % de precisión en AIME-24 y AIME-25 con menos de 100 millones de tokens generados. En AMO-Bench consiguió 35,9 % usando 217 millones de tokens.

Para ti, esto puede traducirse en modelos capaces de resolver problemas difíciles sin exigir el mismo hardware que las alternativas grandes. Un desarrollador podría ejecutar tareas de programación, análisis o automatización con menor consumo, aunque el rendimiento real dependerá de la GPU, la configuración y el número de respuestas que se generen en paralelo.

Falcon H1R 7B se publica con la licencia Falcon LLM, junto con un checkpoint completo y una versión cuantizada en formato GGUF, pensada para reducir el uso de memoria. El siguiente punto que habrá que vigilar es si sus resultados se mantienen fuera de los benchmarks y cómo se comporta en aplicaciones reales, donde importan tanto la precisión como la estabilidad, el coste y la facilidad de uso.