Falcon-H1-Arabic lleva la IA árabe a 256K tokens
TII presenta Falcon-H1-Arabic, una familia de modelos de IA en árabe con versiones de 3B, 7B y 34B parámetros. Las dos mayores procesan hasta 256.000 tokens y combinan las arquitecturas Mamba y Transformer para trabajar con textos extensos y distintos dialectos.

Falcon-H1-Arabic es la nueva familia de modelos de inteligencia artificial de TII para comprender y generar árabe, con versiones de 3.000, 7.000 y 34.000 millones de parámetros. Las dos mayores pueden procesar hasta 256.000 tokens, suficiente para analizar varias novelas o cientos de páginas técnicas en una sola conversación.
El lanzamiento busca resolver problemas habituales de los modelos en árabe: entender dialectos, mantener el hilo en textos largos, razonar sobre matemáticas y trabajar con información especializada. TII asegura que sus tres modelos superan a otros sistemas de tamaño similar en las pruebas realizadas, aunque los resultados dependen del benchmark y de la configuración utilizada.
Una arquitectura híbrida para textos largos
Falcon-H1-Arabic combina dos formas de procesar el lenguaje dentro de cada bloque del modelo. Por un lado usa atención de Transformer, que ayuda a relacionar palabras lejanas con precisión. Por otro incorpora Mamba, una arquitectura basada en modelos de espacio de estados que puede manejar secuencias extensas con un coste más eficiente.
Ambos componentes trabajan en paralelo y sus representaciones se fusionan antes de generar la salida. La idea es aprovechar la velocidad de Mamba en documentos muy largos sin perder la capacidad de la atención para encontrar conexiones importantes dentro del texto.
El salto en la ventana de contexto es considerable. Falcon-Arabic estaba limitado a 32.000 tokens, mientras que las nuevas versiones ofrecen:
- 3B: 128.000 tokens, orientado a agentes rápidos, dispositivos con pocos recursos y sistemas con muchas consultas.
- 7B: 256.000 tokens, pensado para asistentes de producción, chat empresarial y tareas de razonamiento.
- 34B: 256.000 tokens, destinado a análisis documental, investigación y aplicaciones donde los errores tienen un coste alto.
Una ventana de contexto amplia no garantiza por sí sola que el modelo recuerde todo lo que recibe. Por eso TII afirma haber entrenado los modelos para reducir el problema conocido como “perdido en el medio”: ignorar información relevante situada en la parte central de un documento largo.
Más árabe real, no solo árabe formal
El entrenamiento utilizó alrededor de 300.000 millones de tokens, con una mezcla casi equilibrada de árabe, inglés y otros idiomas. Esto busca conservar capacidades para programar, resolver tareas STEM y trabajar entre varios idiomas, sin sacrificar el conocimiento específico del árabe.
TII también amplió la presencia de dialectos como el egipcio, levantino, del Golfo y magrebí. El árabe no se utiliza igual en todos los países, y un modelo entrenado principalmente con árabe estándar puede fallar en conversaciones cotidianas o expresiones regionales.
La compañía asegura que aplicó filtros lingüísticos específicos para detectar problemas de ortografía, morfología, diacríticos y sintaxis. Después del entrenamiento inicial, los modelos pasaron por ajuste supervisado y optimización basada en preferencias, dos etapas destinadas a mejorar el seguimiento de instrucciones, la coherencia y la calidad de las respuestas.
Qué resultados obtiene
En el Open Arabic LLM Leaderboard, una prueba que mide capacidades de comprensión en árabe, TII informa de resultados de vanguardia en las tres escalas. Las cifras pueden variar ligeramente respecto al marcador público porque la evaluación utilizó vLLM en lugar de Accelerate, con diferencias normalmente inferiores a un punto.
Los resultados comunicados incluyen:
- Falcon-H1-Arabic 3B: cerca del 62% en OALL, alrededor del 82% en la parte nativa de 3LM y aproximadamente el 50% en la evaluación de dialectos de AraDice.
- Falcon-H1-Arabic 7B: 71,7% en OALL, cerca del 92% en 3LM nativo y alrededor del 80% en ArabCulture.
- Falcon-H1-Arabic 34B: aproximadamente 75% en OALL, cerca del 96% en 3LM nativo y alrededor del 80% en ArabCulture.
Según TII, el modelo de 34B supera en OALL incluso a sistemas bastante mayores, como Llama-3.3-70B. Eso no significa que sea mejor en cualquier tarea o idioma, pero sí apunta a que una arquitectura y unos datos más adaptados al árabe pueden compensar, en ciertas evaluaciones, una menor cantidad de parámetros.
Qué cambia para ti
La versión de 3B puede servir para asistentes con baja latencia, aplicaciones en dispositivos y agentes que necesitan responder muchas veces sin disparar el coste. La de 7B apunta al uso general en empresas: chatbots, resumen de documentos, generación de contenido y comprensión de información.
La de 34B está pensada para trabajos más exigentes, como revisar contratos, resumir historiales médicos o analizar investigaciones extensas. En estos casos, sus 256.000 tokens permiten enviar grandes volúmenes de texto sin dividirlos en tantas partes y perder conexiones entre ellas.
Aun así, el modelo no debe tratarse como una autoridad automática. TII advierte que puede reproducir sesgos, inventar información y perder precisión cuando se utiliza en los límites extremos de su contexto. En ámbitos médicos, legales o financieros seguirá siendo necesaria la revisión de un profesional.
Falcon-H1-Arabic muestra que el avance de la IA no depende solo de crear modelos más grandes. También importa entrenarlos con datos que reflejen cómo habla la gente y diseñar arquitecturas que funcionen bien con las características de cada idioma. Lo siguiente que habrá que vigilar es si estas mejoras se mantienen fuera de los benchmarks, especialmente en dialectos, documentos sensibles y conversaciones reales de larga duración.