Jais (modelo de lenguaje)
Jais (pronunciado «Yais») es una familia de grandes modelos lingüísticos (LLM) de código abierto, desarrollada en los Emiratos Árabes Unidos y especialmente optimizada para el idioma árabe[1]. El modelo recibe su nombre de la montaña Jebel Jais, el pico más alto de los EAU[2].
El proyecto fue creado en colaboración entre la empresa de investigación Inception (una subsidiaria del conglomerado tecnológico G42), la Universidad de Inteligencia Artificial Mohamed bin Zayed (MBZUAI) y la empresa californiana de chips de IA Cerebras Systems[2]. Jais fue publicado bajo una licencia de código abierto para estimular el desarrollo de un ecosistema de IA para el idioma árabe, preservando el patrimonio cultural y lingüístico y haciendo que las tecnologías modernas de IA sean más accesibles para el mundo arabófono[1].
Historia del desarrollo y lanzamientos
El proyecto Jais se inició en 2023 debido a las limitaciones de los LLM existentes para idiomas con pocos recursos. Los desarrolladores destacaron la escasez de modelos bilingües de alta calidad capaces de procesar tanto el árabe como el inglés con la misma eficacia[2].
Jais-13B: Primera versión
La primera versión, Jais-13B, fue lanzada el 30 de agosto de 2023 y contenía 13 mil millones de parámetros[1]. El modelo fue entrenado en un corpus mixto de textos en inglés y árabe con un volumen de 395 mil millones de tokens[3]. En el momento de su lanzamiento, fue calificado como "el LLM en árabe de mayor calidad del mundo"[1].
Jais-30B: Aumento de escala
El 8 de noviembre de 2023, menos de tres meses después, el consorcio presentó una segunda versión significativamente mejorada: Jais-30B con 30 mil millones de parámetros[4]. El aumento de escala fue motivado por la necesidad de abordar tareas aplicadas más complejas, como la sumarización y la traducción. El modelo fue entrenado en un conjunto de datos ampliado y depurado de 1,63 billones de tokens[4].
Jais-70B y la familia de modelos
El 6 de agosto de 2024, Inception (G42) anunció el lanzamiento del modelo insignia Jais-70B (70 mil millones de parámetros) y toda una familia de modelos relacionados[5]. Jais-70B se convirtió en el LLM de código abierto más grande enfocado en el idioma árabe. En su desarrollo se aplicó el método de entrenamiento continuo (continuous training): en lugar de entrenar desde cero, se tomó como base el modelo Llama 2 70B de Meta, que fue reentrenado con 330 mil millones de tokens en árabe. Esto permitió transferir eficazmente el conocimiento del idioma inglés de Llama 2 y concentrar los recursos en el entrenamiento del árabe[5].
Arquitectura y características técnicas
Jais pertenece a la categoría de modelos de transformador autorregresivos basados en la arquitectura GPT-3 (decoder-only). Una característica clave del modelo es su especialización bilingüe en árabe e inglés, a diferencia de muchos LLM multilingües donde predomina el inglés. Esto permite alcanzar un alto nivel de comprensión del idioma árabe y sus dialectos[3].
En la creación de Jais se integraron soluciones técnicas avanzadas[3]:
- Posicionamiento ALiBi: Un esquema especial de embeddings posicionales que permite al modelo procesar un contexto más largo que aquel en el que fue entrenado.
- Activación SwiGLU: Una función de activación que mejora la calidad del entrenamiento y la expresividad de las capas neuronales.
- Maximal Update Parametrization (µP): Una técnica para ajustar hiperparámetros que estabiliza el entrenamiento a medida que aumenta el tamaño del modelo.
- Tokenizador especializado: Diseñado teniendo en cuenta las particularidades de los idiomas árabe e inglés, lo que reduce el número de tokens para texto en árabe de 3 a 4 veces en comparación con los tokenizadores universales y aumenta la velocidad de procesamiento[6].
Además de los modelos base (foundation models), se lanzó una versión Jais-chat, que fue adicionalmente entrenada con 9,6 millones de pares de preguntas y respuestas para adaptarla a tareas de chatbot y asistente[3].
Entrenamiento y conjunto de datos
Una de las tareas principales del proyecto fue la preparación de un corpus grande y de alta calidad de textos en árabe. El conjunto de datos de entrenamiento final para Jais-13B consistió en 395 mil millones de tokens, de los cuales:
- 116 mil millones de tokens (29%) — texto en árabe.
- 279 mil millones de tokens (71%) — texto en inglés y código de programación.
El componente árabe se hizo intencionadamente significativo (alrededor del 30%) para garantizar un dominio de alta calidad del idioma[3]. Los datos incluían libros, artículos de noticias, páginas web y código fuente. Para aumentar el volumen de textos en árabe de calidad, se utilizó la traducción automática de recursos en inglés[3].
El entrenamiento de los modelos se llevó a cabo en el superordenador Condor Galaxy 1 (CG-1) en Abu Dabi, desarrollado conjuntamente por G42 y Cerebras Systems. Gracias a esta infraestructura, el entrenamiento de Jais-13B tomó solo alrededor de 3,5 días de tiempo neto[2].
Aplicación y significado
Jais se posiciona como un paso clave en el desarrollo de la IA generativa para el idioma árabe y otras comunidades lingüísticas insuficientemente representadas en los LLM modernos. El acceso abierto al modelo tiene como objetivo estimular la adopción de tecnologías de procesamiento del lenguaje natural en las regiones de Oriente Medio y África del Norte.
Desde su lanzamiento, el proyecto ha atraído el interés de entidades gubernamentales y comerciales de los EAU. El Ministerio de Asuntos Exteriores de los EAU, la compañía de petróleo y gas ADNOC, la aerolínea Etihad Airways y el banco First Abu Dhabi Bank obtuvieron acceso temprano al modelo[1]. En 2024, Microsoft anunció la integración de Jais en su plataforma en la nube Microsoft Azure, haciéndolo accesible para usuarios de todo el mundo[6].
Los creadores de Jais enfatizan su papel en la preservación del patrimonio cultural y lingüístico árabe. Según el director ejecutivo de Inception, Andrew Jackson, el proyecto busca "asegurar que el idioma árabe, con su rica herencia, encuentre su voz en el panorama de la IA"[1]. Se planea utilizar la experiencia acumulada para crear LLM similares para otros idiomas y culturas[1].
Literatura
- Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
- Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
- Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
- Inception AI (2024). JAIS 30B Whitepaper. Libro blanco en línea.
- Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
- Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
- Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
- Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.
Referencias
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 "Meet 'Jais', The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception". Cerebras Systems. [1]
- ↑ 2.0 2.1 2.2 2.3 "UAE's G42 launches open source Arabic language AI model". Reuters. [2]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 "[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models". arXiv. [3]
- ↑ 4.0 4.1 "Upgraded Arabic large language model is twice as big". Computer Weekly. [4]
- ↑ 5.0 5.1 "G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing". Abu Dhabi Media Office. [5]
- ↑ 6.0 6.1 "Introducing JAIS: Arabic-centric Large Language Model on Azure". Microsoft Tech Community. [6]