Jais (language model) (IT)
Jais (pronunciato «Jais») — è una famiglia di modelli linguistici di grandi dimensioni (LLM) open source, sviluppata negli Emirati Arabi Uniti e appositamente ottimizzata per la lingua araba[1]. Il nome del modello è stato dato in onore del monte Jebel Jais — la vetta più alta degli EAU[2].
Il progetto è stato creato in collaborazione tra la società di ricerca Inception (sussidiaria del conglomerato tecnologico G42), l'Università di Intelligenza Artificiale Mohamed bin Zayed (MBZUAI) e la società californiana produttrice di chip AI Cerebras Systems[2]. Jais è stato pubblicato apertamente sotto una licenza libera, con l'obiettivo di stimolare lo sviluppo dell'ecosistema AI per la lingua araba, preservando il patrimonio culturale e linguistico e rendendo le moderne tecnologie AI più accessibili al mondo arabofono[1].
Storia dello sviluppo e versioni
Il progetto Jais è stato avviato nel 2023 a fronte delle limitazioni degli LLM esistenti per le lingue con scarse risorse. Gli sviluppatori evidenziavano la mancanza di modelli bilingui di qualità, capaci di elaborare con uguale efficacia sia l'arabo che l'inglese[2].
Jais-13B: Prima versione
La prima versione, Jais-13B, è stata rilasciata il 30 agosto 2023 e conteneva 13 miliardi di parametri[1]. Il modello è stato addestrato su un corpus misto di testi in inglese e arabo con un volume di 395 miliardi di token[3]. Al momento del suo lancio è stato definito «l'LLM arabo di più alta qualità»[1].
Jais-30B: Aumento della scala
L'8 novembre 2023, meno di tre mesi dopo, il consorzio ha presentato la seconda versione, significativamente migliorata — Jais-30B con 30 miliardi di parametri[4]. L'aumento della scala è stato determinato dalla necessità di affrontare compiti applicativi più complessi, come la sintesi e la traduzione. Il modello è stato addestrato su un dataset ampliato e purificato con un volume di 1,63 trilioni di token[4].
Jais-70B e la famiglia di modelli
Il 6 agosto 2024 Inception (G42) ha annunciato il lancio del modello di punta Jais-70B (70 miliardi di parametri) e di un'intera famiglia di modelli correlati[5]. Jais-70B è diventato il più grande LLM open source orientato alla lingua araba. Nel suo sviluppo è stato applicato il metodo del continuous training: invece di addestrare da zero, è stato preso come base il modello Llama 2 70B di Meta, successivamente fine-tuned su 330 miliardi di token in lingua araba. Ciò ha permesso di trasferire efficacemente la conoscenza della lingua inglese da Llama 2 e di concentrare le risorse sull'addestramento in arabo[5].
Architettura e caratteristiche tecniche
Jais appartiene ai modelli transformer autoregressivi basati sull'architettura GPT-3 (decoder-only). La caratteristica principale del modello è la sua specializzazione bilingue sull'arabo e sull'inglese, a differenza di molti LLM multilingui in cui l'inglese predomina. Ciò consente di raggiungere un'elevata profondità di comprensione della lingua araba e dei suoi dialetti[3].
Nella creazione di Jais sono state integrate soluzioni tecniche all'avanguardia[3]:
- Posizionamento ALiBi: Uno schema speciale di embedding posizionali che consente al modello di elaborare contesti più lunghi rispetto a quelli su cui è stato addestrato.
- Attivazione SwiGLU: Una funzione di attivazione che migliora la qualità dell'addestramento e l'espressività degli strati neurali.
- Maximal Update Parametrization (µP): Una metodologia di regolazione degli iperparametri che stabilizza l'addestramento all'aumentare delle dimensioni del modello.
- Tokenizzatore specializzato: Sviluppato tenendo conto delle caratteristiche dell'arabo e dell'inglese, riduce il numero di token per il testo arabo di 3–4 volte rispetto ai tokenizzatori universali e aumenta la velocità di elaborazione[6].
Oltre ai modelli base (foundation models), è stata rilasciata la versione Jais-chat, ulteriormente fine-tuned su 9,6 milioni di coppie domanda-risposta per l'adattamento ai compiti di chatbot e assistente[3].
Addestramento e set di dati
Uno dei compiti principali del progetto era la preparazione di un corpus di testi arabi di qualità e di grandi dimensioni. Il set di addestramento finale per Jais-13B ammontava a 395 miliardi di token, di cui:
- 116 miliardi di token (29%) — testo in arabo.
- 279 miliardi di token (71%) — testo in inglese e codice sorgente.
La componente araba è stata deliberatamente resa significativa (circa il 30%), per garantire un'elevata qualità di padronanza della lingua[3]. I dati includevano libri, articoli di notizie, pagine web e codice sorgente. Per aumentare il volume di testi arabi di qualità è stata applicata la traduzione automatica di risorse in lingua inglese[3].
L'addestramento dei modelli è stato condotto sul supercomputer Condor Galaxy 1 (CG-1) ad Abu Dhabi, sviluppato congiuntamente da G42 e Cerebras Systems. Grazie a questa infrastruttura, l'addestramento di Jais-13B ha richiesto solo circa 3,5 giorni di tempo effettivo[2].
Applicazioni e importanza
Jais è posizionato come un passo fondamentale nello sviluppo dell'AI generativa per la lingua araba e per altre comunità linguistiche scarsamente rappresentate negli LLM moderni. L'accesso aperto al modello mira a stimolare l'adozione delle tecnologie di elaborazione del linguaggio naturale nelle regioni del Medio Oriente e del Nord Africa.
Dal lancio del progetto, esso ha attirato l'interesse di strutture governative e commerciali degli EAU. L'accesso anticipato al modello è stato concesso al Ministero degli Affari Esteri degli EAU, alla compagnia petrolifera e del gas ADNOC, alla compagnia aerea Etihad Airways e alla banca First Abu Dhabi Bank[1]. Nel 2024 Microsoft ha annunciato l'integrazione di Jais sulla propria piattaforma cloud Microsoft Azure, rendendolo accessibile agli utenti globali[6].
I creatori di Jais sottolineano il suo ruolo nella preservazione del patrimonio culturale e linguistico arabo. Secondo le parole del direttore esecutivo di Inception Andrew Jackson, il progetto mira a «garantire che la lingua araba, con il suo ricco patrimonio, trovi la propria voce nel panorama dell'AI»[1]. L'esperienza acquisita è pianificata per essere utilizzata nella creazione di LLM analoghi per altre lingue e culture[1].
Bibliografia
- Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
- Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
- Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
- Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
- Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
- Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
- Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
- Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.
Note
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
- ↑ 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
- ↑ 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
- ↑ 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
- ↑ 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]