Jais (language model) (SV)
Jais (uttalas "Jejs") — är en familj av öppna stora språkmodeller (LLM), utvecklad i Förenade Arabemiraten och särskilt optimerad för arabiska[1]. Modellens namn är hämtat från berget Jebel Jais — den högsta toppen i UAE[2].
Projektet skapades i samarbete mellan forskningsföretaget Inception (ett dotterbolag till teknikkonglomeratet G42), Mohamed bin Zayed University of Artificial Intelligence (MBZUAI) och det kaliforniska AI-chipföretaget Cerebras Systems[2]. Jais publicerades öppet under en fri licens, vilket syftar till att stimulera utvecklingen av ett AI-ekosystem för arabiska, bevara det kulturella och språkliga arvet samt göra modern AI-teknik mer tillgänglig för den arabisktalande världen[1].
Utvecklingshistoria och versioner
Projektet Jais initierades 2023 mot bakgrund av de befintliga LLM:ernas begränsningar för resursssvaga språk. Utvecklarna påpekade bristen på högkvalitativa tvåspråkiga modeller som kan hantera både arabiska och engelska på ett likvärdigt sätt[2].
Jais-13B: Första versionen
Den första versionen, Jais-13B, släpptes den 30 augusti 2023 och innehöll 13 miljarder parametrar[1]. Modellen tränades på ett blandat korpus av engelska och arabiska texter med en volym av 395 miljarder token[3]. Vid lanseringen kallades den "den högst kvalitativa arabiska LLM:en"[1].
Jais-30B: Uppskalning
Den 8 november 2023, mindre än tre månader senare, presenterade konsortiet den andra, avsevärt förbättrade versionen — Jais-30B med 30 miljarder parametrar[4]. Uppskalningen motiverades av behovet att hantera mer komplexa tillämpningsuppgifter, såsom sammanfattning och översättning. Modellen tränades på ett utökat och rensat dataset med en volym av 1,63 biljoner token[4].
Jais-70B och modellfamiljen
Den 6 augusti 2024 tillkännagav Inception (G42) lanseringen av flaggskeppsmodellen Jais-70B (70 miljarder parametrar) och en hel familj av relaterade modeller[5]. Jais-70B blev den största öppna LLM:en inriktad på arabiska. I dess utveckling tillämpades metoden continuous training: i stället för att träna från grunden togs Llama 2 70B från Meta som utgångspunkt, vilken sedan finjusterades på 330 miljarder token på arabiska. Detta möjliggjorde en effektiv överföring av engelskspråkiga kunskaper från Llama 2 och koncentrerade resurserna på arabiskinlärning[5].
Arkitektur och tekniska egenskaper
Jais tillhör de autoregressiva transformer-modellerna baserade på GPT-3-arkitekturen (decoder-only). Modellens viktigaste kännetecken är dess tvåspråkiga specialisering på arabiska och engelska, till skillnad från många flerspråkiga LLM:er där engelskan dominerar. Detta möjliggör en djup förståelse av arabiska och dess dialekter[3].
Vid skapandet av Jais integrerades avancerade tekniska lösningar[3]:
- ALiBi-positionering: Ett speciellt schema för positionella embeddings som gör att modellen kan hantera längre kontext än den som den tränades på.
- SwiGLU-aktivering: En aktiveringsfunktion som förbättrar träningskvaliteten och expressiviteten hos neurala lager.
- Maximal Update Parametrization (µP): En metodik för hyperparameterjustering som stabiliserar träningen vid ökad modellstorlek.
- Specialiserad tokenizer: Utvecklad med hänsyn till arabiskans och engelskans särdrag, vilket minskar antalet token för arabisk text med 3–4 gånger jämfört med universella tokenizers och ökar bearbetningshastigheten[6].
Förutom grundmodellerna (foundation models) lanserades versionen Jais-chat, ytterligare finjusterad på 9,6 miljoner fråga-svar-par för att anpassas till chattbots- och assistentuppgifter[3].
Träning och dataset
En av projektets huvuduppgifter var att förbereda ett högkvalitativt och omfattande korpus av arabiska texter. Det slutliga träningsdatasetet för Jais-13B uppgick till 395 miljarder token, varav:
- 116 miljarder token (29%) — arabisk text.
- 279 miljarder token (71%) — engelsk text och programkod.
Den arabiska komponenten gjordes avsiktligt betydande (cirka 30%) för att säkerställa hög språkkvalitet[3]. Data inkluderade böcker, nyhetsartiklar, webbsidor och källkod. För att öka volymen av högkvalitativa arabiska texter användes maskinöversättning av engelskspråkiga resurser[3].
Träningen av modellerna genomfördes på superdatorn Condor Galaxy 1 (CG-1) i Abu Dhabi, som gemensamt utvecklades av G42 och Cerebras Systems. Tack vare denna infrastruktur tog träningen av Jais-13B bara cirka 3,5 dagar nettotid[2].
Tillämpning och betydelse
Jais positioneras som ett nyckelsteg i utvecklingen av generativ AI för arabiska och andra språkliga gemenskaper som är underrepresenterade i moderna LLM:er. Den öppna tillgången till modellen syftar till att stimulera införandet av teknik för naturlig språkbehandling i Mellanöstern och Nordafrika.
Sedan lanseringen har projektet väckt intresse hos statliga och kommersiella aktörer i UAE. Tidig tillgång till modellen gavs till UAE:s utrikesministerium, olje- och gasbolaget ADNOC, flygbolaget Etihad Airways och banken First Abu Dhabi Bank[1]. År 2024 meddelade Microsoft att Jais integreras i molnplattformen Microsoft Azure, vilket gör den tillgänglig för globala användare[6].
Skaparna av Jais betonar dess roll i bevarandet av det arabiska kulturella och språkliga arvet. Enligt Inceptions verkställande direktör Andrew Jackson syftar projektet till att "säkerställa att det arabiska språket, med sitt rika arv, finner sin röst i AI-landskapet"[1]. Den förvärvade erfarenheten planeras att användas för att skapa liknande LLM:er för andra språk och kulturer[1].
Litteratur
- Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
- Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
- Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
- Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
- Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
- Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
- Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
- Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.
Noter
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
- ↑ 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
- ↑ 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
- ↑ 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
- ↑ 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]