Jais (language model) (SV)

From Systems analysis Wiki
Jump to navigation Jump to search

Jais (uttalas "Jejs") — är en familj av öppna stora språkmodeller (LLM), utvecklad i Förenade Arabemiraten och särskilt optimerad för arabiska[1]. Modellens namn är hämtat från berget Jebel Jais — den högsta toppen i UAE[2].

Projektet skapades i samarbete mellan forskningsföretaget Inception (ett dotterbolag till teknikkonglomeratet G42), Mohamed bin Zayed University of Artificial Intelligence (MBZUAI) och det kaliforniska AI-chipföretaget Cerebras Systems[2]. Jais publicerades öppet under en fri licens, vilket syftar till att stimulera utvecklingen av ett AI-ekosystem för arabiska, bevara det kulturella och språkliga arvet samt göra modern AI-teknik mer tillgänglig för den arabisktalande världen[1].

Utvecklingshistoria och versioner

Projektet Jais initierades 2023 mot bakgrund av de befintliga LLM:ernas begränsningar för resursssvaga språk. Utvecklarna påpekade bristen på högkvalitativa tvåspråkiga modeller som kan hantera både arabiska och engelska på ett likvärdigt sätt[2].

Jais-13B: Första versionen

Den första versionen, Jais-13B, släpptes den 30 augusti 2023 och innehöll 13 miljarder parametrar[1]. Modellen tränades på ett blandat korpus av engelska och arabiska texter med en volym av 395 miljarder token[3]. Vid lanseringen kallades den "den högst kvalitativa arabiska LLM:en"[1].

Jais-30B: Uppskalning

Den 8 november 2023, mindre än tre månader senare, presenterade konsortiet den andra, avsevärt förbättrade versionen — Jais-30B med 30 miljarder parametrar[4]. Uppskalningen motiverades av behovet att hantera mer komplexa tillämpningsuppgifter, såsom sammanfattning och översättning. Modellen tränades på ett utökat och rensat dataset med en volym av 1,63 biljoner token[4].

Jais-70B och modellfamiljen

Den 6 augusti 2024 tillkännagav Inception (G42) lanseringen av flaggskeppsmodellen Jais-70B (70 miljarder parametrar) och en hel familj av relaterade modeller[5]. Jais-70B blev den största öppna LLM:en inriktad på arabiska. I dess utveckling tillämpades metoden continuous training: i stället för att träna från grunden togs Llama 2 70B från Meta som utgångspunkt, vilken sedan finjusterades på 330 miljarder token på arabiska. Detta möjliggjorde en effektiv överföring av engelskspråkiga kunskaper från Llama 2 och koncentrerade resurserna på arabiskinlärning[5].

Arkitektur och tekniska egenskaper

Jais tillhör de autoregressiva transformer-modellerna baserade på GPT-3-arkitekturen (decoder-only). Modellens viktigaste kännetecken är dess tvåspråkiga specialisering på arabiska och engelska, till skillnad från många flerspråkiga LLM:er där engelskan dominerar. Detta möjliggör en djup förståelse av arabiska och dess dialekter[3].

Vid skapandet av Jais integrerades avancerade tekniska lösningar[3]:

  • ALiBi-positionering: Ett speciellt schema för positionella embeddings som gör att modellen kan hantera längre kontext än den som den tränades på.
  • SwiGLU-aktivering: En aktiveringsfunktion som förbättrar träningskvaliteten och expressiviteten hos neurala lager.
  • Maximal Update Parametrization (µP): En metodik för hyperparameterjustering som stabiliserar träningen vid ökad modellstorlek.
  • Specialiserad tokenizer: Utvecklad med hänsyn till arabiskans och engelskans särdrag, vilket minskar antalet token för arabisk text med 3–4 gånger jämfört med universella tokenizers och ökar bearbetningshastigheten[6].

Förutom grundmodellerna (foundation models) lanserades versionen Jais-chat, ytterligare finjusterad på 9,6 miljoner fråga-svar-par för att anpassas till chattbots- och assistentuppgifter[3].

Träning och dataset

En av projektets huvuduppgifter var att förbereda ett högkvalitativt och omfattande korpus av arabiska texter. Det slutliga träningsdatasetet för Jais-13B uppgick till 395 miljarder token, varav:

  • 116 miljarder token (29%) — arabisk text.
  • 279 miljarder token (71%) — engelsk text och programkod.

Den arabiska komponenten gjordes avsiktligt betydande (cirka 30%) för att säkerställa hög språkkvalitet[3]. Data inkluderade böcker, nyhetsartiklar, webbsidor och källkod. För att öka volymen av högkvalitativa arabiska texter användes maskinöversättning av engelskspråkiga resurser[3].

Träningen av modellerna genomfördes på superdatorn Condor Galaxy 1 (CG-1) i Abu Dhabi, som gemensamt utvecklades av G42 och Cerebras Systems. Tack vare denna infrastruktur tog träningen av Jais-13B bara cirka 3,5 dagar nettotid[2].

Tillämpning och betydelse

Jais positioneras som ett nyckelsteg i utvecklingen av generativ AI för arabiska och andra språkliga gemenskaper som är underrepresenterade i moderna LLM:er. Den öppna tillgången till modellen syftar till att stimulera införandet av teknik för naturlig språkbehandling i Mellanöstern och Nordafrika.

Sedan lanseringen har projektet väckt intresse hos statliga och kommersiella aktörer i UAE. Tidig tillgång till modellen gavs till UAE:s utrikesministerium, olje- och gasbolaget ADNOC, flygbolaget Etihad Airways och banken First Abu Dhabi Bank[1]. År 2024 meddelade Microsoft att Jais integreras i molnplattformen Microsoft Azure, vilket gör den tillgänglig för globala användare[6].

Skaparna av Jais betonar dess roll i bevarandet av det arabiska kulturella och språkliga arvet. Enligt Inceptions verkställande direktör Andrew Jackson syftar projektet till att "säkerställa att det arabiska språket, med sitt rika arv, finner sin röst i AI-landskapet"[1]. Den förvärvade erfarenheten planeras att användas för att skapa liknande LLM:er för andra språk och kulturer[1].

Litteratur

  • Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
  • Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
  • Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
  • Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
  • Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
  • Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
  • Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
  • Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.

Noter

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
  2. 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
  3. 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
  4. 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
  5. 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
  6. 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]