Jais (language model) (NL)

From Systems analysis Wiki
Jump to navigation Jump to search

Jais (uitgesproken als "Djeis") is een familie van open grote taalmodellen (LLM), ontwikkeld in de Verenigde Arabische Emiraten en speciaal geoptimaliseerd voor de Arabische taal[1]. De naam van het model is ontleend aan de berg Jebel Jais — de hoogste top van de VAE[2].

Het project is tot stand gekomen door samenwerking tussen het onderzoeksbedrijf Inception (een dochteronderneming van het technologieconcern G42), de Mohamed bin Zayed University of Artificial Intelligence (MBZUAI) en het Californische AI-chipbedrijf Cerebras Systems[2]. Jais werd openbaar gepubliceerd onder een vrije licentie, met als doel de ontwikkeling van het AI-ecosysteem voor de Arabische taal te stimuleren, het cultureel-linguïstisch erfgoed te bewaren en moderne AI-technologieën toegankelijker te maken voor de Arabischtalige wereld[1].

Geschiedenis van ontwikkeling en releases

Het Jais-project werd in 2023 geïnitieerd vanwege de beperkte beschikbaarheid van bestaande LLM's voor talen met weinig middelen. De ontwikkelaars constateerden een gebrek aan kwalitatieve tweetalige modellen die zowel Arabisch als Engels even goed konden verwerken[2].

Jais-13B: Eerste versie

De eerste versie, Jais-13B, werd uitgebracht op 30 augustus 2023 en bevatte 13 miljard parameters[1]. Het model werd getraind op een gemengd corpus van Engelse en Arabische teksten met een omvang van 395 miljard tokens[3]. Op het moment van uitbrengen werd het omschreven als het "hoogwaardige Arabische LLM"[1].

Jais-30B: Opschaling

Op 8 november 2023, minder dan drie maanden later, presenteerde het consortium een tweede, aanzienlijk verbeterde versie — Jais-30B met 30 miljard parameters[4]. De opschaling was ingegeven door de noodzaak om complexere praktische taken aan te pakken, zoals samenvatten en vertalen. Het model werd getraind op een uitgebreide en opgeschoonde dataset van 1,63 biljoen tokens[4].

Jais-70B en de modellfamilie

Op 6 augustus 2024 kondigde Inception (G42) de lancering aan van het vlaggenschipmodel Jais-70B (70 miljard parameters) en een gehele familie van verwante modellen[5]. Jais-70B werd het grootste open LLM gericht op de Arabische taal. Bij de ontwikkeling ervan werd de methode van continuous training toegepast: in plaats van training vanaf nul werd het model Llama 2 70B van Meta als basis genomen en vervolgens fine-tuned op 330 miljard tokens in het Arabisch. Dit maakte het mogelijk om kennis van het Engels uit Llama 2 efficiënt over te dragen en de middelen te concentreren op het aanleren van het Arabisch[5].

Architectuur en technische kenmerken

Jais behoort tot de autoregressieve transformer-modellen op basis van de GPT-3-architectuur (decoder-only). Het belangrijkste kenmerk van het model is de tweetalige specialisatie in Arabisch en Engels, in tegenstelling tot veel meertalige LLM's waarbij het Engels domineert. Dit maakt een groot begripsdiepte van de Arabische taal en haar dialecten mogelijk[3].

Bij het ontwikkelen van Jais werden geavanceerde technische oplossingen geïntegreerd[3]:

  • ALiBi-positionering: Een speciaal schema voor positionele embeddings waarmee het model langere contexten kan verwerken dan waarop het getraind werd.
  • SwiGLU-activatie: Een activatiefunctie die de kwaliteit van de training en de expressiviteit van neurale lagen verbetert.
  • Maximal Update Parametrization (µP): Een methode voor het instellen van hyperparameters die de training stabiliseert bij het vergroten van de modelomvang.
  • Gespecialiseerde tokenizer: Ontwikkeld met inachtneming van de kenmerken van de Arabische en Engelse taal, waardoor het aantal tokens voor Arabische tekst 3–4 keer wordt verminderd ten opzichte van universele tokenizers en de verwerkingssnelheid wordt verhoogd[6].

Naast de basismodellen (foundation models) werd de versie Jais-chat uitgebracht, die aanvullend fine-tuned werd op 9,6 miljoen vraag-antwoordparen voor aanpassing aan chatbot- en assistenttaken[3].

Training en dataset

Een van de voornaamste doelstellingen van het project was het samenstellen van een kwalitatief hoogstaand en omvangrijk corpus van Arabische teksten. De uiteindelijke trainingsset voor Jais-13B omvatte 395 miljard tokens, waarvan:

  • 116 miljard tokens (29%) — Arabische tekst.
  • 279 miljard tokens (71%) — Engelse tekst en broncode.

Het Arabische aandeel werd bewust significant gemaakt (circa 30%) om een hoge taalbeheersing te garanderen[3]. De gegevens omvatten boeken, nieuwsartikelen, webpagina's en broncode. Om het volume aan kwalitatieve Arabische teksten te vergroten, werd machinale vertaling van Engelstalige bronnen toegepast[3].

De training van de modellen werd uitgevoerd op de supercomputer Condor Galaxy 1 (CG-1) in Abu Dhabi, die gezamenlijk werd ontwikkeld door G42 en Cerebras Systems. Dankzij deze infrastructuur nam de training van Jais-13B slechts ongeveer 3,5 dagen netto tijd in beslag[2].

Toepassing en betekenis

Jais wordt gepositioneerd als een sleutelstap in de ontwikkeling van generatieve AI voor de Arabische taal en andere taalgemeenschappen die onvoldoende vertegenwoordigd zijn in hedendaagse LLM's. De open toegang tot het model is bedoeld om de invoering van technologieën voor natuurlijke taalverwerking in de regio's van het Midden-Oosten en Noord-Afrika te stimuleren.

Sinds de lancering heeft het project de interesse gewekt van overheids- en commerciële instellingen in de VAE. Het Ministerie van Buitenlandse Zaken van de VAE, het olie- en gasbedrijf ADNOC, luchtvaartmaatschappij Etihad Airways en First Abu Dhabi Bank kregen vroegtijdig toegang tot het model[1]. In 2024 kondigde Microsoft de integratie van Jais op het cloudplatform Microsoft Azure aan, waardoor het beschikbaar werd voor gebruikers wereldwijd[6].

De makers van Jais benadrukken de rol ervan bij het bewaren van het Arabisch cultureel-linguïstisch erfgoed. Volgens Andrew Jackson, uitvoerend directeur van Inception, is het project erop gericht "te garanderen dat de Arabische taal met haar rijke erfgoed haar stem vindt in het AI-landschap"[1]. De opgedane ervaring is gepland om te benutten voor de ontwikkeling van vergelijkbare LLM's voor andere talen en culturen[1].

Literatuur

  • Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
  • Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
  • Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
  • Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
  • Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
  • Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
  • Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
  • Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.

Noten

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
  2. 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
  3. 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
  4. 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
  5. 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
  6. 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]