Jais (language model) (RO)

From Systems analysis Wiki
Jump to navigation Jump to search

Jais (pronunțat „Jeis") — este o familie de modele lingvistice mari (LLM) cu sursă deschisă, dezvoltată în Emiratele Arabe Unite și optimizată special pentru limba arabă[1]. Numele modelului a fost dat în onoarea muntelui Jebel Jais — cel mai înalt vârf din EAU[2].

Proiectul a fost creat în colaborare între compania de cercetare Inception (filială a conglomeratului tehnologic G42), Universitatea de Inteligență Artificială Mohamed bin Zayed (MBZUAI) și compania californiană producătoare de cipuri AI Cerebras Systems[2]. Jais a fost publicat în acces deschis sub o licență liberă, cu scopul de a stimula dezvoltarea ecosistemului AI pentru limba arabă, păstrând patrimoniul cultural-lingvistic și făcând tehnologiile moderne AI mai accesibile lumii vorbitoare de arabă[1].

Istoricul dezvoltării și lansărilor

Proiectul Jais a fost inițiat în 2023 pe fondul limitărilor LLM-urilor existente pentru limbile cu resurse reduse. Dezvoltatorii au semnalat lipsa unor modele bilingve de calitate, capabile să proceseze la fel de bine atât araba, cât și engleza[2].

Jais-13B: Prima versiune

Prima versiune, Jais-13B, a fost lansată pe 30 august 2023 și conținea 13 miliarde de parametri[1]. Modelul a fost antrenat pe un corpus mixt de texte în engleză și arabă, cu un volum de 395 de miliarde de token-uri[3]. La momentul lansării sale, a fost numit „cel mai performant LLM în arabă"[1].

Jais-30B: Creșterea scalei

Pe 8 noiembrie 2023, la mai puțin de trei luni distanță, consorțiul a prezentat a doua versiune, semnificativ îmbunătățită — Jais-30B cu 30 de miliarde de parametri[4]. Creșterea scalei a fost determinată de necesitatea de a rezolva sarcini aplicative mai complexe, precum sumarizarea și traducerea. Modelul a fost antrenat pe un dataset extins și curățat de 1,63 trilioane de token-uri[4].

Jais-70B și familia de modele

Pe 6 august 2024, Inception (G42) a anunțat lansarea modelului flagship Jais-70B (70 de miliarde de parametri) și a unei întregi familii de modele conexe[5]. Jais-70B a devenit cel mai mare LLM deschis orientat spre limba arabă. În dezvoltarea sa a fost aplicată metoda continuous training: în loc să fie antrenat de la zero, s-a pornit de la modelul Llama 2 70B de la Meta, care a fost ulterior antrenat suplimentar pe 330 de miliarde de token-uri în arabă. Aceasta a permis transferul eficient al cunoștințelor de limbă engleză din Llama 2 și concentrarea resurselor pe învățarea arabei[5].

Arhitectura și caracteristicile tehnice

Jais aparține categoriei modelelor transformer autoregresive bazate pe arhitectura GPT-3 (decoder-only). Caracteristica cheie a modelului este specializarea sa bilingvă în arabă și engleză, spre deosebire de multe LLM-uri multilingve în care engleza predomină. Aceasta permite atingerea unei înțelegeri profunde a limbii arabe și a dialectelor sale[3].

La crearea Jais au fost integrate soluții tehnice avansate[3]:

  • Poziționare ALiBi: O schemă specială de embedding-uri poziționale care permite modelului să proceseze un context mai lung decât cel pe care a fost antrenat.
  • Activare SwiGLU: O funcție de activare care îmbunătățește calitatea antrenării și expresivitatea straturilor neuronale.
  • Maximal Update Parametrization (µP): O metodă de ajustare a hiperparametrilor care stabilizează antrenarea pe măsură ce dimensiunile modelului cresc.
  • Tokenizator specializat: Dezvoltat ținând cont de particularitățile limbilor arabă și engleză, reducând numărul de token-uri pentru textul arab de 3–4 ori față de tokenizatoarele universale și îmbunătățind viteza de procesare[6].

Pe lângă modelele de bază (foundation models), a fost lansată versiunea Jais-chat, antrenată suplimentar pe 9,6 milioane de perechi întrebare-răspuns pentru adaptarea la sarcinile de chat-bot și asistent[3].

Antrenarea și setul de date

Una dintre principalele sarcini ale proiectului a fost pregătirea unui corpus de texte arabe de calitate și de dimensiuni mari. Setul de antrenare final pentru Jais-13B a fost de 395 mld. de token-uri, din care:

  • 116 mld. de token-uri (29%) — text în arabă.
  • 279 mld. de token-uri (71%) — text în engleză și cod sursă.

Componenta arabă a fost intenționat făcută semnificativă (aproximativ 30%) pentru a asigura o calitate ridicată a competenței lingvistice[3]. Datele includeau cărți, articole de știri, pagini web și cod sursă. Pentru a crește volumul textelor arabe de calitate, s-a utilizat traducerea automată a resurselor în limba engleză[3].

Antrenarea modelelor a fost realizată pe supercomputerul Condor Galaxy 1 (CG-1) din Abu Dhabi, dezvoltat în comun de G42 și Cerebras Systems. Datorită acestei infrastructuri, antrenarea Jais-13B a durat doar aproximativ 3,5 zile de timp efectiv[2].

Aplicare și semnificație

Jais este poziționat ca un pas esențial în dezvoltarea AI generativ pentru limba arabă și pentru alte comunități lingvistice insuficient reprezentate în LLM-urile actuale. Accesul deschis la model urmărește să stimuleze adoptarea tehnologiilor de procesare a limbajului natural în regiunile din Orientul Mijlociu și Africa de Nord.

De la lansare, proiectul a atras interesul structurilor guvernamentale și comerciale din EAU. Acces timpuriu la model au obținut Ministerul Afacerilor Externe al EAU, compania petrolieră și de gaze ADNOC, compania aeriană Etihad Airways și banca First Abu Dhabi Bank[1]. În 2024, Microsoft a anunțat integrarea Jais pe platforma sa cloud Microsoft Azure, făcând-o accesibilă utilizatorilor globali[6].

Creatorii Jais subliniază rolul său în păstrarea patrimoniului cultural-lingvistic arab. Potrivit directorului executiv al Inception, Andrew Jackson, proiectul urmărește „să asigure că limba arabă, cu bogatul său patrimoniu, să-și găsească vocea în peisajul AI"[1]. Experiența acumulată este planificată a fi utilizată pentru crearea unor LLM-uri similare pentru alte limbi și culturi[1].

Bibliografie

  • Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
  • Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
  • Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
  • Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
  • Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
  • Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
  • Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
  • Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.

Note

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
  2. 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
  3. 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
  4. 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
  5. 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
  6. 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]