Jais (language model) (HU)

From Systems analysis Wiki
Jump to navigation Jump to search

Jais (ejtsd: „Dzsész") — egy nyílt forráskódú nagy nyelvi modellek (LLM) családja, amelyet az Egyesült Arab Emírségekben fejlesztettek ki, és kifejezetten az arab nyelvre optimalizálták[1]. A modell nevét a Dzsebel Dzsész-hegyről kapta, amely az EAE legmagasabb csúcsa[2].

A projektet az Inception kutatócég (a G42 technológiai konglomerátum leányvállalata), a Mohamed bin Zayed Mesterséges Intelligencia Egyetem (MBZUAI) és a kaliforniai Cerebras Systems MI-chip-gyártó vállalat együttműködésében hozták létre[2]. A Jais szabad licenc alatt nyilvánosan közzétételre került, amelynek célja az arab nyelvű MI-ökoszisztéma fejlődésének ösztönzése, a kulturális és nyelvi örökség megőrzése, valamint a modern MI-technológiák elérhetőbbé tétele az arabul beszélő világ számára[1].

A fejlesztés története és a kiadások

A Jais projektet 2023-ban indították el, reagálva arra, hogy a meglévő LLM-ek korlátozott mértékben támogatták az erőforrás-szegény nyelveket. A fejlesztők rámutattak a minőségi kétnyelvű modellek hiányára, amelyek egyforma hatékonysággal képesek feldolgozni mind az arab, mind az angol nyelvet[2].

Jais-13B: Az első verzió

Az első verzió, a Jais-13B, 2023. augusztus 30-án jelent meg, és 13 milliárd paramétert tartalmazott[1]. A modellt egy vegyes, angol és arab szövegekből álló, 395 milliárd token terjedelmű korpuszon tanították[3]. Megjelenésekor „a legjobb minőségű arab LLM"-ként nevezték meg[1].

Jais-30B: A méretezés növelése

2023. november 8-án, kevesebb mint három hónappal később, a konzorcium bemutatta a második, jelentősen fejlettebb verziót — a Jais-30B-t 30 milliárd paraméterrel[4]. A méretezés növelését az indokolta, hogy összetettebb alkalmazási feladatokat is meg kellett oldani, például összefoglalást és fordítást. A modellt egy bővített és megtisztított, 1,63 billió token terjedelmű dataseten tanították[4].

Jais-70B és a modellek családja

2024. augusztus 6-án az Inception (G42) bejelentette a Jais-70B (70 milliárd paraméteres) zászlóshajó modell és egy teljes kapcsolódó modellcsalád indítását[5]. A Jais-70B az arab nyelvre összpontosító legnagyobb nyílt LLM lett. Fejlesztése során continuous training módszert alkalmaztak: az alapmodell nem nulláról lett betanítva, hanem a Meta Llama 2 70B modelljét finomhangolták 330 milliárd arab nyelvű tokenen. Ez lehetővé tette az angol nyelvtudás hatékony átvitelét a Llama 2-ből, és az erőforrások koncentrálását az arab nyelvű tanításra[5].

Architektúra és technikai jellemzők

A Jais GPT-3 architektúrán alapuló (decoder-only) autoregresszív transformer modell. A modell fő jellegzetessége az arab és angol nyelvre való kétnyelvű specializáció, szemben sok többnyelvű LLM-mel, amelyekben az angol dominál. Ez lehetővé teszi az arab nyelv és dialektusainak mélyebb megértését[3].

A Jais létrehozásakor élvonalbeli technikai megoldásokat integráltak[3]:

  • ALiBi-pozicionálás: Egy speciális pozicionális embedding séma, amely lehetővé teszi, hogy a modell hosszabb kontextust dolgozzon fel, mint amekkorán tanult.
  • SwiGLU-aktiváció: Egy aktivációs függvény, amely javítja a tanítás minőségét és a neurális rétegek kifejezőképességét.
  • Maximal Update Parametrization (µP): Egy hiperparaméter-hangolási módszer, amely stabilizálja a tanítást a modell méretének növekedésekor.
  • Specializált tokenizáló: Az arab és angol nyelv sajátosságait figyelembe véve fejlesztették ki; az arab szöveg tokenjeinek számát az univerzális tokenizálókhoz képest 3–4-szeresére csökkenti, és növeli a feldolgozás sebességét[6].

Az alapmodelleken (foundation models) túlmenően kiadták a Jais-chat verziót is, amelyet 9,6 millió kérdés-válasz párral finomhangoltak chatbot és asszisztens feladatokhoz[3].

Tanítás és az adatkészlet

A projekt egyik fő feladata egy minőségi és nagy arab szöveges korpusz előkészítése volt. A Jais-13B végleges tanítási adatkészlete 395 milliárd token volt, amelyből:

  • 116 milliárd token (29%) — arab szöveg.
  • 279 milliárd token (71%) — angol szöveg és programkód.

Az arab komponenst szándékosan tették jelentőssé (kb. 30%), hogy magas nyelvtudás-minőséget biztosítsanak[3]. Az adatok könyveket, híroldali cikkeket, weboldalakat és forráskódot tartalmaztak. A minőségi arab szövegek mennyiségének növelésére angol nyelvű anyagok gépi fordítását alkalmazták[3].

A modellek tanítása az Abu-Dzabiban működő Condor Galaxy 1 (CG-1) szuperszámítógépen zajlott, amelyet a G42 és a Cerebras Systems közösen fejlesztett. Ennek az infrastruktúrának köszönhetően a Jais-13B tanítása mindössze körülbelül 3,5 nettó napot vett igénybe[2].

Alkalmazás és jelentőség

A Jais a generatív MI fejlesztésének kulcslépéseként pozicionálják az arab és más, a modern LLM-ekben alulreprezentált nyelvi közösségek számára. A modell nyílt elérése a természetes nyelv feldolgozási technológiák elterjedését hivatott ösztönözni a Közel-Kelet és Észak-Afrika régióiban.

Az indítás óta a projekt felkeltette az EAE állami és kereskedelmi szervezeteinek érdeklődését. A modellhez korai hozzáférést kapott az EAE Külügyminisztériuma, az ADNOC olaj- és gázipari vállalat, az Etihad Airways légitársaság és a First Abu Dhabi Bank[1]. 2024-ben a Microsoft bejelentette a Jais integrálását a Microsoft Azure felhőplatformjára, így globális felhasználók számára is elérhetővé téve azt[6].

A Jais alkotói hangsúlyozzák az arab kulturális és nyelvi örökség megőrzésében betöltött szerepét. Az Inception vezérigazgatója, Andrew Jackson szavai szerint a projekt célja „biztosítani, hogy az arab nyelv gazdag örökségével megtalálja a hangját az MI tájképében"[1]. A szerzett tapasztalatokat más nyelvek és kultúrák számára készülő hasonló LLM-ek létrehozásához kívánják felhasználni[1].

Irodalom

  • Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
  • Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
  • Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
  • Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
  • Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
  • Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
  • Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
  • Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.

Jegyzetek

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
  2. 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
  3. 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
  4. 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
  5. 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
  6. 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]