Jais (language model) (HU)
Jais (ejtsd: „Dzsész") — egy nyílt forráskódú nagy nyelvi modellek (LLM) családja, amelyet az Egyesült Arab Emírségekben fejlesztettek ki, és kifejezetten az arab nyelvre optimalizálták[1]. A modell nevét a Dzsebel Dzsész-hegyről kapta, amely az EAE legmagasabb csúcsa[2].
A projektet az Inception kutatócég (a G42 technológiai konglomerátum leányvállalata), a Mohamed bin Zayed Mesterséges Intelligencia Egyetem (MBZUAI) és a kaliforniai Cerebras Systems MI-chip-gyártó vállalat együttműködésében hozták létre[2]. A Jais szabad licenc alatt nyilvánosan közzétételre került, amelynek célja az arab nyelvű MI-ökoszisztéma fejlődésének ösztönzése, a kulturális és nyelvi örökség megőrzése, valamint a modern MI-technológiák elérhetőbbé tétele az arabul beszélő világ számára[1].
A fejlesztés története és a kiadások
A Jais projektet 2023-ban indították el, reagálva arra, hogy a meglévő LLM-ek korlátozott mértékben támogatták az erőforrás-szegény nyelveket. A fejlesztők rámutattak a minőségi kétnyelvű modellek hiányára, amelyek egyforma hatékonysággal képesek feldolgozni mind az arab, mind az angol nyelvet[2].
Jais-13B: Az első verzió
Az első verzió, a Jais-13B, 2023. augusztus 30-án jelent meg, és 13 milliárd paramétert tartalmazott[1]. A modellt egy vegyes, angol és arab szövegekből álló, 395 milliárd token terjedelmű korpuszon tanították[3]. Megjelenésekor „a legjobb minőségű arab LLM"-ként nevezték meg[1].
Jais-30B: A méretezés növelése
2023. november 8-án, kevesebb mint három hónappal később, a konzorcium bemutatta a második, jelentősen fejlettebb verziót — a Jais-30B-t 30 milliárd paraméterrel[4]. A méretezés növelését az indokolta, hogy összetettebb alkalmazási feladatokat is meg kellett oldani, például összefoglalást és fordítást. A modellt egy bővített és megtisztított, 1,63 billió token terjedelmű dataseten tanították[4].
Jais-70B és a modellek családja
2024. augusztus 6-án az Inception (G42) bejelentette a Jais-70B (70 milliárd paraméteres) zászlóshajó modell és egy teljes kapcsolódó modellcsalád indítását[5]. A Jais-70B az arab nyelvre összpontosító legnagyobb nyílt LLM lett. Fejlesztése során continuous training módszert alkalmaztak: az alapmodell nem nulláról lett betanítva, hanem a Meta Llama 2 70B modelljét finomhangolták 330 milliárd arab nyelvű tokenen. Ez lehetővé tette az angol nyelvtudás hatékony átvitelét a Llama 2-ből, és az erőforrások koncentrálását az arab nyelvű tanításra[5].
Architektúra és technikai jellemzők
A Jais GPT-3 architektúrán alapuló (decoder-only) autoregresszív transformer modell. A modell fő jellegzetessége az arab és angol nyelvre való kétnyelvű specializáció, szemben sok többnyelvű LLM-mel, amelyekben az angol dominál. Ez lehetővé teszi az arab nyelv és dialektusainak mélyebb megértését[3].
A Jais létrehozásakor élvonalbeli technikai megoldásokat integráltak[3]:
- ALiBi-pozicionálás: Egy speciális pozicionális embedding séma, amely lehetővé teszi, hogy a modell hosszabb kontextust dolgozzon fel, mint amekkorán tanult.
- SwiGLU-aktiváció: Egy aktivációs függvény, amely javítja a tanítás minőségét és a neurális rétegek kifejezőképességét.
- Maximal Update Parametrization (µP): Egy hiperparaméter-hangolási módszer, amely stabilizálja a tanítást a modell méretének növekedésekor.
- Specializált tokenizáló: Az arab és angol nyelv sajátosságait figyelembe véve fejlesztették ki; az arab szöveg tokenjeinek számát az univerzális tokenizálókhoz képest 3–4-szeresére csökkenti, és növeli a feldolgozás sebességét[6].
Az alapmodelleken (foundation models) túlmenően kiadták a Jais-chat verziót is, amelyet 9,6 millió kérdés-válasz párral finomhangoltak chatbot és asszisztens feladatokhoz[3].
Tanítás és az adatkészlet
A projekt egyik fő feladata egy minőségi és nagy arab szöveges korpusz előkészítése volt. A Jais-13B végleges tanítási adatkészlete 395 milliárd token volt, amelyből:
- 116 milliárd token (29%) — arab szöveg.
- 279 milliárd token (71%) — angol szöveg és programkód.
Az arab komponenst szándékosan tették jelentőssé (kb. 30%), hogy magas nyelvtudás-minőséget biztosítsanak[3]. Az adatok könyveket, híroldali cikkeket, weboldalakat és forráskódot tartalmaztak. A minőségi arab szövegek mennyiségének növelésére angol nyelvű anyagok gépi fordítását alkalmazták[3].
A modellek tanítása az Abu-Dzabiban működő Condor Galaxy 1 (CG-1) szuperszámítógépen zajlott, amelyet a G42 és a Cerebras Systems közösen fejlesztett. Ennek az infrastruktúrának köszönhetően a Jais-13B tanítása mindössze körülbelül 3,5 nettó napot vett igénybe[2].
Alkalmazás és jelentőség
A Jais a generatív MI fejlesztésének kulcslépéseként pozicionálják az arab és más, a modern LLM-ekben alulreprezentált nyelvi közösségek számára. A modell nyílt elérése a természetes nyelv feldolgozási technológiák elterjedését hivatott ösztönözni a Közel-Kelet és Észak-Afrika régióiban.
Az indítás óta a projekt felkeltette az EAE állami és kereskedelmi szervezeteinek érdeklődését. A modellhez korai hozzáférést kapott az EAE Külügyminisztériuma, az ADNOC olaj- és gázipari vállalat, az Etihad Airways légitársaság és a First Abu Dhabi Bank[1]. 2024-ben a Microsoft bejelentette a Jais integrálását a Microsoft Azure felhőplatformjára, így globális felhasználók számára is elérhetővé téve azt[6].
A Jais alkotói hangsúlyozzák az arab kulturális és nyelvi örökség megőrzésében betöltött szerepét. Az Inception vezérigazgatója, Andrew Jackson szavai szerint a projekt célja „biztosítani, hogy az arab nyelv gazdag örökségével megtalálja a hangját az MI tájképében"[1]. A szerzett tapasztalatokat más nyelvek és kultúrák számára készülő hasonló LLM-ek létrehozásához kívánják felhasználni[1].
Irodalom
- Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
- Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
- Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
- Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
- Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
- Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
- Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
- Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.
Jegyzetek
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
- ↑ 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
- ↑ 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
- ↑ 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
- ↑ 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]