---
title: "Jais (language model) (HU)"
source: "https://systems-analysis.info/int/Jais_(language_model)_(HU)"
wiki: "systems-analysis.info/int"
article: "Jais_(language_model)_(HU)"
language: "hu"
categories:
  - "Category:Hungarian"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 3319
wiki_created_at: 2026-09-06T23:18:55Z
wiki_modified_at: 2026-09-06T23:18:55Z
downloaded_at: 2026-09-07T22:56:19Z
---

# Jais (language model) (HU)

**Jais** (ejtsd: „Dzsész") — egy nyílt forráskódú nagy nyelvi modellek (LLM) családja, amelyet az Egyesült Arab Emírségekben fejlesztettek ki, és kifejezetten az arab nyelvre optimalizálták<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-cerebras-launch-1)</sup>. A modell nevét a Dzsebel Dzsész-hegyről kapta, amely az EAE legmagasabb csúcsa<sup>[\[2\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-reuters-launch-2)</sup>.

A projektet az **Inception** kutatócég (a G42 technológiai konglomerátum leányvállalata), a ***Mohamed bin Zayed Mesterséges Intelligencia Egyetem (MBZUAI)*** és a kaliforniai Cerebras Systems MI-chip-gyártó vállalat együttműködésében hozták létre<sup>[\[2\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-reuters-launch-2)</sup>. A Jais szabad licenc alatt nyilvánosan közzétételre került, amelynek célja az arab nyelvű MI-ökoszisztéma fejlődésének ösztönzése, a kulturális és nyelvi örökség megőrzése, valamint a modern MI-technológiák elérhetőbbé tétele az arabul beszélő világ számára<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-cerebras-launch-1)</sup>.

## A fejlesztés története és a kiadások

A Jais projektet 2023-ban indították el, reagálva arra, hogy a meglévő LLM-ek korlátozott mértékben támogatták az erőforrás-szegény nyelveket. A fejlesztők rámutattak a minőségi kétnyelvű modellek hiányára, amelyek egyforma hatékonysággal képesek feldolgozni mind az arab, mind az angol nyelvet<sup>[\[2\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-reuters-launch-2)</sup>.

### Jais-13B: Az első verzió

Az első verzió, a **Jais-13B**, **2023. augusztus 30-án** jelent meg, és **13 milliárd paramétert** tartalmazott<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-cerebras-launch-1)</sup>. A modellt egy vegyes, angol és arab szövegekből álló, **395 milliárd token** terjedelmű korpuszon tanították<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-jais-paper-3)</sup>. Megjelenésekor „a legjobb minőségű arab LLM"-ként nevezték meg<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-cerebras-launch-1)</sup>.

### Jais-30B: A méretezés növelése

**2023. november 8-án**, kevesebb mint három hónappal később, a konzorcium bemutatta a második, jelentősen fejlettebb verziót — a **Jais-30B**-t **30 milliárd paraméterrel**<sup>[\[4\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-computerweekly-30b-4)</sup>. A méretezés növelését az indokolta, hogy összetettebb alkalmazási feladatokat is meg kellett oldani, például összefoglalást és fordítást. A modellt egy bővített és megtisztított, **1,63 billió token** terjedelmű dataseten tanították<sup>[\[4\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-computerweekly-30b-4)</sup>.

### Jais-70B és a modellek családja

**2024. augusztus 6-án** az Inception (G42) bejelentette a **Jais-70B** (70 milliárd paraméteres) zászlóshajó modell és egy teljes kapcsolódó modellcsalád indítását<sup>[\[5\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-mediaoffice-70b-5)</sup>. A Jais-70B az arab nyelvre összpontosító legnagyobb nyílt LLM lett. Fejlesztése során *continuous training* módszert alkalmaztak: az alapmodell nem nulláról lett betanítva, hanem a Meta **Llama 2** 70B modelljét finomhangolták **330 milliárd arab nyelvű tokenen**. Ez lehetővé tette az angol nyelvtudás hatékony átvitelét a Llama 2-ből, és az erőforrások koncentrálását az arab nyelvű tanításra<sup>[\[5\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-mediaoffice-70b-5)</sup>.

## Architektúra és technikai jellemzők

A Jais GPT-3 architektúrán alapuló (*decoder-only*) autoregresszív transformer modell. A modell fő jellegzetessége az arab és angol nyelvre való kétnyelvű specializáció, szemben sok többnyelvű LLM-mel, amelyekben az angol dominál. Ez lehetővé teszi az arab nyelv és dialektusainak mélyebb megértését<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-jais-paper-3)</sup>.

A Jais létrehozásakor élvonalbeli technikai megoldásokat integráltak<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-jais-paper-3)</sup>:

- **ALiBi-pozicionálás**: Egy speciális pozicionális embedding séma, amely lehetővé teszi, hogy a modell hosszabb kontextust dolgozzon fel, mint amekkorán tanult.
- **SwiGLU-aktiváció**: Egy aktivációs függvény, amely javítja a tanítás minőségét és a neurális rétegek kifejezőképességét.
- **Maximal Update Parametrization (µP)**: Egy hiperparaméter-hangolási módszer, amely stabilizálja a tanítást a modell méretének növekedésekor.
- **Specializált tokenizáló**: Az arab és angol nyelv sajátosságait figyelembe véve fejlesztették ki; az arab szöveg tokenjeinek számát az univerzális tokenizálókhoz képest 3–4-szeresére csökkenti, és növeli a feldolgozás sebességét<sup>[\[6\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-microsoft-azure-blog-6)</sup>.

Az alapmodelleken (*foundation models*) túlmenően kiadták a **Jais-chat** verziót is, amelyet 9,6 millió kérdés-válasz párral finomhangoltak chatbot és asszisztens feladatokhoz<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-jais-paper-3)</sup>.

## Tanítás és az adatkészlet

A projekt egyik fő feladata egy minőségi és nagy arab szöveges korpusz előkészítése volt. A Jais-13B végleges tanítási adatkészlete **395 milliárd token** volt, amelyből:

- **116 milliárd token (29%)** — arab szöveg.
- **279 milliárd token (71%)** — angol szöveg és programkód.

Az arab komponenst szándékosan tették jelentőssé (kb. 30%), hogy magas nyelvtudás-minőséget biztosítsanak<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-jais-paper-3)</sup>. Az adatok könyveket, híroldali cikkeket, weboldalakat és forráskódot tartalmaztak. A minőségi arab szövegek mennyiségének növelésére angol nyelvű anyagok gépi fordítását alkalmazták<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-jais-paper-3)</sup>.

A modellek tanítása az Abu-Dzabiban működő **Condor Galaxy 1 (CG-1)** szuperszámítógépen zajlott, amelyet a G42 és a Cerebras Systems közösen fejlesztett. Ennek az infrastruktúrának köszönhetően a Jais-13B tanítása mindössze körülbelül 3,5 nettó napot vett igénybe<sup>[\[2\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-reuters-launch-2)</sup>.

## Alkalmazás és jelentőség

A Jais a generatív MI fejlesztésének kulcslépéseként pozicionálják az arab és más, a modern LLM-ekben alulreprezentált nyelvi közösségek számára. A modell nyílt elérése a természetes nyelv feldolgozási technológiák elterjedését hivatott ösztönözni a Közel-Kelet és Észak-Afrika régióiban.

Az indítás óta a projekt felkeltette az EAE állami és kereskedelmi szervezeteinek érdeklődését. A modellhez korai hozzáférést kapott az EAE Külügyminisztériuma, az ADNOC olaj- és gázipari vállalat, az Etihad Airways légitársaság és a First Abu Dhabi Bank<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-cerebras-launch-1)</sup>. 2024-ben a Microsoft bejelentette a Jais integrálását a Microsoft Azure felhőplatformjára, így globális felhasználók számára is elérhetővé téve azt<sup>[\[6\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-microsoft-azure-blog-6)</sup>.

A Jais alkotói hangsúlyozzák az arab kulturális és nyelvi örökség megőrzésében betöltött szerepét. Az Inception vezérigazgatója, Andrew Jackson szavai szerint a projekt célja „biztosítani, hogy az arab nyelv gazdag örökségével megtalálja a hangját az MI tájképében"<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-cerebras-launch-1)</sup>. A szerzett tapasztalatokat más nyelvek és kultúrák számára készülő hasonló LLM-ek létrehozásához kívánják felhasználni<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_note-cerebras-launch-1)</sup>.

## Irodalom

- Shazeer, N.; et al. (2020). *GLU Variants Improve Transformer*. arXiv:2002.05202.
- Press, O.; et al. (2021). *Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation*. arXiv:2108.12409.
- Yang, G.; et al. (2022). *Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer*. arXiv:2203.03466.
- Ali, A. R.; et al. (2022). *A Large and Diverse Arabic Corpus for Language Modeling*. arXiv:2201.09227.
- Sengupta, N.; et al. (2023). *Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models*. arXiv:2308.16149.
- Inception AI (2024). *JAIS 30B Whitepaper*. Online whitepaper.
- Koto, F.; et al. (2024). *ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic*. arXiv:2402.12840.
- Qian, Z.; et al. (2024). *CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks*. arXiv:2409.12623.
- Blake, C.; et al. (2024). *u‑μP: The Unit‑Scaled Maximal Update Parametrization*. arXiv:2407.17465.
- Inception AI; MBZUAI; Cerebras Systems (2024). *Jais Family Model Card*. Hugging Face.

## Jegyzetek

1.  <span id="cite_note-cerebras-launch-1">↑ <sup>[1.0](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-cerebras-launch_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-cerebras-launch_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-cerebras-launch_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-cerebras-launch_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-cerebras-launch_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-cerebras-launch_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-cerebras-launch_1-6)</sup> «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». *Cerebras Systems*. <a href="https://www.cerebras.ai/press-release/meet-jais-the-worlds-most-advanced-arabic-large-language-model-open-sourced-by-g42s-inception" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-reuters-launch-2">↑ <sup>[2.0](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-reuters-launch_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-reuters-launch_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-reuters-launch_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-reuters-launch_2-3)</sup> «UAE's G42 launches open source Arabic language AI model». *Reuters*. <a href="https://www.reuters.com/technology/uaes-g42-launches-open-source-arabic-language-ai-model-2023-08-30/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-jais-paper-3">↑ <sup>[3.0](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-jais-paper_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-jais-paper_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-jais-paper_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-jais-paper_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-jais-paper_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-jais-paper_3-5)</sup> «\[2308.16149\] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». *arXiv*. <a href="https://ar5iv.labs.arxiv.org/html/2308.16149" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-computerweekly-30b-4">↑ <sup>[4.0](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-computerweekly-30b_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-computerweekly-30b_4-1)</sup> «Upgraded Arabic large language model is twice as big». *Computer Weekly*. <a href="https://www.computerweekly.com/news/366567153/Arabic-LLM-Jais-gets-a-new-version-thats-twice-as-large" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-mediaoffice-70b-5">↑ <sup>[5.0](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-mediaoffice-70b_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-mediaoffice-70b_5-1)</sup> «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». *Abu Dhabi Media Office*. <a href="https://www.mediaoffice.abudhabi/en/technology/g42-launches-jais-70b-and-20-other-ai-models-to-advance-arabic-natural-language-processing/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-microsoft-azure-blog-6">↑ <sup>[6.0](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-microsoft-azure-blog_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Jais_(language_model)_(HU)#cite_ref-microsoft-azure-blog_6-1)</sup> «Introducing JAIS: Arabic-centric Large Language Model on Azure». *Microsoft Tech Community*. <a href="https://techcommunity.microsoft.com/blog/aiplatformblog/introducing-jais-arabic-centric-large-language-model-on-azure/4137329" class="external autonumber" rel="nofollow">[6]</a></span>
