---
title: "Jais (language model) (PL)"
source: "https://systems-analysis.info/int/Jais_(language_model)_(PL)"
wiki: "systems-analysis.info/int"
article: "Jais_(language_model)_(PL)"
language: "pl"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Polish"
revision_id: 3324
wiki_created_at: 2026-09-06T23:18:59Z
wiki_modified_at: 2026-09-06T23:18:59Z
downloaded_at: 2026-09-07T22:56:21Z
---

# Jais (language model) (PL)

**Jais** (wymawiane „Dżejs") — to rodzina otwartych dużych modeli językowych (LLM), opracowana w Zjednoczonych Emiratach Arabskich i specjalnie zoptymalizowana pod kątem języka arabskiego<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-cerebras-launch-1)</sup>. Nazwa modelu pochodzi od góry Dżabal Dżajs — najwyższego szczytu ZEA<sup>[\[2\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-reuters-launch-2)</sup>.

Projekt powstał we współpracy między firmą badawczą **Inception** (spółką zależną konglomeratu technologicznego G42), ***Uniwersytetem Sztucznej Inteligencji imienia Mohammeda bin Zayeda (MBZUAI)*** oraz kalifornijską firmą produkującą układy do AI — Cerebras Systems<sup>[\[2\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-reuters-launch-2)</sup>. Jais został udostępniony publicznie na wolnej licencji, co ma stymulować rozwój ekosystemu AI dla języka arabskiego, zachowując dziedzictwo kulturowo-językowe i czyniąc nowoczesne technologie AI bardziej dostępnymi dla arabskojęzycznego świata<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-cerebras-launch-1)</sup>.

## Historia rozwoju i wydania

Projekt Jais został zainicjowany w 2023 roku w obliczu ograniczoności istniejących LLM dla języków niskozasobowych. Twórcy zwracali uwagę na brak wysokiej jakości dwujęzycznych modeli, zdolnych w równym stopniu przetwarzać zarówno język arabski, jak i angielski<sup>[\[2\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-reuters-launch-2)</sup>.

### Jais-13B: Pierwsza wersja

Pierwsza wersja, **Jais-13B**, została wydana **30 sierpnia 2023 roku** i zawierała **13 miliardów parametrów**<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-cerebras-launch-1)</sup>. Model został wytrenowany na mieszanym korpusie angielskich i arabskich tekstów, liczącym **395 miliardów tokenów**<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-jais-paper-3)</sup>. W chwili premiery został okrzyknięty „najwyższej jakości arabskim LLM"<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-cerebras-launch-1)</sup>.

### Jais-30B: Zwiększenie skali

**8 listopada 2023 roku**, w niecałe trzy miesiące później, konsorcjum zaprezentowało drugą, znacznie ulepszoną wersję — **Jais-30B** z **30 miliardami parametrów**<sup>[\[4\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-computerweekly-30b-4)</sup>. Zwiększenie skali było podyktowane koniecznością rozwiązywania bardziej złożonych zadań praktycznych, takich jak streszczanie i tłumaczenie. Model został wytrenowany na rozszerzonym i oczyszczonym datasecie liczącym **1,63 biliona tokenów**<sup>[\[4\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-computerweekly-30b-4)</sup>.

### Jais-70B i rodzina modeli

**6 sierpnia 2024 roku** firma Inception (G42) ogłosiła premierę flagowego modelu **Jais-70B** (70 miliardów parametrów) oraz całej rodziny powiązanych modeli<sup>[\[5\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-mediaoffice-70b-5)</sup>. Jais-70B stał się największym otwartym LLM zorientowanym na język arabski. W jego opracowaniu zastosowano metodę *continuous training*: zamiast trenować od podstaw, za punkt wyjścia przyjęto model **Llama 2** 70B firmy Meta, który następnie douczono na **330 miliardach tokenów** w języku arabskim. Pozwoliło to efektywnie przenieść wiedzę o języku angielskim z Llama 2 i skoncentrować zasoby na uczeniu języka arabskiego<sup>[\[5\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-mediaoffice-70b-5)</sup>.

## Architektura i cechy techniczne

Jais należy do autoregresywnych modeli transformerowych opartych na architekturze GPT-3 (*decoder-only*). Kluczową cechą modelu jest jego dwujęzyczna specjalizacja w zakresie języka arabskiego i angielskiego, w odróżnieniu od wielu wielojęzycznych LLM, w których dominuje język angielski. Pozwala to osiągnąć głębokie zrozumienie języka arabskiego i jego dialektów<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-jais-paper-3)</sup>.

Przy tworzeniu Jais zintegrowano zaawansowane rozwiązania techniczne<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-jais-paper-3)</sup>:

- **Pozycjonowanie ALiBi**: Specjalny schemat pozycyjnych embeddingów, który pozwala modelowi przetwarzać dłuższy kontekst niż ten, na którym był trenowany.
- **Aktywacja SwiGLU**: Funkcja aktywacji zwiększająca jakość trenowania i ekspresywność warstw neuronowych.
- **Maximal Update Parametrization (µP)**: Metoda dostrajania hiperparametrów, która stabilizuje trening przy zwiększaniu rozmiarów modelu.
- **Specjalizowany tokenizer**: Opracowany z uwzględnieniem specyfiki języka arabskiego i angielskiego, co skraca liczbę tokenów dla arabskiego tekstu 3–4 razy w porównaniu z tokenizatorami uniwersalnymi i zwiększa szybkość działania<sup>[\[6\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-microsoft-azure-blog-6)</sup>.

Oprócz modeli bazowych (*foundation models*) wydano wersję **Jais-chat**, dodatkowo douczaną na 9,6 mln par pytań i odpowiedzi w celu dostosowania do zadań chatbota i asystenta<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-jais-paper-3)</sup>.

## Trening i zbiór danych

Jednym z głównych zadań projektu było przygotowanie wysokiej jakości i obszernego korpusu arabskich tekstów. Końcowy zbiór treningowy dla Jais-13B wyniósł **395 mld tokenów**, z czego:

- **116 mld tokenów (29%)** — tekst arabski.
- **279 mld tokenów (71%)** — tekst angielski i kod źródłowy.

Komponent arabski został celowo uczyniony znaczącym (około 30%), aby zapewnić wysoką jakość znajomości języka<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-jais-paper-3)</sup>. Dane obejmowały książki, artykuły prasowe, strony internetowe oraz kod źródłowy. W celu zwiększenia objętości wysokiej jakości arabskich tekstów zastosowano maszynowe tłumaczenie anglojęzycznych zasobów<sup>[\[3\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-jais-paper-3)</sup>.

Trening modeli przeprowadzono na superkomputerze **Condor Galaxy 1 (CG-1)** w Abu Dhabi, który został wspólnie opracowany przez G42 i Cerebras Systems. Dzięki tej infrastrukturze trening Jais-13B zajął zaledwie około 3,5 dnia czystego czasu<sup>[\[2\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-reuters-launch-2)</sup>.

## Zastosowanie i znaczenie

Jais jest postrzegany jako kluczowy krok w rozwoju generatywnej AI dla języka arabskiego i innych społeczności językowych niedostatecznie reprezentowanych w nowoczesnych LLM. Otwarty dostęp do modelu ma stymulować wdrażanie technologii przetwarzania języka naturalnego w regionach Bliskiego Wschodu i Afryki Północnej.

Od czasu uruchomienia projektu zainteresowanie nim wyraziły państwowe i komercyjne podmioty ZEA. Wczesny dostęp do modelu otrzymały Ministerstwo Spraw Zagranicznych ZEA, firma naftowo-gazowa ADNOC, linie lotnicze Etihad Airways oraz bank First Abu Dhabi Bank<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-cerebras-launch-1)</sup>. W 2024 roku Microsoft ogłosił integrację Jais z platformą chmurową Microsoft Azure, udostępniając go globalnym użytkownikom<sup>[\[6\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-microsoft-azure-blog-6)</sup>.

Twórcy Jais podkreślają jego rolę w zachowaniu arabskiego dziedzictwa kulturowo-językowego. Według słów dyrektora generalnego Inception, Andrew Jacksona, projekt ma „zapewnić, aby język arabski ze swoim bogatym dziedzictwem znalazł swój głos w krajobrazie AI"<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-cerebras-launch-1)</sup>. Zdobyte doświadczenie planuje się wykorzystać do tworzenia analogicznych LLM dla innych języków i kultur<sup>[\[1\]](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_note-cerebras-launch-1)</sup>.

## Literatura

- Shazeer, N.; et al. (2020). *GLU Variants Improve Transformer*. arXiv:2002.05202.
- Press, O.; et al. (2021). *Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation*. arXiv:2108.12409.
- Yang, G.; et al. (2022). *Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer*. arXiv:2203.03466.
- Ali, A. R.; et al. (2022). *A Large and Diverse Arabic Corpus for Language Modeling*. arXiv:2201.09227.
- Sengupta, N.; et al. (2023). *Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models*. arXiv:2308.16149.
- Inception AI (2024). *JAIS 30B Whitepaper*. Online whitepaper.
- Koto, F.; et al. (2024). *ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic*. arXiv:2402.12840.
- Qian, Z.; et al. (2024). *CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks*. arXiv:2409.12623.
- Blake, C.; et al. (2024). *u‑μP: The Unit‑Scaled Maximal Update Parametrization*. arXiv:2407.17465.
- Inception AI; MBZUAI; Cerebras Systems (2024). *Jais Family Model Card*. Hugging Face.

## Przypisy

1.  <span id="cite_note-cerebras-launch-1">↑ <sup>[1.0](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-cerebras-launch_1-0)</sup> <sup>[1.1](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-cerebras-launch_1-1)</sup> <sup>[1.2](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-cerebras-launch_1-2)</sup> <sup>[1.3](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-cerebras-launch_1-3)</sup> <sup>[1.4](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-cerebras-launch_1-4)</sup> <sup>[1.5](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-cerebras-launch_1-5)</sup> <sup>[1.6](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-cerebras-launch_1-6)</sup> «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». *Cerebras Systems*. <a href="https://www.cerebras.ai/press-release/meet-jais-the-worlds-most-advanced-arabic-large-language-model-open-sourced-by-g42s-inception" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-reuters-launch-2">↑ <sup>[2.0](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-reuters-launch_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-reuters-launch_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-reuters-launch_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-reuters-launch_2-3)</sup> «UAE's G42 launches open source Arabic language AI model». *Reuters*. <a href="https://www.reuters.com/technology/uaes-g42-launches-open-source-arabic-language-ai-model-2023-08-30/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-jais-paper-3">↑ <sup>[3.0](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-jais-paper_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-jais-paper_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-jais-paper_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-jais-paper_3-3)</sup> <sup>[3.4](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-jais-paper_3-4)</sup> <sup>[3.5](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-jais-paper_3-5)</sup> «\[2308.16149\] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». *arXiv*. <a href="https://ar5iv.labs.arxiv.org/html/2308.16149" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-computerweekly-30b-4">↑ <sup>[4.0](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-computerweekly-30b_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-computerweekly-30b_4-1)</sup> «Upgraded Arabic large language model is twice as big». *Computer Weekly*. <a href="https://www.computerweekly.com/news/366567153/Arabic-LLM-Jais-gets-a-new-version-thats-twice-as-large" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-mediaoffice-70b-5">↑ <sup>[5.0](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-mediaoffice-70b_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-mediaoffice-70b_5-1)</sup> «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». *Abu Dhabi Media Office*. <a href="https://www.mediaoffice.abudhabi/en/technology/g42-launches-jais-70b-and-20-other-ai-models-to-advance-arabic-natural-language-processing/" class="external autonumber" rel="nofollow">[5]</a></span>
6.  <span id="cite_note-microsoft-azure-blog-6">↑ <sup>[6.0](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-microsoft-azure-blog_6-0)</sup> <sup>[6.1](https://systems-analysis.info/int/Jais_(language_model)_(PL)#cite_ref-microsoft-azure-blog_6-1)</sup> «Introducing JAIS: Arabic-centric Large Language Model on Azure». *Microsoft Tech Community*. <a href="https://techcommunity.microsoft.com/blog/aiplatformblog/introducing-jais-arabic-centric-large-language-model-on-azure/4137329" class="external autonumber" rel="nofollow">[6]</a></span>
