Jais (language model) (PL)
Jais (wymawiane „Dżejs") — to rodzina otwartych dużych modeli językowych (LLM), opracowana w Zjednoczonych Emiratach Arabskich i specjalnie zoptymalizowana pod kątem języka arabskiego[1]. Nazwa modelu pochodzi od góry Dżabal Dżajs — najwyższego szczytu ZEA[2].
Projekt powstał we współpracy między firmą badawczą Inception (spółką zależną konglomeratu technologicznego G42), Uniwersytetem Sztucznej Inteligencji imienia Mohammeda bin Zayeda (MBZUAI) oraz kalifornijską firmą produkującą układy do AI — Cerebras Systems[2]. Jais został udostępniony publicznie na wolnej licencji, co ma stymulować rozwój ekosystemu AI dla języka arabskiego, zachowując dziedzictwo kulturowo-językowe i czyniąc nowoczesne technologie AI bardziej dostępnymi dla arabskojęzycznego świata[1].
Historia rozwoju i wydania
Projekt Jais został zainicjowany w 2023 roku w obliczu ograniczoności istniejących LLM dla języków niskozasobowych. Twórcy zwracali uwagę na brak wysokiej jakości dwujęzycznych modeli, zdolnych w równym stopniu przetwarzać zarówno język arabski, jak i angielski[2].
Jais-13B: Pierwsza wersja
Pierwsza wersja, Jais-13B, została wydana 30 sierpnia 2023 roku i zawierała 13 miliardów parametrów[1]. Model został wytrenowany na mieszanym korpusie angielskich i arabskich tekstów, liczącym 395 miliardów tokenów[3]. W chwili premiery został okrzyknięty „najwyższej jakości arabskim LLM"[1].
Jais-30B: Zwiększenie skali
8 listopada 2023 roku, w niecałe trzy miesiące później, konsorcjum zaprezentowało drugą, znacznie ulepszoną wersję — Jais-30B z 30 miliardami parametrów[4]. Zwiększenie skali było podyktowane koniecznością rozwiązywania bardziej złożonych zadań praktycznych, takich jak streszczanie i tłumaczenie. Model został wytrenowany na rozszerzonym i oczyszczonym datasecie liczącym 1,63 biliona tokenów[4].
Jais-70B i rodzina modeli
6 sierpnia 2024 roku firma Inception (G42) ogłosiła premierę flagowego modelu Jais-70B (70 miliardów parametrów) oraz całej rodziny powiązanych modeli[5]. Jais-70B stał się największym otwartym LLM zorientowanym na język arabski. W jego opracowaniu zastosowano metodę continuous training: zamiast trenować od podstaw, za punkt wyjścia przyjęto model Llama 2 70B firmy Meta, który następnie douczono na 330 miliardach tokenów w języku arabskim. Pozwoliło to efektywnie przenieść wiedzę o języku angielskim z Llama 2 i skoncentrować zasoby na uczeniu języka arabskiego[5].
Architektura i cechy techniczne
Jais należy do autoregresywnych modeli transformerowych opartych na architekturze GPT-3 (decoder-only). Kluczową cechą modelu jest jego dwujęzyczna specjalizacja w zakresie języka arabskiego i angielskiego, w odróżnieniu od wielu wielojęzycznych LLM, w których dominuje język angielski. Pozwala to osiągnąć głębokie zrozumienie języka arabskiego i jego dialektów[3].
Przy tworzeniu Jais zintegrowano zaawansowane rozwiązania techniczne[3]:
- Pozycjonowanie ALiBi: Specjalny schemat pozycyjnych embeddingów, który pozwala modelowi przetwarzać dłuższy kontekst niż ten, na którym był trenowany.
- Aktywacja SwiGLU: Funkcja aktywacji zwiększająca jakość trenowania i ekspresywność warstw neuronowych.
- Maximal Update Parametrization (µP): Metoda dostrajania hiperparametrów, która stabilizuje trening przy zwiększaniu rozmiarów modelu.
- Specjalizowany tokenizer: Opracowany z uwzględnieniem specyfiki języka arabskiego i angielskiego, co skraca liczbę tokenów dla arabskiego tekstu 3–4 razy w porównaniu z tokenizatorami uniwersalnymi i zwiększa szybkość działania[6].
Oprócz modeli bazowych (foundation models) wydano wersję Jais-chat, dodatkowo douczaną na 9,6 mln par pytań i odpowiedzi w celu dostosowania do zadań chatbota i asystenta[3].
Trening i zbiór danych
Jednym z głównych zadań projektu było przygotowanie wysokiej jakości i obszernego korpusu arabskich tekstów. Końcowy zbiór treningowy dla Jais-13B wyniósł 395 mld tokenów, z czego:
- 116 mld tokenów (29%) — tekst arabski.
- 279 mld tokenów (71%) — tekst angielski i kod źródłowy.
Komponent arabski został celowo uczyniony znaczącym (około 30%), aby zapewnić wysoką jakość znajomości języka[3]. Dane obejmowały książki, artykuły prasowe, strony internetowe oraz kod źródłowy. W celu zwiększenia objętości wysokiej jakości arabskich tekstów zastosowano maszynowe tłumaczenie anglojęzycznych zasobów[3].
Trening modeli przeprowadzono na superkomputerze Condor Galaxy 1 (CG-1) w Abu Dhabi, który został wspólnie opracowany przez G42 i Cerebras Systems. Dzięki tej infrastrukturze trening Jais-13B zajął zaledwie około 3,5 dnia czystego czasu[2].
Zastosowanie i znaczenie
Jais jest postrzegany jako kluczowy krok w rozwoju generatywnej AI dla języka arabskiego i innych społeczności językowych niedostatecznie reprezentowanych w nowoczesnych LLM. Otwarty dostęp do modelu ma stymulować wdrażanie technologii przetwarzania języka naturalnego w regionach Bliskiego Wschodu i Afryki Północnej.
Od czasu uruchomienia projektu zainteresowanie nim wyraziły państwowe i komercyjne podmioty ZEA. Wczesny dostęp do modelu otrzymały Ministerstwo Spraw Zagranicznych ZEA, firma naftowo-gazowa ADNOC, linie lotnicze Etihad Airways oraz bank First Abu Dhabi Bank[1]. W 2024 roku Microsoft ogłosił integrację Jais z platformą chmurową Microsoft Azure, udostępniając go globalnym użytkownikom[6].
Twórcy Jais podkreślają jego rolę w zachowaniu arabskiego dziedzictwa kulturowo-językowego. Według słów dyrektora generalnego Inception, Andrew Jacksona, projekt ma „zapewnić, aby język arabski ze swoim bogatym dziedzictwem znalazł swój głos w krajobrazie AI"[1]. Zdobyte doświadczenie planuje się wykorzystać do tworzenia analogicznych LLM dla innych języków i kultur[1].
Literatura
- Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
- Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
- Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
- Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
- Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
- Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
- Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
- Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.
Przypisy
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
- ↑ 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
- ↑ 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
- ↑ 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
- ↑ 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]