Jais (language model) (PL)

From Systems analysis Wiki
Jump to navigation Jump to search

Jais (wymawiane „Dżejs") — to rodzina otwartych dużych modeli językowych (LLM), opracowana w Zjednoczonych Emiratach Arabskich i specjalnie zoptymalizowana pod kątem języka arabskiego[1]. Nazwa modelu pochodzi od góry Dżabal Dżajs — najwyższego szczytu ZEA[2].

Projekt powstał we współpracy między firmą badawczą Inception (spółką zależną konglomeratu technologicznego G42), Uniwersytetem Sztucznej Inteligencji imienia Mohammeda bin Zayeda (MBZUAI) oraz kalifornijską firmą produkującą układy do AI — Cerebras Systems[2]. Jais został udostępniony publicznie na wolnej licencji, co ma stymulować rozwój ekosystemu AI dla języka arabskiego, zachowując dziedzictwo kulturowo-językowe i czyniąc nowoczesne technologie AI bardziej dostępnymi dla arabskojęzycznego świata[1].

Historia rozwoju i wydania

Projekt Jais został zainicjowany w 2023 roku w obliczu ograniczoności istniejących LLM dla języków niskozasobowych. Twórcy zwracali uwagę na brak wysokiej jakości dwujęzycznych modeli, zdolnych w równym stopniu przetwarzać zarówno język arabski, jak i angielski[2].

Jais-13B: Pierwsza wersja

Pierwsza wersja, Jais-13B, została wydana 30 sierpnia 2023 roku i zawierała 13 miliardów parametrów[1]. Model został wytrenowany na mieszanym korpusie angielskich i arabskich tekstów, liczącym 395 miliardów tokenów[3]. W chwili premiery został okrzyknięty „najwyższej jakości arabskim LLM"[1].

Jais-30B: Zwiększenie skali

8 listopada 2023 roku, w niecałe trzy miesiące później, konsorcjum zaprezentowało drugą, znacznie ulepszoną wersję — Jais-30B z 30 miliardami parametrów[4]. Zwiększenie skali było podyktowane koniecznością rozwiązywania bardziej złożonych zadań praktycznych, takich jak streszczanie i tłumaczenie. Model został wytrenowany na rozszerzonym i oczyszczonym datasecie liczącym 1,63 biliona tokenów[4].

Jais-70B i rodzina modeli

6 sierpnia 2024 roku firma Inception (G42) ogłosiła premierę flagowego modelu Jais-70B (70 miliardów parametrów) oraz całej rodziny powiązanych modeli[5]. Jais-70B stał się największym otwartym LLM zorientowanym na język arabski. W jego opracowaniu zastosowano metodę continuous training: zamiast trenować od podstaw, za punkt wyjścia przyjęto model Llama 2 70B firmy Meta, który następnie douczono na 330 miliardach tokenów w języku arabskim. Pozwoliło to efektywnie przenieść wiedzę o języku angielskim z Llama 2 i skoncentrować zasoby na uczeniu języka arabskiego[5].

Architektura i cechy techniczne

Jais należy do autoregresywnych modeli transformerowych opartych na architekturze GPT-3 (decoder-only). Kluczową cechą modelu jest jego dwujęzyczna specjalizacja w zakresie języka arabskiego i angielskiego, w odróżnieniu od wielu wielojęzycznych LLM, w których dominuje język angielski. Pozwala to osiągnąć głębokie zrozumienie języka arabskiego i jego dialektów[3].

Przy tworzeniu Jais zintegrowano zaawansowane rozwiązania techniczne[3]:

  • Pozycjonowanie ALiBi: Specjalny schemat pozycyjnych embeddingów, który pozwala modelowi przetwarzać dłuższy kontekst niż ten, na którym był trenowany.
  • Aktywacja SwiGLU: Funkcja aktywacji zwiększająca jakość trenowania i ekspresywność warstw neuronowych.
  • Maximal Update Parametrization (µP): Metoda dostrajania hiperparametrów, która stabilizuje trening przy zwiększaniu rozmiarów modelu.
  • Specjalizowany tokenizer: Opracowany z uwzględnieniem specyfiki języka arabskiego i angielskiego, co skraca liczbę tokenów dla arabskiego tekstu 3–4 razy w porównaniu z tokenizatorami uniwersalnymi i zwiększa szybkość działania[6].

Oprócz modeli bazowych (foundation models) wydano wersję Jais-chat, dodatkowo douczaną na 9,6 mln par pytań i odpowiedzi w celu dostosowania do zadań chatbota i asystenta[3].

Trening i zbiór danych

Jednym z głównych zadań projektu było przygotowanie wysokiej jakości i obszernego korpusu arabskich tekstów. Końcowy zbiór treningowy dla Jais-13B wyniósł 395 mld tokenów, z czego:

  • 116 mld tokenów (29%) — tekst arabski.
  • 279 mld tokenów (71%) — tekst angielski i kod źródłowy.

Komponent arabski został celowo uczyniony znaczącym (około 30%), aby zapewnić wysoką jakość znajomości języka[3]. Dane obejmowały książki, artykuły prasowe, strony internetowe oraz kod źródłowy. W celu zwiększenia objętości wysokiej jakości arabskich tekstów zastosowano maszynowe tłumaczenie anglojęzycznych zasobów[3].

Trening modeli przeprowadzono na superkomputerze Condor Galaxy 1 (CG-1) w Abu Dhabi, który został wspólnie opracowany przez G42 i Cerebras Systems. Dzięki tej infrastrukturze trening Jais-13B zajął zaledwie około 3,5 dnia czystego czasu[2].

Zastosowanie i znaczenie

Jais jest postrzegany jako kluczowy krok w rozwoju generatywnej AI dla języka arabskiego i innych społeczności językowych niedostatecznie reprezentowanych w nowoczesnych LLM. Otwarty dostęp do modelu ma stymulować wdrażanie technologii przetwarzania języka naturalnego w regionach Bliskiego Wschodu i Afryki Północnej.

Od czasu uruchomienia projektu zainteresowanie nim wyraziły państwowe i komercyjne podmioty ZEA. Wczesny dostęp do modelu otrzymały Ministerstwo Spraw Zagranicznych ZEA, firma naftowo-gazowa ADNOC, linie lotnicze Etihad Airways oraz bank First Abu Dhabi Bank[1]. W 2024 roku Microsoft ogłosił integrację Jais z platformą chmurową Microsoft Azure, udostępniając go globalnym użytkownikom[6].

Twórcy Jais podkreślają jego rolę w zachowaniu arabskiego dziedzictwa kulturowo-językowego. Według słów dyrektora generalnego Inception, Andrew Jacksona, projekt ma „zapewnić, aby język arabski ze swoim bogatym dziedzictwem znalazł swój głos w krajobrazie AI"[1]. Zdobyte doświadczenie planuje się wykorzystać do tworzenia analogicznych LLM dla innych języków i kultur[1].

Literatura

  • Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
  • Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
  • Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
  • Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
  • Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
  • Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
  • Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
  • Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.

Przypisy

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
  2. 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
  3. 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
  4. 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
  5. 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
  6. 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]