Jais (language model) (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

Jais (vyslovuje se „Džejs") — je rodina otevřených velkých jazykových modelů (LLM) vyvinutá ve Spojených arabských emirátech a speciálně optimalizovaná pro arabský jazyk[1]. Název modelu byl dán podle hory Džabal Džajs — nejvyššího vrcholu SAE[2].

Projekt byl vytvořen ve spolupráci mezi výzkumnou společností Inception (dceřiná společnost technologického konglomerátu G42), Univerzitou umělé inteligence Mohameda bin Zajida (MBZUAI) a kalifornskou společností vyrábějící AI čipy Cerebras Systems[2]. Jais byl otevřeně zveřejněn pod svobodnou licencí, což má podpořit rozvoj AI ekosystému pro arabský jazyk, zachovat kulturně-jazykové dědictví a zpřístupnit moderní AI technologie arabsky mluvícímu světu[1].

Historie vývoje a vydání

Projekt Jais byl zahájen v roce 2023 na pozadí omezenosti stávajících LLM pro jazyky s nedostatečnými zdroji. Vývojáři poukazovali na nedostatek kvalitních dvojjazyčných modelů schopných stejně dobře zpracovávat arabský i anglický jazyk[2].

Jais-13B: První verze

První verze, Jais-13B, byla vydána 30. srpna 2023 a obsahovala 13 miliard parametrů[1]. Model byl natrénován na smíšeném korpusu anglických a arabských textů o objemu 395 miliard tokenů[3]. V době svého vydání byl označen za „nejvyšší kvalitní arabský LLM\"[1].

Jais-30B: Zvýšení rozsahu

8. listopadu 2023, méně než tři měsíce poté, konsorcium představilo druhou, výrazně vylepšenou verzi — Jais-30B s 30 miliardami parametrů[4]. Zvětšení rozsahu bylo podmíněno potřebou řešit složitější aplikační úlohy, jako je sumarizace a překlad. Model byl natrénován na rozšířeném a vyčištěném datasetu o objemu 1,63 bilionu tokenů[4].

Jais-70B a rodina modelů

6. srpna 2024 Inception (G42) oznámila spuštění vlajkového modelu Jais-70B (70 miliard parametrů) a celé rodiny souvisejících modelů[5]. Jais-70B se stal největším otevřeným LLM zaměřeným na arabský jazyk. Při jeho vývoji byla použita metoda continuous training: namísto trénování od nuly byl jako základ vzat model Llama 2 70B od Meta, který byl dotrénován na 330 miliardách tokenů v arabském jazyce. To umožnilo efektivně přenést znalosti anglického jazyka z Llama 2 a soustředit zdroje na trénování arabštiny[5].

Architektura a technické vlastnosti

Jais patří mezi autoregresivní transformerové modely založené na architektuře GPT-3 (decoder-only). Klíčovou vlastností modelu je jeho dvojjazyčná specializace na arabský a anglický jazyk, na rozdíl od mnoha vícejazyčných LLM, kde dominuje angličtina. To umožňuje dosáhnout vysoké hloubky porozumění arabskému jazyku a jeho dialektům[3].

Při vytváření Jais byla integrována pokročilá technická řešení[3]:

  • ALiBi-pozicování: Speciální schéma pozičních embeddingů, která umožňuje modelu zpracovávat delší kontext, než na jakém byl natrénován.
  • SwiGLU-aktivace: Aktivační funkce zvyšující kvalitu trénování a expresivitu neuronových vrstev.
  • Maximal Update Parametrization (µP): Metoda nastavení hyperparametrů, která stabilizuje trénování při zvětšování velikosti modelu.
  • Specializovaný tokenizátor: Vyvinut s ohledem na specifika arabského a anglického jazyka, čímž snižuje počet tokenů pro arabský text 3–4krát ve srovnání s univerzálními tokenizátory a zvyšuje rychlost zpracování[6].

Kromě základních modelů (foundation models) byla vydána verze Jais-chat, dodatečně dotrénovaná na 9,6 milionu párů otázek a odpovědí pro přizpůsobení úlohám chatbotu a asistenta[3].

Trénování a datová sada

Jedním z hlavních úkolů projektu byla příprava kvalitního a rozsáhlého korpusu arabských textů. Výsledná trénovací sada pro Jais-13B obsahovala 395 mld. tokenů, z nichž:

  • 116 mld. tokenů (29%) — arabský text.
  • 279 mld. tokenů (71%) — anglický text a zdrojový kód.

Arabská složka byla záměrně ponechána jako výrazná (přibližně 30 %), aby bylo zajištěno vysoké kvalitní ovládání jazyka[3]. Data zahrnovala knihy, zpravodajské články, webové stránky a zdrojový kód. Pro zvýšení objemu kvalitních arabských textů byl využíván strojový překlad anglicky psaných zdrojů[3].

Trénování modelů probíhalo na superpočítači Condor Galaxy 1 (CG-1) v Abú Dhabí, který byl společně vyvinut společnostmi G42 a Cerebras Systems. Díky této infrastruktuře zabralo trénování Jais-13B pouhých přibližně 3,5 dne čistého času[2].

Použití a význam

Jais je prezentován jako klíčový krok v rozvoji generativní AI pro arabský jazyk a další jazyková společenství nedostatečně zastoupená v moderních LLM. Otevřený přístup k modelu má podpořit zavádění technologií zpracování přirozeného jazyka v regionech Blízkého východu a severní Afriky.

Od spuštění projektu přitáhl zájem státních i komerčních struktur SAE. Předčasný přístup k modelu získalo Ministerstvo zahraničních věcí SAE, ropná a plynárenská společnost ADNOC, letecká společnost Etihad Airways a banka First Abu Dhabi Bank[1]. V roce 2024 Microsoft oznámil integraci Jais na svou cloudovou platformu Microsoft Azure, čímž jej zpřístupnil globálním uživatelům[6].

Tvůrci Jais zdůrazňují jeho roli při zachování arabského kulturně-jazykového dědictví. Podle slov výkonného ředitele Inception Andrewa Jacksona má projekt zajistit, „aby arabský jazyk se svým bohatým dědictvím našel svůj hlas v krajině AI\"[1]. Získané zkušenosti se plánuje využít k vytvoření analogických LLM pro jiné jazyky a kultury[1].

Literatura

  • Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
  • Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
  • Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
  • Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
  • Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
  • Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
  • Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
  • Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.

Poznámky

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
  2. 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
  3. 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
  4. 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
  5. 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
  6. 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]