Jais (language model) (CS)
Jais (vyslovuje se „Džejs") — je rodina otevřených velkých jazykových modelů (LLM) vyvinutá ve Spojených arabských emirátech a speciálně optimalizovaná pro arabský jazyk[1]. Název modelu byl dán podle hory Džabal Džajs — nejvyššího vrcholu SAE[2].
Projekt byl vytvořen ve spolupráci mezi výzkumnou společností Inception (dceřiná společnost technologického konglomerátu G42), Univerzitou umělé inteligence Mohameda bin Zajida (MBZUAI) a kalifornskou společností vyrábějící AI čipy Cerebras Systems[2]. Jais byl otevřeně zveřejněn pod svobodnou licencí, což má podpořit rozvoj AI ekosystému pro arabský jazyk, zachovat kulturně-jazykové dědictví a zpřístupnit moderní AI technologie arabsky mluvícímu světu[1].
Historie vývoje a vydání
Projekt Jais byl zahájen v roce 2023 na pozadí omezenosti stávajících LLM pro jazyky s nedostatečnými zdroji. Vývojáři poukazovali na nedostatek kvalitních dvojjazyčných modelů schopných stejně dobře zpracovávat arabský i anglický jazyk[2].
Jais-13B: První verze
První verze, Jais-13B, byla vydána 30. srpna 2023 a obsahovala 13 miliard parametrů[1]. Model byl natrénován na smíšeném korpusu anglických a arabských textů o objemu 395 miliard tokenů[3]. V době svého vydání byl označen za „nejvyšší kvalitní arabský LLM\"[1].
Jais-30B: Zvýšení rozsahu
8. listopadu 2023, méně než tři měsíce poté, konsorcium představilo druhou, výrazně vylepšenou verzi — Jais-30B s 30 miliardami parametrů[4]. Zvětšení rozsahu bylo podmíněno potřebou řešit složitější aplikační úlohy, jako je sumarizace a překlad. Model byl natrénován na rozšířeném a vyčištěném datasetu o objemu 1,63 bilionu tokenů[4].
Jais-70B a rodina modelů
6. srpna 2024 Inception (G42) oznámila spuštění vlajkového modelu Jais-70B (70 miliard parametrů) a celé rodiny souvisejících modelů[5]. Jais-70B se stal největším otevřeným LLM zaměřeným na arabský jazyk. Při jeho vývoji byla použita metoda continuous training: namísto trénování od nuly byl jako základ vzat model Llama 2 70B od Meta, který byl dotrénován na 330 miliardách tokenů v arabském jazyce. To umožnilo efektivně přenést znalosti anglického jazyka z Llama 2 a soustředit zdroje na trénování arabštiny[5].
Architektura a technické vlastnosti
Jais patří mezi autoregresivní transformerové modely založené na architektuře GPT-3 (decoder-only). Klíčovou vlastností modelu je jeho dvojjazyčná specializace na arabský a anglický jazyk, na rozdíl od mnoha vícejazyčných LLM, kde dominuje angličtina. To umožňuje dosáhnout vysoké hloubky porozumění arabskému jazyku a jeho dialektům[3].
Při vytváření Jais byla integrována pokročilá technická řešení[3]:
- ALiBi-pozicování: Speciální schéma pozičních embeddingů, která umožňuje modelu zpracovávat delší kontext, než na jakém byl natrénován.
- SwiGLU-aktivace: Aktivační funkce zvyšující kvalitu trénování a expresivitu neuronových vrstev.
- Maximal Update Parametrization (µP): Metoda nastavení hyperparametrů, která stabilizuje trénování při zvětšování velikosti modelu.
- Specializovaný tokenizátor: Vyvinut s ohledem na specifika arabského a anglického jazyka, čímž snižuje počet tokenů pro arabský text 3–4krát ve srovnání s univerzálními tokenizátory a zvyšuje rychlost zpracování[6].
Kromě základních modelů (foundation models) byla vydána verze Jais-chat, dodatečně dotrénovaná na 9,6 milionu párů otázek a odpovědí pro přizpůsobení úlohám chatbotu a asistenta[3].
Trénování a datová sada
Jedním z hlavních úkolů projektu byla příprava kvalitního a rozsáhlého korpusu arabských textů. Výsledná trénovací sada pro Jais-13B obsahovala 395 mld. tokenů, z nichž:
- 116 mld. tokenů (29%) — arabský text.
- 279 mld. tokenů (71%) — anglický text a zdrojový kód.
Arabská složka byla záměrně ponechána jako výrazná (přibližně 30 %), aby bylo zajištěno vysoké kvalitní ovládání jazyka[3]. Data zahrnovala knihy, zpravodajské články, webové stránky a zdrojový kód. Pro zvýšení objemu kvalitních arabských textů byl využíván strojový překlad anglicky psaných zdrojů[3].
Trénování modelů probíhalo na superpočítači Condor Galaxy 1 (CG-1) v Abú Dhabí, který byl společně vyvinut společnostmi G42 a Cerebras Systems. Díky této infrastruktuře zabralo trénování Jais-13B pouhých přibližně 3,5 dne čistého času[2].
Použití a význam
Jais je prezentován jako klíčový krok v rozvoji generativní AI pro arabský jazyk a další jazyková společenství nedostatečně zastoupená v moderních LLM. Otevřený přístup k modelu má podpořit zavádění technologií zpracování přirozeného jazyka v regionech Blízkého východu a severní Afriky.
Od spuštění projektu přitáhl zájem státních i komerčních struktur SAE. Předčasný přístup k modelu získalo Ministerstvo zahraničních věcí SAE, ropná a plynárenská společnost ADNOC, letecká společnost Etihad Airways a banka First Abu Dhabi Bank[1]. V roce 2024 Microsoft oznámil integraci Jais na svou cloudovou platformu Microsoft Azure, čímž jej zpřístupnil globálním uživatelům[6].
Tvůrci Jais zdůrazňují jeho roli při zachování arabského kulturně-jazykového dědictví. Podle slov výkonného ředitele Inception Andrewa Jacksona má projekt zajistit, „aby arabský jazyk se svým bohatým dědictvím našel svůj hlas v krajině AI\"[1]. Získané zkušenosti se plánuje využít k vytvoření analogických LLM pro jiné jazyky a kultury[1].
Literatura
- Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
- Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
- Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
- Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
- Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
- Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
- Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
- Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.
Poznámky
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
- ↑ 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
- ↑ 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
- ↑ 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
- ↑ 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]