Jais (language model) (TL)
Jais (binibigkas na "Jeis") — isang pamilya ng mga bukas na malaking language model (LLM), na binuo sa United Arab Emirates at espesyal na na-optimize para sa wikang Arabe[1]. Ang pangalan ng modelo ay hango sa bundok ng Jebel Jais — ang pinakamataas na tuktok ng UAE[2].
Ang proyekto ay nilikha sa pakikipagtulungan ng kumpanyang pangpananaliksik na Inception (subsidiary ng teknolohiyang konglomerado ng G42), Mohamed bin Zayed University of Artificial Intelligence (MBZUAI), at ng kumpanyang Californiano na gumagawa ng AI chips na Cerebras Systems[2]. Ang Jais ay bukas na inilathala sa ilalim ng libreng lisensya, na nilalayong pasiglahin ang pagpapaunlad ng AI ecosystem para sa wikang Arabe, pinapanatili ang kultural at lingguwistikong pamana at ginagawang mas accessible ang mga modernong teknolohiya ng AI para sa mundong nagsasalita ng Arabe[1].
Kasaysayan ng pagbuo at mga release
Ang proyektong Jais ay sinimulan noong 2023 sa gitna ng limitasyon ng mga umiiral na LLM para sa mga wikang kulang sa mapagkukunan. Itinutukoy ng mga developer ang kakulangan ng mga kalidad na dalawang-wikang modelo na kayang iproseso nang pantay-pantay ang parehong Arabe at Ingles[2].
Jais-13B: Unang bersyon
Ang unang bersyon, Jais-13B, ay inilabas noong Agosto 30, 2023 at naglalaman ng 13 bilyong parameter[1]. Ang modelo ay sinanay sa pinaghalong corpus ng mga tekstong Ingles at Arabe na may dami na 395 bilyong token[3]. Sa oras ng paglabas nito, ito ay tinawag na "pinakamataas na kalidad na Arabic LLM"[1].
Jais-30B: Pagpapalaki ng sukat
Noong Nobyembre 8, 2023, wala pang tatlong buwan ang lumipas, iprinisenta ng consortium ang pangalawa, at lubos na pinahusay na bersyon — Jais-30B na may 30 bilyong parameter[4]. Ang pagpapalaki ng sukat ay dahil sa pangangailangan na malutas ang mas kumplikadong mga gawaing pang-aplikasyon, tulad ng pagbubuod at pagsasalin. Ang modelo ay sinanay sa pinalawak at nalinis na dataset na may dami na 1.63 trilyon na token[4].
Jais-70B at pamilya ng mga modelo
Noong Agosto 6, 2024, inanunsyo ng Inception (G42) ang paglulunsad ng flagship model na Jais-70B (70 bilyong parameter) at isang buong pamilya ng mga kaugnay na modelo[5]. Ang Jais-70B ay naging pinakamalaking bukas na LLM na nakatuon sa wikang Arabe. Sa pagbuo nito, ginamit ang pamamaraang continuous training: sa halip na sanayin mula sa simula, ginamit bilang batayan ang modelo ng Llama 2 70B mula sa Meta, na pagkatapos ay dino-fine-tune sa 330 bilyong token sa wikang Arabe. Nagpahintulot ito na epektibong mailipat ang kaalaman sa Ingles mula sa Llama 2 at maikonsentrate ang mga mapagkukunan sa pagsasanay sa Arabe[5].
Arkitektura at mga teknikal na katangian
Ang Jais ay kabilang sa mga autoregressive transformer model batay sa arkitektura ng GPT-3 (decoder-only). Ang pangunahing katangian ng modelo ay ang dalawang-wikang espesyalisasyon nito sa Arabe at Ingles, hindi katulad ng maraming multilingual na LLM kung saan nangingibabaw ang Ingles. Nagbibigay-daan ito na makamit ang mataas na lalim ng pag-unawa sa wikang Arabe at sa mga diyalekto nito[3].
Sa paglikha ng Jais, isinama ang mga makabagong teknikal na solusyon[3]:
- ALiBi-positioning: Isang espesyal na pamamaraan ng positional embedding na nagbibigay-daan sa modelo na iproseso ang mas mahabang konteksto kaysa sa sinanay nito.
- SwiGLU-activation: Isang activation function na nagpapahusay ng kalidad ng pagsasanay at ng expresibidad ng mga neural layer.
- Maximal Update Parametrization (µP): Isang pamamaraan ng pag-aayos ng hyperparameter na nagpapanatag ng pagsasanay habang lumalaki ang sukat ng modelo.
- Espesyalisadong tokenizer: Binuo na isinasaalang-alang ang mga katangian ng Arabe at Ingles, na nagbabawas ng bilang ng mga token para sa tekstong Arabe ng 3–4 na beses kumpara sa mga pangkalahatang tokenizer at nagpapataas ng bilis ng trabaho[6].
Bukod sa mga base model (foundation models), inilabas ang bersyong Jais-chat, na karagdagang dino-fine-tune sa 9.6 milyong pares ng mga tanong-at-sagot para sa pag-aangkop sa mga gawaing chatbot at assistant[3].
Pagsasanay at dataset
Isa sa mga pangunahing gawain ng proyekto ang paghahanda ng kalidad at malaking corpus ng mga tekstong Arabe. Ang panghuling training set para sa Jais-13B ay umabot sa 395 bilyong token, kung saan:
- 116 bilyong token (29%) — tekstong Arabe.
- 279 bilyong token (71%) — tekstong Ingles at source code.
Ang bahagi ng Arabe ay sinadyang gawing malaki (humigit-kumulang 30%), upang matiyak ang mataas na kalidad ng kasanayan sa wika[3]. Ang data ay kinabibilangan ng mga libro, artikulong balita, mga web page at source code. Upang mapataas ang dami ng mga kalidad na tekstong Arabe, ginamit ang makinaryang pagsasalin ng mga mapagkukunang Ingles[3].
Ang pagsasanay ng mga modelo ay isinagawa sa supercomputer na Condor Galaxy 1 (CG-1) sa Abu Dhabi, na pinagsamang binuo ng G42 at Cerebras Systems. Salamat sa imprastrakturang ito, ang pagsasanay ng Jais-13B ay tumagal lamang ng humigit-kumulang 3.5 araw ng purong oras[2].
Paggamit at kahalagahan
Ang Jais ay inilalahad bilang isang pangunahing hakbang sa pagpapaunlad ng generative AI para sa wikang Arabe at para sa iba pang mga lingguwistikong komunidad na hindi sapat na kinakatawan sa mga kasalukuyang LLM. Ang bukas na access sa modelo ay nilalayong pasiglahin ang pagpapakilala ng mga teknolohiya sa natural na pagpoproseso ng wika sa mga rehiyon ng Middle East at North Africa.
Mula nang ilunsad ang proyekto, nakaakit ito ng interes mula sa mga pampubliko at komersyal na istruktura ng UAE. Ang maagang access sa modelo ay natanggap ng Ministry of Foreign Affairs ng UAE, ang kumpanyang langis at gas na ADNOC, ang airline na Etihad Airways, at ang First Abu Dhabi Bank[1]. Noong 2024, inanunsyo ng Microsoft ang pagsasama ng Jais sa cloud platform nitong Microsoft Azure, na ginagawa itong available para sa mga pandaigdigang gumagamit[6].
Binibigyang-diin ng mga tagalikha ng Jais ang papel nito sa pagpapanatili ng kultural at lingguwistikong pamana ng Arabe. Ayon sa punong ehekutibo ng Inception na si Andrew Jackson, ang proyekto ay naglalayong "tiyakin na ang wikang Arabe, na may mayamang pamana nito, ay makakakita ng sarili nitong tinig sa tanawin ng AI"[1]. Ang naipon na karanasan ay plano na gamitin para lumikha ng mga katulad na LLM para sa iba pang mga wika at kultura[1].
Mga sanggunian
- Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
- Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
- Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
- Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
- Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
- Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
- Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
- Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.
Mga tala
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
- ↑ 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
- ↑ 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
- ↑ 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
- ↑ 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]