Jais (language model) (BG)
Jais (произнася се „Джейс") — това е семейство от отворени големи езикови модели (LLM), разработено в Обединените арабски емирства и специално оптимизирано за арабски език[1]. Името на модела е дадено в чест на планината Джебел Джейс — най-високия връх на ОАЕ[2].
Проектът е създаден в сътрудничество между изследователската компания Inception (дъщерно предприятие на технологичния конгломерат G42), Университета по изкуствен интелект „Мохамед бин Зайед" (MBZUAI) и калифорнийската компания за AI чипове Cerebras Systems[2]. Jais беше открито публикувана под свободен лиценз, което цели да стимулира развитието на AI екосистемата за арабски език, запазвайки културно-езиковото наследство и правейки съвременните AI технологии по-достъпни за арабоезичния свят[1].
История на разработката и издания
Проектът Jais беше иниציран през 2023 година на фона на ограничеността на съществуващите LLM за езици с недостатъчни ресурси. Разработчиците отбелязваха липсата на качествени двуезични модели, способни да обработват еднакво добре както арабски, така и английски език[2].
Jais-13B: Първа версия
Първата версия, Jais-13B, беше издадена на 30 август 2023 година и съдържаше 13 милиарда параметра[1]. Моделът беше обучен върху смесен корпус от английски и арабски текстове с обем 395 милиарда токена[3]. В момента на своето излизане тя беше наречена „най-висококачественият арабски LLM"[1].
Jais-30B: Увеличаване на мащаба
На 8 ноември 2023 година, по-малко от три месеца по-късно, консорциумът представи втора, значително подобрена версия — Jais-30B с 30 милиарда параметра[4]. Увеличаването на мащаба беше продиктувано от необходимостта да се решават по-сложни приложни задачи, като обобщаване и превод. Моделът беше обучен върху разширен и пречистен dataset с обем 1,63 трилиона токена[4].
Jais-70B и семейство от модели
На 6 август 2024 година Inception (G42) обяви пускането на флагманския модел Jais-70B (70 милиарда параметра) и цяло семейство от свързани модели[5]. Jais-70B се превърна в най-големия отворен LLM, ориентиран към арабски език. При разработката му беше приложен методът continuous training: вместо обучение от нулата, за основа беше взет моделът Llama 2 70B от Meta, който беше дообучен върху 330 милиарда токена на арабски език. Това позволи ефективно да се пренесат знанията по английски от Llama 2 и да се съсредоточат ресурсите върху обучението по арабски[5].
Архитектура и технически особености
Jais се отнася към авторегресивните трансформерни модели на базата на архитектурата GPT-3 (decoder-only). Ключовата особеност на модела е неговата двуезична специализация върху арабски и английски език, за разлика от много многоезични LLM, в които преобладава английският. Това позволява да се постигне висока дълбочина на разбиране на арабския език и неговите диалекти[3].
При създаването на Jais бяха интегрирани съвременни технически решения[3]:
- ALiBi-позициониране: Специална схема за позиционни embedding-и, която позволява на модела да обработва по-дълъг контекст от този, върху който е бил обучен.
- SwiGLU-активация: Функция на активация, която повишава качеството на обучението и изразителността на невронните слоеве.
- Maximal Update Parametrization (µP): Методика за настройка на хиперпараметри, която стабилизира обучението при увеличаване на размерите на модела.
- Специализиран токенизатор: Разработен с отчитане на особеностите на арабския и английския език, което намалява броя на токените за арабски текст 3–4 пъти в сравнение с универсалните токенизатори и повишава скоростта на работа[6].
Освен базовите модели (foundation models), беше издадена версия Jais-chat, допълнително дообучена върху 9,6 млн двойки въпроси-отговори за адаптиране към задачи на чатбот и асистент[3].
Обучение и набор от данни
Една от главните задачи на проекта беше подготовката на качествен и обширен корпус от арабски текстове. Окончателният обучаващ набор за Jais-13B възлизаше на 395 млрд токена, от които:
- 116 млрд токена (29%) — арабски текст.
- 279 млрд токена (71%) — английски текст и програмен код.
Арабският компонент беше умишлено направен значителен (около 30%), за да се осигури високо качество на владеенето на езика[3]. Данните включваха книги, новинарски статии, уеб страници и изходен код. За увеличаване на обема от качествени арабски текстове беше приложен машинен превод на англоезични ресурси[3].
Обучението на моделите беше проведено на суперкомпютъра Condor Galaxy 1 (CG-1) в Абу Даби, който беше съвместно разработен от G42 и Cerebras Systems. Благодарение на тази инфраструктура, обучението на Jais-13B отне едва около 3,5 дни чисто процесорно време[2].
Приложение и значение
Jais се позиционира като ключова стъпка в развитието на генеративния AI за арабски език и други езикови общности, недостатъчно представени в съвременните LLM. Отвореният достъп до модела цели да стимулира внедряването на технологии за обработка на естествен език в регионите на Близкия изток и Северна Африка.
От момента на стартирането проектът привлече интереса на държавни и търговски структури на ОАЕ. Ранен достъп до модела получиха Министерството на външните работи на ОАЕ, нефтогазовата компания ADNOC, авиокомпанията Etihad Airways и банката First Abu Dhabi Bank[1]. През 2024 година Microsoft обяви интегрирането на Jais в своята облачна платформа Microsoft Azure, правейки я достъпна за глобалните потребители[6].
Създателите на Jais подчертават нейната роля в запазването на арабското културно-езиково наследство. Според изпълнителния директор на Inception Андрю Джаксън, проектът цели „да гарантира, че арабският език с неговото богато наследство да намери своя глас в пейзажа на AI"[1]. Натрупаният опит се планира да бъде използван за създаването на аналогични LLM за други езици и култури[1].
Литература
- Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
- Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
- Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
- Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
- Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
- Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
- Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
- Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.
Бележки
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
- ↑ 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
- ↑ 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
- ↑ 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
- ↑ 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]