Jais (language model) (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

Jais (произнася се „Джейс") — това е семейство от отворени големи езикови модели (LLM), разработено в Обединените арабски емирства и специално оптимизирано за арабски език[1]. Името на модела е дадено в чест на планината Джебел Джейс — най-високия връх на ОАЕ[2].

Проектът е създаден в сътрудничество между изследователската компания Inception (дъщерно предприятие на технологичния конгломерат G42), Университета по изкуствен интелект „Мохамед бин Зайед" (MBZUAI) и калифорнийската компания за AI чипове Cerebras Systems[2]. Jais беше открито публикувана под свободен лиценз, което цели да стимулира развитието на AI екосистемата за арабски език, запазвайки културно-езиковото наследство и правейки съвременните AI технологии по-достъпни за арабоезичния свят[1].

История на разработката и издания

Проектът Jais беше иниציран през 2023 година на фона на ограничеността на съществуващите LLM за езици с недостатъчни ресурси. Разработчиците отбелязваха липсата на качествени двуезични модели, способни да обработват еднакво добре както арабски, така и английски език[2].

Jais-13B: Първа версия

Първата версия, Jais-13B, беше издадена на 30 август 2023 година и съдържаше 13 милиарда параметра[1]. Моделът беше обучен върху смесен корпус от английски и арабски текстове с обем 395 милиарда токена[3]. В момента на своето излизане тя беше наречена „най-висококачественият арабски LLM"[1].

Jais-30B: Увеличаване на мащаба

На 8 ноември 2023 година, по-малко от три месеца по-късно, консорциумът представи втора, значително подобрена версия — Jais-30B с 30 милиарда параметра[4]. Увеличаването на мащаба беше продиктувано от необходимостта да се решават по-сложни приложни задачи, като обобщаване и превод. Моделът беше обучен върху разширен и пречистен dataset с обем 1,63 трилиона токена[4].

Jais-70B и семейство от модели

На 6 август 2024 година Inception (G42) обяви пускането на флагманския модел Jais-70B (70 милиарда параметра) и цяло семейство от свързани модели[5]. Jais-70B се превърна в най-големия отворен LLM, ориентиран към арабски език. При разработката му беше приложен методът continuous training: вместо обучение от нулата, за основа беше взет моделът Llama 2 70B от Meta, който беше дообучен върху 330 милиарда токена на арабски език. Това позволи ефективно да се пренесат знанията по английски от Llama 2 и да се съсредоточат ресурсите върху обучението по арабски[5].

Архитектура и технически особености

Jais се отнася към авторегресивните трансформерни модели на базата на архитектурата GPT-3 (decoder-only). Ключовата особеност на модела е неговата двуезична специализация върху арабски и английски език, за разлика от много многоезични LLM, в които преобладава английският. Това позволява да се постигне висока дълбочина на разбиране на арабския език и неговите диалекти[3].

При създаването на Jais бяха интегрирани съвременни технически решения[3]:

  • ALiBi-позициониране: Специална схема за позиционни embedding-и, която позволява на модела да обработва по-дълъг контекст от този, върху който е бил обучен.
  • SwiGLU-активация: Функция на активация, която повишава качеството на обучението и изразителността на невронните слоеве.
  • Maximal Update Parametrization (µP): Методика за настройка на хиперпараметри, която стабилизира обучението при увеличаване на размерите на модела.
  • Специализиран токенизатор: Разработен с отчитане на особеностите на арабския и английския език, което намалява броя на токените за арабски текст 3–4 пъти в сравнение с универсалните токенизатори и повишава скоростта на работа[6].

Освен базовите модели (foundation models), беше издадена версия Jais-chat, допълнително дообучена върху 9,6 млн двойки въпроси-отговори за адаптиране към задачи на чатбот и асистент[3].

Обучение и набор от данни

Една от главните задачи на проекта беше подготовката на качествен и обширен корпус от арабски текстове. Окончателният обучаващ набор за Jais-13B възлизаше на 395 млрд токена, от които:

  • 116 млрд токена (29%) — арабски текст.
  • 279 млрд токена (71%) — английски текст и програмен код.

Арабският компонент беше умишлено направен значителен (около 30%), за да се осигури високо качество на владеенето на езика[3]. Данните включваха книги, новинарски статии, уеб страници и изходен код. За увеличаване на обема от качествени арабски текстове беше приложен машинен превод на англоезични ресурси[3].

Обучението на моделите беше проведено на суперкомпютъра Condor Galaxy 1 (CG-1) в Абу Даби, който беше съвместно разработен от G42 и Cerebras Systems. Благодарение на тази инфраструктура, обучението на Jais-13B отне едва около 3,5 дни чисто процесорно време[2].

Приложение и значение

Jais се позиционира като ключова стъпка в развитието на генеративния AI за арабски език и други езикови общности, недостатъчно представени в съвременните LLM. Отвореният достъп до модела цели да стимулира внедряването на технологии за обработка на естествен език в регионите на Близкия изток и Северна Африка.

От момента на стартирането проектът привлече интереса на държавни и търговски структури на ОАЕ. Ранен достъп до модела получиха Министерството на външните работи на ОАЕ, нефтогазовата компания ADNOC, авиокомпанията Etihad Airways и банката First Abu Dhabi Bank[1]. През 2024 година Microsoft обяви интегрирането на Jais в своята облачна платформа Microsoft Azure, правейки я достъпна за глобалните потребители[6].

Създателите на Jais подчертават нейната роля в запазването на арабското културно-езиково наследство. Според изпълнителния директор на Inception Андрю Джаксън, проектът цели „да гарантира, че арабският език с неговото богато наследство да намери своя глас в пейзажа на AI"[1]. Натрупаният опит се планира да бъде използван за създаването на аналогични LLM за други езици и култури[1].

Литература

  • Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
  • Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
  • Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
  • Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
  • Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
  • Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
  • Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
  • Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.

Бележки

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
  2. 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
  3. 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
  4. 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
  5. 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
  6. 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]