Jais (modelo de linguagem)

From Systems analysis Wiki
Jump to navigation Jump to search

Jais (pronuncia-se "Jais") é uma família de grandes modelos de linguagem (LLM) de código aberto, desenvolvida nos Emirados Árabes Unidos e especialmente otimizada para o idioma árabe[1]. O nome do modelo é uma homenagem à montanha Jebel Jais — o pico mais alto dos Emirados Árabes Unidos[2].

O projeto foi criado em uma colaboração entre a empresa de pesquisa Inception (uma subsidiária do conglomerado de tecnologia G42), a Universidade de Inteligência Artificial Mohamed bin Zayed (MBZUAI) e a empresa californiana de chips de IA Cerebras Systems[2]. Jais foi lançado publicamente sob uma licença de código aberto, com o objetivo de estimular o desenvolvimento de um ecossistema de IA para o idioma árabe, preservando o patrimônio cultural e linguístico e tornando as tecnologias modernas de IA mais acessíveis para o mundo de língua árabe[1].

História do desenvolvimento e lançamentos

O projeto Jais foi iniciado em 2023 em resposta às limitações dos LLMs existentes para idiomas com poucos recursos. Os desenvolvedores notaram a escassez de modelos bilíngues de alta qualidade capazes de processar tanto o árabe quanto o inglês com a mesma proficiência[2].

Jais-13B: Primeira versão

A primeira versão, Jais-13B, foi lançada em 30 de agosto de 2023 e continha 13 bilhões de parâmetros[1]. O modelo foi treinado em um corpus misto de textos em inglês e árabe com um total de 395 bilhões de tokens[3]. Na época de seu lançamento, foi considerado o "LLM em árabe de mais alta qualidade"[1].

Jais-30B: Aumento de escala

Em 8 de novembro de 2023, menos de três meses depois, o consórcio apresentou uma segunda versão significativamente aprimorada — o Jais-30B com 30 bilhões de parâmetros[4]. O aumento de escala foi motivado pela necessidade de resolver tarefas aplicadas mais complexas, como sumarização e tradução. O modelo foi treinado em um conjunto de dados expandido e limpo de 1,63 trilhão de tokens[4].

Jais-70B e a família de modelos

Em 6 de agosto de 2024, a Inception (G42) anunciou o lançamento do modelo principal Jais-70B (70 bilhões de parâmetros) e de uma família inteira de modelos relacionados[5]. O Jais-70B tornou-se o maior LLM de código aberto focado no idioma árabe. Em seu desenvolvimento, foi aplicado o método de treinamento contínuo (continuous training): em vez de treinar do zero, o modelo Llama 2 70B da Meta foi usado como base e continuou sendo treinado com 330 bilhões de tokens em árabe. Isso permitiu transferir eficientemente o conhecimento do idioma inglês do Llama 2 e concentrar os recursos no treinamento do árabe[5].

Arquitetura e características técnicas

Jais pertence à categoria de modelos transformer autorregressivos baseados na arquitetura GPT-3 (decoder-only). A principal característica do modelo é sua especialização bilíngue em árabe e inglês, diferentemente de muitos LLMs multilíngues nos quais o inglês prevalece. Isso permite alcançar uma alta profundidade de compreensão do idioma árabe e de seus dialetos[3].

Na criação do Jais, foram integradas soluções técnicas avançadas[3]:

  • Posicionamento ALiBi: Um esquema especial de embeddings posicionais que permite ao modelo processar contextos mais longos do que aqueles em que foi treinado.
  • Ativação SwiGLU: Uma função de ativação que melhora a qualidade do treinamento e a expressividade das camadas neurais.
  • Maximal Update Parametrization (µP): Uma metodologia para ajustar hiperparâmetros que estabiliza o treinamento à medida que o tamanho do modelo aumenta.
  • Tokenizador especializado: Desenvolvido levando em conta as particularidades dos idiomas árabe e inglês, o que reduz o número de tokens para textos em árabe em 3 a 4 vezes em comparação com tokenizadores universais e aumenta a velocidade de processamento[6].

Além dos modelos de base (foundation models), foi lançada uma versão Jais-chat, que passou por um treinamento adicional com 9,6 milhões de pares de perguntas e respostas para ser adaptada a tarefas de chatbot e assistente[3].

Treinamento e conjunto de dados

Uma das principais tarefas do projeto foi preparar um corpus de textos em árabe de alta qualidade e em grande escala. O conjunto de dados de treinamento final para o Jais-13B totalizou 395 bilhões de tokens, dos quais:

  • 116 bilhões de tokens (29%) — texto em árabe.
  • 279 bilhões de tokens (71%) — texto em inglês e código de programação.

O componente árabe foi intencionalmente significativo (cerca de 30%) para garantir uma alta proficiência no idioma[3]. Os dados incluíam livros, artigos de notícias, páginas da web e código-fonte. Para aumentar o volume de textos árabes de qualidade, foi utilizada a tradução automática de recursos em inglês[3].

O treinamento dos modelos foi realizado no supercomputador Condor Galaxy 1 (CG-1) em Abu Dhabi, desenvolvido em conjunto pela G42 e pela Cerebras Systems. Graças a essa infraestrutura, o treinamento do Jais-13B levou apenas cerca de 3,5 dias de tempo de computação puro[2].

Aplicação e importância

Jais é posicionado como um passo fundamental no desenvolvimento de IA generativa para o idioma árabe e outras comunidades linguísticas sub-representadas nos LLMs modernos. O acesso aberto ao modelo visa estimular a adoção de tecnologias de processamento de linguagem natural nas regiões do Oriente Médio e Norte da África.

Desde o seu lançamento, o projeto atraiu o interesse de entidades governamentais e comerciais dos Emirados Árabes Unidos. Acesso antecipado ao modelo foi concedido ao Ministério das Relações Exteriores dos EAU, à companhia de petróleo e gás ADNOC, à companhia aérea Etihad Airways e ao banco First Abu Dhabi Bank[1]. Em 2024, a Microsoft anunciou a integração do Jais em sua plataforma de nuvem Microsoft Azure, tornando-o disponível para usuários globais[6].

Os criadores do Jais destacam seu papel na preservação do patrimônio cultural e linguístico árabe. Segundo Andrew Jackson, diretor executivo da Inception, o projeto visa "garantir que o idioma árabe, com sua rica herança, encontre sua voz no cenário da IA"[1]. A experiência acumulada será usada para criar LLMs semelhantes para outros idiomas e culturas[1].

Literatura

  • Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
  • Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
  • Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
  • Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
  • Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
  • Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
  • Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
  • Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
  • Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
  • Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.

Notas

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
  2. 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
  3. 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
  4. 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
  5. 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
  6. 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]