Jais (modelo de linguagem)
Jais (pronuncia-se "Jais") é uma família de grandes modelos de linguagem (LLM) de código aberto, desenvolvida nos Emirados Árabes Unidos e especialmente otimizada para o idioma árabe[1]. O nome do modelo é uma homenagem à montanha Jebel Jais — o pico mais alto dos Emirados Árabes Unidos[2].
O projeto foi criado em uma colaboração entre a empresa de pesquisa Inception (uma subsidiária do conglomerado de tecnologia G42), a Universidade de Inteligência Artificial Mohamed bin Zayed (MBZUAI) e a empresa californiana de chips de IA Cerebras Systems[2]. Jais foi lançado publicamente sob uma licença de código aberto, com o objetivo de estimular o desenvolvimento de um ecossistema de IA para o idioma árabe, preservando o patrimônio cultural e linguístico e tornando as tecnologias modernas de IA mais acessíveis para o mundo de língua árabe[1].
História do desenvolvimento e lançamentos
O projeto Jais foi iniciado em 2023 em resposta às limitações dos LLMs existentes para idiomas com poucos recursos. Os desenvolvedores notaram a escassez de modelos bilíngues de alta qualidade capazes de processar tanto o árabe quanto o inglês com a mesma proficiência[2].
Jais-13B: Primeira versão
A primeira versão, Jais-13B, foi lançada em 30 de agosto de 2023 e continha 13 bilhões de parâmetros[1]. O modelo foi treinado em um corpus misto de textos em inglês e árabe com um total de 395 bilhões de tokens[3]. Na época de seu lançamento, foi considerado o "LLM em árabe de mais alta qualidade"[1].
Jais-30B: Aumento de escala
Em 8 de novembro de 2023, menos de três meses depois, o consórcio apresentou uma segunda versão significativamente aprimorada — o Jais-30B com 30 bilhões de parâmetros[4]. O aumento de escala foi motivado pela necessidade de resolver tarefas aplicadas mais complexas, como sumarização e tradução. O modelo foi treinado em um conjunto de dados expandido e limpo de 1,63 trilhão de tokens[4].
Jais-70B e a família de modelos
Em 6 de agosto de 2024, a Inception (G42) anunciou o lançamento do modelo principal Jais-70B (70 bilhões de parâmetros) e de uma família inteira de modelos relacionados[5]. O Jais-70B tornou-se o maior LLM de código aberto focado no idioma árabe. Em seu desenvolvimento, foi aplicado o método de treinamento contínuo (continuous training): em vez de treinar do zero, o modelo Llama 2 70B da Meta foi usado como base e continuou sendo treinado com 330 bilhões de tokens em árabe. Isso permitiu transferir eficientemente o conhecimento do idioma inglês do Llama 2 e concentrar os recursos no treinamento do árabe[5].
Arquitetura e características técnicas
Jais pertence à categoria de modelos transformer autorregressivos baseados na arquitetura GPT-3 (decoder-only). A principal característica do modelo é sua especialização bilíngue em árabe e inglês, diferentemente de muitos LLMs multilíngues nos quais o inglês prevalece. Isso permite alcançar uma alta profundidade de compreensão do idioma árabe e de seus dialetos[3].
Na criação do Jais, foram integradas soluções técnicas avançadas[3]:
- Posicionamento ALiBi: Um esquema especial de embeddings posicionais que permite ao modelo processar contextos mais longos do que aqueles em que foi treinado.
- Ativação SwiGLU: Uma função de ativação que melhora a qualidade do treinamento e a expressividade das camadas neurais.
- Maximal Update Parametrization (µP): Uma metodologia para ajustar hiperparâmetros que estabiliza o treinamento à medida que o tamanho do modelo aumenta.
- Tokenizador especializado: Desenvolvido levando em conta as particularidades dos idiomas árabe e inglês, o que reduz o número de tokens para textos em árabe em 3 a 4 vezes em comparação com tokenizadores universais e aumenta a velocidade de processamento[6].
Além dos modelos de base (foundation models), foi lançada uma versão Jais-chat, que passou por um treinamento adicional com 9,6 milhões de pares de perguntas e respostas para ser adaptada a tarefas de chatbot e assistente[3].
Treinamento e conjunto de dados
Uma das principais tarefas do projeto foi preparar um corpus de textos em árabe de alta qualidade e em grande escala. O conjunto de dados de treinamento final para o Jais-13B totalizou 395 bilhões de tokens, dos quais:
- 116 bilhões de tokens (29%) — texto em árabe.
- 279 bilhões de tokens (71%) — texto em inglês e código de programação.
O componente árabe foi intencionalmente significativo (cerca de 30%) para garantir uma alta proficiência no idioma[3]. Os dados incluíam livros, artigos de notícias, páginas da web e código-fonte. Para aumentar o volume de textos árabes de qualidade, foi utilizada a tradução automática de recursos em inglês[3].
O treinamento dos modelos foi realizado no supercomputador Condor Galaxy 1 (CG-1) em Abu Dhabi, desenvolvido em conjunto pela G42 e pela Cerebras Systems. Graças a essa infraestrutura, o treinamento do Jais-13B levou apenas cerca de 3,5 dias de tempo de computação puro[2].
Aplicação e importância
Jais é posicionado como um passo fundamental no desenvolvimento de IA generativa para o idioma árabe e outras comunidades linguísticas sub-representadas nos LLMs modernos. O acesso aberto ao modelo visa estimular a adoção de tecnologias de processamento de linguagem natural nas regiões do Oriente Médio e Norte da África.
Desde o seu lançamento, o projeto atraiu o interesse de entidades governamentais e comerciais dos Emirados Árabes Unidos. Acesso antecipado ao modelo foi concedido ao Ministério das Relações Exteriores dos EAU, à companhia de petróleo e gás ADNOC, à companhia aérea Etihad Airways e ao banco First Abu Dhabi Bank[1]. Em 2024, a Microsoft anunciou a integração do Jais em sua plataforma de nuvem Microsoft Azure, tornando-o disponível para usuários globais[6].
Os criadores do Jais destacam seu papel na preservação do patrimônio cultural e linguístico árabe. Segundo Andrew Jackson, diretor executivo da Inception, o projeto visa "garantir que o idioma árabe, com sua rica herança, encontre sua voz no cenário da IA"[1]. A experiência acumulada será usada para criar LLMs semelhantes para outros idiomas e culturas[1].
Literatura
- Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
- Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
- Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
- Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
- Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
- Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
- Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
- Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.
Notas
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
- ↑ 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
- ↑ 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
- ↑ 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
- ↑ 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]