Mixtral (Mistral AI) (PT)

From Systems analysis Wiki
Jump to navigation Jump to search

Mixtral 8x7B é um grande modelo de linguagem (LLM) de código aberto, desenvolvido pela empresa francesa Mistral AI e lançado em dezembro de 2023. O modelo é baseado na arquitetura de mistura esparsa de especialistas (Sparse Mixture of Experts, SMoE), o que lhe permite combinar um desempenho comparável ao de modelos muito maiores (como Llama 2 70B e GPT-3.5) com alta velocidade e eficiência de inferência[1].

O modelo é distribuído sob a licença livre Apache 2.0, o que o torna acessível para uso acadêmico и comercial. O Mixtral 8x7B demonstra fortes capacidades em tarefas multilíngues, geração de código e seguimento de instruções, o que o tornou um dos modelos abertos mais populares na época de seu lançamento[2].

Histórico de desenvolvimento

A empresa Mistral AI foi fundada em abril de 2023 por ex-pesquisadores da Meta e do Google. Em setembro de 2023, a empresa lançou seu primeiro modelo, o Mistral 7B, que ganhou reconhecimento por sua alta eficiência em um tamanho reduzido.

Em 11 de dezembro de 2023, a Mistral AI anunciou o lançamento do Mixtral 8x7B, seu primeiro modelo baseado na arquitetura de mistura de especialistas. O modelo imediatamente atraiu a atenção da comunidade como o LLM aberto mais poderoso da época, demonstrando qualidade no nível do GPT-3.5 com uma velocidade de inferência significativamente maior. Em janeiro de 2024, uma descrição técnica detalhada do modelo foi publicada como um artigo científico no arXiv, permitindo que pesquisadores independentes examinassem os detalhes da arquitetura e os resultados dos testes[2].

Arquitetura: Mistura Esparsa de Especialistas (SMoE)

A principal inovação do Mixtral 8x7B é a implementação da arquitetura Sparse Mixture of Experts. Diferentemente dos transformadores padrão ("densos"), onde cada camada realiza o mesmo cálculo para todos os tokens, no Mixtral cada camada contém vários blocos paralelos de "especialistas".

Principais características da arquitetura:

  • Estrutura MoE: Cada camada do transformador contém 8 blocos feed-forward ("especialistas"). Para processar cada token, uma rede roteadora especial seleciona os 2 especialistas mais adequados (Top-2 routing).
  • Parâmetros: O número total de parâmetros do modelo é de 46,7 bilhões, mas, devido à ativação esparsa, apenas 12,9 bilhões de parâmetros ativos são utilizados para cada token durante a inferência. Isso proporciona uma velocidade de inferência comparável à de modelos com aproximadamente 13 bilhões de parâmetros.
  • Otimização da atenção: O modelo utiliza técnicas modernas para o processamento eficiente de sequências longas, incluindo Sliding Window Attention (SWA) e Grouped Query Attention (GQA).
  • Comprimento do contexto: O modelo suporta uma janela de contexto de até 32.768 tokens.

Treinamento

A família Mixtral 8x7B inclui duas versões principais: 1. Mixtral-8x7B-v0.1 (modelo base): Um modelo pré-treinado em um grande corpus de dados da web em vários idiomas europeus (inglês, francês, alemão, espanhol, italiano). Sua tarefa principal é a previsão do próximo token. 2. Mixtral-8x7B-Instruct-v0.1 (modelo de instrução): Uma versão ajustada (fine-tuned) com supervised fine-tuning (SFT) e Direct Preference Optimization (DPO). Este modelo segue melhor as instruções do usuário e é projetado para uso em formato de diálogo.

Desempenho

O Mixtral 8x7B supera ou é comparável em qualidade ao modelo Llama 2 70B na maioria dos benchmarks padrão, tendo 5 vezes menos parâmetros ativos e, como resultado, uma velocidade de inferência significativamente maior (até 6 vezes mais rápida)[2].

Comparação de desempenho do Mixtral 8x7B com o Llama 2 70B e o GPT-3.5[2]
Métrica Llama 2 70B GPT-3.5 Mixtral 8x7B
MMLU (conhecimentos gerais) 69,9% 70,0% 70,6%
GSM-8K (matemática) 53,6% 57,1% 58,4%
MBPP (geração de código) 49,8% 52,2% 60,7%
MT-Bench (avaliação de diálogo, versões Instruct) 6,86 8,32 8,30
  • Multilinguismo: Graças à maior proporção de dados multilíngues no corpus de treinamento, o Mixtral supera significativamente o Llama 2 70B em tarefas em francês, alemão, espanhol e italiano.
  • Vieses e alucinações: Em comparação com o Llama 2 70B, o modelo demonstra maior precisão no benchmark BBQ (avaliação de vieses sociais) e um perfil de sentimento mais positivo no benchmark BOLD.

Licenciamento e disponibilidade

Ambas as versões do Mixtral 8x7B (base e Instruct) são lançadas sob a licença Apache 2.0, que permite o uso livre para fins acadêmicos e comerciais. Os códigos-fonte e os pesos dos modelos estão disponíveis no GitHub e no Hugging Face.

Ligações externas

Literatura

  • Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.

Notas

  1. «Mixtral of Experts». Mistral AI Blog. 11 Dec 2023. [1]
  2. 2.0 2.1 2.2 2.3 Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». arXiv:2401.04088. [2]