Mixtral (Mistral AI) (IT)

From Systems analysis Wiki
Jump to navigation Jump to search

Mixtral 8x7B — è un grande modello linguistico (LLM) open source sviluppato dalla società francese Mistral AI e rilasciato nel dicembre 2023. Il modello è basato sull'architettura Sparse Mixture of Experts (SMoE), che gli consente di combinare prestazioni paragonabili a modelli molto più grandi (ad esempio Llama 2 70B e GPT-3.5) con un'elevata velocità ed efficienza di inferenza[1].

Il modello è distribuito con la licenza libera Apache 2.0, rendendolo disponibile per uso accademico e commerciale. Mixtral 8x7B dimostra forti capacità in compiti multilingue, generazione di codice e seguire istruzioni, il che lo ha reso uno dei modelli aperti più popolari al momento del rilascio[2].

Storia dello sviluppo

La società Mistral AI è stata fondata nell'aprile 2023 da ex ricercatori di Meta e Google. Nel settembre 2023, l'azienda ha rilasciato il suo primo modello, Mistral 7B, che ha ottenuto riconoscimento per l'elevata efficienza a fronte delle ridotte dimensioni.

L'11 dicembre 2023 Mistral AI ha annunciato il rilascio di Mixtral 8x7B, il suo primo modello basato sull'architettura Mixture of Experts. Il modello ha immediatamente attirato l'attenzione della comunità come il più potente LLM aperto dell'epoca, dimostrando una qualità paragonabile a GPT-3.5 con una velocità di inferenza significativamente più elevata. Nel gennaio 2024 è stata pubblicata una descrizione tecnica dettagliata del modello sotto forma di articolo scientifico su arXiv, consentendo ai ricercatori indipendenti di prendere visione dei dettagli dell'architettura e dei risultati dei test[2].

Architettura: Sparse Mixture of Experts (SMoE)

La principale novità di Mixtral 8x7B è l'introduzione dell'architettura Sparse Mixture of Experts. A differenza dei transformer standard («densi»), in cui ogni livello esegue lo stesso calcolo per tutti i token, in Mixtral ogni livello contiene diversi blocchi paralleli detti «esperti».

Caratteristiche principali dell'architettura:

  • Struttura MoE: Ogni livello transformer contiene 8 blocchi feed-forward («esperti»). Per elaborare ciascun token, una speciale rete router seleziona i 2 esperti più appropriati (Top-2 routing).
  • Parametri: Il numero totale di parametri del modello è di 46,7 miliardi, tuttavia grazie all'attivazione sparsa, per ogni token durante l'inferenza vengono utilizzati solo 12,9 miliardi di parametri attivi. Ciò garantisce una velocità di inferenza paragonabile a quella dei modelli con ~13 miliardi di parametri.
  • Ottimizzazione dell'attenzione: Il modello utilizza tecniche moderne per l'elaborazione efficiente di sequenze lunghe, tra cui Sliding Window Attention (SWA) e Grouped Query Attention (GQA).
  • Lunghezza del contesto: Il modello supporta una finestra contestuale fino a 32.768 token.

Addestramento

La famiglia Mixtral 8x7B comprende due versioni principali:

  1. Mixtral-8x7B-v0.1 (modello base): Modello pre-addestrato su un ampio corpus di dati web in diverse lingue europee (inglese, francese, tedesco, spagnolo, italiano). Il compito principale è la previsione del token successivo.
  2. Mixtral-8x7B-Instruct-v0.1 (modello istruttivo): Versione affinata tramite supervised fine-tuning (SFT) e Direct Preference Optimization (DPO). Questo modello segue meglio le istruzioni dell'utente ed è progettato per l'uso in formato dialogico.

Prestazioni

Mixtral 8x7B supera o è paragonabile per qualità al modello Llama 2 70B sulla maggior parte dei benchmark standard, avendo al contempo 5 volte meno parametri attivi e, di conseguenza, una velocità di inferenza significativamente più elevata (fino a 6 volte più veloce)[2].

Confronto delle prestazioni di Mixtral 8x7B con Llama 2 70B e GPT-3.5[2]
Metrica Llama 2 70B GPT-3.5 Mixtral 8x7B
MMLU (conoscenze generali) 69,9% 70,0% 70,6%
GSM-8K (matematica) 53,6% 57,1% 58,4%
MBPP (generazione di codice) 49,8% 52,2% 60,7%
MT-Bench (valutazione del dialogo, versioni Instruct) 6,86 8,32 8,30
  • Multilingualità: Grazie alla maggiore quota di dati multilingue nel corpus di addestramento, Mixtral supera significativamente Llama 2 70B nei compiti in francese, tedesco, spagnolo e italiano.
  • Bias e allucinazioni: Rispetto a Llama 2 70B, il modello dimostra una maggiore precisione sul benchmark BBQ (valutazione dei pregiudizi sociali) e un profilo di sentiment più positivo sul benchmark BOLD.

Licenza e disponibilità

Entrambe le versioni di Mixtral 8x7B (base e Instruct) sono rilasciate con licenza Apache 2.0, che consente il libero utilizzo accademico e commerciale. Il codice sorgente e i pesi dei modelli sono disponibili su GitHub e Hugging Face.

Riferimenti

  • Mixtral of Experts — annuncio ufficiale sul blog di Mistral AI
  • Modello Mixtral 8x7B su Hugging Face

Bibliografia

  • Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.

Note

  1. «Mixtral of Experts». Mistral AI Blog. 11 Dec 2023. [1]
  2. 2.0 2.1 2.2 2.3 Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». arXiv:2401.04088. [2]