---
title: "Mixtral (Mistral AI) (IT)"
source: "https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(IT)"
wiki: "systems-analysis.info/int"
article: "Mixtral_(Mistral_AI)_(IT)"
language: "it"
categories:
  - "Category:Italian"
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
revision_id: 4431
wiki_created_at: 2026-09-06T23:35:04Z
wiki_modified_at: 2026-09-06T23:35:04Z
downloaded_at: 2026-09-07T23:02:37Z
---

# Mixtral (Mistral AI) (IT)

**Mixtral 8x7B** — è un grande modello linguistico (LLM) open source sviluppato dalla società francese Mistral AI e rilasciato nel dicembre 2023. Il modello è basato sull'architettura **Sparse Mixture of Experts (SMoE)**, che gli consente di combinare prestazioni paragonabili a modelli molto più grandi (ad esempio Llama 2 70B e GPT-3.5) con un'elevata velocità ed efficienza di inferenza<sup>[\[1\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(IT)#cite_note-mistral_blog-1)</sup>.

Il modello è distribuito con la licenza libera Apache 2.0, rendendolo disponibile per uso accademico e commerciale. Mixtral 8x7B dimostra forti capacità in compiti multilingue, generazione di codice e seguire istruzioni, il che lo ha reso uno dei modelli aperti più popolari al momento del rilascio<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(IT)#cite_note-arxiv_paper-2)</sup>.

## Storia dello sviluppo

La società Mistral AI è stata fondata nell'aprile 2023 da ex ricercatori di Meta e Google. Nel settembre 2023, l'azienda ha rilasciato il suo primo modello, **Mistral 7B**, che ha ottenuto riconoscimento per l'elevata efficienza a fronte delle ridotte dimensioni.

**L'11 dicembre 2023** Mistral AI ha annunciato il rilascio di **Mixtral 8x7B**, il suo primo modello basato sull'architettura Mixture of Experts. Il modello ha immediatamente attirato l'attenzione della comunità come il più potente LLM aperto dell'epoca, dimostrando una qualità paragonabile a GPT-3.5 con una velocità di inferenza significativamente più elevata. Nel gennaio 2024 è stata pubblicata una descrizione tecnica dettagliata del modello sotto forma di articolo scientifico su arXiv, consentendo ai ricercatori indipendenti di prendere visione dei dettagli dell'architettura e dei risultati dei test<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(IT)#cite_note-arxiv_paper-2)</sup>.

## Architettura: Sparse Mixture of Experts (SMoE)

La principale novità di Mixtral 8x7B è l'introduzione dell'architettura **Sparse Mixture of Experts**. A differenza dei transformer standard («densi»), in cui ogni livello esegue lo stesso calcolo per tutti i token, in Mixtral ogni livello contiene diversi blocchi paralleli detti «esperti».

Caratteristiche principali dell'architettura:

- **Struttura MoE**: Ogni livello transformer contiene **8** blocchi feed-forward («esperti»). Per elaborare ciascun token, una speciale *rete router* seleziona i **2** esperti più appropriati (*Top-2 routing*).
- **Parametri**: Il numero totale di parametri del modello è di **46,7 miliardi**, tuttavia grazie all'attivazione sparsa, per ogni token durante l'inferenza vengono utilizzati solo **12,9 miliardi** di parametri attivi. Ciò garantisce una velocità di inferenza paragonabile a quella dei modelli con ~13 miliardi di parametri.
- **Ottimizzazione dell'attenzione**: Il modello utilizza tecniche moderne per l'elaborazione efficiente di sequenze lunghe, tra cui **Sliding Window Attention (SWA)** e **Grouped Query Attention (GQA)**.
- **Lunghezza del contesto**: Il modello supporta una finestra contestuale fino a **32.768 token**.

## Addestramento

La famiglia Mixtral 8x7B comprende due versioni principali:

1.  **Mixtral-8x7B-v0.1** (modello base): Modello pre-addestrato su un ampio corpus di dati web in diverse lingue europee (inglese, francese, tedesco, spagnolo, italiano). Il compito principale è la previsione del token successivo.
2.  **Mixtral-8x7B-Instruct-v0.1** (modello istruttivo): Versione affinata tramite *supervised fine-tuning (SFT)* e *Direct Preference Optimization (DPO)*. Questo modello segue meglio le istruzioni dell'utente ed è progettato per l'uso in formato dialogico.

## Prestazioni

Mixtral 8x7B supera o è paragonabile per qualità al modello Llama 2 70B sulla maggior parte dei benchmark standard, avendo al contempo 5 volte meno parametri attivi e, di conseguenza, una velocità di inferenza significativamente più elevata (fino a 6 volte più veloce)<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(IT)#cite_note-arxiv_paper-2)</sup>.

| Metrica                                                   | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|-----------------------------------------------------------|-------------|---------|--------------|
| **MMLU** (conoscenze generali)                            | 69,9%       | 70,0%   | **70,6%**    |
| **GSM-8K** (matematica)                                   | 53,6%       | 57,1%   | **58,4%**    |
| **MBPP** (generazione di codice)                          | 49,8%       | 52,2%   | **60,7%**    |
| **MT-Bench** (valutazione del dialogo, versioni Instruct) | 6,86        | 8,32    | **8,30**     |

Confronto delle prestazioni di Mixtral 8x7B con Llama 2 70B e GPT-3.5<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(IT)#cite_note-arxiv_paper-2)</sup>

- **Multilingualità**: Grazie alla maggiore quota di dati multilingue nel corpus di addestramento, Mixtral supera significativamente Llama 2 70B nei compiti in francese, tedesco, spagnolo e italiano.
- **Bias e allucinazioni**: Rispetto a Llama 2 70B, il modello dimostra una maggiore precisione sul benchmark BBQ (valutazione dei pregiudizi sociali) e un profilo di sentiment più positivo sul benchmark BOLD.

## Licenza e disponibilità

Entrambe le versioni di Mixtral 8x7B (base e Instruct) sono rilasciate con licenza Apache 2.0, che consente il libero utilizzo accademico e commerciale. Il codice sorgente e i pesi dei modelli sono disponibili su GitHub e Hugging Face.

## Riferimenti

- Mixtral of Experts — annuncio ufficiale sul blog di Mistral AI
- Modello Mixtral 8x7B su Hugging Face

## Bibliografia

- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). *Mixtral of Experts*. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). *Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer*. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. arXiv:2004.05150.
- Dao, T.; et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. arXiv:2205.14135.
- Cai, W.; et al. (2025). *A Survey on Mixture of Experts in Large Language Models*. arXiv:2407.06204.
- Yun, L.; et al. (2024). *Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models*. arXiv:2404.02852.
- Huang, B.; et al. (2024). *Toward Efficient Inference for Mixture of Experts*. OpenReview: stXtBqyTWX.

## Note

1.  <span id="cite_note-mistral_blog-1">[↑](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(IT)#cite_ref-mistral_blog_1-0) «Mixtral of Experts». *Mistral AI Blog*. 11 Dec 2023. <a href="https://mistral.ai/news/mixtral-of-experts" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv_paper-2">↑ <sup>[2.0](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(IT)#cite_ref-arxiv_paper_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(IT)#cite_ref-arxiv_paper_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(IT)#cite_ref-arxiv_paper_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(IT)#cite_ref-arxiv_paper_2-3)</sup> Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». *arXiv:2401.04088*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[2]</a></span>
