---
title: "Mixtral (Mistral AI) (TL)"
source: "https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TL)"
wiki: "systems-analysis.info/int"
article: "Mixtral_(Mistral_AI)_(TL)"
language: "tl"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Tagalog"
revision_id: 4439
wiki_created_at: 2026-09-06T23:35:11Z
wiki_modified_at: 2026-09-06T23:35:11Z
downloaded_at: 2026-09-07T23:02:39Z
---

# Mixtral (Mistral AI) (TL)

**Mixtral 8x7B** — ito ay isang malaking language model (LLM) na may bukas na source code, na binuo ng French na kumpanyang Mistral AI at inilabas noong Disyembre 2023. Ang modelo ay batay sa arkitektura ng **Sparse Mixture of Experts (SMoE)**, na nagbibigay-daan sa kanya na pagsamahin ang pagganap na maihahambing sa mas malalaking modelo (halimbawa, Llama 2 70B at GPT-3.5), na may mataas na bilis at kahusayan ng inference<sup>[\[1\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TL)#cite_note-mistral_blog-1)</sup>.

Ang modelo ay ipinamamahagi sa ilalim ng libreng lisensyang Apache 2.0, na ginagawa itong available para sa akademiko at komersyal na paggamit. Ang Mixtral 8x7B ay nagpapakita ng malakas na kakayahan sa mga multilingual na gawain, pagbuo ng code, at pagsunod sa mga instruksyon, na ginawa itong isa sa mga pinakasikat na bukas na modelo sa oras ng paglabas<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TL)#cite_note-arxiv_paper-2)</sup>.

## Kasaysayan ng Pag-unlad

Ang kumpanyang Mistral AI ay itinatag noong Abril 2023 ng mga dating mananaliksik mula sa Meta at Google. Noong Setyembre 2023, inilabas ng kumpanya ang kanyang unang modelo, ang **Mistral 7B**, na nakatanggap ng pagkilala para sa mataas na kahusayan sa maliit na sukat.

**Ika-11 ng Disyembre 2023** inihayag ng Mistral AI ang paglabas ng **Mixtral 8x7B**, ang kanyang unang modelo batay sa arkitektura ng mixture of experts. Agad na nakuha ng modelo ang atensyon ng komunidad bilang pinaka-makapangyarihang bukas na LLM sa panahong iyon, na nagpapakita ng kalidad sa antas ng GPT-3.5 na may makabuluhang mas mataas na bilis ng inference. Noong Enero 2024, isang detalyadong teknikal na paglalarawan ng modelo ay nailathala sa anyo ng siyentipikong artikulo sa arXiv, na nagpapahintulot sa mga independyenteng mananaliksik na pag-aralan ang mga detalye ng arkitektura at mga resulta ng pagsubok<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TL)#cite_note-arxiv_paper-2)</sup>.

## Arkitektura: Sparse Mixture of Experts - Bihirang Halo ng mga Eksperto (SMoE)

Ang pangunahing inobasyon ng Mixtral 8x7B ay ang pagpapakilala ng arkitektura ng **Sparse Mixture of Experts**. Hindi tulad ng mga karaniwang ("siksik") transformer, kung saan ang bawat layer ay nagsasagawa ng parehong pagkalkula para sa lahat ng token, sa Mixtral ang bawat layer ay naglalaman ng ilang parallel na bloke-\\eksperto\\.

Mga pangunahing katangian ng arkitektura:

- **Istraktura ng MoE**: Ang bawat transformer layer ay naglalaman ng **8** feed-forward na bloke ("mga eksperto"). Para sa pagproseso ng bawat token, isang espesyal na *router network* ang pumipili ng **2** pinaka-angkop na eksperto (*Top-2 routing*).
- **Mga Parameter**: Ang kabuuang bilang ng mga parameter ng modelo ay **46.7 bilyon**, ngunit dahil sa sparse na aktibrasyon, para sa bawat token sa proseso ng pagpapalabas ay ginagamit lamang ang **12.9 bilyon** na aktibong parameter. Nagbibigay ito ng bilis ng inference na maihahambing sa mga modelo na may ~13 bilyong parameter.
- **Pag-optimize ng Attention**: Gumagamit ang modelo ng mga modernong teknik para sa mahusay na pagproseso ng mahabang sequence, kabilang ang **Sliding Window Attention (SWA)** at **Grouped Query Attention (GQA)**.
- **Haba ng Konteksto**: Sinusuportahan ng modelo ang isang context window na may haba na hanggang **32,768 token**.

## Pagsasanay

Ang pamilya ng Mixtral 8x7B ay kinabibilangan ng dalawang pangunahing bersyon: 1. **Mixtral-8x7B-v0.1** (base model): Isang pre-trained na modelo, na sinanay sa malaking corpus ng web data sa ilang European na wika (Ingles, Pranses, Aleman, Espanyol, Italyano). Ang pangunahing gawain ay ang hula ng susunod na token. 2. **Mixtral-8x7B-Instruct-v0.1** (instructional model): Isang bersyon na na-fine-tune gamit ang *supervised fine-tuning (SFT)* at *Direct Preference Optimization (DPO)*. Mas mahusay na sinusunod ng modelong ito ang mga instruksyon ng gumagamit at inilaan para gamitin sa format ng diyalogo.

## Pagganap

Ang Mixtral 8x7B ay nalampasan o maihahambing sa kalidad ng modelo ng Llama 2 70B sa karamihan ng mga karaniwang benchmark, na may 5 beses na mas kaunting aktibong parameter at, bilang resulta, makabuluhang mas mataas na bilis ng pagpapalabas (hanggang 6 beses na mas mabilis)<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TL)#cite_note-arxiv_paper-2)</sup>.

| Sukatan                                                     | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|-------------------------------------------------------------|-------------|---------|--------------|
| **MMLU** (pangkalahatang kaalaman)                          | 69.9%       | 70.0%   | **70.6%**    |
| **GSM-8K** (matematika)                                     | 53.6%       | 57.1%   | **58.4%**    |
| **MBPP** (pagbuo ng code)                                   | 49.8%       | 52.2%   | **60.7%**    |
| **MT-Bench** (pagtatasa ng diyalogo, mga bersyong Instruct) | 6.86        | 8.32    | **8.30**     |

Paghahambing ng pagganap ng Mixtral 8x7B sa Llama 2 70B at GPT-3.5<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TL)#cite_note-arxiv_paper-2)</sup>

- **Multilingualismo**: Dahil sa tumaas na bahagi ng multilingual na data sa training corpus, ang Mixtral ay makabuluhang nalampasan ang Llama 2 70B sa mga gawain sa Pranses, Aleman, Espanyol, at Italyanong wika.
- **Pagkiling at Mga Halusina**: Kumpara sa Llama 2 70B, ang modelo ay nagpapakita ng mas mataas na katumpakan sa benchmark ng BBQ (pagtatasa ng mga panlipunang pagkiling) at mas positibong profile ng damdamin sa benchmark ng BOLD.

## Paglilisensya at Availability

Ang parehong bersyon ng Mixtral 8x7B (base at Instruct) ay inilabas sa ilalim ng lisensyang Apache 2.0, na nagpapahintulot ng libreng akademiko at komersyal na paggamit. Ang source code at mga timbang ng modelo ay available sa GitHub at Hugging Face.

## Mga Link

- Mixtral of Experts — opisyal na anunsyo sa blog ng Mistral AI
- Ang modelong Mixtral 8x7B sa Hugging Face

## Panitikan

- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). *Mixtral of Experts*. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). *Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer*. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. arXiv:2004.05150.
- Dao, T.; et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. arXiv:2205.14135.
- Cai, W.; et al. (2025). *A Survey on Mixture of Experts in Large Language Models*. arXiv:2407.06204.
- Yun, L.; et al. (2024). *Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models*. arXiv:2404.02852.
- Huang, B.; et al. (2024). *Toward Efficient Inference for Mixture of Experts*. OpenReview: stXtBqyTWX.

## Mga Tala

1.  <span id="cite_note-mistral_blog-1">[↑](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TL)#cite_ref-mistral_blog_1-0) «Mixtral of Experts». *Mistral AI Blog*. 11 Dec 2023. <a href="https://mistral.ai/news/mixtral-of-experts" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv_paper-2">↑ <sup>[2.0](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TL)#cite_ref-arxiv_paper_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TL)#cite_ref-arxiv_paper_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TL)#cite_ref-arxiv_paper_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TL)#cite_ref-arxiv_paper_2-3)</sup> Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». *arXiv:2401.04088*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[2]</a></span>
