---
title: "Mixtral (Mistral AI) (TH)"
source: "https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TH)"
wiki: "systems-analysis.info/int"
article: "Mixtral_(Mistral_AI)_(TH)"
language: "th"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Thai"
revision_id: 4438
wiki_created_at: 2026-09-06T23:35:10Z
wiki_modified_at: 2026-09-06T23:35:10Z
downloaded_at: 2026-09-07T23:02:39Z
---

# Mixtral (Mistral AI) (TH)

**Mixtral 8x7B** — คือโมเดลภาษาขนาดใหญ่ (LLM) แบบโอเพนซอร์ส พัฒนาโดยบริษัทสัญชาติฝรั่งเศส Mistral AI และเปิดตัวในเดือนธันวาคม ค.ศ. 2023 โมเดลนี้อิงบนสถาปัตยกรรม **Sparse Mixture of Experts (SMoE)** ซึ่งทำให้สามารถผสานประสิทธิภาพที่ทัดเทียมกับโมเดลขนาดใหญ่กว่ามาก (เช่น Llama 2 70B และ GPT-3.5) เข้ากับความเร็วและประสิทธิภาพในการอนุมานที่สูง<sup>[\[1\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TH)#cite_note-mistral_blog-1)</sup>

โมเดลนี้เผยแพร่ภายใต้ใบอนุญาต Apache 2.0 แบบเสรี ทำให้สามารถนำไปใช้งานทั้งในเชิงวิชาการและเชิงพาณิชย์ Mixtral 8x7B แสดงความสามารถที่โดดเด่นในงานหลายภาษา การสร้างโค้ด และการปฏิบัติตามคำสั่ง ซึ่งทำให้กลายเป็นหนึ่งในโมเดลโอเพนซอร์สที่ได้รับความนิยมมากที่สุดในช่วงเวลาที่เปิดตัว<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TH)#cite_note-arxiv_paper-2)</sup>

## ประวัติการพัฒนา

บริษัท Mistral AI ก่อตั้งขึ้นในเดือนเมษายน ค.ศ. 2023 โดยอดีตนักวิจัยจาก Meta และ Google ในเดือนกันยายน ค.ศ. 2023 บริษัทได้เปิดตัวโมเดลแรก คือ **Mistral 7B** ซึ่งได้รับการยอมรับในด้านประสิทธิภาพสูงแม้จะมีขนาดเล็ก

**วันที่ 11 ธันวาคม ค.ศ. 2023** Mistral AI ประกาศเปิดตัว **Mixtral 8x7B** ซึ่งเป็นโมเดลแรกที่อิงบนสถาปัตยกรรม Mixture of Experts โมเดลนี้ดึงดูดความสนใจจากชุมชนทันทีในฐานะ LLM โอเพนซอร์สที่ทรงพลังที่สุดในขณะนั้น โดยแสดงคุณภาพระดับ GPT-3.5 พร้อมกับความเร็วในการอนุมานที่สูงกว่าอย่างมีนัยสำคัญ ในเดือนมกราคม ค.ศ. 2024 ได้มีการเผยแพร่รายละเอียดทางเทคนิคของโมเดลในรูปแบบบทความวิชาการบน arXiv ซึ่งช่วยให้นักวิจัยอิสระสามารถศึกษารายละเอียดของสถาปัตยกรรมและผลการทดสอบได้<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TH)#cite_note-arxiv_paper-2)</sup>

## สถาปัตยกรรม: Sparse Mixture of Experts (SMoE)

นวัตกรรมสำคัญของ Mixtral 8x7B คือการนำสถาปัตยกรรม **Sparse Mixture of Experts** มาใช้งาน ต่างจาก transformer มาตรฐาน (แบบ "หนาแน่น") ที่แต่ละชั้นทำการคำนวณแบบเดียวกันสำหรับทุก token ใน Mixtral แต่ละชั้นจะประกอบด้วยบล็อก "ผู้เชี่ยวชาญ" (expert) แบบขนานหลายตัว

คุณลักษณะสำคัญของสถาปัตยกรรม:

- **โครงสร้าง MoE**: แต่ละชั้น transformer ประกอบด้วย feed-forward บล็อก ("ผู้เชี่ยวชาญ") จำนวน **8** ตัว สำหรับการประมวลผลแต่ละ token เครือข่าย *router* พิเศษจะเลือกผู้เชี่ยวชาญที่เหมาะสมที่สุด **2** ตัว (*Top-2 routing*)
- **พารามิเตอร์**: จำนวนพารามิเตอร์รวมทั้งหมดของโมเดลคือ **46.7 พันล้าน** แต่ด้วยการกระตุ้นแบบกระจาย สำหรับแต่ละ token ในกระบวนการอนุมานจะใช้เพียง **12.9 พันล้าน** พารามิเตอร์ที่ใช้งานจริง ทำให้ได้ความเร็วในการอนุมานที่ทัดเทียมกับโมเดลขนาดประมาณ 13 พันล้านพารามิเตอร์
- **การปรับแต่ง attention**: โมเดลใช้เทคนิคทันสมัยสำหรับการประมวลผลลำดับยาวอย่างมีประสิทธิภาพ ได้แก่ **Sliding Window Attention (SWA)** และ **Grouped Query Attention (GQA)**
- **ความยาว context**: โมเดลรองรับหน้าต่าง context ยาวถึง **32,768 token**

## การฝึกอบรม

ตระกูล Mixtral 8x7B ประกอบด้วยสองเวอร์ชันหลัก:

1.  **Mixtral-8x7B-v0.1** (โมเดลพื้นฐาน): โมเดลที่ผ่านการ pre-training บนคลังข้อมูลเว็บขนาดใหญ่ในหลายภาษายุโรป (อังกฤษ ฝรั่งเศส เยอรมัน สเปน อิตาลี) งานหลักคือการทำนาย token ถัดไป
2.  **Mixtral-8x7B-Instruct-v0.1** (โมเดลแบบ instruct): เวอร์ชันที่ผ่านการ fine-tuning เพิ่มเติมด้วย *supervised fine-tuning (SFT)* และ *Direct Preference Optimization (DPO)* โมเดลนี้ปฏิบัติตามคำสั่งของผู้ใช้ได้ดีขึ้นและออกแบบมาสำหรับการใช้งานในรูปแบบบทสนทนา

## ประสิทธิภาพ

Mixtral 8x7B มีประสิทธิภาพเหนือกว่าหรือเทียบเคียงได้กับโมเดล Llama 2 70B ในเกณฑ์มาตรฐาน (benchmark) ส่วนใหญ่ โดยมีพารามิเตอร์ที่ใช้งานจริงน้อยกว่าถึง 5 เท่า และส่งผลให้มีความเร็วในการอนุมานสูงกว่าอย่างมีนัยสำคัญ (เร็วกว่าถึง 6 เท่า)<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TH)#cite_note-arxiv_paper-2)</sup>

| เมตริก                                           | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|-------------------------------------------------|-------------|---------|--------------|
| **MMLU** (ความรู้ทั่วไป)                            | 69.9%       | 70.0%   | **70.6%**    |
| **GSM-8K** (คณิตศาสตร์)                           | 53.6%       | 57.1%   | **58.4%**    |
| **MBPP** (การสร้างโค้ด)                           | 49.8%       | 52.2%   | **60.7%**    |
| **MT-Bench** (การประเมินบทสนทนา เวอร์ชัน Instruct) | 6.86        | 8.32    | **8.30**     |

การเปรียบเทียบประสิทธิภาพของ Mixtral 8x7B กับ Llama 2 70B และ GPT-3.5<sup>[\[2\]](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TH)#cite_note-arxiv_paper-2)</sup>

- **ความสามารถหลายภาษา**: ด้วยสัดส่วนข้อมูลหลายภาษาที่เพิ่มขึ้นในชุดข้อมูลการฝึกอบรม Mixtral มีประสิทธิภาพเหนือกว่า Llama 2 70B อย่างมีนัยสำคัญในงานภาษาฝรั่งเศส เยอรมัน สเปน และอิตาลี
- **ความลำเอียงและภาพหลอน**: เมื่อเปรียบเทียบกับ Llama 2 70B โมเดลแสดงความแม่นยำที่สูงกว่าบน benchmark BBQ (การประเมินอคติทางสังคม) และโปรไฟล์อารมณ์เชิงบวกมากกว่าบน benchmark BOLD

## การอนุญาตสิทธิ์และความพร้อมใช้งาน

ทั้งสองเวอร์ชันของ Mixtral 8x7B (พื้นฐานและ Instruct) เผยแพร่ภายใต้ใบอนุญาต Apache 2.0 ซึ่งอนุญาตให้ใช้งานทั้งในเชิงวิชาการและเชิงพาณิชย์อย่างเสรี ซอร์สโค้ดและน้ำหนักของโมเดลสามารถเข้าถึงได้บน GitHub และ Hugging Face

## ลิงก์

- Mixtral of Experts — ประกาศอย่างเป็นทางการบนบล็อกของ Mistral AI
- โมเดล Mixtral 8x7B บน Hugging Face

## เอกสารอ้างอิง

- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). *Mixtral of Experts*. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). *Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer*. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). *GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding*. arXiv:2006.16668.
- Fedus, W.; et al. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. arXiv:2004.05150.
- Dao, T.; et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. arXiv:2205.14135.
- Cai, W.; et al. (2025). *A Survey on Mixture of Experts in Large Language Models*. arXiv:2407.06204.
- Yun, L.; et al. (2024). *Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models*. arXiv:2404.02852.
- Huang, B.; et al. (2024). *Toward Efficient Inference for Mixture of Experts*. OpenReview: stXtBqyTWX.

## หมายเหตุ

1.  <span id="cite_note-mistral_blog-1">[↑](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TH)#cite_ref-mistral_blog_1-0) «Mixtral of Experts». *Mistral AI Blog*. 11 Dec 2023. <a href="https://mistral.ai/news/mixtral-of-experts" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv_paper-2">↑ <sup>[2.0](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TH)#cite_ref-arxiv_paper_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TH)#cite_ref-arxiv_paper_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TH)#cite_ref-arxiv_paper_2-2)</sup> <sup>[2.3](https://systems-analysis.info/int/Mixtral_(Mistral_AI)_(TH)#cite_ref-arxiv_paper_2-3)</sup> Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». *arXiv:2401.04088*. <a href="https://arxiv.org/abs/2401.04088" class="external autonumber" rel="nofollow">[2]</a></span>
