---
title: "Mistral AI (TH)"
source: "https://systems-analysis.info/int/Mistral_AI_(TH)"
wiki: "systems-analysis.info/int"
article: "Mistral_AI_(TH)"
language: "th"
categories:
  - "Category:Large language models"
  - "Category:LLM families"
  - "Category:Machine learning"
  - "Category:Thai"
revision_id: 4411
wiki_created_at: 2026-09-06T23:34:47Z
wiki_modified_at: 2026-09-06T23:34:47Z
downloaded_at: 2026-09-07T23:02:31Z
---

# Mistral AI (TH)

**Mistral AI** — บริษัทฝรั่งเศสด้านปัญญาประดิษฐ์ที่เชี่ยวชาญในการพัฒนาโมเดลภาษาขนาดใหญ่ (LLM) ก่อตั้งขึ้นในเดือนเมษายน ค.ศ. 2023 บริษัทได้กลายเป็นหนึ่งในผู้เล่นสำคัญในตลาดยุโรปและตลาดโลกอย่างรวดเร็ว โดยวางตำแหน่งตัวเองเป็นทางเลือกแทนโมเดลแบบปิด (proprietary) จากบริษัทเทคโนโลยียักษ์ใหญ่ของอเมริกา

จุดเด่นสำคัญของแนวทาง Mistral AI คือการมุ่งเน้นสร้างโมเดลประสิทธิภาพสูงที่เปิดเผยน้ำหนัก (open-weight) (ส่วนใหญ่ภายใต้ลิขสิทธิ์ Apache 2.0) ซึ่งช่วยส่งเสริมการเข้าถึงเทคโนโลยี AI ขั้นสูงอย่างเท่าเทียม บริษัทเป็นที่รู้จักในด้านนวัตกรรมทางสถาปัตยกรรม ได้แก่ **Grouped-Query Attention (GQA)**, **Sliding Window Attention (SWA)** และ **Sparse Mixture-of-Experts (MoE)** ซึ่งช่วยให้โมเดลบรรลุประสิทธิภาพสูงในขนาดและค่าใช้จ่ายในการคำนวณที่ค่อนข้างต่ำ

## ประวัติ

บริษัท Mistral AI ก่อตั้งขึ้นในกรุงปารีสเมื่อเดือนเมษายน ค.ศ. 2023 โดยนักวิจัยชาวฝรั่งเศสสามคน ได้แก่ **อาร์ทูร์ มองช์** (Arthur Mensch), **กีโยม ล็องปล์** (Guillaume Lample) และ **ติโมเต ลาครัว** (Timothée Lacroix) ผู้ก่อตั้งทั้งสามคนเคยทำงานด้านโมเดลภาษาขนาดใหญ่ในบริษัทชั้นนำระดับโลกมาก่อน โดย Mensch เป็นนักวิจัยที่ Google DeepMind ส่วน Lample และ Lacroix ทำงานด้าน LLM ที่ Meta AI

พันธกิจของบริษัทคือทำให้ความก้าวหน้าของ AI เข้าถึงได้สำหรับทุกคน โดยส่งเสริมความเปิดกว้าง ความร่วมมือ และความโปร่งใส แนวทางนี้ช่วยให้ Mistral AI ดึงดูดเงินลงทุนจำนวนมากได้อย่างรวดเร็ว:

- **มิถุนายน 2023:** €105 ล้าน ในรอบ seed ซึ่งสร้างสถิติใหม่สำหรับยุโรป
- **ธันวาคม 2023:** €385 ล้าน ในรอบ Series A หลังจากนั้นมูลค่าบริษัทเกิน \$2 พันล้าน และได้รับสถานะ "ยูนิคอร์น"
- **กุมภาพันธ์ 2024:** ประกาศความร่วมมือเชิงกลยุทธ์กับ Microsoft ซึ่งรวมถึงการลงทุนมูลค่า \$16 ล้าน และการนำโมเดล Mistral ไปใช้บน cloud Azure
- **มิถุนายน 2024:** รอบการระดมทุนใหม่มูลค่า €600 ล้าน ส่งผลให้มูลค่าบริษัทอยู่ที่ ~€5.8 พันล้าน ทำให้เป็นหนึ่งในสตาร์ทอัพ AI ที่มีมูลค่าสูงที่สุดในโลก

## คุณลักษณะทางเทคนิคของสถาปัตยกรรม

โมเดลของ Mistral AI อยู่บนพื้นฐานสถาปัตยกรรม transformer แต่รวมนวัตกรรมสำคัญหลายอย่างที่มุ่งเพิ่มประสิทธิภาพและลดค่าใช้จ่ายในการคำนวณ

### Transformer ที่ได้รับการปรับปรุง (Mistral 7B)

โมเดลแรกของบริษัท **Mistral 7B** นำเสนอการปรับปรุงสถาปัตยกรรมที่สำคัญสองประการ:

- **Sliding Window Attention (SWA)** (การ attention ด้วยหน้าต่างเลื่อน): แทนที่แต่ละ token จะโต้ตอบกับ token ก่อนหน้าทั้งหมด (ซึ่งมีความซับซ้อนแบบกำลังสอง) SWA จำกัดการ attention ให้อยู่ในหน้าต่างขนาดคงที่ (เช่น 4,096 token) ทำให้สามารถประมวลผลลำดับที่ยาวมาก (ถึง 32,000 token และมากกว่า) ด้วยความซับซ้อนเชิงคำนวณแบบเส้นตรง ซึ่งเร่งความเร็วในการประมวลผลได้อย่างมีนัยสำคัญ
- **Grouped-Query Attention (GQA)** (การ attention แบบจัดกลุ่มตาม query): การปรับปรุงกลไก multi-head attention มาตรฐาน GQA ใช้จำนวน "หัว" สำหรับ keys และ values น้อยกว่า queries (เช่น ในอัตราส่วน 8:1) ซึ่งช่วยลดความต้องการหน่วยความจำและเร่งความเร็วในการสร้างผลลัพธ์ (inference) ได้อย่างมีนัยสำคัญโดยไม่สูญเสียคุณภาพมากนัก

### Sparse Mixture-of-Experts (MoE)

ในโมเดลซีรีส์ **Mixtral** (เช่น *Mixtral 8x7B*, *Mixtral 8x22B*) ใช้สถาปัตยกรรม **Sparse Mixture-of-Experts** (ส่วนผสมของผู้เชี่ยวชาญแบบกระจาย) แทนที่จะใช้เลเยอร์ neural network แบบหนาแน่นเดียว จะใช้เครือข่ายย่อย "ผู้เชี่ยวชาญ" หลายตัวแบบขนาน สำหรับแต่ละ token ที่รับเข้า เลเยอร์ *gating* พิเศษ (router) จะเลือกชุดผู้เชี่ยวชาญจำนวนน้อยแบบไดนามิกเพื่อเปิดใช้งาน (โดยทั่วไป 2 จาก 8)

วิธีนี้ช่วยให้สร้างโมเดลที่มีจำนวน parameter รวมมหาศาล (Mixtral 8x22B มี 141 พันล้าน parameter) แต่เมื่อประมวลผลแต่ละ token จะใช้เพียงส่วนเล็กน้อย (~39 พันล้าน) ผลลัพธ์คือโมเดลบรรลุคุณภาพที่เทียบได้กับโมเดลแบบ "หนาแน่น" ขนาดใหญ่กว่ามาก แต่มีความเร็วและค่าใช้จ่ายใน inference เทียบเท่าโมเดลขนาดเล็กกว่าอย่างมีนัยสำคัญ

### สถาปัตยกรรม Mamba (SSM)

ในปี ค.ศ. 2024 Mistral AI นำเสนอโมเดลทดลอง **Codestral Mamba** ที่สร้างบนสถาปัตยกรรม **Mamba (Selective State-Space Model)** ต่างจาก transformer ตรงที่ Mamba ใช้กลไก recurrent ที่อิงกับโมเดลปริภูมิสถานะ ข้อดีสำคัญ ได้แก่:

- **ความซับซ้อนเชิงเส้นตรง** ตามความยาวของลำดับ ทำให้เร็วอย่างยิ่งในบริบทที่ยาว
- **บริบท "อนันต์" ในทางทฤษฎี** ที่จำกัดเพียงหน่วยความจำที่มีอยู่เท่านั้น
- **ความเร็ว inference สูง** เมื่อเทียบกับ transformer ที่เทียบเท่ากัน

## ลำดับเวลาและโมเดล

<table class="wikitable mw-collapsible">
<caption>การเปิดตัวโมเดลหลักของ Mistral AI</caption>
<colgroup>
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
<col style="width: 20%" />
</colgroup>
<thead>
<tr class="header">
<th>เดือน / ปี</th>
<th>โมเดล</th>
<th>จำนวน Parameter (พันล้าน)</th>
<th>คุณลักษณะสำคัญ</th>
<th>ลิขสิทธิ์</th>
</tr>
</thead>
<tbody>
<tr class="odd">
<td>09 / 2023</td>
<td><strong>Mistral 7B</strong></td>
<td>7.3</td>
<td>สถาปัตยกรรม GQA + SWA; บริบท 32k; เหนือกว่า Llama 2 13B ในทุก benchmark</td>
<td>Apache 2.0</td>
</tr>
<tr class="even">
<td>12 / 2023</td>
<td><strong>Mixtral 8x7B</strong></td>
<td>46.7 (เปิดใช้งาน 12.9)</td>
<td>โมเดล MoE แบบเปิดรุ่นแรก; คุณภาพระดับ GPT-3.5</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>02 / 2024</td>
<td><strong>Mistral Small / Large</strong></td>
<td>?</td>
<td>โมเดล "รุ่นเล็ก" และ flagship ที่เข้าถึงได้ผ่าน API</td>
<td>Small: Apache 2.0,<br />
Large: Research</td>
</tr>
<tr class="even">
<td>04 / 2024</td>
<td><strong>Mixtral 8x22B</strong></td>
<td>141 (เปิดใช้งาน 39)</td>
<td>บริบท 64k; คุณภาพระดับ SOTA ในบรรดาโมเดล open-source ณ เวลาที่เปิดตัว</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>05 / 2024</td>
<td><strong>Codestral 22B</strong></td>
<td>22</td>
<td>โมเดลเฉพาะทางสำหรับการสร้างโค้ด (80+ ภาษา)</td>
<td>Non-Production</td>
</tr>
<tr class="even">
<td>07 / 2024</td>
<td><strong>Mathstral 7B</strong> / <strong>Nemo 12B</strong></td>
<td>7 / 12</td>
<td>โมเดลเฉพาะทางสำหรับคณิตศาสตร์และความสามารถหลายภาษา</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>07 / 2024</td>
<td><strong>Codestral Mamba 7.3B</strong></td>
<td>7.3</td>
<td>โมเดลทดลองสำหรับโค้ดบนสถาปัตยกรรม Mamba; บริบท 256k+</td>
<td>Apache 2.0</td>
</tr>
<tr class="even">
<td>09 / 2024</td>
<td><strong>Pixtral 12B</strong></td>
<td>12</td>
<td>โมเดล multimodal แบบเปิดรุ่นแรก (ข้อความ + รูปภาพ)</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>11 / 2024</td>
<td><strong>Mistral Large 24.11</strong></td>
<td>~100+ (ประมาณการ)</td>
<td>โมเดล flagship ที่อัปเดตแล้วพร้อม reasoning ที่ดีขึ้น</td>
<td>Research</td>
</tr>
<tr class="even">
<td>01 / 2025</td>
<td><strong>Mistral Small 3</strong></td>
<td>24</td>
<td>ปรับให้เหมาะสำหรับ latency ต่ำ (ถึง 150 token/วินาที); คุณภาพระดับโมเดล 70B</td>
<td>Apache 2.0</td>
</tr>
<tr class="odd">
<td>05 / 2025</td>
<td><strong>Mistral Medium 3</strong></td>
<td>?</td>
<td>โมเดล multimodal ระดับ frontier (ข้อความ, รูปภาพ) พร้อมบริบท 128k</td>
<td>Proprietary</td>
</tr>
<tr class="even">
<td>05 / 2025</td>
<td><strong>Devstral 24B</strong></td>
<td>24</td>
<td>โมเดล "agentive" สำหรับการพัฒนาซอฟต์แวร์แบบอัตโนมัติ; 46.8% บน SWE-Bench</td>
<td>Apache 2.0</td>
</tr>
</tbody>
</table>

การเปิดตัวโมเดลหลักของ Mistral AI

## การเปรียบเทียบกับคู่แข่ง

- **เทียบกับ Llama (Meta):** โมเดล Mistral มีประสิทธิภาพเหนือกว่าโมเดล Llama ที่มีขนาดใกล้เคียงหรือแม้แต่ใหญ่กว่าอย่างสม่ำเสมอ Mistral 7B เหนือกว่า Llama 2 13B ส่วน Mixtral 8x7B เหนือกว่า Llama 2 70B ความแตกต่างหลักคือลิขสิทธิ์: Mistral ใช้ Apache 2.0 แบบอนุญาตอย่างเต็มที่ ในขณะที่ลิขสิทธิ์ Llama มีข้อจำกัด
- **เทียบกับ GPT (OpenAI):** โมเดล flagship ของ OpenAI (GPT-4) ยังคงเป็นผู้นำในงานที่ซับซ้อนที่สุด แต่โมเดลเปิดของ Mistral (เช่น Mixtral 8x7B) แสดงคุณภาพที่เทียบได้กับ GPT-3.5 Mistral มอบทางเลือกแบบเปิดที่ให้ผู้ใช้นำโมเดลไปใช้งานในเครื่องท้องถิ่นและควบคุมได้อย่างเต็มที่
- **เทียบกับ Claude (Anthropic):** โมเดล Claude เป็นที่รู้จักในด้านหน้าต่าง context ขนาดใหญ่และการมุ่งเน้นด้านความปลอดภัย Mistral นำเสนอโมเดลเปิดที่มี context เทียบได้หรือมากกว่า ในด้านประสิทธิภาพบน benchmark มาตรฐาน (LMSys Arena) โมเดล Medium 3 เหนือกว่า Claude 3 Opus

## การประยุกต์ใช้และระบบนิเวศ

### ผลิตภัณฑ์

- **Le Chat:** ผู้ช่วย chat สาธารณะ (เว็บ, iOS/Android) ที่แสดงความสามารถของโมเดล Mistral รวมถึงการค้นหาเว็บและการสร้างรูปภาพ
- **La Plateforme:** แพลตฟอร์มองค์กรที่ให้เข้าถึงโมเดล Mistral ทั้งหมดผ่าน API ช่วยให้บริษัทต่าง ๆ สามารถผสาน LLM เข้ากับผลิตภัณฑ์ของตนได้

### ลูกค้าองค์กร

เทคโนโลยีของ Mistral ถูกนำไปใช้โดยบริษัทขนาดใหญ่ อาทิ **BNP Paribas** (การเงิน), **CMA CGM** (โลจิสติกส์), **Zalando** (e-commerce) และหน่วยงานภาครัฐ **France Travail** สำหรับลูกค้าในยุโรป ความสามารถในการนำโมเดลไปใช้งานในเครื่องท้องถิ่นเพื่อให้สอดคล้องกับ GDPR ถือเป็นสิ่งสำคัญ

### ชุมชน Open-Source

ด้วยลิขสิทธิ์แบบเปิด โมเดล Mistral ได้กลายเป็นรากฐานสำหรับโปรเจกต์หลายพันรายการบนแพลตฟอร์มอย่าง Hugging Face ชุมชนมีการ fine-tuning โมเดลอย่างแข็งขันเพื่อแก้ไขปัญหาเฉพาะทาง โดยสร้างเวอร์ชันสำหรับชีววิทยา (BioMistral), นิติศาสตร์ (SaulLM-7B) และการแปลเป็นภาษาต่าง ๆ (เช่น Polish Bielik 7B)

## การออกใบอนุญาต

| ซีรีส์โมเดล                                                       | ลิขสิทธิ์                          | ข้อจำกัด                                |
|----------------------------------------------------------------|--------------------------------|---------------------------------------|
| โมเดลพื้นฐาน, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral | Apache 2.0                     | ใช้งานเชิงพาณิชย์ได้อย่างเสรี                |
| Codestral 22B                                                  | Non-Production License         | ห้ามใช้งานเชิงพาณิชย์โดยไม่มีข้อตกลงแยกต่างหาก |
| ซีรีส์ Large, ซีรีส์ Medium                                          | Mistral Research / Proprietary | เข้าถึงได้เฉพาะผ่าน cloud API เท่านั้น       |

## ลิงก์

- เอกสารทางการของ Mistral AI
- โปรไฟล์ Mistral AI บน Hugging Face

## บรรณานุกรม

- Ainslie, J. et al. (2023). *GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints*. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). *Longformer: The Long‑Document Transformer*. arXiv:2004.05150.
- Dao, T. et al. (2022). *FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness*. arXiv:2205.14135.
- Ding, Y. et al. (2024). *LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens*. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). *Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity*. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). *Mamba: Linear‑Time Sequence Modeling with Selective State Spaces*. arXiv:2312.00752.
- He, L. et al. (2025). *Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation*. arXiv:2504.12637.
- Jiang, A. Q. et al. (2023). *Mistral 7B*. arXiv:2310.06825.
- Jiang, A. Q. et al. (2024). *Mixtral of Experts*. arXiv:2401.04088.
- Peng, B. et al. (2023). *YaRN: Efficient Context Window Extension of Large Language Models*. arXiv:2309.00071.
- Shazeer, N. (2019). *Fast Transformer Decoding: One Write‑Head is All You Need*. arXiv:1911.02150.
