Mixtral (Mistral AI) (TH)
Mixtral 8x7B — คือโมเดลภาษาขนาดใหญ่ (LLM) แบบโอเพนซอร์ส พัฒนาโดยบริษัทสัญชาติฝรั่งเศส Mistral AI และเปิดตัวในเดือนธันวาคม ค.ศ. 2023 โมเดลนี้อิงบนสถาปัตยกรรม Sparse Mixture of Experts (SMoE) ซึ่งทำให้สามารถผสานประสิทธิภาพที่ทัดเทียมกับโมเดลขนาดใหญ่กว่ามาก (เช่น Llama 2 70B และ GPT-3.5) เข้ากับความเร็วและประสิทธิภาพในการอนุมานที่สูง[1]
โมเดลนี้เผยแพร่ภายใต้ใบอนุญาต Apache 2.0 แบบเสรี ทำให้สามารถนำไปใช้งานทั้งในเชิงวิชาการและเชิงพาณิชย์ Mixtral 8x7B แสดงความสามารถที่โดดเด่นในงานหลายภาษา การสร้างโค้ด และการปฏิบัติตามคำสั่ง ซึ่งทำให้กลายเป็นหนึ่งในโมเดลโอเพนซอร์สที่ได้รับความนิยมมากที่สุดในช่วงเวลาที่เปิดตัว[2]
ประวัติการพัฒนา
บริษัท Mistral AI ก่อตั้งขึ้นในเดือนเมษายน ค.ศ. 2023 โดยอดีตนักวิจัยจาก Meta และ Google ในเดือนกันยายน ค.ศ. 2023 บริษัทได้เปิดตัวโมเดลแรก คือ Mistral 7B ซึ่งได้รับการยอมรับในด้านประสิทธิภาพสูงแม้จะมีขนาดเล็ก
วันที่ 11 ธันวาคม ค.ศ. 2023 Mistral AI ประกาศเปิดตัว Mixtral 8x7B ซึ่งเป็นโมเดลแรกที่อิงบนสถาปัตยกรรม Mixture of Experts โมเดลนี้ดึงดูดความสนใจจากชุมชนทันทีในฐานะ LLM โอเพนซอร์สที่ทรงพลังที่สุดในขณะนั้น โดยแสดงคุณภาพระดับ GPT-3.5 พร้อมกับความเร็วในการอนุมานที่สูงกว่าอย่างมีนัยสำคัญ ในเดือนมกราคม ค.ศ. 2024 ได้มีการเผยแพร่รายละเอียดทางเทคนิคของโมเดลในรูปแบบบทความวิชาการบน arXiv ซึ่งช่วยให้นักวิจัยอิสระสามารถศึกษารายละเอียดของสถาปัตยกรรมและผลการทดสอบได้[2]
สถาปัตยกรรม: Sparse Mixture of Experts (SMoE)
นวัตกรรมสำคัญของ Mixtral 8x7B คือการนำสถาปัตยกรรม Sparse Mixture of Experts มาใช้งาน ต่างจาก transformer มาตรฐาน (แบบ "หนาแน่น") ที่แต่ละชั้นทำการคำนวณแบบเดียวกันสำหรับทุก token ใน Mixtral แต่ละชั้นจะประกอบด้วยบล็อก "ผู้เชี่ยวชาญ" (expert) แบบขนานหลายตัว
คุณลักษณะสำคัญของสถาปัตยกรรม:
- โครงสร้าง MoE: แต่ละชั้น transformer ประกอบด้วย feed-forward บล็อก ("ผู้เชี่ยวชาญ") จำนวน 8 ตัว สำหรับการประมวลผลแต่ละ token เครือข่าย router พิเศษจะเลือกผู้เชี่ยวชาญที่เหมาะสมที่สุด 2 ตัว (Top-2 routing)
- พารามิเตอร์: จำนวนพารามิเตอร์รวมทั้งหมดของโมเดลคือ 46.7 พันล้าน แต่ด้วยการกระตุ้นแบบกระจาย สำหรับแต่ละ token ในกระบวนการอนุมานจะใช้เพียง 12.9 พันล้าน พารามิเตอร์ที่ใช้งานจริง ทำให้ได้ความเร็วในการอนุมานที่ทัดเทียมกับโมเดลขนาดประมาณ 13 พันล้านพารามิเตอร์
- การปรับแต่ง attention: โมเดลใช้เทคนิคทันสมัยสำหรับการประมวลผลลำดับยาวอย่างมีประสิทธิภาพ ได้แก่ Sliding Window Attention (SWA) และ Grouped Query Attention (GQA)
- ความยาว context: โมเดลรองรับหน้าต่าง context ยาวถึง 32,768 token
การฝึกอบรม
ตระกูล Mixtral 8x7B ประกอบด้วยสองเวอร์ชันหลัก:
- Mixtral-8x7B-v0.1 (โมเดลพื้นฐาน): โมเดลที่ผ่านการ pre-training บนคลังข้อมูลเว็บขนาดใหญ่ในหลายภาษายุโรป (อังกฤษ ฝรั่งเศส เยอรมัน สเปน อิตาลี) งานหลักคือการทำนาย token ถัดไป
- Mixtral-8x7B-Instruct-v0.1 (โมเดลแบบ instruct): เวอร์ชันที่ผ่านการ fine-tuning เพิ่มเติมด้วย supervised fine-tuning (SFT) และ Direct Preference Optimization (DPO) โมเดลนี้ปฏิบัติตามคำสั่งของผู้ใช้ได้ดีขึ้นและออกแบบมาสำหรับการใช้งานในรูปแบบบทสนทนา
ประสิทธิภาพ
Mixtral 8x7B มีประสิทธิภาพเหนือกว่าหรือเทียบเคียงได้กับโมเดล Llama 2 70B ในเกณฑ์มาตรฐาน (benchmark) ส่วนใหญ่ โดยมีพารามิเตอร์ที่ใช้งานจริงน้อยกว่าถึง 5 เท่า และส่งผลให้มีความเร็วในการอนุมานสูงกว่าอย่างมีนัยสำคัญ (เร็วกว่าถึง 6 เท่า)[2]
| เมตริก | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|---|---|---|---|
| MMLU (ความรู้ทั่วไป) | 69.9% | 70.0% | 70.6% |
| GSM-8K (คณิตศาสตร์) | 53.6% | 57.1% | 58.4% |
| MBPP (การสร้างโค้ด) | 49.8% | 52.2% | 60.7% |
| MT-Bench (การประเมินบทสนทนา เวอร์ชัน Instruct) | 6.86 | 8.32 | 8.30 |
- ความสามารถหลายภาษา: ด้วยสัดส่วนข้อมูลหลายภาษาที่เพิ่มขึ้นในชุดข้อมูลการฝึกอบรม Mixtral มีประสิทธิภาพเหนือกว่า Llama 2 70B อย่างมีนัยสำคัญในงานภาษาฝรั่งเศส เยอรมัน สเปน และอิตาลี
- ความลำเอียงและภาพหลอน: เมื่อเปรียบเทียบกับ Llama 2 70B โมเดลแสดงความแม่นยำที่สูงกว่าบน benchmark BBQ (การประเมินอคติทางสังคม) และโปรไฟล์อารมณ์เชิงบวกมากกว่าบน benchmark BOLD
การอนุญาตสิทธิ์และความพร้อมใช้งาน
ทั้งสองเวอร์ชันของ Mixtral 8x7B (พื้นฐานและ Instruct) เผยแพร่ภายใต้ใบอนุญาต Apache 2.0 ซึ่งอนุญาตให้ใช้งานทั้งในเชิงวิชาการและเชิงพาณิชย์อย่างเสรี ซอร์สโค้ดและน้ำหนักของโมเดลสามารถเข้าถึงได้บน GitHub และ Hugging Face
ลิงก์
- Mixtral of Experts — ประกาศอย่างเป็นทางการบนบล็อกของ Mistral AI
- โมเดล Mixtral 8x7B บน Hugging Face
เอกสารอ้างอิง
- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.