Mixtral (Mistral AI) (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

Mixtral 8x7B — คือโมเดลภาษาขนาดใหญ่ (LLM) แบบโอเพนซอร์ส พัฒนาโดยบริษัทสัญชาติฝรั่งเศส Mistral AI และเปิดตัวในเดือนธันวาคม ค.ศ. 2023 โมเดลนี้อิงบนสถาปัตยกรรม Sparse Mixture of Experts (SMoE) ซึ่งทำให้สามารถผสานประสิทธิภาพที่ทัดเทียมกับโมเดลขนาดใหญ่กว่ามาก (เช่น Llama 2 70B และ GPT-3.5) เข้ากับความเร็วและประสิทธิภาพในการอนุมานที่สูง[1]

โมเดลนี้เผยแพร่ภายใต้ใบอนุญาต Apache 2.0 แบบเสรี ทำให้สามารถนำไปใช้งานทั้งในเชิงวิชาการและเชิงพาณิชย์ Mixtral 8x7B แสดงความสามารถที่โดดเด่นในงานหลายภาษา การสร้างโค้ด และการปฏิบัติตามคำสั่ง ซึ่งทำให้กลายเป็นหนึ่งในโมเดลโอเพนซอร์สที่ได้รับความนิยมมากที่สุดในช่วงเวลาที่เปิดตัว[2]

ประวัติการพัฒนา

บริษัท Mistral AI ก่อตั้งขึ้นในเดือนเมษายน ค.ศ. 2023 โดยอดีตนักวิจัยจาก Meta และ Google ในเดือนกันยายน ค.ศ. 2023 บริษัทได้เปิดตัวโมเดลแรก คือ Mistral 7B ซึ่งได้รับการยอมรับในด้านประสิทธิภาพสูงแม้จะมีขนาดเล็ก

วันที่ 11 ธันวาคม ค.ศ. 2023 Mistral AI ประกาศเปิดตัว Mixtral 8x7B ซึ่งเป็นโมเดลแรกที่อิงบนสถาปัตยกรรม Mixture of Experts โมเดลนี้ดึงดูดความสนใจจากชุมชนทันทีในฐานะ LLM โอเพนซอร์สที่ทรงพลังที่สุดในขณะนั้น โดยแสดงคุณภาพระดับ GPT-3.5 พร้อมกับความเร็วในการอนุมานที่สูงกว่าอย่างมีนัยสำคัญ ในเดือนมกราคม ค.ศ. 2024 ได้มีการเผยแพร่รายละเอียดทางเทคนิคของโมเดลในรูปแบบบทความวิชาการบน arXiv ซึ่งช่วยให้นักวิจัยอิสระสามารถศึกษารายละเอียดของสถาปัตยกรรมและผลการทดสอบได้[2]

สถาปัตยกรรม: Sparse Mixture of Experts (SMoE)

นวัตกรรมสำคัญของ Mixtral 8x7B คือการนำสถาปัตยกรรม Sparse Mixture of Experts มาใช้งาน ต่างจาก transformer มาตรฐาน (แบบ "หนาแน่น") ที่แต่ละชั้นทำการคำนวณแบบเดียวกันสำหรับทุก token ใน Mixtral แต่ละชั้นจะประกอบด้วยบล็อก "ผู้เชี่ยวชาญ" (expert) แบบขนานหลายตัว

คุณลักษณะสำคัญของสถาปัตยกรรม:

  • โครงสร้าง MoE: แต่ละชั้น transformer ประกอบด้วย feed-forward บล็อก ("ผู้เชี่ยวชาญ") จำนวน 8 ตัว สำหรับการประมวลผลแต่ละ token เครือข่าย router พิเศษจะเลือกผู้เชี่ยวชาญที่เหมาะสมที่สุด 2 ตัว (Top-2 routing)
  • พารามิเตอร์: จำนวนพารามิเตอร์รวมทั้งหมดของโมเดลคือ 46.7 พันล้าน แต่ด้วยการกระตุ้นแบบกระจาย สำหรับแต่ละ token ในกระบวนการอนุมานจะใช้เพียง 12.9 พันล้าน พารามิเตอร์ที่ใช้งานจริง ทำให้ได้ความเร็วในการอนุมานที่ทัดเทียมกับโมเดลขนาดประมาณ 13 พันล้านพารามิเตอร์
  • การปรับแต่ง attention: โมเดลใช้เทคนิคทันสมัยสำหรับการประมวลผลลำดับยาวอย่างมีประสิทธิภาพ ได้แก่ Sliding Window Attention (SWA) และ Grouped Query Attention (GQA)
  • ความยาว context: โมเดลรองรับหน้าต่าง context ยาวถึง 32,768 token

การฝึกอบรม

ตระกูล Mixtral 8x7B ประกอบด้วยสองเวอร์ชันหลัก:

  1. Mixtral-8x7B-v0.1 (โมเดลพื้นฐาน): โมเดลที่ผ่านการ pre-training บนคลังข้อมูลเว็บขนาดใหญ่ในหลายภาษายุโรป (อังกฤษ ฝรั่งเศส เยอรมัน สเปน อิตาลี) งานหลักคือการทำนาย token ถัดไป
  2. Mixtral-8x7B-Instruct-v0.1 (โมเดลแบบ instruct): เวอร์ชันที่ผ่านการ fine-tuning เพิ่มเติมด้วย supervised fine-tuning (SFT) และ Direct Preference Optimization (DPO) โมเดลนี้ปฏิบัติตามคำสั่งของผู้ใช้ได้ดีขึ้นและออกแบบมาสำหรับการใช้งานในรูปแบบบทสนทนา

ประสิทธิภาพ

Mixtral 8x7B มีประสิทธิภาพเหนือกว่าหรือเทียบเคียงได้กับโมเดล Llama 2 70B ในเกณฑ์มาตรฐาน (benchmark) ส่วนใหญ่ โดยมีพารามิเตอร์ที่ใช้งานจริงน้อยกว่าถึง 5 เท่า และส่งผลให้มีความเร็วในการอนุมานสูงกว่าอย่างมีนัยสำคัญ (เร็วกว่าถึง 6 เท่า)[2]

การเปรียบเทียบประสิทธิภาพของ Mixtral 8x7B กับ Llama 2 70B และ GPT-3.5[2]
เมตริก Llama 2 70B GPT-3.5 Mixtral 8x7B
MMLU (ความรู้ทั่วไป) 69.9% 70.0% 70.6%
GSM-8K (คณิตศาสตร์) 53.6% 57.1% 58.4%
MBPP (การสร้างโค้ด) 49.8% 52.2% 60.7%
MT-Bench (การประเมินบทสนทนา เวอร์ชัน Instruct) 6.86 8.32 8.30
  • ความสามารถหลายภาษา: ด้วยสัดส่วนข้อมูลหลายภาษาที่เพิ่มขึ้นในชุดข้อมูลการฝึกอบรม Mixtral มีประสิทธิภาพเหนือกว่า Llama 2 70B อย่างมีนัยสำคัญในงานภาษาฝรั่งเศส เยอรมัน สเปน และอิตาลี
  • ความลำเอียงและภาพหลอน: เมื่อเปรียบเทียบกับ Llama 2 70B โมเดลแสดงความแม่นยำที่สูงกว่าบน benchmark BBQ (การประเมินอคติทางสังคม) และโปรไฟล์อารมณ์เชิงบวกมากกว่าบน benchmark BOLD

การอนุญาตสิทธิ์และความพร้อมใช้งาน

ทั้งสองเวอร์ชันของ Mixtral 8x7B (พื้นฐานและ Instruct) เผยแพร่ภายใต้ใบอนุญาต Apache 2.0 ซึ่งอนุญาตให้ใช้งานทั้งในเชิงวิชาการและเชิงพาณิชย์อย่างเสรี ซอร์สโค้ดและน้ำหนักของโมเดลสามารถเข้าถึงได้บน GitHub และ Hugging Face

ลิงก์

  • Mixtral of Experts — ประกาศอย่างเป็นทางการบนบล็อกของ Mistral AI
  • โมเดล Mixtral 8x7B บน Hugging Face

เอกสารอ้างอิง

  • Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.

หมายเหตุ

  1. «Mixtral of Experts». Mistral AI Blog. 11 Dec 2023. [1]
  2. 2.0 2.1 2.2 2.3 Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». arXiv:2401.04088. [2]