Mixtral (Mistral AI) (ID)

From Systems analysis Wiki
Jump to navigation Jump to search

Mixtral 8x7B — adalah model bahasa besar (LLM) dengan kode sumber terbuka yang dikembangkan oleh perusahaan Prancis Mistral AI dan dirilis pada Desember 2023. Model ini didasarkan pada arsitektur Sparse Mixture of Experts (SMoE), yang memungkinkannya menggabungkan performa yang sebanding dengan model yang jauh lebih besar (misalnya, Llama 2 70B dan GPT-3.5) dengan kecepatan dan efisiensi inferensi yang tinggi[1].

Model ini didistribusikan di bawah lisensi bebas Apache 2.0, sehingga tersedia untuk penggunaan akademis dan komersial. Mixtral 8x7B menunjukkan kemampuan yang kuat dalam tugas multibahasa, pembuatan kode, dan mengikuti instruksi, menjadikannya salah satu model terbuka paling populer pada saat perilisannya[2].

Sejarah Pengembangan

Perusahaan Mistral AI didirikan pada April 2023 oleh mantan peneliti dari Meta dan Google. Pada September 2023, perusahaan ini merilis model pertamanya, Mistral 7B, yang mendapat pengakuan atas efisiensinya yang tinggi meskipun berukuran kecil.

11 Desember 2023 Mistral AI mengumumkan rilis Mixtral 8x7B, model pertamanya yang berbasis arsitektur Mixture of Experts. Model ini langsung menarik perhatian komunitas sebagai LLM terbuka paling canggih pada saat itu, menunjukkan kualitas setara GPT-3.5 dengan kecepatan inferensi yang jauh lebih tinggi. Pada Januari 2024, deskripsi teknis terperinci model ini diterbitkan dalam bentuk artikel ilmiah di arXiv, memungkinkan para peneliti independen untuk mempelajari detail arsitektur dan hasil pengujiannya[2].

Arsitektur: Sparse Mixture of Experts (SMoE)

Inovasi utama Mixtral 8x7B adalah penerapan arsitektur Sparse Mixture of Experts. Berbeda dengan transformer standar ("padat") di mana setiap lapisan melakukan komputasi yang sama untuk semua token, dalam Mixtral setiap lapisan mengandung beberapa blok paralel yang disebut "pakar".

Fitur-fitur utama arsitektur:

  • Struktur MoE: Setiap lapisan transformer mengandung 8 blok feed-forward ("pakar"). Untuk memproses setiap token, jaringan router khusus memilih 2 pakar yang paling sesuai (Top-2 routing).
  • Parameter: Total jumlah parameter model adalah 46,7 miliar, namun berkat aktivasi yang jarang, hanya 12,9 miliar parameter aktif yang digunakan untuk setiap token selama inferensi. Hal ini memberikan kecepatan inferensi yang sebanding dengan model berukuran ~13 miliar parameter.
  • Optimasi perhatian: Model ini menggunakan teknik-teknik modern untuk pemrosesan urutan panjang yang efisien, termasuk Sliding Window Attention (SWA) dan Grouped Query Attention (GQA).
  • Panjang konteks: Model mendukung jendela konteks hingga 32.768 token.

Pelatihan

Keluarga Mixtral 8x7B mencakup dua versi utama:

  1. Mixtral-8x7B-v0.1 (model dasar): Model yang telah dilatih sebelumnya pada korpus besar data web dalam beberapa bahasa Eropa (Inggris, Prancis, Jerman, Spanyol, Italia). Tugas utamanya adalah memprediksi token berikutnya.
  2. Mixtral-8x7B-Instruct-v0.1 (model instruksi): Versi yang di-fine-tune menggunakan supervised fine-tuning (SFT) dan Direct Preference Optimization (DPO). Model ini lebih baik dalam mengikuti instruksi pengguna dan dirancang untuk digunakan dalam format dialog.

Performa

Mixtral 8x7B melampaui atau setara kualitasnya dengan model Llama 2 70B pada sebagian besar benchmark standar, dengan jumlah parameter aktif 5 kali lebih sedikit dan, sebagai konsekuensinya, kecepatan inferensi yang jauh lebih tinggi (hingga 6 kali lebih cepat)[2].

Perbandingan performa Mixtral 8x7B dengan Llama 2 70B dan GPT-3.5[2]
Metrik Llama 2 70B GPT-3.5 Mixtral 8x7B
MMLU (pengetahuan umum) 69,9% 70,0% 70,6%
GSM-8K (matematika) 53,6% 57,1% 58,4%
MBPP (pembuatan kode) 49,8% 52,2% 60,7%
MT-Bench (evaluasi dialog, versi Instruct) 6,86 8,32 8,30
  • Multibahasa: Berkat proporsi data multibahasa yang lebih besar dalam korpus pelatihan, Mixtral secara signifikan melampaui Llama 2 70B dalam tugas berbahasa Prancis, Jerman, Spanyol, dan Italia.
  • Bias dan halusinasi: Dibandingkan dengan Llama 2 70B, model ini menunjukkan akurasi yang lebih tinggi pada benchmark BBQ (evaluasi bias sosial) dan profil sentimen yang lebih positif pada benchmark BOLD.

Lisensi dan Ketersediaan

Kedua versi Mixtral 8x7B (dasar dan Instruct) dirilis di bawah lisensi Apache 2.0, yang mengizinkan penggunaan akademis dan komersial secara bebas. Kode sumber dan bobot model tersedia di GitHub dan Hugging Face.

Tautan

  • Mixtral of Experts — pengumuman resmi di blog Mistral AI
  • Model Mixtral 8x7B di Hugging Face

Literatur

  • Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.

Catatan

  1. «Mixtral of Experts». Mistral AI Blog. 11 Dec 2023. [1]
  2. 2.0 2.1 2.2 2.3 Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». arXiv:2401.04088. [2]