Mixtral (Mistral AI) (TR)

From Systems analysis Wiki
Jump to navigation Jump to search

Mixtral 8x7B — açık kaynak kodlu büyük bir dil modelidir (LLM); Fransız şirketi Mistral AI tarafından geliştirilmiş ve Aralık 2023'te yayımlanmıştır. Model, seyrek uzman karışımı (Sparse Mixture of Experts, SMoE) mimarisine dayanmaktadır; bu sayede çok daha büyük modellerle (örneğin Llama 2 70B ve GPT-3.5) kıyaslanabilir bir performansı yüksek hız ve verimli çıkarım (inference) kapasitesiyle bir arada sunabilmektedir[1].

Model, özgür Apache 2.0 lisansı kapsamında dağıtılmakta olup akademik ve ticari kullanıma açıktır. Mixtral 8x7B, çok dilli görevlerde, kod üretiminde ve talimat takibinde güçlü beceriler sergilemekte; bu durum onu yayımlandığı dönemin en popüler açık modelleri arasına sokmuştur[2].

Geliştirme Tarihi

Mistral AI şirketi, Nisan 2023'te Meta ve Google'dan ayrılan eski araştırmacılar tarafından kurulmuştur. Eylül 2023'te şirket, küçük boyutuna karşın yüksek verimliliğiyle takdir toplayan ilk modeli Mistral 7B'yi yayımlamıştır.

11 Aralık 2023'te Mistral AI, uzman karışımı mimarisine dayanan ilk modeli olan Mixtral 8x7B'yi duyurmuştur. Model, çıkarım hızı açısından GPT-3.5 düzeyinde kalite sergileyerek o dönemin en güçlü açık LLM'i olarak topluluğun dikkatini hemen çekmiştir. Ocak 2024'te arXiv üzerinde yayımlanan ayrıntılı teknik bir makale, bağımsız araştırmacıların mimari ayrıntılarını ve test sonuçlarını incelemesine olanak tanımıştır[2].

Mimari: Seyrek Uzman Karışımı (SMoE) - Sparse Mixture of Experts

Mixtral 8x7B'nin en önemli yeniliği, Sparse Mixture of Experts mimarisinin benimsenmesidir. Her katmanın tüm token'lar için aynı hesaplamayı yürüttüğü standart ("yoğun") transformer'lardan farklı olarak Mixtral'da her katman, paralel çalışan birden fazla "uzman" bloğu içermektedir.

Mimarinin temel özellikleri:

  • MoE yapısı: Her transformer katmanı 8 adet feed-forward blok ("uzman") barındırmaktadır. Her token işlenirken özel bir router ağı, en uygun 2 uzmanı seçmektedir (Top-2 routing).
  • Parametreler: Modelin toplam parametre sayısı 46,7 milyardır; ancak seyrek aktivasyon sayesinde çıkarım sırasında her token için yalnızca 12,9 milyar aktif parametre kullanılmaktadır. Bu durum, yaklaşık 13 milyar parametreli modellerle kıyaslanabilir bir çıkarım hızı sağlamaktadır.
  • Dikkat optimizasyonu: Model, uzun dizilerin verimli işlenmesi için Sliding Window Attention (SWA) ve Grouped Query Attention (GQA) dahil olmak üzere modern tekniklerden yararlanmaktadır.
  • Bağlam uzunluğu: Model, 32.768 token'a kadar bağlam penceresi desteklemektedir.

Eğitim

Mixtral 8x7B ailesi iki temel sürümden oluşmaktadır: 1. Mixtral-8x7B-v0.1 (temel model): Birden fazla Avrupa dilinde (İngilizce, Fransızca, Almanca, İspanyolca, İtalyanca) büyük bir web verisi derlemine dayalı ön eğitimli modeldir. Temel görev, bir sonraki token'ı tahmin etmektir. 2. Mixtral-8x7B-Instruct-v0.1 (talimat modeli): supervised fine-tuning (SFT) ve Direct Preference Optimization (DPO) yöntemleriyle ince ayar yapılmış sürümdür. Bu model, kullanıcı talimatlarına daha iyi uymakta ve diyalog biçiminde kullanım için tasarlanmıştır.

Performans

Mixtral 8x7B, standart benchmark'ların büyük çoğunluğunda Llama 2 70B ile eşdeğer ya da ondan daha iyi sonuçlar elde etmektedir; üstelik 5 kat daha az aktif parametre kullandığından çıkarım hızı belirgin biçimde yüksektir (6 kata kadar daha hızlı)[2].

Mixtral 8x7B'nin Llama 2 70B ve GPT-3.5 ile Performans Karşılaştırması[2]
Metrik Llama 2 70B GPT-3.5 Mixtral 8x7B
MMLU (genel bilgi) 69,9% 70,0% 70,6%
GSM-8K (matematik) 53,6% 57,1% 58,4%
MBPP (kod üretimi) 49,8% 52,2% 60,7%
MT-Bench (diyalog değerlendirmesi, Instruct sürümleri) 6,86 8,32 8,30
  • Çok dillilik: Eğitim derlemindeki çok dilli veri oranının artırılması sayesinde Mixtral, Fransızca, Almanca, İspanyolca ve İtalyanca görevlerinde Llama 2 70B'yi belirgin biçimde geride bırakmaktadır.
  • Yanlılık ve halüsinasyon: Llama 2 70B ile karşılaştırıldığında model, sosyal önyargıları değerlendiren BBQ benchmark'ında daha yüksek doğruluk ve BOLD benchmark'ında daha olumlu bir duygu profili sergilemektedir.

Lisanslama ve Erişilebilirlik

Mixtral 8x7B'nin her iki sürümü de (temel ve Instruct) özgür akademik ve ticari kullanıma izin veren Apache 2.0 lisansı ile yayımlanmıştır. Kaynak kodları ve model ağırlıkları GitHub ve Hugging Face üzerinden erişilebilir durumdadır.

Dış bağlantılar

  • Mixtral of Experts — Mistral AI blogundaki resmi duyuru
  • Hugging Face'teki Mixtral 8x7B modeli

Kaynakça

  • Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
  • Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
  • Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
  • Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
  • Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.

Notlar

  1. «Mixtral of Experts». Mistral AI Blog. 11 Dec 2023. [1]
  2. 2.0 2.1 2.2 2.3 Jiang, A. Q., Sablayrolles, A., Roux, A., et al. (2024). «Mixtral of Experts». arXiv:2401.04088. [2]