Mistral AI (TR)
Mistral AI — Fransız bir yapay zeka şirketi olup büyük dil modelleri (LLM) geliştirme alanında uzmanlaşmıştır. Nisan 2023'te kurulan şirket, kendisini Amerikalı teknoloji devlerinin tescilli modellerine bir alternatif olarak konumlandırarak Avrupa ve dünya pazarlarında hızla önemli bir oyuncu haline gelmiştir.
Mistral AI'ın yaklaşımının temel özelliği, ileri düzey yapay zeka teknolojilerine erişimin demokratikleştirilmesine katkıda bulunan açık ağırlıklı (ağırlıklı olarak Apache 2.0 lisansı altında) yüksek performanslı modeller oluşturmaya odaklanmasıdır. Şirket, modellerinin görece küçük boyutlarda ve düşük hesaplama maliyetleriyle yüksek verimlilik elde etmesini sağlayan Grouped-Query Attention (GQA), Sliding Window Attention (SWA) ve Sparse Mixture-of-Experts (MoE) gibi mimari yenilikleriyle tanınmaktadır.
Tarihçe
Mistral AI, Nisan 2023'te Paris'te üç Fransız araştırmacı tarafından kurulmuştur: Arthur Mensch, Guillaume Lample ve Timothée Lacroix. Kurucuların üçü de daha önce dünyanın önde gelen şirketlerinde büyük dil modelleri üzerinde çalışmıştır: Mensch, Google DeepMind'da araştırmacı olarak görev yaparken Lample ve Lacroix, Meta AI'da LLM alanında çalışmıştır.
Şirketin misyonu, açıklığı, işbirliğini ve şeffaflığı teşvik ederek yapay zekanın öncü başarımlarını herkes için erişilebilir kılmaktır. Bu yaklaşım, Mistral AI'ın hızla önemli yatırımlar çekmesini sağlamıştır:
- Haziran 2023: Avrupa rekoru kıran seed turunda €105 milyon.
- Aralık 2023: Şirket değerinin $2 milyarı aşmasıyla "unicorn" statüsü kazandığı Seri A turunda €385 milyon.
- Şubat 2024: $16 milyon yatırım ve Mistral modellerinin Azure bulutunda barındırılmasını kapsayan Microsoft ile stratejik ortaklık duyurusu.
- Haziran 2024: Şirket değerini ~€5,8 milyara ulaştırarak onu dünyanın en değerli yapay zeka girişimlerinden biri haline getiren €600 milyon yeni finansman turu.
Mimarinin Teknik Özellikleri
Mistral AI modelleri, transformer mimarisine dayanmakla birlikte verimliliği artırmaya ve hesaplama maliyetlerini düşürmeye yönelik bir dizi temel yenilik içermektedir.
Transformer with Enhancements - İyileştirilmiş Transformer (Mistral 7B)
Şirketin ilk modeli Mistral 7B, iki önemli mimari iyileştirme sunmuştur:
- Sliding Window Attention (SWA) (Kayan Pencere Dikkat Mekanizması): Her token'ın tüm önceki token'larla etkileşime girmesi (karesel karmaşıklık) yerine SWA, dikkati sabit bir pencereyle (örneğin 4096 token) sınırlandırır. Bu, çok uzun dizilerin (32.000 token ve üzeri) doğrusal hesaplama karmaşıklığıyla işlenmesine olanak tanır ve işleme sürecini önemli ölçüde hızlandırır.
- Grouped-Query Attention (GQA) (Gruplandırılmış Sorgu Dikkati): Standart multi-head attention mekanizmasının bir optimizasyonudur. GQA, anahtar (keys) ve değerler (values) için sorgu (queries) başlıklarından daha az "başlık" kullanır (örneğin 8:1 oranında); bu durum bellek gereksinimlerini önemli ölçüde azaltır ve kaliteden önemli ölçüde taviz vermeden üretim (inference) sürecini hızlandırır.
Sparse Mixture-of-Experts (MoE)
Mixtral serisi modellerde (örneğin Mixtral 8x7B, Mixtral 8x22B) Sparse Mixture-of-Experts (seyrek uzmanlar karışımı) mimarisi kullanılmaktadır. Tek bir yoğun sinir ağı katmanı yerine birden fazla paralel "uzman" alt ağı kullanılır. Her girdi token'ı için özel bir gating katmanı (yönlendirici), etkinleştirilecek uzmanların küçük bir alt kümesini dinamik olarak seçer (genellikle 8'den 2'si).
Bu yaklaşım, çok büyük toplam parametre sayısına sahip modeller oluşturmayı mümkün kılar (Mixtral 8x22B'nin 141 milyar parametresi vardır), ancak her token işlenirken bunların yalnızca küçük bir kısmı (~39 milyar) kullanılır. Sonuç olarak model, çok daha büyük "yoğun" modellerle kıyaslanabilir bir kaliteye, ancak çok daha küçük modellerin inference hızı ve maliyetiyle ulaşır.
Mamba Architecture (SSM) - Mamba Mimarisi (SSM)
2024 yılında Mistral AI, Mamba (Selective State-Space Model) mimarisine dayanan deneysel bir model olan Codestral Mamba'yı tanıttı. Transformer'lardan farklı olarak Mamba, durum uzayı modellerine dayanan tekrarlayan bir mekanizma kullanır. Temel avantajları:
- Uzun bağlamlarda son derece hızlı işlem yapılmasını sağlayan dizi uzunluğuna göre doğrusal karmaşıklık.
- Yalnızca kullanılabilir bellek tarafından sınırlanan, teorik olarak "sonsuz" bağlam.
- Eşdeğer transformer'larla karşılaştırıldığında yüksek inference hızı.
Zaman Çizelgesi ve Modeller
| Ay / Yıl | Model | Parametre Sayısı (milyar) | Temel Özellikler | Lisans |
|---|---|---|---|---|
| 09 / 2023 | Mistral 7B | 7,3 | GQA + SWA mimarisi; 32k bağlam; tüm benchmark'larda Llama 2 13B'yi geçiyor. | Apache 2.0 |
| 12 / 2023 | Mixtral 8x7B | 46,7 (12,9 aktif) | İlk açık MoE modeli; GPT-3.5 düzeyinde kalite. | Apache 2.0 |
| 02 / 2024 | Mistral Small / Large | ? | API üzerinden erişilebilen "küçük" ve amiral gemisi modeller. | Small: Apache 2.0, Large: Research |
| 04 / 2024 | Mixtral 8x22B | 141 (39 aktif) | 64k bağlam; çıkış anında open-source modeller arasında SOTA kalitesi. | Apache 2.0 |
| 05 / 2024 | Codestral 22B | 22 | Kod üretimi için özelleştirilmiş model (80+ dil). | Non-Production |
| 07 / 2024 | Mathstral 7B / Nemo 12B | 7 / 12 | Matematik ve çok dilliliğe yönelik özelleşmiş modeller. | Apache 2.0 |
| 07 / 2024 | Codestral Mamba 7.3B | 7,3 | Mamba mimarisi üzerinde kod için deneysel model; 256k+ bağlam. | Apache 2.0 |
| 09 / 2024 | Pixtral 12B | 12 | İlk açık multimodal model (metin + görüntü). | Apache 2.0 |
| 11 / 2024 | Mistral Large 24.11 | ~100+ (tahmin) | Geliştirilmiş akıl yürütme özellikli güncellenmiş amiral gemisi model. | Research |
| 01 / 2025 | Mistral Small 3 | 24 | Düşük gecikme (150 token/s'ye kadar) için optimize edilmiş; 70B model düzeyinde kalite. | Apache 2.0 |
| 05 / 2025 | Mistral Medium 3 | ? | 128k bağlamlı sınır multimodal model (metin, görüntü). | Tescilli |
| 05 / 2025 | Devstral 24B | 24 | Otonom yazılım geliştirme için "ajan" modeli; SWE-Bench'te %46,8. | Apache 2.0 |
Rakiplerle Karşılaştırma
- vs. Llama (Meta): Mistral modelleri, benzer ve hatta daha büyük boyuttaki Llama modellerini sürekli olarak geride bırakmaktadır. Mistral 7B, Llama 2 13B'yi; Mixtral 8x7B ise Llama 2 70B'yi geçmiştir. Temel fark lisanstadır: Mistral tamamen izin verici Apache 2.0 kullanırken Llama lisansının kısıtlamaları mevcuttur.
- vs. GPT (OpenAI): OpenAI'ın amiral gemisi modelleri (GPT-4) en zorlu görevlerde lider konumunu korumaktadır; ancak Mistral'ın açık modelleri (örneğin Mixtral 8x7B) GPT-3.5 ile kıyaslanabilir bir kalite sergilemektedir. Mistral, modelleri yerel olarak dağıtmayı ve üzerinde tam kontrol sahibi olmayı mümkün kılan açık bir alternatif sunmaktadır.
- vs. Claude (Anthropic): Claude modelleri, geniş bağlam penceresi ve güvenlik odaklı yaklaşımıyla bilinmektedir. Mistral, karşılaştırılabilir veya daha büyük bağlama sahip açık modeller sunmuştur. Standart benchmark'lardaki (LMSys Arena) performans açısından Medium 3 modeli, Claude 3 Opus'u geride bırakmıştır.
Kullanım Alanları ve Ekosistem
Ürünler
- Le Chat: Web arama ve görüntü oluşturma dahil olmak üzere Mistral modellerinin yeteneklerini sergileyen halka açık sohbet asistanı (web, iOS/Android).
- La Plateforme: Şirketlerin LLM'leri kendi ürünlerine entegre etmesine olanak tanıyan, tüm Mistral modellerine API erişimi sağlayan kurumsal platform.
Kurumsal Müşteriler
Mistral teknolojileri, BNP Paribas (finans), CMA CGM (lojistik), Zalando (e-ticaret) ve devlet kurumu France Travail gibi büyük şirketler tarafından kullanılmaktadır. Avrupalı müşteriler için GDPR uyumluluğu amacıyla modellerin yerel olarak dağıtılabilmesi büyük önem taşımaktadır.
Open-Source Topluluğu
Açık lisansı sayesinde Mistral modelleri, Hugging Face gibi platformlarda binlerce projenin temeli haline gelmiştir. Topluluk, biyoloji (BioMistral), hukuk (SaulLM-7B) ve çeşitli dillere yerelleştirme (örneğin Polonya dili Bielik 7B) için sürümler oluşturarak modelleri özelleştirilmiş görevler için aktif olarak ince ayar yapmaktadır.
Lisanslama
| Model Serisi | Lisans | Kısıtlamalar |
|---|---|---|
| Temel, Small, Mixtral, Mathstral, Nemo, Pixtral, Devstral | Apache 2.0 | Serbest ticari kullanım. |
| Codestral 22B | Non-Production License | Ayrı bir anlaşma olmaksızın ticari kullanım yasaktır. |
| Large serisi, Medium serisi | Mistral Research / Tescilli | Yalnızca bulut API'si üzerinden erişim. |
Kaynakça
- Mistral AI Resmi Belgelendirmesi
- Hugging Face'te Mistral AI Profili
Kaynakça
- Ainslie, J. et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T. et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Ding, Y. et al. (2024). LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens. arXiv:2402.13753.
- Fedus, W.; Zoph, B.; Shazeer, N. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
- He, L. et al. (2025). Scaling Instruction‑Tuned LLMs to Million‑Token Contexts via Hierarchical Synthetic Data Generation. arXiv:2504.12637.
- Jiang, A. Q. et al. (2023). Mistral 7B. arXiv:2310.06825.
- Jiang, A. Q. et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Peng, B. et al. (2023). YaRN: Efficient Context Window Extension of Large Language Models. arXiv:2309.00071.
- Shazeer, N. (2019). Fast Transformer Decoding: One Write‑Head is All You Need. arXiv:1911.02150.