Mixtral (Mistral AI) (PL)
Mixtral 8x7B — to duży model językowy (LLM) o otwartym kodzie źródłowym, opracowany przez francuską firmę Mistral AI i wydany w grudniu 2023 roku. Model oparty jest na architekturze rzadkiej mieszaniny ekspertów (Sparse Mixture of Experts, SMoE), co pozwala mu łączyć wydajność porównywalną z znacznie większymi modelami (np. Llama 2 70B i GPT-3.5) z wysoką szybkością i efektywnością inferencji[1].
Model jest dystrybuowany na wolnej licencji Apache 2.0, co czyni go dostępnym do użytku akademickiego i komercyjnego. Mixtral 8x7B wykazuje silne zdolności w zadaniach wielojęzycznych, generowaniu kodu oraz wykonywaniu instrukcji, co uczyniło go jednym z najpopularniejszych otwartych modeli w momencie wydania[2].
Historia rozwoju
Firma Mistral AI została założona w kwietniu 2023 roku przez byłych badaczy z Meta i Google. We wrześniu 2023 roku firma wydała swój pierwszy model, Mistral 7B, który zyskał uznanie za wysoką efektywność przy niewielkich rozmiarach.
11 grudnia 2023 roku Mistral AI ogłosiła wydanie Mixtral 8x7B, swojego pierwszego modelu opartego na architekturze mieszaniny ekspertów. Model natychmiast przyciągnął uwagę społeczności jako najpotężniejszy ówczesny otwarty LLM, demonstrując jakość na poziomie GPT-3.5 przy znacznie wyższej szybkości inferencji. W styczniu 2024 roku opublikowano szczegółowy opis techniczny modelu w formie artykułu naukowego na arXiv, co pozwoliło niezależnym badaczom zapoznać się ze szczegółami architektury i wynikami testów[2].
Architektura: Rzadka mieszanina ekspertów (SMoE)
Główną innowacją Mixtral 8x7B jest wdrożenie architektury Sparse Mixture of Experts. W przeciwieństwie do standardowych („gęstych") transformerów, gdzie każda warstwa wykonuje te same obliczenia dla wszystkich tokenów, w Mixtral każda warstwa zawiera kilka równoległych bloków-„ekspertów".
Kluczowe cechy architektury:
- Struktura MoE: Każda warstwa transformera zawiera 8 bloków feed-forward („ekspertów"). Do przetwarzania każdego tokenu specjalna sieć router wybiera 2 najbardziej odpowiednich ekspertów (Top-2 routing).
- Parametry: Łączna liczba parametrów modelu wynosi 46,7 mld, jednak dzięki rzadkiej aktywacji dla każdego tokenu w procesie wnioskowania wykorzystywanych jest jedynie 12,9 mld aktywnych parametrów. Zapewnia to szybkość inferencji porównywalną z modelami o ~13 mld parametrów.
- Optymalizacja uwagi: Model wykorzystuje nowoczesne techniki efektywnego przetwarzania długich sekwencji, w tym Sliding Window Attention (SWA) i Grouped Query Attention (GQA).
- Długość kontekstu: Model obsługuje okno kontekstowe o długości do 32 768 tokenów.
Uczenie
Rodzina Mixtral 8x7B obejmuje dwie główne wersje:
- Mixtral-8x7B-v0.1 (model bazowy): Model wstępnie wytrenowany na dużym korpusie danych internetowych w kilku językach europejskich (angielski, francuski, niemiecki, hiszpański, włoski). Głównym zadaniem jest przewidywanie następnego tokenu.
- Mixtral-8x7B-Instruct-v0.1 (model instrukcyjny): Wersja dostrojona przy użyciu supervised fine-tuning (SFT) oraz Direct Preference Optimization (DPO). Ten model lepiej wykonuje instrukcje użytkownika i jest przeznaczony do użytku w formacie dialogowym.
Wydajność
Mixtral 8x7B przewyższa lub jest porównywalny pod względem jakości z modelem Llama 2 70B na większości standardowych benchmarków, mając przy tym 5 razy mniej aktywnych parametrów i w konsekwencji znacznie wyższą szybkość wnioskowania (do 6 razy szybciej)[2].
| Metryka | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|---|---|---|---|
| MMLU (wiedza ogólna) | 69,9% | 70,0% | 70,6% |
| GSM-8K (matematyka) | 53,6% | 57,1% | 58,4% |
| MBPP (generowanie kodu) | 49,8% | 52,2% | 60,7% |
| MT-Bench (ocena dialogu, wersje Instruct) | 6,86 | 8,32 | 8,30 |
- Wielojęzyczność: Dzięki zwiększonemu udziałowi danych wielojęzycznych w korpusie treningowym, Mixtral znacznie przewyższa Llama 2 70B w zadaniach w języku francuskim, niemieckim, hiszpańskim i włoskim.
- Stronniczość i halucynacje: W porównaniu z Llama 2 70B model wykazuje wyższą dokładność na benchmarku BBQ (ocena uprzedzeń społecznych) oraz bardziej pozytywny profil nastrojów na benchmarku BOLD.
Licencjonowanie i dostępność
Obie wersje Mixtral 8x7B (bazowa i Instruct) zostały wydane na licencji Apache 2.0, która zezwala na swobodne użytkowanie akademiczne i komercyjne. Kody źródłowe i wagi modeli są dostępne na GitHub i Hugging Face.
Linki
- Mixtral of Experts — oficjalny anons na blogu Mistral AI
- Model Mixtral 8x7B na Hugging Face
Literatura
- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.