Mixtral (Mistral AI) (EL)
Mixtral 8x7B — είναι ένα μεγάλο γλωσσικό μοντέλο (LLM) ανοιχτού κώδικα, που αναπτύχθηκε από τη γαλλική εταιρεία Mistral AI και κυκλοφόρησε τον Δεκέμβριο του 2023. Το μοντέλο βασίζεται στην αρχιτεκτονική αραιού μείγματος εμπειρογνωμόνων (Sparse Mixture of Experts, SMoE), η οποία του επιτρέπει να συνδυάζει απόδοση συγκρίσιμη με πολύ μεγαλύτερα μοντέλα (όπως τα Llama 2 70B και GPT-3.5) με υψηλή ταχύτητα και αποδοτικότητα inference[1].
Το μοντέλο διανέμεται υπό την ελεύθερη άδεια Apache 2.0, καθιστώντας το διαθέσιμο για ακαδημαϊκή και εμπορική χρήση. Το Mixtral 8x7B επιδεικνύει ισχυρές ικανότητες σε πολύγλωσσες εργασίες, δημιουργία κώδικα και ακολουθία οδηγιών, γεγονός που το κατέστησε ένα από τα πιο δημοφιλή ανοιχτά μοντέλα κατά τη στιγμή της κυκλοφορίας του[2].
Ιστορία ανάπτυξης
Η εταιρεία Mistral AI ιδρύθηκε τον Απρίλιο του 2023 από πρώην ερευνητές της Meta και της Google. Τον Σεπτέμβριο του 2023, η εταιρεία κυκλοφόρησε το πρώτο της μοντέλο, Mistral 7B, το οποίο έτυχε αναγνώρισης για την υψηλή του αποδοτικότητα σε μικρό μέγεθος.
Στις 11 Δεκεμβρίου 2023 η Mistral AI ανακοίνωσε την κυκλοφορία του Mixtral 8x7B, του πρώτου της μοντέλου βασισμένου στην αρχιτεκτονική μείγματος εμπειρογνωμόνων. Το μοντέλο προσέλκυσε αμέσως την προσοχή της κοινότητας ως το ισχυρότερο ανοιχτό LLM εκείνη την εποχή, επιδεικνύοντας ποιότητα ισάξια του GPT-3.5 με σημαντικά υψηλότερη ταχύτητα inference. Τον Ιανουάριο του 2024 δημοσιεύθηκε λεπτομερής τεχνική περιγραφή του μοντέλου με τη μορφή επιστημονικής εργασίας στο arXiv, επιτρέποντας σε ανεξάρτητους ερευνητές να εξοικειωθούν με τις λεπτομέρειες της αρχιτεκτονικής και τα αποτελέσματα των δοκιμών[2].
Αρχιτεκτονική: Αραιό Μείγμα Εμπειρογνωμόνων (SMoE)
Η κύρια καινοτομία του Mixtral 8x7B είναι η υλοποίηση της αρχιτεκτονικής Sparse Mixture of Experts. Σε αντίθεση με τους τυπικούς («πυκνούς») transformers, όπου κάθε στρώμα εκτελεί τον ίδιο υπολογισμό για όλα τα token, στο Mixtral κάθε στρώμα περιέχει αρκετά παράλληλα μπλοκ-«εμπειρογνώμονες».
Βασικά χαρακτηριστικά της αρχιτεκτονικής:
- Δομή MoE: Κάθε στρώμα transformer περιέχει 8 feed-forward μπλοκ («εμπειρογνώμονες»). Για την επεξεργασία κάθε token, ένα ειδικό δίκτυο δρομολόγησης (router) επιλέγει τους 2 πιο κατάλληλους εμπειρογνώμονες (Top-2 routing).
- Παράμετροι: Ο συνολικός αριθμός παραμέτρων του μοντέλου ανέρχεται σε 46,7 δισεκατομμύρια, ωστόσο χάρη στην αραιή ενεργοποίηση, για κάθε token κατά τη διαδικασία εξαγωγής χρησιμοποιούνται μόνο 12,9 δισεκατομμύρια ενεργές παράμετροι. Αυτό εξασφαλίζει ταχύτητα inference συγκρίσιμη με μοντέλα ~13 δισεκατομμυρίων παραμέτρων.
- Βελτιστοποίηση attention: Το μοντέλο χρησιμοποιεί σύγχρονες τεχνικές για αποδοτική επεξεργασία μεγάλων ακολουθιών, συμπεριλαμβανομένων των Sliding Window Attention (SWA) και Grouped Query Attention (GQA).
- Μήκος πλαισίου: Το μοντέλο υποστηρίζει παράθυρο πλαισίου έως 32.768 token.
Εκπαίδευση
Η οικογένεια Mixtral 8x7B περιλαμβάνει δύο κύριες εκδόσεις: 1. Mixtral-8x7B-v0.1 (βασικό μοντέλο): Προεκπαιδευμένο μοντέλο, εκπαιδευμένο σε μεγάλο σώμα δεδομένων ιστού σε αρκετές ευρωπαϊκές γλώσσες (αγγλικά, γαλλικά, γερμανικά, ισπανικά, ιταλικά). Κύρια εργασία — πρόβλεψη του επόμενου token. 2. Mixtral-8x7B-Instruct-v0.1 (μοντέλο οδηγιών): Έκδοση που έχει υποστεί fine-tuning με supervised fine-tuning (SFT) και Direct Preference Optimization (DPO). Αυτό το μοντέλο ακολουθεί καλύτερα τις οδηγίες του χρήστη και προορίζεται για χρήση σε διαλογικό πλαίσιο.
Απόδοση
Το Mixtral 8x7B υπερτερεί ή είναι συγκρίσιμο σε ποιότητα με το μοντέλο Llama 2 70B στα περισσότερα τυπικά benchmark, έχοντας ταυτόχρονα 5 φορές λιγότερες ενεργές παραμέτρους και, ως εκ τούτου, σημαντικά υψηλότερη ταχύτητα εξαγωγής (έως 6 φορές ταχύτερα)[2].
| Μετρική | Llama 2 70B | GPT-3.5 | Mixtral 8x7B |
|---|---|---|---|
| MMLU (γενικές γνώσεις) | 69,9% | 70,0% | 70,6% |
| GSM-8K (μαθηματικά) | 53,6% | 57,1% | 58,4% |
| MBPP (δημιουργία κώδικα) | 49,8% | 52,2% | 60,7% |
| MT-Bench (αξιολόγηση διαλόγου, εκδόσεις Instruct) | 6,86 | 8,32 | 8,30 |
- Πολυγλωσσία: Χάρη στο αυξημένο ποσοστό πολύγλωσσων δεδομένων στο εκπαιδευτικό σώμα, το Mixtral υπερτερεί σημαντικά του Llama 2 70B σε εργασίες στα γαλλικά, γερμανικά, ισπανικά και ιταλικά.
- Μεροληψία και παραισθήσεις: Σε σύγκριση με το Llama 2 70B, το μοντέλο επιδεικνύει υψηλότερη ακρίβεια στο benchmark BBQ (αξιολόγηση κοινωνικών προκαταλήψεων) και πιο θετικό προφίλ συναισθήματος στο benchmark BOLD.
Αδειοδότηση και διαθεσιμότητα
Και οι δύο εκδόσεις του Mixtral 8x7B (βασική και Instruct) κυκλοφόρησαν υπό την άδεια Apache 2.0, η οποία επιτρέπει ελεύθερη ακαδημαϊκή και εμπορική χρήση. Ο πηγαίος κώδικας και τα βάρη των μοντέλων είναι διαθέσιμα στο GitHub και στο Hugging Face.
Σύνδεσμοι
- Mixtral of Experts — επίσημη ανακοίνωση στο blog της Mistral AI
- Μοντέλο Mixtral 8x7B στο Hugging Face
Βιβλιογραφία
- Jiang, A. Q.; Sablayrolles, A.; Roux, A.; et al. (2024). Mixtral of Experts. arXiv:2401.04088.
- Shazeer, N.; et al. (2017). Outrageously Large Neural Networks: The Sparsely‑Gated Mixture‑of‑Experts Layer. arXiv:1701.06538.
- Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
- Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
- Ainslie, J.; et al. (2023). GQA: Training Generalized Multi‑Query Transformer Models from Multi‑Head Checkpoints. arXiv:2305.13245.
- Beltagy, I.; Peters, M. E.; Cohan, A. (2020). Longformer: The Long‑Document Transformer. arXiv:2004.05150.
- Dao, T.; et al. (2022). FlashAttention: Fast and Memory‑Efficient Exact Attention with IO‑Awareness. arXiv:2205.14135.
- Cai, W.; et al. (2025). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
- Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
- Huang, B.; et al. (2024). Toward Efficient Inference for Mixture of Experts. OpenReview: stXtBqyTWX.