DBRX (language model) (EL)

From Systems analysis Wiki
Jump to navigation Jump to search

DBRX — είναι ένα ανοιχτό μεγάλο γλωσσικό μοντέλο (LLM), που αναπτύχθηκε από την ερευνητική ομάδα Mosaic AI στο πλαίσιο της εταιρείας Databricks. Το μοντέλο κυκλοφόρησε επίσημα στις 27 Μαρτίου 2024 και τοποθετείται ως υψηλής απόδοσης λύση για εταιρική χρήση[1].

Το DBRX βασίζεται σε λεπτόκοκκη αρχιτεκτονική μείγματος εμπειρογνωμόνων (MoE) και συνδυάζει υψηλή απόδοση με αποδοτικότητα εκπαίδευσης και inference. Κατά τη στιγμή της κυκλοφορίας του, το DBRX επέδειξε τα καλύτερα αποτελέσματα μεταξύ όλων των ανοιχτών μοντέλων στα βασικά benchmarks, ξεπερνώντας μοντέλα όπως τα LLaMA 2, Mixtral και Grok-1, και παρουσιάζοντας ανταγωνιστικότητα με κλειστά μοντέλα επιπέδου GPT-3.5 Turbo[2].

Ιστορία ανάπτυξης

Η εμφάνιση του DBRX αποτέλεσε συνέχεια της στρατηγικής της Databricks για την ανάπτυξη ανοιχτών γενετικών μοντέλων. Τον Ιούνιο του 2023, η Databricks εξαγόρασε τη startup MosaicML, η οποία ειδικευόταν στην εκπαίδευση μεγάλων μοντέλων, και στη βάση της δημιουργήθηκε ο τομέας Mosaic AI[3].

Η ομάδα Mosaic AI, με επικεφαλής τον κορυφαίο αρχιτέκτονα νευρωνικών δικτύων Jonathan Frankle, ξεκίνησε την ανάπτυξη ενός νέου μεγάλου LLM με στόχο να επιτύχει ποιότητα συγκρίσιμη με τα καλύτερα ιδιόκτητα συστήματα, αλλά σε ανοιχτή μορφή. Το έργο ονομάστηκε DBRX. Η ανάπτυξη και η προ-εκπαίδευση του μοντέλου διήρκεσαν περίπου 2,5 μήνες και, σύμφωνα με εκτιμήσεις, κόστισαν περίπου $10 εκατομμύρια[3].

Αρχιτεκτονική

Το DBRX είναι ένα transformer μοντέλο τύπου decoder-only (decoder-only) και υλοποιεί λεπτόκοκκη (fine-grained) αρχιτεκτονική μείγματος εμπειρογνωμόνων (MoE).

Βασικά χαρακτηριστικά της αρχιτεκτονικής:

  • Συνολικός αριθμός παραμέτρων: 132 δισεκατομμύρια.
  • Εμπειρογνώμονες: Το μοντέλο αποτελείται από 16 μικρά εξειδικευμένα υπομοντέλα («εμπειρογνώμονες»).
  • Μηχανισμός ενεργοποίησης: Για κάθε token εισόδου ενεργοποιούνται μόνο 4 από τους 16 εμπειρογνώμονες. Αυτό σημαίνει ότι κατά το inference είναι ενεργές μόνο 36 δισ. παράμετροι, γεγονός που εξασφαλίζει υψηλή ταχύτητα και αποδοτικότητα. Αυτό το σχήμα παρέχει 65 φορές περισσότερους δυνατούς συνδυασμούς εμπειρογνωμόνων σε σύγκριση με το μοντέλο Mixtral (8 εμπειρογνώμονες με ενεργοποίηση 2)[1].
  • Συστατικά: Χρησιμοποιούνται σύγχρονες αρχιτεκτονικές λύσεις, όπως τα rotary position embeddings (RoPE), gated linear units (GLU) και grouped query attention (GQA).
  • Μήκος πλαισίου: 32.768 tokens.

Αυτή η αρχιτεκτονική επιτρέπει στο μοντέλο να συνδυάζει τα πλεονεκτήματα του τεράστιου αριθμού παραμέτρων (για αποθήκευση γνώσης) με την αποδοτικότητα μικρότερων μοντέλων (για ταχύτητα εξαγωγής αποτελεσμάτων).

Εκπαίδευση

Η προ-εκπαίδευση του DBRX πραγματοποιήθηκε σε ένα προσεκτικά επιμελημένο dataset όγκου 12 τρισεκατομμυρίων tokens, αποτελούμενο από κείμενα και κώδικα. Η ποιότητα των δεδομένων ήταν βασική προτεραιότητα: οι προγραμματιστές χρησιμοποίησαν την πλατφόρμα cloud Databricks (Apache Spark, Databricks Notebooks, Unity Catalog) για τον καθαρισμό, την προετοιμασία και τον έλεγχο των δεδομένων[1].

Κατά την εκπαίδευση εφαρμόστηκε η μέθοδος curriculum learning, κατά την οποία σε διαφορετικά στάδια μεταβαλλόταν η αναλογία των τύπων δεδομένων. Για παράδειγμα, το τελικό μέρος της εκπαίδευσης αφιερώθηκε στη σταδιακή εισαγωγή σύνθετων εργασιών, γεγονός που, σύμφωνα με τους προγραμματιστές, έδωσε αισθητή βελτίωση της ποιότητας. Η εκπαίδευση πραγματοποιήθηκε σε cluster από 3072 Nvidia H100 GPU.

Μετά την προ-εκπαίδευση, το βασικό μοντέλο υποβλήθηκε σε πρόσθετο fine-tuning (instruction tuning) για τη δημιουργία της διαδραστικής έκδοσης DBRX Instruct, βελτιστοποιημένης για την εκτέλεση οδηγιών χρήστη.

Απόδοση

Κατά τη στιγμή της κυκλοφορίας του, το DBRX καθιέρωσε νέο πρότυπο ποιότητας για τα ανοιχτά LLM σε ευρύ φάσμα benchmarks.

Σύγκριση με ανοιχτά μοντέλα

Αποτελέσματα του DBRX Instruct στα βασικά benchmarks[1]
Benchmark Εργασία DBRX Instruct Επόμενο καλύτερο (Mixtral/Grok-1)
Hugging Face Open LLM Leaderboard (AVG) Γενικές γνώσεις 74,5% 72,7% (Mixtral Instruct)
HumanEval Προγραμματισμός 70,1% 63,2% (Grok-1)
GSM8K Μαθηματική συλλογιστική 66,9% 62,9% (Grok-1)
MMLU Γενικές γνώσεις 73,7% 71,5% (Mixtral Instruct)

Το DBRX κατέλαβε την πρώτη θέση τόσο στη συνολική κατάταξη Hugging Face Open LLM Leaderboard όσο και στο σύνθετο τεστ Databricks LLM Gauntlet, παρουσιάζοντας σημαντική υπεροχή έναντι των προκατόχων του[1].

Σύγκριση με κλειστά μοντέλα

Το DBRX Instruct υπερέχει του GPT-3.5 Turbo σε μια σειρά βασικών δεικτών, συμπεριλαμβανομένων των MMLU (73,7% έναντι 70,0%) και HumanEval (70,1% έναντι 48,1%). Ως προς την ποιότητα απαντήσεων σε ορισμένα benchmarks (π.χ. MTBench), το μοντέλο πλησιάζει το επίπεδο του Gemini 1.0 Pro και των πρώιμων εκδόσεων του GPT-4[1].

Αποδοτικότητα εκπαίδευσης και inference

  • Αποδοτικότητα εκπαίδευσης: Η χρήση της αρχιτεκτονικής MoE επέτρεψε τη μείωση του κόστους σε FLOPS κατά 2-4 φορές σε σύγκριση με πυκνά μοντέλα παρόμοιας ποιότητας.
  • Αποδοτικότητα inference: Χάρη στην ενεργοποίηση μόνο 36 δισ. παραμέτρων, το DBRX παρέχει 2-3 φορές μεγαλύτερη απόδοση (ταχύτητα εξαγωγής αποτελεσμάτων) σε σύγκριση με πυκνά μοντέλα ισοδύναμου μεγέθους (π.χ. LLaMA2-70B)[1].

Αδειοδότηση και διαθεσιμότητα

Το DBRX διανέμεται υπό την ειδικά σχεδιασμένη άδεια Databricks Open Model License. Επιτρέπει την ελεύθερη χρήση και τροποποίηση, συμπεριλαμβανομένης της εμπορικής εφαρμογής, αλλά περιέχει ορισμένους περιορισμούς. Συγκεκριμένα, όπως και η άδεια LLaMA 2, απαιτεί τη λήψη ξεχωριστής άδειας από τη Databricks εάν οι υπηρεσίες που βασίζονται στο DBRX χρησιμοποιηθούν από κοινό άνω των 700 εκατομμυρίων ενεργών χρηστών ανά μήνα.

Τα προ-εκπαιδευμένα βάρη του μοντέλου (της βασικής και της Instruct έκδοσης) είναι διαθέσιμα για λήψη μέσω του αποθετηρίου στο Hugging Face[4].

Βιβλιογραφία

  • Mosaic Research Team. (2024). Introducing DBRX: A New State‑of‑the‑Art Open LLM. Databricks Blog.
  • Databricks. (2024). Databricks Open Model License (DBRX). Online specification.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Lepikhin, D.; et al. (2020). GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding. arXiv:2006.16668.
  • Ainslie, J.; et al. (2023). Grouped‑Query Attention: Efficient Training of Generalized Multi‑Query Transformers. arXiv:2305.13245.
  • Su, J.; et al. (2021). RoFormer: Enhanced Transformer with Rotary Position Embedding. arXiv:2104.09864.
  • Dao, T. (2023). FlashAttention‑2: Faster Attention with Better Parallelism and Work Partitioning. arXiv:2307.08691.
  • Cai, W.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Chen, Y.; et al. (2024). Scaling Laws for Fine‑Grained Mixture of Experts. arXiv:2402.07871.
  • Kundu, A.; et al. (2024). Strategic Data Ordering: Enhancing Large Language Model Training via Curriculum Learning. arXiv:2405.07490.

Παραπομπές

  1. 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Introducing DBRX: A New State-of-the-Art Open LLM». Databricks Blog. [1]
  2. «Databricks' open-source DBRX LLM beats Llama 2, Mixtral, and Grok». InfoWorld. [2]
  3. 3.0 3.1 «Databricks spent $10M on new DBRX generative AI model». TechCrunch. [3]
  4. «databricks/dbrx-base». Hugging Face. [4]