Jamba (language model) (EL)

From Systems analysis Wiki
Jump to navigation Jump to search

Jamba — είναι μια οικογένεια μεγάλων γλωσσικών μοντέλων (LLM), που αναπτύχθηκε από την ισραηλινή ερευνητική εταιρεία AI21 Labs. Το Jamba αποτελεί την πρώτη στο είδος της υβριδική αρχιτεκτονική, που συνδυάζει βασικά στοιχεία δύο κυρίαρχων προσεγγίσεων στην ανάπτυξη AI: transformer και μοντέλα χώρου καταστάσεων (State Space Models, SSM), ειδικότερα, της αρχιτεκτονικής Mamba[1].

Ο κύριος στόχος του Jamba είναι η επίλυση του θεμελιώδους συμβιβασμού των σύγχρονων LLM: υψηλή ποιότητα και απόδοση (χαρακτηριστικά των transformer) έναντι αποδοτικότητας και ικανότητας επεξεργασίας υπερ-μακρών πλαισίων (χαρακτηριστικά των SSM). Συνδυάζοντας αυτές τις προσεγγίσεις και προσθέτοντας σπανιότητα μέσω Mixture-of-Experts (MoE), το Jamba προσφέρει ένα μοντέλο που είναι ταυτόχρονα ισχυρό, αποδοτικό και ικανό να επεξεργάζεται τεράστιους όγκους κειμένου σε ένα μόνο ερώτημα.

Αρχιτεκτονική Jamba σε λεπτομέρειες

Το Jamba δεν απλώς εναλλάσσει στρώματα transformer και Mamba. Χρησιμοποιεί μια προσεκτικά σχεδιασμένη δομή block, όπου κάθε block αποτελείται από οκτώ στρώματα.

Δομή ενός block Jamba:

  • Ένα στρώμα Transformer: Αυτό το στρώμα είναι υπεύθυνο για την «βαθιά» κατανόηση και τους σύνθετους συλλογισμούς. Σε αυτό το στρώμα είναι ενσωματωμένη η αρχιτεκτονική Mixture-of-Experts (MoE).
  • Επτά στρώματα Mamba: Αυτά τα στρώματα ακολουθούν το στρώμα transformer και είναι υπεύθυνα για την αποδοτική επεξεργασία της ακολουθίας και τη «μεταφορά» πληροφοριών μέσα από μεγάλο πλαίσιο[2].

Αυτή η ασύμμετρη δομή επιτρέπει στο μοντέλο να διαχειρίζεται αποδοτικά τους υπολογιστικούς πόρους: οι βαριές αλλά ισχυρές λειτουργίες transformer εκτελούνται λιγότερο συχνά, ενώ οι ελαφριές και γρήγορες λειτουργίες Mamba εκτελούνται συχνότερα.

Ενσωμάτωση Mixture-of-Experts (MoE)

Στο Jamba χρησιμοποιείται η αρχιτεκτονική MoE για περαιτέρω αύξηση της αποδοτικότητας.

  • Το MoE εφαρμόζεται μόνο στα πλήρως συνδεδεμένα blocks (FFN) εντός των στρωμάτων-transformer[3]. Τα στρώματα Mamba παραμένουν πυκνά.
  • Στο πρώτο μοντέλο Jamba υπήρχαν 16 ειδικοί.
  • Για κάθε token, το δίκτυο-δρομολογητής επιλέγει 2 καλύτερους ειδικούς (Top-2 gating).

Αυτό σημαίνει ότι, αν και ο συνολικός αριθμός παραμέτρων του μοντέλου είναι μεγάλος (52 δισ.), σε κάθε βήμα επεξεργασίας token στο στρώμα-transformer ενεργοποιούνται μόνο 2 από τους 16 ειδικούς, καθιστώντας τους υπολογισμούς πολύ γρήγορους.

Εξέλιξη των μοντέλων Jamba

Jamba-v0.1 (Μάρτιος 2024)

Το πρώτο μοντέλο που παρουσιάστηκε στο πλαίσιο αυτής της οικογένειας έχει τα ακόλουθα χαρακτηριστικά:

Τεχνικά χαρακτηριστικά Jamba-v0.1
Χαρακτηριστικό Τιμή
Συνολικός αριθμός παραμέτρων 52 δισεκατομμύρια
Ενεργές παράμετροι ~12 δισεκατομμύρια
Αριθμός ειδικών (MoE) 16 (2 ενεργοί)
Παράθυρο πλαισίου 256 000 token
Άδεια Apache 2.0[4]

Χάρη στην υβριδική αρχιτεκτονική του, το Jamba-1 είναι ικανό να επεξεργάζεται πλαίσιο μήκους 256 000 token, που ισοδυναμεί με ένα μυθιστόρημα περίπου 400 σελίδων, και μπορεί να αναπτυχθεί σε μία καταναλωτική GPU με 80 GB μνήμης[5].

Jamba-1.5 (2024)

Το 2024 η AI21 Labs παρουσίασε την ανανεωμένη οικογένεια μοντέλων Jamba 1.5, που περιλαμβάνει δύο εκδόσεις: Jamba 1.5 Mini (12B ενεργές παράμετροι από 52B συνολικά) και Jamba 1.5 Large (94B ενεργές παράμετροι από 398B συνολικά)[6]. Αυτά τα μοντέλα παρουσιάζουν ουσιαστικές βελτιώσεις στην απόδοση:

  • Έως 2,5 φορές ταχύτερη εξαγωγή συμπερασμάτων σε μεγάλα πλαίσια σε σύγκριση με τους ανταγωνιστές.
  • Υποστήριξη εννέα γλωσσών, συμπεριλαμβανομένων των αγγλικών, ισπανικών, γαλλικών και αραβικών[7].

Βασικά πλεονεκτήματα και απόδοση

  • Τεράστιο παράθυρο πλαισίου: 256 000 token — ένα από τα μεγαλύτερα παράθυρα μεταξύ όλων των διαθέσιμων (συμπεριλαμβανομένων των ιδιόκτητων) μοντέλων κατά τη στιγμή της κυκλοφορίας του. Αυτό καθιστά το Jamba ιδανικό για εργασίες που απαιτούν ανάλυση μεγάλων εγγράφων: νομικών συμβολαίων, επιστημονικών εργασιών, ολόκληρων βάσεων κώδικα ή μακρών διαλόγων.
  • Υψηλή απόδοση και αποδοτικότητα: Στις δοκιμές, το Jamba επιδεικνύει απόδοση συγκρίσιμη ή ανώτερη από τα κορυφαία ανοιχτά μοντέλα παρόμοιου μεγέθους, όπως τα Llama και Mixtral, παρουσιάζοντας ταυτόχρονα 3 φορές υψηλότερη απόδοση σε μεγάλα πλαίσια[8].
  • Ανοιχτότητα και προσβασιμότητα: Το Jamba διανέμεται υπό την ελεύθερη άδεια Apache 2.0, που επιτρέπει την ελεύθερη χρήση του για εμπορικούς και ερευνητικούς σκοπούς. Τα βάρη του μοντέλου είναι διαθέσιμα στην πλατφόρμα Hugging Face.

Αποτελέσματα σε benchmark

Το Jamba 1.5 παρουσιάζει ανταγωνιστικά αποτελέσματα σε διάφορα benchmark[9]:

  • Jamba 1.5 Mini σκόραρε 46,1 στο Arena Hard, καθιστώντας το το κορυφαίο δημόσιο μοντέλο στην κατηγορία του[10].
  • Jamba 1.5 Large σκόραρε 65,4 στο Arena Hard, ξεπερνώντας τα Llama 3.1 70B και 405B.

Εφαρμογές και διαθεσιμότητα

Το Jamba είναι βελτιστοποιημένο για επιχειρηματικές εφαρμογές και υποστηρίζει δυνατότητες όπως κλήση συναρτήσεων, δομημένη εξαγωγή σε JSON και επεξεργασία εγγράφων. Το μοντέλο είναι διαθέσιμο σε πολλές πλατφόρμες, συμπεριλαμβανομένων:

  • Hugging Face
  • Google Cloud Vertex AI
  • Microsoft Azure
  • NVIDIA API catalog
  • Amazon Bedrock[9]
  • AI21 Studio

Για την υποστήριξη οικονομικά αποδοτικής εξαγωγής συμπερασμάτων, η AI21 Labs παρουσίασε ExpertsInt8 — μια νέα τεχνική κβαντισμού που επιτρέπει την εκτέλεση του Jamba 1.5 Large σε μηχάνημα με 8 GPU των 80GB χωρίς απώλεια ποιότητας κατά την επεξεργασία πλαισίου 256K token[11].

Βιβλιογραφία

  • Lieber, O.; et al. (2024). Jamba: A Hybrid Transformer‑Mamba Language Model. arXiv:2403.19887.
  • Lieber, O.; et al. (2024). Jamba‑1.5 Models and ExpertsInt8 Quantization. OpenReview JFPaD7lpBD.
  • Gu, A.; Dao, T. (2023). Mamba: Linear‑Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752.
  • Gu, A.; et al. (2021). S4: Efficiently Modeling Long Sequences with Structured State Spaces. arXiv:2111.00396.
  • Fedus, W.; et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Yun, L.; et al. (2024). Toward Inference‑Optimal Mixture‑of‑Expert Large Language Models. arXiv:2404.02852.
  • Liu, J.; et al. (2024). A Survey on Mixture of Experts in Large Language Models. arXiv:2407.06204.
  • Gupta, V.; et al. (2024). Lynx: Enabling Efficient MoE Inference through Dynamic Batch‑Aware Expert Selection. arXiv:2411.08982.
  • Liu, J.; et al. (2024). A Survey on Inference Optimization Techniques for Mixture of Experts Models. arXiv:2412.14219.
  • Hsieh, C.‑P.; et al. (2024). RULER: What's the Real Context Size of Your Long‑Context Language Models?. arXiv:2404.06654.

Σημειώσεις

  1. «Announcing Jamba: AI21's Groundbreaking SSM-Transformer Model». AI21 Labs Blog. [1]
  2. Lieber, O., et al. (2024). Jamba: A Hybrid Transformer-Mamba Language Model. arXiv:2403.19887.
  3. «Jamba Documentation». Hugging Face Transformers. [2]
  4. «ai21labs/Jamba-v0.1». Hugging Face. [3]
  5. «AI21 Labs' Jamba: A New Hybrid LLM Architecture». Gradient Flow. [4]
  6. «Announcing the Jamba-1.5 model family». AI21 Labs Blog. [5]
  7. «ai21labs/AI21-Jamba-Large-1.5». Hugging Face. [6]
  8. «AI21 Labs разбивает новые барьеры с помощью Jamba». ITinAI. [7]
  9. 9.0 9.1 «Вышла Jamba 1.5: гибридная модель от AI21 Labs». Дзен. [8]
  10. «Jamba-1.5 family of models by AI21 Labs is now available in Amazon Bedrock». AWS What's New. [9]
  11. «ExpertsInt8: A new paradigm for efficient inference of MoE-based LLMs». OpenReview. [10]