Jais (language model) (EL)
Jais (προφέρεται «Τζέις») — είναι μια οικογένεια ανοικτών μεγάλων γλωσσικών μοντέλων (LLM), που αναπτύχθηκε στα Ηνωμένα Αραβικά Εμιράτα και είναι ειδικά βελτιστοποιημένη για την αραβική γλώσσα[1]. Το όνομα του μοντέλου δόθηκε προς τιμήν του όρους Τζέμπελ Τζέις — της υψηλότερης κορυφής των ΗΑΕ[2].
Το έργο δημιουργήθηκε σε συνεργασία μεταξύ της ερευνητικής εταιρείας Inception (θυγατρική του τεχνολογικού ομίλου G42), του Πανεπιστημίου Τεχνητής Νοημοσύνης Mohamed bin Zayed (MBZUAI) και της καλιφορνέζικης εταιρείας κατασκευής chip τεχνητής νοημοσύνης Cerebras Systems[2]. Το Jais δημοσιεύθηκε ανοικτά υπό ελεύθερη άδεια χρήσης, με σκοπό να τονωθεί η ανάπτυξη του οικοσυστήματος ΤΝ για την αραβική γλώσσα, διατηρώντας την πολιτισμική και γλωσσική κληρονομιά και καθιστώντας τις σύγχρονες τεχνολογίες ΤΝ πιο προσιτές στον αραβόφωνο κόσμο[1].
Ιστορία ανάπτυξης και εκδόσεις
Το έργο Jais ξεκίνησε το 2023 στο πλαίσιο της περιορισμένης διαθεσιμότητας υφιστάμενων LLM για γλώσσες με λίγους πόρους. Οι προγραμματιστές επεσήμαναν την έλλειψη ποιοτικών δίγλωσσων μοντέλων που να μπορούν να επεξεργάζονται εξίσου καλά τόσο την αραβική όσο και την αγγλική γλώσσα[2].
Jais-13B: Πρώτη έκδοση
Η πρώτη έκδοση, Jais-13B, κυκλοφόρησε στις 30 Αυγούστου 2023 και περιείχε 13 δισεκατομμύρια παραμέτρους[1]. Το μοντέλο εκπαιδεύτηκε σε ένα μεικτό corpus αγγλικών και αραβικών κειμένων συνολικού όγκου 395 δισεκατομμυρίων token[3]. Κατά την κυκλοφορία του χαρακτηρίστηκε ως «το υψηλότερης ποιότητας αραβικό LLM»[1].
Jais-30B: Κλιμάκωση
Στις 8 Νοεμβρίου 2023, λιγότερο από τρεις μήνες αργότερα, η κοινοπραξία παρουσίασε τη δεύτερη, σημαντικά βελτιωμένη έκδοση — Jais-30B με 30 δισεκατομμύρια παραμέτρους[4]. Η κλιμάκωση του μεγέθους επιβλήθηκε από την ανάγκη αντιμετώπισης πιο σύνθετων εφαρμοσμένων εργασιών, όπως η περίληψη και η μετάφραση. Το μοντέλο εκπαιδεύτηκε σε ένα επεκτεταμένο και καθαρισμένο dataset όγκου 1,63 τρισεκατομμυρίων token[4].
Jais-70B και οικογένεια μοντέλων
Στις 6 Αυγούστου 2024 η Inception (G42) ανακοίνωσε την κυκλοφορία του ναυαρχίδος μοντέλου Jais-70B (70 δισεκατομμύρια παράμετροι) και μιας ολόκληρης οικογένειας συναφών μοντέλων[5]. Το Jais-70B έγινε το μεγαλύτερο ανοικτό LLM προσανατολισμένο στην αραβική γλώσσα. Στην ανάπτυξή του εφαρμόστηκε η μέθοδος continuous training: αντί για εκπαίδευση από μηδενική βάση, χρησιμοποιήθηκε ως αφετηρία το μοντέλο Llama 2 70B της Meta, το οποίο fine-tuned σε 330 δισεκατομμύρια token στα αραβικά. Αυτό επέτρεψε την αποτελεσματική μεταφορά γνώσης της αγγλικής γλώσσας από το Llama 2 και τη συγκέντρωση πόρων στην εκπαίδευση της αραβικής[5].
Αρχιτεκτονική και τεχνικά χαρακτηριστικά
Το Jais ανήκει στα αυτοπαλίνδρομα transformer μοντέλα βασισμένα στην αρχιτεκτονική GPT-3 (decoder-only). Το βασικό χαρακτηριστικό του μοντέλου είναι η δίγλωσση εξειδίκευσή του στην αραβική και αγγλική γλώσσα, σε αντίθεση με πολλά πολύγλωσσα LLM όπου κυριαρχεί η αγγλική. Αυτό επιτρέπει την επίτευξη υψηλού βάθους κατανόησης της αραβικής γλώσσας και των διαλέκτων της[3].
Κατά τη δημιουργία του Jais ενσωματώθηκαν προηγμένες τεχνικές λύσεις[3]:
- Τοποθέτηση ALiBi: Ένα ειδικό σχήμα positional embedding που επιτρέπει στο μοντέλο να επεξεργάζεται μεγαλύτερο context από αυτό στο οποίο εκπαιδεύτηκε.
- Ενεργοποίηση SwiGLU: Συνάρτηση ενεργοποίησης που βελτιώνει την ποιότητα εκπαίδευσης και την εκφραστικότητα των νευρωνικών στρωμάτων.
- Maximal Update Parametrization (µP): Μεθοδολογία ρύθμισης υπερπαραμέτρων που σταθεροποιεί την εκπαίδευση κατά την αύξηση του μεγέθους του μοντέλου.
- Εξειδικευμένος tokenizer: Σχεδιασμένος λαμβάνοντας υπόψη τις ιδιαιτερότητες της αραβικής και αγγλικής γλώσσας, μειώνοντας τον αριθμό των token για αραβικό κείμενο κατά 3–4 φορές σε σύγκριση με καθολικούς tokenizer και βελτιώνοντας την ταχύτητα επεξεργασίας[6].
Πέραν των βασικών μοντέλων (foundation models), κυκλοφόρησε η έκδοση Jais-chat, η οποία έχει υποβληθεί σε πρόσθετο fine-tuning σε 9,6 εκατομμύρια ζεύγη ερωτήσεων-απαντήσεων για προσαρμογή σε εργασίες chatbot και βοηθού[3].
Εκπαίδευση και σύνολο δεδομένων
Ένα από τα κύρια ζητήματα του έργου ήταν η προετοιμασία ενός ποιοτικού και μεγάλου corpus αραβικών κειμένων. Το τελικό σύνολο εκπαίδευσης για το Jais-13B ανήλθε σε 395 δισ. token, εκ των οποίων:
- 116 δισ. token (29%) — αραβικό κείμενο.
- 279 δισ. token (71%) — αγγλικό κείμενο και πηγαίος κώδικας.
Το αραβικό συστατικό έγινε σκόπιμα σημαντικό (περίπου 30%), ώστε να εξασφαλιστεί υψηλή ποιότητα γλωσσομάθειας[3]. Τα δεδομένα περιλάμβαναν βιβλία, άρθρα ειδήσεων, ιστοσελίδες και πηγαίο κώδικα. Για την αύξηση του όγκου ποιοτικών αραβικών κειμένων εφαρμόστηκε μηχανική μετάφραση αγγλόφωνων πόρων[3].
Η εκπαίδευση των μοντέλων διεξήχθη στον υπερυπολογιστή Condor Galaxy 1 (CG-1) στο Αμπού Ντάμπι, ο οποίος αναπτύχθηκε από κοινού από τις G42 και Cerebras Systems. Χάρη σε αυτή την υποδομή, η εκπαίδευση του Jais-13B διήρκεσε μόλις περίπου 3,5 ημέρες καθαρού χρόνου[2].
Εφαρμογή και σημασία
Το Jais τοποθετείται ως ένα βασικό βήμα στην ανάπτυξη του γενεσιουργού ΤΝ για την αραβική γλώσσα και άλλες γλωσσικές κοινότητες που εκπροσωπούνται ανεπαρκώς στα σύγχρονα LLM. Η ανοικτή πρόσβαση στο μοντέλο αποσκοπεί στη διέγερση της υιοθέτησης τεχνολογιών επεξεργασίας φυσικής γλώσσας στις περιοχές της Μέσης Ανατολής και της Βόρειας Αφρικής.
Από την έναρξη του έργου, αυτό κέντρισε το ενδιαφέρον κυβερνητικών και εμπορικών φορέων των ΗΑΕ. Πρώιμη πρόσβαση στο μοντέλο έλαβαν το Υπουργείο Εξωτερικών των ΗΑΕ, η εταιρεία πετρελαίου και φυσικού αερίου ADNOC, η αεροπορική εταιρεία Etihad Airways και η τράπεζα First Abu Dhabi Bank[1]. Το 2024 η Microsoft ανακοίνωσε την ενσωμάτωση του Jais στην υπολογιστική νεφική πλατφόρμα Microsoft Azure, καθιστώντας το διαθέσιμο σε παγκόσμιους χρήστες[6].
Οι δημιουργοί του Jais τονίζουν τον ρόλο του στη διατήρηση της αραβικής πολιτισμικής και γλωσσικής κληρονομιάς. Σύμφωνα με τον διευθύνοντα σύμβουλο της Inception Andrew Jackson, το έργο αποσκοπεί στο «να διασφαλίσει ότι η αραβική γλώσσα με την πλούσια κληρονομιά της θα βρει τη φωνή της στο τοπίο της ΤΝ»[1]. Η συσσωρευθείσα εμπειρία σχεδιάζεται να χρησιμοποιηθεί για τη δημιουργία ανάλογων LLM για άλλες γλώσσες και πολιτισμούς[1].
Βιβλιογραφία
- Shazeer, N.; et al. (2020). GLU Variants Improve Transformer. arXiv:2002.05202.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Yang, G.; et al. (2022). Tensor Programs V: Tuning Large Neural Networks via Zero‑Shot Hyperparameter Transfer. arXiv:2203.03466.
- Ali, A. R.; et al. (2022). A Large and Diverse Arabic Corpus for Language Modeling. arXiv:2201.09227.
- Sengupta, N.; et al. (2023). Jais and Jais‑chat: Arabic‑Centric Foundation and Instruction‑Tuned Open Generative Large Language Models. arXiv:2308.16149.
- Inception AI (2024). JAIS 30B Whitepaper. Online whitepaper.
- Koto, F.; et al. (2024). ArabicMMLU: Assessing Massive Multitask Language Understanding in Arabic. arXiv:2402.12840.
- Qian, Z.; et al. (2024). CamelEval: Advancing Culturally Aligned Arabic Language Models and Benchmarks. arXiv:2409.12623.
- Blake, C.; et al. (2024). u‑μP: The Unit‑Scaled Maximal Update Parametrization. arXiv:2407.17465.
- Inception AI; MBZUAI; Cerebras Systems (2024). Jais Family Model Card. Hugging Face.
Παραπομπές
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «Meet "Jais", The World's Most Advanced Arabic Large Language Model Open Sourced by G42's Inception». Cerebras Systems. [1]
- ↑ 2.0 2.1 2.2 2.3 «UAE's G42 launches open source Arabic language AI model». Reuters. [2]
- ↑ 3.0 3.1 3.2 3.3 3.4 3.5 «[2308.16149] Jais and Jais-chat: Arabic-Centric Foundation and Instruction-Tuned Open Generative Large Language Models». arXiv. [3]
- ↑ 4.0 4.1 «Upgraded Arabic large language model is twice as big». Computer Weekly. [4]
- ↑ 5.0 5.1 «G42 launches JAIS 70B and 20 other AI models to advance Arabic natural language processing». Abu Dhabi Media Office. [5]
- ↑ 6.0 6.1 «Introducing JAIS: Arabic-centric Large Language Model on Azure». Microsoft Tech Community. [6]