BLOOM (language model) (EL)
BLOOM (BigScience Large Open-science Open-access Multilingual Language Model) — είναι ένα μεγάλο γλωσσικό μοντέλο (LLM) ανοιχτής πρόσβασης, που περιέχει 176 δισεκατομμύρια παραμέτρους. Αναπτύχθηκε το 2022 στο πλαίσιο του έργου BigScience — μιας διεθνούς συνεργασίας άνω των 1000 ερευνητών από 70 χώρες υπό την αιγίδα της εταιρείας Hugging Face[1].
Το BLOOM είναι ένα αυτοπαλίνδρομο μοντέλο transformer, ικανό να παράγει συνεκτικό κείμενο σε 46 φυσικές γλώσσες και 13 γλώσσες προγραμματισμού. Το μοντέλο εκπαιδεύτηκε στον υπερυπολογιστή Jean Zay στη Γαλλία και αποτέλεσε μία από τις πρώτες πραγματικά ανοιχτές εναλλακτικές λύσεις έναντι των κλειστών μοντέλων, όπως το GPT-3 της OpenAI[2].
Ιστορικό και ανάπτυξη
Η πρωτοβουλία BigScience ξεκίνησε τον Μάιο του 2021 με στόχο τη δημοκρατικοποίηση της έρευνας στον τομέα της ΤΝ μέσω της από κοινού δημιουργίας ενός μεγάλου ανοιχτού γλωσσικού μοντέλου[1]. Εκείνη την εποχή, τα προηγμένα LLM, όπως το GPT-3, αναπτύσσονταν με κλειστό τρόπο σε μεγάλες εταιρείες, οι οποίες δεν αποκάλυπταν την αρχιτεκτονική, τα δεδομένα εκπαίδευσης και τον πηγαίο κώδικα. Το έργο BigScience συγκέντρωσε περισσότερους από χίλιους εθελοντές-ερευνητές από όλο τον κόσμο για τη δημιουργία ενός ανταγωνιστικού και πλήρως ανοιχτού μοντέλου.
Το έργο έλαβε επιχορήγηση για υπολογιστικούς πόρους στον γαλλικό υπερυπολογιστή Jean Zay (IDRIS/CNRS). Η εκπαίδευση του μοντέλου πραγματοποιήθηκε από τις 11 Μαρτίου έως τις 6 Ιουλίου 2022[3]. Η ανάπτυξη διεξήχθη με μέγιστη διαφάνεια: η ομάδα δημοσίευε πληροφορίες για την επιλογή δεδομένων, τις ρυθμίσεις εκπαίδευσης και διεξήγαγε δημόσιες συζητήσεις, ακολουθώντας τον εγκεκριμένο ηθικό χάρτη του έργου.
Αρχιτεκτονική και εκπαίδευση
Αρχιτεκτονική μοντέλου
Το BLOOM βασίζεται στην αρχιτεκτονική αυτοπαλίνδρομου transformer τύπου (decoder-only), ανάλογη με εκείνη του μοντέλου GPT-3[2].
| Παράμετρος | Χαρακτηριστικό |
|---|---|
| Τύπος | Transformer decoder-only |
| Παράμετροι | 176 247 271 424 |
| Στρώματα (layers) | 70 |
| Κεφαλές attention | 112 |
| Μέγεθος κρυφής κατάστασης | 14 336 |
| Μήκος ακολουθίας | 2048 tokens |
| Συνάρτηση ενεργοποίησης | GeLU· κωδικοποιήσεις θέσης ALiBi |
Το μοντέλο υλοποιήθηκε με βάση τα frameworks Megatron-LM και DeepSpeed, που αναπτύχθηκαν από την Nvidia και τη Microsoft αντίστοιχα, με ορισμένες τροποποιήσεις για αποδοτική κατανεμημένη εκπαίδευση[5].
Δεδομένα εκπαίδευσης
Το BLOOM εκπαιδεύτηκε σε ειδικά δημιουργημένο σώμα κειμενικών δεδομένων ROOTS (The Responsible Open-science Open-collaboration Text Sources). Ο συνολικός όγκος των δεδομένων ανήλθε σε 1,6 terabyte καθαρισμένου και απαλλαγμένου από διπλότυπα κειμένου (≈366 δισεκατομμύρια tokens)[6].
Το σώμα περιλαμβάνει κείμενα σε 59 γλώσσες:
- 46 φυσικές γλώσσες, συμπεριλαμβανομένης της αγγλικής (30% των tokens), της κινεζικής, της γαλλικής, της ισπανικής, της αραβικής, καθώς και πολλών γλωσσών με λίγους πόρους (π.χ. Chi Tumbuka — 0,00002% των tokens).
- 13 γλώσσες προγραμματισμού, συμπεριλαμβανομένων των Python, Java, JavaScript και C++.
Αυτό το πολύγλωσσο και πολυτομεακό dataset συλλέχθηκε σκόπιμα, ώστε το μοντέλο να είναι κατάλληλο για ευρύ φάσμα γλωσσικών κοινοτήτων.
Απόδοση και εφαρμογές
Το BLOOM επιδεικνύει ανταγωνιστικά αποτελέσματα σε ποικίλα benchmarks, συγκρίσιμα με μοντέλα παρόμοιου μεγέθους, όπως το OPT-175B της Meta, παρά την πολυγλωσσικότητά του[2].
Το μοντέλο είναι ικανό να εκτελεί ευρύ φάσμα εργασιών σε λειτουργία zero-shot (χωρίς πρόσθετη εκπαίδευση), συμπεριλαμβανομένων:
- Παραγωγής κειμένου σε καθορισμένο ύφος.
- Σύνοψης εγγράφων.
- Απαντήσεων σε ερωτήσεις βάσει περιβάλλοντος.
- Μετάφρασης μεταξύ γλωσσών.
- Παραγωγής απλού κώδικα προγραμμάτων.
Για τη βελτίωση της πρακτικής χρησιμότητας, η ομάδα BigScience πραγματοποίησε αργότερα πρόσθετο πολυεργασιακό fine-tuning του μοντέλου, δημιουργώντας την έκδοση BLOOMZ, η οποία ακολουθεί πιο ακριβώς τις οδηγίες του χρήστη.
Αδειοδότηση και ανοιχτή πρόσβαση
Το πλήρες μοντέλο BLOOM των 176 δισεκατομμυρίων παραμέτρων, ο πηγαίος κώδικάς του και τα δεδομένα δημοσιεύθηκαν τον Ιούλιο του 2022. Το μοντέλο διανέμεται υπό την ειδικά σχεδιασμένη άδεια RAIL (Responsible AI License) v1.0[7].
Αυτή η άδεια επιτρέπει τη δωρεάν χρήση και τροποποίηση του μοντέλου, αλλά επιβάλλει ορισμένους περιορισμούς στη χρήση του σε συγκεκριμένους τομείς. Ειδικότερα, απαγορεύεται η χρήση του BLOOM για σκοπούς που αντιβαίνουν στους ηθικούς κανόνες του BigScience, όπως:
- Μαζική παρακολούθηση.
- Αλγοριθμικές διακρίσεις.
- Διάδοση παραπληροφόρησης.
- Διαχείριση θανατηφόρων όπλων.
Το BLOOM έγινε το πρώτο μεγάλο μοντέλο ΤΝ που κυκλοφόρησε υπό άδεια με ρητές ρήτρες υπεύθυνης χρήσης[8].
Βιβλιογραφία
- Hendrycks, D.; Gimpel, K. (2016). Gaussian Error Linear Units (GELUs). arXiv:1606.08415.
- Shoeybi, M.; et al. (2019). Megatron‑LM: Training Multi‑Billion Parameter Language Models Using Model Parallelism. arXiv:1909.08053.
- Rajbhandari, S.; et al. (2020). ZeRO: Memory Optimizations Toward Training Trillion Parameter Models. arXiv:1910.02054.
- Press, O.; et al. (2021). Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation. arXiv:2108.12409.
- Le Scao, T.; et al. (2022). BLOOM: A 176B‑Parameter Open‑Access Multilingual Language Model. arXiv:2211.05100.
- Muennighoff, N.; et al. (2022). BLOOMZ & mT0: A Cross‑Lingual Baseline for Instruction Finetuning. arXiv:2211.01786.
- BigScience Workshop (2022). BigScience OpenRAIL‑M License v1.0. Online specification.
- Akiki, C.; et al. (2022). BigScience: A Case Study in the Social Construction of a Multilingual Large Language Model. arXiv:2212.04960.
- Yong, Z.‑X.; et al. (2022). BLOOM+1: Adding Language Support to BLOOM for Zero‑Shot Prompting. arXiv:2212.09535.
- Biderman, S.; et al. (2023). The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset. arXiv:2303.03915.
Παραπομπές
- ↑ 1.0 1.1 «BLOOM». BigScience Blog. [1]
- ↑ 2.0 2.1 2.2 Le Scao, T., et al. (2022). «BLOOM: A 176B-Parameter Open-Access Multilingual Language Model». arXiv:2211.05100. [2]
- ↑ «Researchers open-source neural network with 176B parameters». SiliconANGLE. [3]
- ↑ «bigscience/bloom». Hugging Face. [4]
- ↑ «The Technology Behind BLOOM Training». Hugging Face Blog. [5]
- ↑ Biderman, S. et al. (2023). «The BigScience ROOTS Corpus: A 1.6 TB Composite Multilingual Dataset». arXiv:2303.03915. [6]
- ↑ «BigScience OpenRAIL-M». BigScience Blog. [7]
- ↑ Heikkilä, M. «BLOOM is the first AI model to be under a...». X. [8]