PaLM (Pathways Language Model) (EL)
PaLM (Pathways Language Model) — είναι μια οικογένεια μεγάλων γλωσσικών μοντέλων (LLM), που αναπτύχθηκε από την εταιρεία Google. Η πρώτη έκδοση του μοντέλου, που παρουσιάστηκε τον Απρίλιο του 2022, περιείχε 540 δισεκατομμύρια παραμέτρους και έγινε ένα από τα μεγαλύτερα γλωσσικά μοντέλα στον κόσμο εκείνη την εποχή, επιδεικνύοντας획-breaking δυνατότητες που αποτελούσαν αποτέλεσμα μαζικής κλιμάκωσης[1].
Η βασική τεχνολογική θεμελίωση του PaLM ήταν το Pathways — μια νέα αρχιτεκτονική συστημάτων Machine Learning από την Google, που επιτρέπει τον αποτελεσματικό συντονισμό κατανεμημένων υπολογισμών σε χιλιάδες επεξεργαστές επιτάχυνσης[2]. Το PaLM έγινε η πρώτη μεγάλης κλίμακας επίδειξη αυτού του συστήματος, αποδεικνύοντας πρωτοφανή αποδοτικότητα εκπαίδευσης σε τεράστιες κλίμακες.
Σύστημα Pathways: Η βάση για κλιμάκωση
Η έννοια του Pathways, που παρουσιάστηκε από την Google το 2021, προέβλεπε τη δημιουργία ενός ενιαίου νευρωνικού δικτύου, ικανού να γενικεύει αποτελεσματικά γνώσεις για διαφορετικούς τομείς και να εκτελεί χιλιάδες εργασίες ταυτόχρονα. Το PaLM έγινε η πρώτη μεγάλης κλίμακας εφαρμογή αυτού του συστήματος: η εκπαίδευσή του παραλληλίστηκε σε 6144 εξειδικευμένους επεξεργαστές TPU v4, που ενώθηκαν σε δύο cloud clusters (TPU v4 Pods)[1].
Τη στιγμή της δημιουργίας του, ήταν η μεγαλύτερη διαμόρφωση TPU που είχε χρησιμοποιηθεί ποτέ για την εκπαίδευση ενός μοντέλου. Το σύστημα επίτευξε ρεκόρ αποδοτικότητας χρήσης υλικού (57,8% FLOPs), κάτι που επέτρεψε να ξεπεραστούν σε κλίμακα σημαντικά τα προηγούμενα έργα και να εκπαιδευτεί επιτυχώς ένα μοντέλο με περισσότερες από μισό τρισεκατομμύριο παραμέτρους[3].
Αρχιτεκτονική και δεδομένα εκπαίδευσης
Αρχιτεκτονική μοντέλου
Το PaLM είναι ένα πυκνό (μη αραιό) γλωσσικό μοντέλο με αρχιτεκτονική «μόνο αποκωδικοποιητής» (decoder-only), ανάλογο με τα μοντέλα της σειράς GPT. Αυτή η αρχιτεκτονική είναι προσανατολισμένη σε εργασίες πρόβλεψης του επόμενου token και είναι κατάλληλη για παραγωγή κειμένου. Σε αντίθεση με την τυπική αρχιτεκτονική transformer, το PaLM χρησιμοποιεί αρκετές βασικές τροποποιήσεις για τη βελτίωση της αποδοτικότητας[1]:
- Παράλληλα στρώματα: Οι μηχανισμοί attention και τα πλήρως συνδεδεμένα στρώματα υπολογίζονται παράλληλα, κάτι που επέτρεψε να επιταχυνθεί η εκπαίδευση κατά περίπου 15%.
- SwiGLU ενεργοποίηση: Χρήση της συνάρτησης ενεργοποίησης SwiGLU αντί της τυπικής ReLU, κάτι που βελτίωσε σημαντικά την ποιότητα του μοντέλου.
Δεδομένα εκπαίδευσης
Το PaLM εκπαιδεύτηκε σε ένα υψηλής ποιότητας corpus δεδομένων όγκου 780 δισεκατομμυρίων token. Το dataset ήταν πολύγλωσσο και ποικίλο, συμπεριλαμβάνοντας[1]:
- Υψηλής ποιότητας διαδικτυακά έγγραφα και βιβλία.
- Άρθρα από τη Wikipedia.
- Διαλόγους από κοινωνικά δίκτυα (50% του corpus).
- Πηγαίο κώδικα από το GitHub (5% του corpus).
Περίπου 78% των δεδομένων ήταν στην αγγλική γλώσσα, ενώ το υπόλοιπο 22% αποτελούσε πολύγλωσσο σύνολο. Για τη διαδικασία tokenization χρησιμοποιήθηκε μια ειδική «χωρίς απώλειες» μέθοδος, η οποία διατηρούσε όλα τα κενά (κρίσιμο για τον κώδικα) και χώριζε μη αναγνωρισμένους χαρακτήρες Unicode σε bytes.
Δυνατότητες και αποτελέσματα
Αναδυόμενες ικανότητες και few-shot εκπαίδευση
Το PaLM απέδειξε ότι η αύξηση της κλίμακας του μοντέλου, του όγκου των δεδομένων και των υπολογιστικών πόρων μπορεί να οδηγεί σε αναδυόμενες (απροσδόκητα εμφανιζόμενες) ικανότητες. Σε πολλές εργασίες, η απόδοση του μοντέλου αυξανόταν απότομα και μη γραμμικά μόνο όταν επιτυγχανόταν η μέγιστη κλίμακα, γεγονός που υποδείκνυε την εμφάνιση νέων, προηγουμένως μη παρατηρημένων δυνατοτήτων[3].
Το μοντέλο αξιολογήθηκε σε λειτουργία few-shot εκπαίδευσης (χωρίς fine-tuning, με λίγα παραδείγματα στο prompt) και ξεπέρασε τα προηγούμενα μεγάλα μοντέλα (όπως το GPT-3 και το LaMDA) σε 28 από τα 29 δημοφιλή NLP benchmark. Στο σύνθετο σύνολο δοκιμών BIG-bench, το PaLM έγινε το πρώτο μοντέλο τα αποτελέσματα του οποίου ξεπέρασαν το μέσο επίπεδο που επίτευξαν ανθρώπινοι δοκιμαστές[1].
Συλλογισμός με αλυσίδα σκέψης (Chain-of-Thought)
Ένα από τα πιο εντυπωσιακά επιτεύγματα του PaLM ήταν η ικανότητα πολυβηματικού λογικού συλλογισμού με τη χρήση της τεχνικής «αλυσίδα σκέψης» (chain-of-thought prompting)[1]. Αυτή η μεθοδολογία συνίσταται στην παροχή στο μοντέλο παραδειγμάτων όπου η επίλυση μιας εργασίας αναλύεται βήμα προς βήμα. Αφού εκπαιδεύτηκε σε τέτοια παραδείγματα, το PaLM μπόρεσε να παράγει τη δική του «αλυσίδα σκέψης» για την επίλυση νέων σύνθετων εργασιών, όπως:
- Μαθηματικά προβλήματα: Στη δοκιμή GSM8K (προβλήματα επιπέδου δημοτικού σχολείου) το PaLM έλυσε το 58% των προβλημάτων, ξεπερνώντας το προηγούμενο state-of-the-art αποτέλεσμα που επιτεύχθηκε από fine-tuned μοντέλο.
- Εργασίες κοινής λογικής: Το μοντέλο μπόρεσε να παράγει εκτενείς εξηγήσεις για μη τετριμμένες εργασίες, για παράδειγμα να ερμηνεύει αστεία που δεν είχε συναντήσει προηγουμένως.
Αυτή η ικανότητα έκανε τη διαδικασία «σκέψης» του μοντέλου πιο διαφανή και πιο κοντά στην ανθρώπινη.
Παραγωγή κώδικα και πολυγλωσσία
Παρά το γεγονός ότι ο πηγαίος κώδικας αποτελούσε μόλις το 5% των δεδομένων εκπαίδευσης, το PaLM έδειξε επίπεδο συγκρίσιμο με το εξειδικευμένο μοντέλο OpenAI Codex σε εργασίες παραγωγής και μετασχηματισμού κώδικα. Το μοντέλο επίσης επέδειξε ισχυρές ικανότητες σε πολύγλωσσες εργασίες, συμπεριλαμβανομένης της μετάφρασης[3].
Εξέλιξη και διάδοχοι: Η οικογένεια PaLM
Το PaLM έγινε η βάση για μια ολόκληρη οικογένεια μοντέλων που αναπτύχθηκαν από την Google.
PaLM 2
Παρουσιάστηκε τον Μάιο του 2023, το PaLM 2 έγινε ένας πιο αποδοτικός και πολύγλωσσος διάδοχος. Αντί για κυνήγι του αριθμού παραμέτρων, η έμφαση μετατοπίστηκε στην ποιότητα των δεδομένων εκπαίδευσης και στην αποδοτικότητα της αρχιτεκτονικής. Το PaLM 2 εκπαιδεύτηκε σε κείμενα σε περισσότερες από 100 γλώσσες και επιδεικνύει βελτιωμένες ικανότητες στη λογική, τον προγραμματισμό και τη μετάφραση[4]. Το μοντέλο κυκλοφορεί σε τέσσερα μεγέθη (από το μικρότερο στο μεγαλύτερο): Gecko, Otter, Bison και Unicorn. Η πιο συμπαγής παραλλαγή (Gecko) είναι αρκετά ελαφριά για να λειτουργεί σε κινητές συσκευές σε λειτουργία εκτός σύνδεσης.
Εξειδικευμένες εκδόσεις
Βασισμένες στο PaLM και στο PaLM 2, δημιουργήθηκαν εκδόσεις για συγκεκριμένους τομείς:
- Med-PaLM 2: Εξειδικευμένο μοντέλο για την ιατρική. Έγινε το πρώτο σύστημα ΤΝ που επίτευξε επίπεδο ειδικού στις ερωτήσεις της εξέτασης αδειοδότησης ιατρών στις ΗΠΑ (USMLE)[4].
- Sec-PaLM 2: Μοντέλο προσανατολισμένο στην κυβερνοασφάλεια, εκπαιδευμένο να εντοπίζει ευπάθειες και να αναλύει κακόβουλο κώδικα[5].
PaLM-E: Πολυτροπική έκδοση
Το PaLM-E (Pathways Language Model Embodied) — είναι ένα πολυτροπικό μοντέλο που συνδυάζει το γλωσσικό μοντέλο PaLM με οπτικά δεδομένα από το Vision Transformer (ViT). Αυτό επιτρέπει στο μοντέλο να επεξεργάζεται τόσο κείμενο όσο και εικόνες, επιλύοντας εργασίες που σχετίζονται με τον φυσικό κόσμο, για παράδειγμα για τον έλεγχο ρομπότ[6].
Ηθικές πτυχές και περιορισμοί
Οι δημιουργοί του PaLM τονίζουν την ανάγκη υπεύθυνης προσέγγισης στην ανάπτυξη μεγάλων γλωσσικών μοντέλων. Στην επίσημη επιστημονική εργασία πραγματοποιήθηκε ανάλυση των πιθανών προκαταλήψεων και τοξικότητας στο παραγόμενο κείμενο. Για τη διασφάλιση της διαφάνειας, η Google δημοσίευσε κάρτα μοντέλου (Model Card) και φύλλο δεδομένων (Datasheet) για το PaLM, όπου τεκμηριώνονται τα χαρακτηριστικά του dataset, τα αποτελέσματα δοκιμών και οι εντοπισμένοι περιορισμοί[1]. Αυτά τα μέτρα συμφωνούν με τις σύγχρονες πρακτικές υπεύθυνης ΤΝ και αποσκοπούν στη μείωση των κινδύνων που σχετίζονται με προκαταλήψεις και παραγωγή επιβλαβούς περιεχομένου.
Σύνδεσμοι
- Επίσημο blog της Google για το PaLM
- PaLM API για προγραμματιστές
Βιβλιογραφία
- Chowdhery, A. et al. (2022). PaLM: Scaling Language Modeling with Pathways. arXiv:2204.02311.
- Anil, R. et al. (2023). PaLM 2 Technical Report. arXiv:2305.10403.
- Driess, D. et al. (2023). PaLM-E: An Embodied Multimodal Language Model. arXiv:2303.03378.
- Singhal, K. et al. (2022). Large Language Models Encode Clinical Knowledge. arXiv:2212.13138.
- Singhal, K. et al. (2023). Towards Expert-Level Medical Question Answering with Large Language Models. arXiv:2305.09617.
- Barham, P. et al. (2022). Pathways: Asynchronous Distributed Dataflow for ML. arXiv:2203.12533.
- Wei, J. et al. (2022). Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.11903.
- Zhang, Z. et al. (2022). Automatic Chain of Thought Prompting in Large Language Models. arXiv:2210.03493.
- Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
- Schaeffer, R. et al. (2023). Are Emergent Abilities of Large Language Models a Mirage?. arXiv:2304.15004.
- Lu, S. et al. (2023). Are Emergent Abilities in Large Language Models just In-Context Learning?. arXiv:2309.01809.
- Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
- Hoffmann, J. et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Rae, J. W. et al. (2021). Scaling Language Models: Methods, Analysis & Insights from Training Gopher. arXiv:2112.11446.
- Diao, S. et al. (2023). Active Prompting with Chain-of-Thought for Large Language Models. arXiv:2302.12246.
Παραπομπές
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 Chowdhery, Aakanksha; Narang, Sharan; Devlin, Jacob; et al. «PaLM: Scaling Language Modeling with Pathways». arXiv. [1]
- ↑ «Introducing Pathways: A next-generation AI architecture». Google AI Blog. [2]
- ↑ 3.0 3.1 3.2 «Pathways Language Model (PaLM): Scaling to 540 Billion Parameters for Breakthrough Performance». Google Research Blog. [3]
- ↑ 4.0 4.1 «Google AI: What to know about the PaLM 2 large language model». Google AI Blog. [4]
- ↑ «New AI capabilities that can help address your security challenges». Google Cloud Blog. [5]
- ↑ «PaLM-E: An embodied multimodal language model». Google Research Blog. [6]