T5 (Text-to-Text Transfer Transformer) (EL)

From Systems analysis Wiki
Jump to navigation Jump to search

T5 (Text-to-Text Transfer Transformer) — είναι μια οικογένεια μεγάλων γλωσσικών μοντέλων που αναπτύχθηκε από ερευνητές της Google AI και παρουσιάστηκε το 2019[1]. Η βασική καινοτομία του T5 είναι το ενοποιημένο framework «text-to-text», το οποίο αντιμετωπίζει κάθε εργασία επεξεργασίας φυσικής γλώσσας (NLP) ως πρόβλημα μετατροπής μιας ακολουθίας κειμένου σε μια άλλη. Αυτό επέτρεψε τη χρήση ενός ενιαίου μοντέλου, συνάρτησης απωλειών και διαδικασίας εκπαίδευσης για ένα ευρύ φάσμα εργασιών, όπως μετάφραση, περίληψη, απαντήσεις σε ερωτήσεις και ταξινόμηση[2].

Το μοντέλο βασίζεται στην τυπική αρχιτεκτονική transformer «encoder-decoder», γεγονός που το διαφοροποιεί από μοντέλα τύπου BERT (μόνο encoder) και GPT (μόνο decoder). Η εργασία για το T5 σχεδιάστηκε ως μια εκτενής εμπειρική έρευνα για τη συστηματική μελέτη και σύγκριση διαφόρων μεθόδων transfer learning στο NLP, και όχι ως δημιουργία μιας ριζικά νέας μεθόδου[1].

Παράδειγμα «Text-to-Text»

Η κεντρική ιδέα του T5 είναι ότι όλες οι εργασίες διατυπώνονται σε ενιαία μορφή. Το μοντέλο λαμβάνει ως είσοδο κείμενο και παράγει ως έξοδο επίσης κείμενο. Προκειμένου το μοντέλο να μπορεί να διακρίνει τις εργασίες που του ανατίθενται, στην ακολουθία εισόδου προστίθεται ένα ειδικό κειμενικό πρόθεμα-οδηγία[2].

  • Μετάφραση: `translate English to German: That is good.` → `Das ist gut.`
  • Ταξινόμηση συναισθήματος: `sst2 sentence: a very exciting film.` → `positive`
  • Περίληψη: `summarize: [μακρύ κείμενο άρθρου]` → `[σύνοψη]`

Αυτή η προσέγγιση απλοποιεί ριζικά τη διαδικασία εφαρμογής του μοντέλου, εξαλείφοντας την ανάγκη ανάπτυξης ειδικών «κεφαλών» (task-specific heads) για κάθε ξεχωριστή εργασία, κάτι που ήταν χαρακτηριστικό αρχιτεκτονικών όπως το BERT[3].

Αρχιτεκτονική και κλιμάκωση

Αρχιτεκτονική encoder-decoder

Το T5 χρησιμοποιεί την τυπική αρχιτεκτονική transformer, η οποία αποτελείται από δύο μέρη[1]:

  • Encoder: Επεξεργάζεται ολόκληρη την ακολουθία εισόδου ταυτόχρονα, δημιουργώντας μια πλούσια, πλαισιοποιημένη αναπαράσταση. Όπως και στο BERT, ο encoder του T5 είναι αμφίδρομος.
  • Decoder: Παράγει το κείμενο εξόδου ένα token τη φορά (αυτοπαλίνδρομα), χρησιμοποιώντας την αναπαράσταση που λαμβάνει από τον encoder.

Αυτή η υβριδική δομή επιτρέπει στο T5 να αντιμετωπίζει αποτελεσματικά τόσο εργασίες κατανόησης γλώσσας όσο και εργασίες παραγωγής κειμένου[4].

Βασικές βελτιώσεις

Η αρχιτεκτονική του T5 περιλαμβάνει αρκετές αλλαγές σε σχέση με το αρχικό μοντέλο transformer:

  • Σχετικά positional embeddings: Αντί για απόλυτα ημιτονοειδή embeddings, το T5 χρησιμοποιεί μια απλοποιημένη αλλά αποτελεσματική μορφή σχετικής κωδικοποίησης θέσης, όπου στα logits προσοχής προστίθεται ένα εκπαιδεύσιμο βαθμωτό bias που εξαρτάται μόνο από τη σχετική απόσταση μεταξύ των token[1].
  • Τροποποιημένη κανονικοποίηση στρωμάτων (Layer Norm): Η κανονικοποίηση τοποθετείται εκτός της υπολειμματικής σύνδεσης (residual connection), και αφαιρείται από αυτήν το προσθετικό bias για αυξημένη σταθερότητα εκπαίδευσης.

Κλίμακες μοντέλου

Στην αρχική εργασία, το μοντέλο παρουσιάστηκε σε αρκετές διαμορφώσεις που διαφέρουν ως προς τον αριθμό παραμέτρων, επιτρέποντας τη συστηματική μελέτη της επίδρασης της κλίμακας[5]:

  • T5-Small: ~60 εκατομμύρια παράμετροι
  • T5-Base: ~220 εκατομμύρια παράμετροι
  • T5-Large: ~770 εκατομμύρια παράμετροι
  • T5-3B: ~3 δισεκατομμύρια παράμετροι
  • T5-11B: ~11 δισεκατομμύρια παράμετροι

Η έρευνα έδειξε ότι η αύξηση της κλίμακας του μοντέλου είναι ένας από τους πιο αξιόπιστους τρόπους βελτίωσης της απόδοσής του[1].

Προεκπαίδευση: dataset C4 και η εργασία Span Corruption

Εργασία Span Corruption

Για την προεκπαίδευση του T5 επιλέχθηκε η εργασία απομείωσης θορύβου (denoising), και συγκεκριμένα μια ειδική παραλλαγή της που ονομάζεται καταστροφή τμημάτων (span corruption)[6]. Η μέθοδος λειτουργεί ως εξής:

  1. Στο κείμενο εισόδου, τυχαία καλύπτεται το 15% των token.
  2. Σε αντίθεση με τη μέθοδο MLM στο BERT, όπου καλύπτονται μεμονωμένα token, στο T5 καλύπτονται ολόκληρα συνεχόμενα τμήματα (spans).
  3. Κάθε κατεστραμμένο τμήμα αντικαθίσταται από ένα μοναδικό token-μάσκα (π.χ. `<X>`, `<Y>`).
  4. Το μοντέλο εκπαιδεύεται να παράγει ως έξοδο την ακολουθία των αφαιρεμένων τμημάτων, διαχωρισμένων από τις αντίστοιχες μάσκες.

Αυτή η προσέγγιση αναγκάζει το μοντέλο να προβλέπει ολόκληρες ακολουθίες κειμένου, κάτι που αποδείχθηκε πιο αποτελεσματική εργασία για την προεκπαίδευση από ό,τι η απλή γλωσσική μοντελοποίηση[1].

Dataset C4 (Colossal Clean Crawled Corpus)

Για να αξιοποιηθεί πλήρως το δυναμικό του transfer learning, οι ερευνητές δημιούργησαν ένα τεράστιο και ποιοτικά καθαρισμένο σύνολο δεδομένων κειμένου, το C4, όγκου περίπου 750 GB[2]. Αποκτήθηκε μέσω εκτενούς καθαρισμού και φιλτραρίσματος του δημόσια διαθέσιμου corpus ιστού Common Crawl[7]. Η διαδικασία καθαρισμού περιλάμβανε αφαίρεση διπλότυπων, προτύπων κειμένου («Lorem ipsum»), ατελών προτάσεων, καθώς και φιλτράρισμα ανάρμοστου λεξιλογίου[8].

Κριτική του dataset C4

Παρά τον δηλωμένο στόχο δημιουργίας ενός «καθαρού» corpus, η διαδικασία φιλτραρίσματος του C4 δέχθηκε κριτική για συστηματικές προκαταλήψεις. Έρευνες έδειξαν ότι το φίλτρο ανάρμοστου λεξιλογίου αφαιρούσε δυσανάλογα κείμενα που σχετίζονται με κοινότητες ΛΟΑΤΚΙ+, καθώς και κείμενα στην αφροαμερικανική αγγλική (AAE)[8]. Επιπλέον, στο dataset εντοπίστηκε σημαντική ποσότητα προσβλητικού και πνευματικά προστατευμένου περιεχομένου. Αυτά τα προβλήματα αναδεικνύουν την πολυπλοκότητα της δημιουργίας αντικειμενικά «ποιοτικών» συνόλων δεδομένων και το πώς τεχνικές αποφάσεις φιλτραρίσματος μπορούν να οδηγούν σε ακούσιες κοινωνικές προκαταλήψεις.

Αποτελέσματα και απόδοση

Κατά τη δημοσίευση, το T5 έθεσε νέα ρεκόρ απόδοσης (state-of-the-art) σε πολλά benchmark, συμπεριλαμβανομένων των GLUE, SuperGLUE, SQuAD και εργασιών περίληψης[2]. Συγκεκριμένα, το μοντέλο T5-11B πέτυχε στο SuperGLUE αποτέλεσμα κοντά στο ανθρώπινο επίπεδο, αποδεικνύοντας ικανότητα αντιμετώπισης εργασιών που απαιτούν σύνθετη λογική εξαγωγή συμπερασμάτων[9]. Αυτά τα αποτελέσματα επιβεβαίωσαν την κεντρική υπόθεση της έρευνας: ο συνδυασμός ενοποιημένου framework, μεγάλης κλίμακας και ποιοτικού συνόλου δεδομένων αποτελεί εξαιρετικά ισχυρή στρατηγική για την επίτευξη προηγμένων αποτελεσμάτων στο NLP.

Εξέλιξη και παραλλαγές του T5

Η προσέγγιση T5 αποτέλεσε τη βάση για πολλά μεταγενέστερα μοντέλα:

  • mT5: Πολύγλωσση έκδοση του T5, εκπαιδευμένη στο corpus mC4, που καλύπτει 101 γλώσσες[10].
  • ByT5: Πειραματική έκδοση που εγκαταλείπει εντελώς την tokenization και εργάζεται απευθείας με ακατέργαστα bytes UTF-8. Αυτό την καθιστά ανθεκτική σε τυπογραφικά λάθη και επιτρέπει την επεξεργασία οποιασδήποτε γλώσσας «εκτός συσκευασίας»[11].
  • Switch Transformer: Κλιμακούμενη έκδοση του T5, που εισήγαγε την αρχιτεκτονική Mixture-of-Experts (MoE), επιτρέποντας την αύξηση του αριθμού παραμέτρων σε τρισεκατομμύρια διατηρώντας παράλληλα λογικό υπολογιστικό κόστος[12].
  • FLAN-T5: Δεν πρόκειται για νέα αρχιτεκτονική, αλλά για το τυπικό T5 που πέρασε από ένα επιπλέον στάδιο fine-tuning σε εκατοντάδες εργασίες διατυπωμένες ως οδηγίες (instruction tuning). Αυτό βελτίωσε σημαντικά την ικανότητά του να γενικεύει σε νέες, άγνωστες εργασίες στο πλαίσιο zero-shot (χωρίς παραδείγματα)[13].
  • UL2: Μοντέλο που αναπτύσσει τις ιδέες του T5 και χρησιμοποιεί ένα νέο στόχο προεκπαίδευσης με την ονομασία Mixture of Denoisers, συνδυάζοντας διαφορετικά σχήματα κάλυψης κειμένου για τη βελτίωση της γενικής χρησιμότητας[14].

Αναφορές

  • Επίσημο αποθετήριο T5 στο GitHub
  • Άρθρο στο blog της Google Research σχετικά με την έρευνα T5

Βιβλιογραφία

  • Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
  • Raffel, C. et al. (2020). Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. arXiv:1910.10683.
  • Xue, L. et al. (2021). mT5: A Massively Multilingual Pre-trained Text-to-Text Transformer. arXiv:2010.11934.
  • Dodge, J. et al. (2021). Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus. arXiv:2104.08758.
  • Fedus, W. et al. (2021). Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity. arXiv:2101.03961.
  • Ni, J. et al. (2021). Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models. arXiv:2108.08877.
  • Guo, M. et al. (2021). LongT5: Efficient Text-To-Text Transformer for Long Sequences. arXiv:2112.07916.
  • Xue, L. et al. (2022). ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models. arXiv:2105.13626.
  • Tay, Y. et al. (2022). UL2: Unifying Language Learning Paradigms. arXiv:2205.05131.
  • Chung, H. W. et al. (2022). Scaling Instruction-Finetuned Language Models. arXiv:2210.11416.
  • Longpre, S. et al. (2023). The Flan Collection: Designing Data and Methods for Effective Instruction Tuning. arXiv:2301.13688.

Σημειώσεις

  1. 1.0 1.1 1.2 1.3 1.4 1.5 Raffel, Colin; Shazeer, Noam; Roberts, Adam; et al. «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer». Journal of Machine Learning Research. [1]
  2. 2.0 2.1 2.2 2.3 «Exploring Transfer Learning with T5: the Text-To-Text Transfer Transformer». Google Research Blog. [2]
  3. «A Detailed Look At Google's T5 Model in NLP». DhiWise Blog. [3]
  4. «T5 (Text-to-Text Transfer Transformer)». GeeksforGeeks. [4]
  5. «T5». Hugging Face Transformers Documentation. [5]
  6. «T5 (language model)». In Wikipedia. [6]
  7. «C4 Dataset». Papers With Code. [7]
  8. 8.0 8.1 Dodge, J.; Sap, M.; Marasović, A.; et al. «Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus». arXiv. [8]
  9. «Google T5 algorithm scores 88.9 on SuperGLUE languge benchmark, compared to 89.8 human baseline». Reddit, r/linguistics. [9]
  10. Xue, Linting; Constant, Noah; Roberts, Adam; et al. «mT5: A massively multilingual pre-trained text-to-text transformer». arXiv. [10]
  11. Xue, Linting; Barua, Aditya; Constant, Noah; et al. «ByT5: Towards a token-free future with pre-trained byte-to-byte models». arXiv. [11]
  12. Fedus, William; Zoph, Barret; Shazeer, Noam. «Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity». arXiv. [12]
  13. Chung, Hyung Won; et al. «Scaling Instruction-Finetuned Language Models». arXiv. [13]
  14. Tay, Yi; Dehghani, Mostafa; Tran, Vinh; et al. «UL2: Unifying Language Learning Paradigms». arXiv. [14]