Encoder-only models — Μοντέλα μόνο με κωδικοποιητή

From Systems analysis Wiki
Jump to navigation Jump to search

Μοντέλα μόνο με κωδικοποιητή (αγγλ. Encoder-Only Models) — αυτή είναι μια κατηγορία αρχιτεκτονικών μεγάλων γλωσσικών μοντέλων (LLM), που βασίζεται αποκλειστικά στο κωδικοποιητικό τμήμα (encoder) της αρχιτεκτονικής Transformer. Σε αντίθεση με τα μοντέλα που χρησιμοποιούν αποκωδικοποιητή ή πλήρη αρχιτεκτονική encoder-decoder, αυτά τα μοντέλα εξειδικεύονται σε εργασίες κατανόησης φυσικής γλώσσας (Natural Language Understanding, NLU).

Το κορυφαίο μοντέλο και πρωτοπόρος αυτής της προσέγγισης είναι το BERT (Bidirectional Encoder Representations from Transformers), που αναπτύχθηκε από την Google το 2018.

Έννοια και αρχιτεκτονική

Η βασική ιδέα των μοντέλων μόνο με κωδικοποιητή είναι η δημιουργία βαθιών, εκπλαισιωμένων αναπαραστάσεων (embeddings) για κάθε token στην ακολουθία εισόδου. Χάρη στον μηχανισμό αυτο-προσοχής (self-attention) στο Transformer, κάθε token μπορεί να «βλέπει» και να αλληλεπιδρά με όλα τα υπόλοιπα tokens στην ακολουθία, επιτρέποντας στο μοντέλο να συλλαμβάνει πλούσιο πλαίσιο.

Το βασικό χαρακτηριστικό είναι η αμφίδρομη κατεύθυνση: η αναπαράσταση κάθε token διαμορφώνεται με βάση τόσο το αριστερό όσο και το δεξιό πλαίσιο ταυτόχρονα. Αυτό τα διαφοροποιεί ριζικά από τα αυτοπαλίνδρομα μοντέλα μόνο με αποκωδικοποιητή (όπως το GPT), τα οποία από τη φύση τους είναι μονοκατευθυντικά.

Αρχιτεκτονικά, το μοντέλο αποτελείται από μια στοίβα N πανομοιότυπων στρωμάτων κωδικοποιητή. Κάθε στρώμα αποτελείται από δύο βασικά υποστρώματα:

  1. Πολυκεφαλική αυτο-προσοχή (Multi-Head Self-Attention): Υπολογίζει εκπλαισιωμένη αναπαράσταση για κάθε token.
  2. Πλήρως συνδεδεμένο νευρωνικό δίκτυο (Feed-Forward Network): Εφαρμόζει μη γραμμικό μετασχηματισμό σε κάθε αναπαράσταση token.

Στην έξοδο, το μοντέλο παράγει μια ακολουθία διανυσμάτων ίδιου μήκους με την ακολουθία εισόδου, όπου κάθε διάνυσμα αποτελεί πλούσια αναπαράσταση του αντίστοιχου token εισόδου.

Εργασίες προ-εκπαίδευσης

Για να εκπαιδεύσουμε το μοντέλο στην κατανόηση γλώσσας σε αμφίδρομο πλαίσιο, χρησιμοποιούνται ειδικές αυτο-επιβλεπόμενες εργασίες προ-εκπαίδευσης:

Masked Language Modeling - Μοντελοποίηση γλώσσας με κάλυψη (MLM)

Αυτή είναι η κύρια και σημαντικότερη εργασία για τα μοντέλα μόνο με κωδικοποιητή, που παρουσιάστηκε για πρώτη φορά στο BERT.

  • Αρχή λειτουργίας: Από την ακολουθία εισόδου αποκρύπτεται (καλύπτεται) τυχαία ένα μικρό ποσοστό tokens (συνήθως 15%). Εργασία του μοντέλου είναι να προβλέψει τις αρχικές τιμές αυτών των καλυμμένων tokens, χρησιμοποιώντας το αμφίδρομο πλαίσιο που τα περιβάλλει.
  • Στόχος: Αυτή η εργασία αναγκάζει το μοντέλο να μαθαίνει βαθιές σημασιολογικές και συντακτικές σχέσεις μεταξύ λέξεων.

Next Sentence Prediction - Πρόβλεψη επόμενης πρότασης (NSP)

Αυτή η εργασία (επίσης από το αρχικό BERT) αναπτύχθηκε για να διδάξει στο μοντέλο την κατανόηση σχέσεων μεταξύ προτάσεων.

  • Αρχή λειτουργίας: Στο μοντέλο δίνεται ένα ζεύγος προτάσεων και πρέπει να προσδιορίσει αν η δεύτερη πρόταση αποτελεί λογική συνέχεια της πρώτης στο αρχικό κείμενο.
  • Κατάσταση: Αργότερα, έρευνες (π.χ. στο μοντέλο RoBERTa) έδειξαν ότι η NSP είναι λιγότερο αποτελεσματική από την MLM, και συχνά αντικαθίσταται από άλλες εργασίες ή παραλείπεται εντελώς.

Εφαρμογές

Τα μοντέλα μόνο με κωδικοποιητή δεν προορίζονται για ελεύθερη παραγωγή κειμένου, καθώς δεν διαθέτουν αυτοπαλίνδρομο αποκωδικοποιητή. Η δύναμή τους έγκειται στην ανάλυση και κατανόηση κειμένου. Οι διανυσματικές αναπαραστάσεις εξόδου του μοντέλου χρησιμοποιούνται για την επίλυση ευρέος φάσματος εργασιών NLU:

  • Κατηγοριοποίηση κειμένου: Για εργασίες όπως η ανάλυση συναισθήματος ή ο προσδιορισμός θέματος, χρησιμοποιείται η αναπαράσταση του ειδικού token `[CLS]`, που προστίθεται στην αρχή κάθε ακολουθίας. Το τελικό του διάνυσμα συγκεντρώνει πληροφορίες για ολόκληρη την ακολουθία.
  • Κατηγοριοποίηση token: Για εργασίες όπως η αναγνώριση ονομαστικών οντοτήτων (NER) ή η επισήμανση μερών του λόγου (POS-tagging), χρησιμοποιούνται οι διανυσματικές αναπαραστάσεις κάθε μεμονωμένου token.
  • Απάντηση ερωτήσεων (Question Answering): Σε εργασίες όπου η απάντηση αποτελεί απόσπασμα από δεδομένο κείμενο (extractive QA), το μοντέλο εκπαιδεύεται να προβλέπει τα αρχικά και τελικά tokens της απάντησης.
  • Λήψη embeddings: Τα μοντέλα κωδικοποιητή χρησιμοποιούνται συχνά ως καθολικοί κωδικοποιητές κειμένου για την απόκτηση υψηλής ποιότητας embeddings προτάσεων ή εγγράφων, τα οποία στη συνέχεια μπορούν να χρησιμοποιηθούν σε μηχανές αναζήτησης ή για εργασίες σημασιολογικής ομοιότητας.

Κύρια μοντέλα και η εξέλιξή τους

  • BERT (2018): Πρωτοπόρος της αρχιτεκτονικής, που κατέρριψε ρεκόρ σε πολλά NLP benchmarks.
  • RoBERTa (2019): «Αξιόπιστα βελτιστοποιημένο BERT». Έδειξε ότι η απόδοση του BERT μπορεί να βελτιωθεί σημαντικά μέσω μακρύτερης εκπαίδευσης σε περισσότερα δεδομένα και εγκατάλειψης της εργασίας NSP.
  • ALBERT (2019): «A Lite BERT». Μοντέλο με σημαντικά μικρότερο αριθμό παραμέτρων χάρη σε τεχνικές παραγοντοποίησης embeddings και διαστρωματικής κοινής χρήσης παραμέτρων.
  • DistilBERT (2019): Μειωμένη έκδοση του BERT, δημιουργηθείσα μέσω απόσταξης γνώσης, που είναι ταχύτερη και ελαφρύτερη, διατηρώντας όμως μεγάλο μέρος της απόδοσης του πρωτοτύπου.
  • ELECTRA (2020): Παρουσίασε μια πιο αποδοτική εργασία προ-εκπαίδευσης — replaced token detection, όπου το μοντέλο μαθαίνει να διακρίνει τα αρχικά tokens από τα «ψεύτικα» που παράγονται από ένα μικρό μοντέλο-γεννήτρια.
  • DeBERTa (2020): Εισήγαγε τον μηχανισμό «αποσυζευγμένης προσοχής» (disentangled attention), που κωδικοποιεί ξεχωριστά το περιεχόμενο και τις σχετικές θέσεις των tokens.

Δείτε επίσης

  • BERT