Token (LLM) (EL)
Τόκεν (token) — η ελάχιστη μονάδα κειμένου με την οποία μπορούν να εργαστούν τα μεγάλα γλωσσικά μοντέλα (LLM). Κάθε κείμενο, πριν από την επεξεργασία του από ένα LLM, μετατρέπεται εκ των προτέρων σε ακολουθία token, τα οποία στη συνέχεια αποδίδονται σε αριθμητικές αναπαραστάσεις κατάλληλες για ανάλυση και επεξεργασία από το μοντέλο.
Ανάλογα με την στρατηγική tokenization που χρησιμοποιείται, ένα token μπορεί να αναπαριστά:
- Ολόκληρη λέξη (π.χ. «σπίτι»)
- Τμήμα λέξης ή ρίζα (π.χ. «σπίτ-» στη λέξη «σπιτάκι»)
- Μεμονωμένο χαρακτήρα ή σημείο στίξης (π.χ. «,», «!»)
Η χρήση token επιτρέπει στα γλωσσικά μοντέλα να μελετούν και να αναπαράγουν αποτελεσματικά τις δομές κειμένου, να εντοπίζουν νομοτέλειες, καθώς και να κατανοούν τη σημασιολογία και τη σύνταξη του κειμένου.
Διαδικασία tokenization
Tokenization (tokenization) — είναι η διαδικασία διαίρεσης του αρχικού κειμένου σε token με την επακόλουθη μετατροπή τους σε αριθμητικά αναγνωριστικά κατανοητά από το μοντέλο.
Αυτό το στάδιο είναι υποχρεωτικό και θεμελιώδες για τη λειτουργία των μεγάλων γλωσσικών μοντέλων. Μέσω αυτού, το LLM αποκτά τη δυνατότητα να:
- Αναλύει τη σύνταξη — τη δομή του κειμένου και τη διάταξη των στοιχείων (λέξεων και φράσεων)·
- Εξάγει σημασιολογία — το βαθύτερο νόημα του κειμένου και τις σχέσεις μεταξύ των στοιχείων.
Διακρίνονται αρκετές βασικές μέθοδοι tokenization, μεταξύ των οποίων:
- Byte Pair Encoding (BPE): Αλγόριθμος που επαναληπτικά αντικαθιστά τα πιο συχνά ζεύγη χαρακτήρων με νέα token, επιτρέποντας αποτελεσματική επεξεργασία σπάνιων λέξεων και μορφολογικών παραλλαγών.
- WordPiece: Χρησιμοποιείται στα μοντέλα BERT και διασπά τις λέξεις σε υπολεξικές μονάδες, βοηθώντας στην επεξεργασία άγνωστων λέξεων.
- SentencePiece: Μέθοδος που αντιμετωπίζει το κείμενο ως ακολουθία χαρακτήρων και εφαρμόζει μοντέλα βασισμένα σε BPE ή Unigram για tokenization.
Η επιλογή μεθόδου tokenization επηρεάζει την απόδοση του μοντέλου, την ικανότητά του να επεξεργάζεται διαφορετικές γλώσσες και την αποτελεσματικότητα της εκπαίδευσης.
Ειδικά token
Εκτός από τα βασικά token, τα μοντέλα χρησιμοποιούν επίσης ειδικά token για τον χαρακτηρισμό λειτουργικών στοιχείων του κειμένου, όπως:
[CLS](class) — token έναρξης ακολουθίας, που χρησιμοποιείται συχνά για εργασίες ταξινόμησης κειμένου·[SEP](separator) — διαχωρίζει διαφορετικά τμήματα κειμένου (π.χ. ερώτηση και απάντηση, προτάσεις ή παραγράφους)·[MASK]— ειδικό token για τον χαρακτηρισμό της λέξης που το μοντέλο πρέπει να προβλέψει (χρησιμοποιείται στο BERT και άλλα masked-language μοντέλα)·[PAD](padding) — χρησιμοποιείται για την ευθυγράμμιση του κειμένου ως προς το μήκος.
Αυτά τα ειδικά token βοηθούν τα μοντέλα να αντιλαμβάνονται με μεγαλύτερη ακρίβεια τη δομή και το πλαίσιο του κειμένου που επεξεργάζονται.
Token και παράθυρο πλαισίου
Παράθυρο πλαισίου (context window) — είναι ο μέγιστος αριθμός token που το μοντέλο είναι σε θέση να λαμβάνει υπόψη και να επεξεργάζεται ταυτόχρονα κατά τη δημιουργία κειμένου.
Για παράδειγμα, το μοντέλο GPT-3 διαθέτει παράθυρο πλαισίου μεγέθους 2048 token. Αυτό σημαίνει ότι κατά τη δημιουργία κειμένου, το μοντέλο μπορεί να λαμβάνει υπόψη ταυτόχρονα πληροφορίες που περιέχονται σε έως 2048 token του αρχικού κειμένου. Το μέγεθος του παραθύρου πλαισίου επηρεάζει:
- Τον μέγιστο όγκο πληροφοριών που είναι διαθέσιμος στο μοντέλο·
- Την ποιότητα και τη συνοχή των παραγόμενων απαντήσεων·
- Την ικανότητα του μοντέλου να επεξεργάζεται μεγάλα κείμενα και να διατηρεί το πλαίσιο σε μεγάλη απόσταση μεταξύ των token.
Βιβλιογραφία
- Sennrich, R.; Haddow, B.; Birch, A. (2016). Neural Machine Translation of Rare Words with Subword Units. arXiv:1508.07909.
- Kudo, T.; Richardson, J. (2018). SentencePiece: A Simple and Language-Independent Subword Tokenizer and Detokenizer for Neural Text Processing. arXiv:1808.06226.
- Kudo, T. (2018). Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates. arXiv:1804.10959.
- Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv:1810.04805.
- Song, X. et al. (2021). Fast WordPiece Tokenization. *EMNLP 2021*. ACL Anthology.
- Mielke, S. J.; Dalmia, S.; Cotterell, R. (2021). A Brief History of Open-Vocabulary Modeling and Tokenization in NLP. arXiv:2112.10508.
- Xue, J. et al. (2022). ByT5: Towards a Token-Free Future with Pre-trained Byte-to-Byte Models. arXiv:2105.13626.
- Limisiewicz, T.; Balhar, J.; Mareček, D. (2023). Tokenization Impacts Multilingual Language Modeling: Assessing Vocabulary Allocation and Overlap Across Languages. arXiv:2305.17179.
- Pourmostafa Roshan Sharami, J.; Shterionov, D.; Spronck, P. (2023). A Systematic Analysis of Vocabulary and BPE Settings for Optimal Fine-tuning of NMT. arXiv:2303.00722.
- Batsuren, K. et al. (2024). Evaluating Subword Tokenization: Alien Subword Composition and OOV Generalization Challenge. arXiv:2404.13292.
- Chai, Y. et al. (2024). Tokenization Falling Short: On Subword Robustness in Large Language Models. arXiv:2406.11687.