Few-Shot and Zero-Shot Learning — Few-shot και Zero-shot
Εκμάθηση με λίγα παραδείγματα (Few-shot Learning, FSL) και εκμάθηση χωρίς παραδείγματα (Zero-shot Learning, ZSL) — αποτελούν παραδείγματα Machine Learning που στοχεύουν στην αντιμετώπιση του προβλήματος της έλλειψης επισημειωμένων δεδομένων. Επιτρέπουν στα μοντέλα να εκπαιδεύονται και να γενικεύουν γνώσεις βάσει εξαιρετικά περιορισμένης πληροφορίας, κάτι που είναι κρίσιμο για την εφαρμογή της τεχνητής νοημοσύνης σε πραγματικά σενάρια όπου η συλλογή μεγάλων συνόλων δεδομένων είναι αδύνατη ή μη σκόπιμη.
Το διαδεδομένο πρόβλημα έλλειψης δεδομένων
Τα σύγχρονα μοντέλα βαθιάς μάθησης επιδεικνύουν εντυπωσιακά αποτελέσματα, ωστόσο η αποτελεσματικότητά τους εξαρτάται γενικά άμεσα από τεράστιους όγκους επισημειωμένων δεδομένων. Η συλλογή και η σχολιασμός τέτοιων δεδομένων αποτελεί μια δαπανηρή, χρονοβόρα και συχνά αδύνατη διαδικασία. Αυτό το πρόβλημα, γνωστό ως «πείνα πληροφορίας», είναι ιδιαίτερα έντονο σε τομείς όπως:
- Διάγνωση σπάνιων ασθενειών.
- Εξειδικευμένη βιομηχανική παραγωγή.
- Ρομποτική και αλληλεπίδραση με νέα αντικείμενα.
- Κατηγοριοποίηση νέων προϊόντων ή θεμάτων που εμφανίζονται συνεχώς.
Τα FSL και ZSL προσφέρουν λύση μετατοπίζοντας την έμφαση από τα «μεγάλα δεδομένα» στα «έξυπνα δεδομένα», εστιάζοντας στην αποτελεσματική μεταφορά και γενίκευση γνώσεων.
Εκμάθηση με λίγα παραδείγματα (Few-shot Learning)
Few-shot Learning (FSL) — είναι ένα παράδειγμα όπου το μοντέλο εκπαιδεύεται να αναγνωρίζει νέες κλάσεις βάσει πολύ μικρού αριθμού επισημειωμένων παραδειγμάτων (συνήθως από 1 έως 5), που ονομάζονται σύνολο υποστήριξης (support set).
Κεντρική ιδέα
Η βασική ιδέα του FSL δεν είναι απλώς η εκμάθηση χαρακτηριστικών για συγκεκριμένες κλάσεις, αλλά η εκμάθηση της διαδικασίας εκμάθησης (learning to learn). Το μοντέλο πρέπει να προσαρμόζεται γρήγορα σε νέες, άγνωστες εργασίες χρησιμοποιώντας ελάχιστο αριθμό παραδειγμάτων. Αυτό επιτυγχάνεται μέσω της αξιοποίησης προηγουμένως αποκτημένων γνώσεων και στρατηγικών προσαρμογής.
Κύριες προσεγγίσεις στο FSL
- Μεταεκμάθηση («Εκμάθηση της εκμάθησης»): Αποτελεί το κυρίαρχο παράδειγμα στο FSL. Το μοντέλο εκπαιδεύεται σε πλήθος διαφορετικών εργασιών ώστε να μάθει να προσαρμόζεται αποτελεσματικά σε νέες.
- Βασισμένα σε μετρικές: Τα μοντέλα (π.χ. siamese ή prototυπικά δίκτυα) μαθαίνουν να κατασκευάζουν έναν χώρο embedding όπου η απόσταση μεταξύ διανυσμάτων αντικατοπτρίζει τη σημασιολογική εγγύτητα. Η ταξινόμηση ενός νέου παραδείγματος γίνεται με σύγκριση του embedding του με τα embeddings του συνόλου υποστήριξης.
- Βασισμένα σε βελτιστοποίηση: Τα μοντέλα (π.χ. MAML) μαθαίνουν να βρίσκουν μια αρχικοποίηση παραμέτρων που επιτρέπει γρήγορη (σε λίγα βήματα gradient descent) προσαρμογή για νέα εργασία.
- Εκμάθηση στο πλαίσιο (In-Context Learning): Με την εμφάνιση μεγάλων γλωσσικών μοντέλων (LLM) έγινε δημοφιλής η προσέγγιση όπου τα παραδείγματα από το σύνολο υποστήριξης παρέχονται στο μοντέλο απευθείας στο prompt. Το μοντέλο εκτελεί «σιωπηρή μεταεκμάθηση» κατά το inference, προσαρμοζόμενο στην εργασία χωρίς ενημέρωση των βαρών.
Εκτεταμένες προσεγγίσεις στο FSL
- One-shot Learning: Αποτελεί ειδική περίπτωση του FSL όπου ο αριθμός παραδειγμάτων για κάθε κλάση είναι ένα (K=1 στη σημειογραφία «N-way K-shot»). Κλασικά παραδείγματα αρχιτεκτονικών είναι τα Matching Networks και τα Siamese Networks.
- Γεννητικές μέθοδοι και επαύξηση δεδομένων: Το FSL χρησιμοποιεί ενεργά γεννητικά μοντέλα (GAN, VAE, μοντέλα διάχυσης) για τη σύνθεση επιπλέον παραδειγμάτων δεδομένων. Αυτό επιτρέπει την τεχνητή επέκταση του συνόλου υποστήριξης και τη βελτίωση της ποιότητας ταξινόμησης, ιδιαίτερα για σπάνιες ή ασυνήθιστες κλάσεις.
- Transductive FSL: Σε αντίθεση με την τυπική (επαγωγική) προσέγγιση, εδώ το μοντέλο κατά την προσαρμογή λαμβάνει υπόψη όχι μόνο το επισημειωμένο σύνολο υποστήριξης, αλλά και το σύνολο των μη επισημειωμένων παραδειγμάτων ελέγχου (ερωτημάτων). Αυτό επιτρέπει τη σύλληψη της δομής των δεδομένων στα ερωτήματα, για παράδειγμα με τεχνικές διάδοσης ετικετών (label propagation), και βελτιώνει τη σταθερότητα της ταξινόμησης.
Εκμάθηση χωρίς παραδείγματα (Zero-shot Learning)
Zero-shot Learning (ZSL) — είναι ένα παράδειγμα όπου το μοντέλο είναι σε θέση να αναγνωρίζει κλάσεις κανένα παράδειγμα των οποίων δεν έχει δει κατά τη φάση εκπαίδευσης.
Κεντρική ιδέα
Αυτό επιτυγχάνεται μέσω της αξιοποίησης βοηθητικής σημασιολογικής πληροφορίας, η οποία περιγράφει τόσο τις ορατές όσο και τις αόρατες κλάσεις. Το μοντέλο μαθαίνει μια αντιστοίχιση από τον χώρο των χαρακτηριστικών εισόδου (π.χ. εικόνων) σε έναν κοινό σημασιολογικό χώρο.
Μηχανισμοί σημασιολογικής πληροφορίας
- Σημασιολογικά χαρακτηριστικά: Οι κλάσεις περιγράφονται από ένα σύνολο ανθρώπινα ορισμένων χαρακτηριστικών (π.χ. για την κλάση «ζέβρα»: [έχει_ρίγες, έχει_οπλές, είναι_θηλαστικό]).
- Διανυσματικές αναπαραστάσεις λέξεων (Word Embeddings): Τα ονόματα κλάσεων ή οι κειμενικές τους περιγραφές μετατρέπονται σε embeddings μέσω προεκπαιδευμένων γλωσσικών μοντέλων (π.χ. Word2Vec, BERT).
- Prompting σε LLM: Με την εμφάνιση πολυτροπικών μοντέλων όπως το CLIP, το ZSL μπορεί να εκτελεστεί συγκρίνοντας το embedding μιας εικόνας με τα embeddings κειμενικών περιγραφών κλάσεων (π.χ. «φωτογραφία σκύλου», «φωτογραφία γάτας»).
Τύποι ZSL: Παραδοσιακό, Γενικευμένο, Επαγωγικό και Transductive
- Παραδοσιακό ZSL: Κατά τη φάση ελέγχου, το μοντέλο πρέπει να ταξινομεί παραδείγματα μόνο από αόρατες κλάσεις.
- Γενικευμένο ZSL (Generalized ZSL, GZSL): Πιο ρεαλιστικό και πολύπλοκο σενάριο όπου το μοντέλο πρέπει να ταξινομεί παραδείγματα τόσο από ορατές όσο και από αόρατες κλάσεις. Αυτό απαιτεί από το μοντέλο όχι μόνο να αναγνωρίζει το νέο, αλλά και να το διακρίνει από το ήδη γνωστό, καταπολεμώντας τη μεροληψία προς τις ορατές κλάσεις.
- Επαγωγικό ZSL: Η τυπική διατύπωση, όπου το μοντέλο εκπαιδεύεται μόνο με δεδομένα και σημασιολογικές περιγραφές ορατών κλάσεων, χωρίς καμία πρόσβαση σε πληροφορίες για αόρατες κλάσεις.
- Transductive ZSL: Πιο προηγμένο σχήμα όπου το μοντέλο κατά την εκπαίδευση μπορεί να χρησιμοποιεί μη επισημειωμένα παραδείγματα από αόρατες κλάσεις. Αυτό επιτρέπει την εκ των προτέρων προσαρμογή του σημασιολογικού χώρου και τη βελτίωση της τελικής ποιότητας.
Γεννητικές προσεγγίσεις στο ZSL
- Παραγωγή χαρακτηριστικών αόρατων κλάσεων: Για την αντιμετώπιση του προβλήματος μεροληψίας στο GZSL χρησιμοποιούνται ευρέως γεννητικά μοντέλα (VAE, GAN). Αυτά συνθέτουν όχι τις ίδιες τις εικόνες, αλλά τα διανύσματα χαρακτηριστικών τους (embeddings) για αόρατες κλάσεις βάσει των σημασιολογικών τους περιγραφών. Αυτό επιτρέπει την εξισορρόπηση του συνόλου δεδομένων για την εκπαίδευση του τελικού ταξινομητή.
Συγκριτική ανάλυση και συνέργεια
| Πτυχή | Εκμάθηση με λίγα παραδείγματα (FSL) | Εκμάθηση χωρίς παραδείγματα (ZSL) |
|---|---|---|
| Κεντρική ιδέα | Εκμάθηση γρήγορης προσαρμογής σε νέες κλάσεις βάσει λίγων παραδειγμάτων. | Εκμάθηση αναγνώρισης νέων κλάσεων βάσει των σημασιολογικών τους περιγραφών. |
| Απαιτήσεις δεδομένων για νέα εργασία/κλάση | Λίγα επισημειωμένα παραδείγματα (1-5) για κάθε νέα κλάση. | Μηδέν επισημειωμένα παραδείγματα· απαιτείται σημασιολογική περιγραφή. |
| Μεταφορά γνώσης | Εκμάθηση διαδικαστικής γνώσης («πώς να προσαρμοστείς») ή καλού χώρου χαρακτηριστικών. | Εκμάθηση σημασιολογικών σχέσεων και χαρακτηριστικών, μεταφορά γνώσης μέσω κοινού σημασιολογικού χώρου. |
| Τυπικές περιπτώσεις χρήσης | Γρήγορη δημιουργία πρωτοτύπων, εξατομίκευση, αναγνώριση σπάνιων αντικειμένων, ρομποτική. | Ανίχνευση νέων ειδών, κατηγοριοποίηση αναδυόμενων θεμάτων, διαχείριση εντελώς νέων τύπων προϊόντων. |
Βασικές αποχρώσεις και σύγχρονες τάσεις
- Διάκριση μεταξύ Zero-shot Learning και Zero-shot Prompting: Είναι σημαντικό να διακρίνουμε αυτές τις έννοιες. Το ZSL είναι ένα αρχιτεκτονικό παράδειγμα Machine Learning που απαιτεί εξειδικευμένο μοντέλο και σημασιολογική πληροφορία. Το Zero-shot Prompting είναι μια εφαρμοσμένη τεχνική prompt engineering, όπου ένα μεγάλο γλωσσικό μοντέλο (π.χ. GPT-4) επιλύει μια εργασία χωρίς παραδείγματα στο prompt, βασιζόμενο αποκλειστικά στις εσωτερικές του γνώσεις.
- Ο ρόλος της μαζικής προεκπαίδευσης: Η σύγχρονη επιτυχία των FSL και ZSL οφείλεται σε μεγάλο βαθμό στα ισχυρά θεμελιώδη μοντέλα (BERT, CLIP, GPT-4). Η προεκπαίδευσή τους σε τεράστια σύνολα δεδομένων δημιουργεί ένα καθολικό και σημασιολογικά πλούσιο embedding frontend, το οποίο χρησιμεύει ως εξαιρετική βάση για γρήγορη προσαρμογή και σημασιολογική εξαγωγή συμπερασμάτων υπό συνθήκες έλλειψης δεδομένων.
Τα FSL και ZSL αντιπροσωπεύουν διαφορετικά σημεία στο φάσμα αποδοτικότητας χρήσης δεδομένων και συχνά χρησιμοποιούνται από κοινού. Για παράδειγμα, το ZSL μπορεί να χρησιμοποιηθεί για την αρχικοποίηση αναπαραστάσεων, οι οποίες στη συνέχεια προσαρμόζονται περαιτέρω με τη βοήθεια του FSL όταν εμφανίζονται τα πρώτα παραδείγματα νέας κλάσης.
Κύρια ερευνητικά ιδρύματα και συμμετέχοντες
Η έρευνα στον τομέα FSL και ZSL διεξάγεται ενεργά τόσο σε ακαδημαϊκούς κύκλους όσο και σε βιομηχανικά εργαστήρια.
- Πανεπιστήμια: Πανεπιστήμιο Stanford, Πανεπιστήμιο του Πεκίνου, Εθνικό Πανεπιστήμιο Σιγκαπούρης.
- Βιομηχανικά εργαστήρια: Google AI, Meta AI, OpenAI.
Με την εμφάνιση ισχυρών θεμελιωδών μοντέλων, το ερευνητικό ενδιαφέρον μετατοπίστηκε από την ανάπτυξη εξειδικευμένων αρχιτεκτονικών για FSL/ZSL στις μεθόδους αποτελεσματικής προσαρμογής αυτών των μοντέλων.
Βιβλιογραφία
- Finn, C. et al. (2017). Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks. arXiv:1703.03400.
- Koch, G. et al. (2015). Siamese Neural Networks for One-Shot Image Recognition. PDF.
- Vinyals, O. et al. (2016). Matching Networks for One Shot Learning. arXiv:1606.04080.
- Snell, J. et al. (2017). Prototypical Networks for Few-Shot Learning. arXiv:1703.05175.
- Sung, F. et al. (2018). Learning to Compare: Relation Network for Few-Shot Learning. arXiv:1711.06025.
- Chen, Y. et al. (2021). Meta-Baseline: Exploring Simple Meta-Learning for Few-Shot Learning. arXiv:2003.04390.
- Wang, Y. et al. (2020). Generalizing from a Few Examples: A Survey on Few-Shot Learning. arXiv:1904.05046.
- Xian, Y. et al. (2018). Zero-Shot Learning — A Comprehensive Evaluation of the State of the Art. arXiv:1707.00600.
- Verma, V. K. et al. (2018). Generalized Zero-Shot Learning via Synthesized Examples. arXiv:1712.03878.
- Radford, A. et al. (2021). Learning Transferable Visual Models from Natural Language Supervision. arXiv:2103.00020.
- Xian, Y. et al. (2019). Zero-Shot Learning via Simultaneous Generating and Learning. arXiv:1910.09446.
- Verma, V. K. et al. (2017). Zero-Shot Learning via Generative Adversarial Training of Class-Conditional Feature Vectors. arXiv:1712.00981.
Δείτε επίσης
- Μεγάλα γλωσσικά μοντέλα