---
title: "Few-Shot and Zero-Shot Learning — Few-shot ו-Zero-shot"
source: "https://systems-analysis.info/int/Few-Shot_and_Zero-Shot_Learning_%E2%80%94_Few-shot_%D7%95-Zero-shot"
wiki: "systems-analysis.info/int"
article: "Few-Shot_and_Zero-Shot_Learning_—_Few-shot_ו-Zero-shot"
language: "he"
categories:
  - "Category:Hebrew"
  - "Category:Large language models"
  - "Category:Machine learning"
  - "Category:Prompt engineering"
revision_id: 2143
wiki_created_at: 2026-09-06T22:59:15Z
wiki_modified_at: 2026-09-06T22:59:15Z
downloaded_at: 2026-09-07T22:49:31Z
---

# Few-Shot and Zero-Shot Learning — Few-shot ו-Zero-shot

**למידה עם מספר מועט של דוגמאות (Few-shot Learning, FSL)** ו**למידה ללא דוגמאות (Zero-shot Learning, ZSL)** — אלו פרדיגמות של Machine Learning המיועדות לפתרון בעיית המחסור בנתונים מתויגים. הן מאפשרות למודלים ללמוד ולהכליל ידע על בסיס כמות מוגבלת ביותר של מידע, וזהו מפתח ליישום בינה מלאכותית בתרחישים מהעולם האמיתי, שבהם איסוף מערכי נתונים גדולים אינו אפשרי או אינו כדאי.

## הבעיה הנפוצה של מחסור בנתונים

מודלי למידה עמוקה מודרניים מפגינים תוצאות מרשימות, אך יעילותם תלויה בדרך כלל ישירות בנפחים עצומים של נתונים מתויגים. איסוף ותיוג נתונים כאלה הוא תהליך יקר, עתיר עבודה ולעתים קרובות בלתי אפשרי. בעיה זו, המכונה "רעב מידע", חריפה במיוחד בתחומים כגון:

- אבחון מחלות נדירות.
- ייצור תעשייתי מתמחה.
- רובוטיקה ואינטראקציה עם אובייקטים חדשים.
- קטגוריזציה של מוצרים או נושאים חדשים המופיעים ללא הרף.

FSL ו-ZSL מציעים פתרון על ידי הסטת הדגש מ"נתונים גדולים" ל"נתונים חכמים", תוך התמקדות בהעברה ובהכללה יעילה של ידע.

## למידה עם מספר מועט של דוגמאות (Few-shot Learning)

**Few-shot Learning (FSL)** — היא פרדיגמה שבה מודל לומד לזהות מחלקות חדשות על בסיס מספר קטן מאוד של דוגמאות מתויגות (בדרך כלל בין 1 ל-5), המכונות **מערך תמיכה** (support set).

### הרעיון המרכזי

הרעיון הבסיסי של FSL אינו רק ללמוד מאפיינים של מחלקות ספציפיות, אלא ללמוד את **תהליך הלמידה** (learning to learn). המודל חייב להסתגל במהירות למשימות חדשות ובלתי מוכרות תוך שימוש במינימום דוגמאות. הדבר מושג באמצעות שימוש בידע שנרכש מראש ובאסטרטגיות הסתגלות.

### גישות עיקריות ב-FSL

- **מטא-למידה ("למידה ללמוד"):** זוהי הפרדיגמה הדומיננטית ב-FSL. המודל מתאמן על מגוון רחב של משימות כדי ללמוד להסתגל ביעילות למשימות חדשות.
  - **מבוססת מטריקה:** מודלים (לדוגמה, רשתות סיאמיות או רשתות פרוטוטיפיות) לומדים לבנות מרחב embedding שבו המרחק בין וקטורים משקף קרבה סמנטית. סיווג דוגמה חדשה נעשה על ידי השוואת ה-embedding שלה עם ה-embeddings ממערך התמיכה.
  - **מבוססת אופטימיזציה:** מודלים (לדוגמה, MAML) לומדים למצוא אתחול פרמטרים כזה המאפשר fine-tuning מהיר (בכמה צעדי גרדיאנט) למשימה חדשה.
- **למידה בהקשר (In-Context Learning):** עם הופעתן של מודלי שפה גדולים (LLM), הפכה פופולרית גישה שבה דוגמאות ממערך התמיכה מסופקות למודל ישירות ב-prompt. המודל מבצע "מטא-למידה משתמעת" בזמן ה-inference, מסתגל למשימה ללא עדכון משקלים.

### גישות מורחבות ב-FSL

- **One-shot Learning:** זהו מקרה פרטי של FSL, שבו מספר הדוגמאות לכל מחלקה שווה לאחת (K=1 בסימון "N-way K-shot"). דוגמאות קלאסיות לארכיטקטורות הן Matching Networks ו-Siamese Networks.
- **שיטות גנרטיביות והגדלת נתונים:** FSL עושה שימוש נרחב במודלים גנרטיביים (GAN, VAE, מודלי דיפוזיה) לסינתוז דוגמאות נתונים נוספות. הדבר מאפשר הרחבה מלאכותית של מערך התמיכה ושיפור איכות הסיווג, במיוחד עבור מחלקות נדירות או חריגות.
- **FSL טרנסדוקטיבי:** בניגוד לגישה הסטנדרטית (האינדוקטיבית), כאן המודל בעת ההסתגלות לוקח בחשבון לא רק את מערך התמיכה המתויג, אלא גם את מכלול דוגמאות הבדיקה הלא-מתויגות (שאילתות). הדבר מאפשר לתפוס את מבנה הנתונים בשאילתות, לדוגמה באמצעות טכניקות label propagation, ולהגביר את יציבות הסיווג.

## למידה ללא דוגמאות (Zero-shot Learning)

**Zero-shot Learning (ZSL)** — היא פרדיגמה שבה המודל מסוגל לזהות מחלקות שלא ראה **אף דוגמה** מהן בשלב האימון.

### הרעיון המרכזי

הדבר מושג באמצעות שימוש ב**מידע סמנטי עזר**, המתאר הן מחלקות שנראו והן מחלקות שלא נראו. המודל לומד מיפוי ממרחב מאפייני הקלט (לדוגמה, תמונות) אל מרחב סמנטי משותף.

### מנגנוני המידע הסמנטי

- **תכונות סמנטיות:** מחלקות מתוארות באמצעות קבוצת תכונות המוגדרות על ידי בני אדם (לדוגמה, עבור המחלקה "זברה": \[יש_פסים, יש_פרסות, הוא_יונק\]).
- **ייצוגי וקטורים של מילים (Word Embeddings):** שמות המחלקות או תיאוריהם הטקסטואליים מומרים ל-embeddings באמצעות מודלי שפה מאומנים מראש (לדוגמה, Word2Vec, BERT).
- **Prompting ב-LLM:** עם הופעתן של מודלים מולטי-מודאליים כגון CLIP, ניתן לבצע ZSL על ידי השוואת ה-embedding של תמונה עם ה-embeddings של תיאורי טקסט של מחלקות (לדוגמה, "תצלום של כלב", "תצלום של חתול").

### סוגי ZSL: מסורתי, מוכלל, אינדוקטיבי וטרנסדוקטיבי

- **ZSL מסורתי:** בשלב הבדיקה המודל חייב לסווג דוגמאות רק ממחלקות שלא נראו.
- **ZSL מוכלל (Generalized ZSL, GZSL):** תרחיש ריאליסטי ומורכב יותר, שבו המודל חייב לסווג דוגמאות הן ממחלקות שנראו והן ממחלקות שלא נראו. הדבר דורש מהמודל לא רק לזהות חדש, אלא גם להבדיל אותו מהמוכר, תוך התמודדות עם הטיה לטובת מחלקות שנראו.
- **ZSL אינדוקטיבי:** הגדרה סטנדרטית, שבה המודל מתאמן רק על נתונים ותיאורים סמנטיים של מחלקות שנראו, ללא גישה כלשהי למידע על מחלקות שלא נראו.
- **ZSL טרנסדוקטיבי:** תוכנית מתקדמת יותר, שבה המודל במהלך האימון יכול להשתמש בדוגמאות לא-מתויגות ממחלקות שלא נראו. הדבר מאפשר להתאים מראש את המרחב הסמנטי ולשפר את האיכות הסופית.

### גישות גנרטיביות ב-ZSL

- **יצירת מאפיינים של מחלקות שלא נראו:** לפתרון בעיית ההטיה ב-GZSL נעשה שימוש נרחב במודלים גנרטיביים (VAE, GAN). הם מסנתזים לא את התמונות עצמן, אלא את וקטורי המאפיינים (embeddings) של מחלקות שלא נראו על בסיס תיאוריהם הסמנטיים. הדבר מאפשר לאזן את מערך הנתונים לאימון המסווג הסופי.

## ניתוח השוואתי וסינרגיה

| היבט                            | למידה עם מספר מועט של דוגמאות (FSL)                           | למידה ללא דוגמאות (ZSL)                                                             |
|---------------------------------|---------------------------------------------------------------|-------------------------------------------------------------------------------------|
| הרעיון המרכזי                   | ללמוד להסתגל במהירות למחלקות חדשות על בסיס כמה דוגמאות.       | ללמוד לזהות מחלקות חדשות על בסיס תיאוריהן הסמנטיים.                                 |
| דרישות נתונים למשימה/מחלקה חדשה | כמה דוגמאות מתויגות (1-5) לכל מחלקה חדשה.                     | אפס דוגמאות מתויגות; נדרש תיאור סמנטי.                                              |
| העברת ידע                       | לימוד ידע פרוצדורלי ("כיצד להסתגל") או מרחב מאפיינים טוב.     | לימוד יחסים סמנטיים ותכונות, העברת ידע דרך מרחב סמנטי משותף.                        |
| מקרי שימוש טיפוסיים             | אב-טיפוס מהיר, התאמה אישית, זיהוי אובייקטים נדירים, רובוטיקה. | גילוי מינים חדשים, קטגוריזציה של נושאים מתעוררים, טיפול בסוגי מוצרים חדשים לחלוטין. |

השוואת פרדיגמות למידה עם נתונים מוגבלים

### ניואנסים מרכזיים ומגמות עכשוויות

- **ההבחנה בין Zero-shot Learning לבין Zero-shot Prompting:** חשוב להבחין בין מושגים אלה. ZSL היא פרדיגמת ארכיטקטורה של Machine Learning הדורשת מודל מיוחד ומידע סמנטי. Zero-shot Prompting היא טכניקת prompt engineering יישומית, שבה מודל שפה גדול (לדוגמה, GPT-4) פותר משימה ללא דוגמאות ב-prompt, תוך הסתמכות אך ורק על ידע פנימי שלו.
- **תפקיד האימון המקדים בקנה מידה גדול:** ההצלחה המודרנית של FSL ו-ZSL נובעת במידה רבה ממודלים בסיסיים (foundation models) חזקים (BERT, CLIP, GPT-4). האימון המקדים שלהם על מסות עצומות של נתונים יוצר embedding-frontend אוניברסלי ועשיר סמנטית, המשמש בסיס מצוין להסתגלות מהירה ולהסקה סמנטית בתנאי מחסור בנתונים.

FSL ו-ZSL מייצגים נקודות שונות על ספקטרום היעילות בשימוש בנתונים ולעתים קרובות משמשים יחד. לדוגמה, ZSL יכול לשמש לאתחול ייצוגים, אשר לאחר מכן עוברים fine-tuning באמצעות FSL כאשר מופיעות הדוגמאות הראשונות של מחלקה חדשה.

## מוסדות מחקר מרכזיים ומשתתפים

מחקר בתחום FSL ו-ZSL מתנהל באופן פעיל הן בחוגים האקדמיים והן במעבדות תעשייתיות.

- **אוניברסיטאות:** אוניברסיטת סטנפורד, אוניברסיטת פקין, האוניברסיטה הלאומית של סינגפור.
- **מעבדות תעשייתיות:** Google AI, Meta AI, OpenAI.

עם הופעתם של מודלים בסיסיים חזקים, מרכז הכובד של המחקר עבר מפיתוח ארכיטקטורות מתמחות עבור FSL/ZSL לשיטות הסתגלות יעילה של מודלים אלה.

## ספרות

- Finn, C. et al. (2017). *Model-Agnostic Meta-Learning for Fast Adaptation of Deep Networks*. arXiv:1703.03400.
- Koch, G. et al. (2015). *Siamese Neural Networks for One-Shot Image Recognition*. PDF.
- Vinyals, O. et al. (2016). *Matching Networks for One Shot Learning*. arXiv:1606.04080.
- Snell, J. et al. (2017). *Prototypical Networks for Few-Shot Learning*. arXiv:1703.05175.
- Sung, F. et al. (2018). *Learning to Compare: Relation Network for Few-Shot Learning*. arXiv:1711.06025.
- Chen, Y. et al. (2021). *Meta-Baseline: Exploring Simple Meta-Learning for Few-Shot Learning*. arXiv:2003.04390.
- Wang, Y. et al. (2020). *Generalizing from a Few Examples: A Survey on Few-Shot Learning*. arXiv:1904.05046.
- Xian, Y. et al. (2018). *Zero-Shot Learning — A Comprehensive Evaluation of the State of the Art*. arXiv:1707.00600.
- Verma, V. K. et al. (2018). *Generalized Zero-Shot Learning via Synthesized Examples*. arXiv:1712.03878.
- Radford, A. et al. (2021). *Learning Transferable Visual Models from Natural Language Supervision*. arXiv:2103.00020.
- Xian, Y. et al. (2019). *Zero-Shot Learning via Simultaneous Generating and Learning*. arXiv:1910.09446.
- Verma, V. K. et al. (2017). *Zero-Shot Learning via Generative Adversarial Training of Class-Conditional Feature Vectors*. arXiv:1712.00981.

## ראו גם

- מודלי שפה גדולים
