Fine-tuning (deep learning) (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

כיוון עדין (באנגלית: Fine-tuning), המכונה גם תיקון עדין, הוא שיטה של למידת העברה (Transfer Learning) בתחום Machine Learning, שבה פרמטרים של מודל מאומן מראש (pre-trained model) מותאמים לפתרון משימה חדשה וספציפית. במקום לאמן מודל מאפס, דבר הדורש כמויות עצומות של נתונים ומשאבי חישוב, כיוון עדין מאפשר להשתמש בידע הכבר מקודד במשקלות המודל ו"לכוונן" אותם לצרכים ספציפיים.

גישה זו הפכה לסטנדרט דה-פקטו בתחום הלמידה העמוקה, בפרט בעבודה עם מודלי שפה גדולים (LLM) ומודלי ראייה ממוחשבת.

הקונספט

ניתן לחלק את תהליך הכיוון העדין לשני שלבים עיקריים:

1. אימון מקדים (Pre-training): המודל (לדוגמה, BERT או GPT) מאומן על מאגר נתונים גדול ומגוון ביותר (לדוגמה, כלל האינטרנט) תוך שימוש במשימה בפיקוח עצמי (לדוגמה, חיזוי המילה הבאה). בשלב זה המודל לומד דפוסים כלליים, תחביר, סמנטיקה וידע על העולם.

2. כיוון עדין (Fine-tuning): המודל המאומן מראש משמש כבסיס, ומשקלותיו מכוווננים מחדש על מאגר נתונים קטן אך מתויג הספציפי למשימת היעד.

הרעיון המרכזי הוא שהידע שנרכש בשלב האימון המקדים הוא אוניברסלי וניתן להעבירו בהצלחה לפתרון של משימות רבות ונוספות, צרות יותר.

תהליך הכיוון העדין

תהליך הכיוון העדין הטיפוסי כולל את השלבים הבאים:

1. בחירת מודל מאומן מראש: נבחר מודל שיכולותיו הבסיסיות מתאימות למשימת היעד (לדוגמה, BERT למשימות הבנת טקסט, GPT לייצור טקסט).

2. התאמת הארכיטקטורה: למודל המאומן מראש מתווסף שכבת "ראש" (head) חדשה הספציפית למשימת היעד. לדוגמה:

  • לסיווג טקסט מתווסף שכבה מחוברת במלואה עם פונקציית softmax.
  • לזיהוי ישויות בשם (NER) מתווסף מסווג לפלט של כל token.

3. אימון על מאגר הנתונים של היעד: המודל כולו (או חלקו) מאומן על מאגר נתונים חדש ומתויג. בשלב זה משקלות המודל, כולל משקלות השכבות המאומנות מראש, מתעדכנות באמצעות ירידת גרדיאנט כדי למזער את פונקציית ההפסד על המשימה החדשה. 4. שימוש בקצב למידה נמוך יותר: בכיוון עדין משתמשים בדרך כלל בקצב למידה נמוך משמעותית מאשר באימון המקדים. הדבר נחוץ כדי לא "להרוס" את הידע השימושי הכבר מקודד במשקלות המודל, אלא רק לכוונן אותו בעדינות.

סוגי כיוון עדין

כיוון עדין מלא (Full Fine-tuning)

  • עקרון: מתעדכנים כל פרמטרי המודל המאומן מראש יחד עם שכבת ה"ראש" החדשה.
  • יתרונות: עשוי להבטיח את הביצועים הטובים ביותר, שכן כל המודל מותאם למשימה החדשה.
  • חסרונות: דורש משאבי חישוב וזיכרון ניכרים, שכן יש לאחסן ולעדכן גרדיאנטים עבור כל הפרמטרים. קיים סיכון של שכחה קטסטרופלית, כאשר המודל "שוכח" את הידע הכללי שנרכש באימון המקדים.

כיוון עדין יעיל-פרמטרים (Parameter-Efficient Fine-Tuning, PEFT)

זהו משפחה של שיטות שנועדו להפחית את עלויות החישוב בכיוון עדין. הרעיון המרכזי הוא להקפיא את רוב פרמטרי המודל המאומן מראש ולאמן רק כמות קטנה של פרמטרים חדשים או קיימים נבחרים.

  • דוגמאות לשיטות PEFT:
    • מתאמים (Adapters): לארכיטקטורת ה-transformer מוכנסות שכבות מתאם קטנות ונוספות, ורק הן מאומנות.
    • LoRA (Low-Rank Adaptation): במקום עדכון מטריצות המשקל המלאות, LoRA מאמן את העדכונים בדרגה נמוכה (low-rank) שלהן. הדבר מאפשר לצמצם את מספר הפרמטרים הניתנים לאימון באלפי מונים.
    • Prompt Tuning: לנתוני הקלט מתווספים וקטורים מאומנים – "prompts" – המכוווונים לפתרון המשימה, בעוד המודל עצמו נשאר קפוא.
  • יתרונות PEFT:
    • יעילות: מפחית משמעותית את דרישות הזיכרון והחישוב.
    • מודולריות: מאפשר להתאים בקלות מודל מאומן מראש אחד למשימות רבות, תוך אחסון רק של מערכות קטנות של משקלות מותאמות לכל משימה.

כיוון עדין על הוראות (Instruction Tuning)

זהו סוג ספציפי של כיוון עדין שנועד לשפר את יכולת LLM לעקוב אחר הוראות בשפה טבעית.

  • עקרון פעולה: המודל מקבל כיוון עדין על מאגר נתונים המורכב מזוגות "הוראה — פלט רצוי".
  • מטרה: לשפר את יכולת ההכללה של המודל על משימות חדשות שלא נראו קודם, אשר ניתן לתאר בצורת הוראות. מודלים כגון InstructGPT ו-FLAN-T5 הם דוגמאות בולטות לגישה זו.

ספרות

  • Howard, J.; Ruder, S. (2018). Universal Language Model Fine-tuning for Text Classification. arXiv:1801.06146.
  • Houlsby, N. et al. (2019). Parameter-Efficient Transfer Learning for NLP. arXiv:1902.00751.
  • Pfeiffer, J. et al. (2020). AdapterFusion: Non-Destructive Task Composition for Transfer Learning. arXiv:2005.00247.
  • Hu, E. J. et al. (2021). LoRA: Low-Rank Adaptation of Large Language Models. arXiv:2106.09685.
  • Lester, B.; Al-Rfou, R.; Constant, N. (2021). The Power of Scale for Parameter-Efficient Prompt Tuning. arXiv:2104.08691.
  • Ben Zaken, A.; Goldberg, Y.; Ravfogel, S. (2022). BitFit: Simple Parameter-Efficient Fine-Tuning for Transformer-based Masked Language-Models. ACL 2022.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Han, Z. et al. (2024). Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey. arXiv:2403.14608.
  • Bian, J. et al. (2025). A Survey on Parameter-Efficient Fine-Tuning for Foundation Models in Federated Learning. arXiv:2504.21099.
  • Li, X. et al. (2025). Revisiting Fine-Tuning: A Survey of Parameter-Efficient Techniques and Future Directions. Preprints.org.

ראו גם

  • מודלי שפה גדולים
  • BERT
  • GPT