Reinforcement learning from human feedback (RLHF) (HE)

From Systems analysis Wiki
Jump to navigation Jump to search

למידה מחיזוק עם משוב אנושי (Reinforcement Learning from Human Feedback, RLHF) — שיטת Machine Learning שבה תחילה מאומן מודל מיוחד של «תגמול» (reward model) על בסיס משוב מבני אדם, ולאחר מכן הוא משמש בתהליך Reinforcement Learning (RL) לאופטימיזציה של התנהגות הסוכן החכם[1].

RLHF מאפשר לפרמל מטרות מורכבות או קשות להגדרה (לדוגמה, תשובה «שימושית», «בטוחה» או «מצחיקה») באמצעות הערכות של בני אדם. במקום להגדיר ידנית פונקציית תגמול מורכבת, RLHF מאפשר לאמן את מודל התגמול ישירות על העדפות אנושיות. גישה זו הפכה מרכזית ל«יישור» (alignment) של מודלי שפה גדולים (LLM), כלומר התאמת התנהגותם לערכים ולכוונות אנושיים[2].

פיתוח השיטה והישגים ראשונים

הרעיון של אימון סוכנים באמצעות משוב אנושי נולד בשנות ה-2010. אחד מהתוצאות המשמעותיות הראשונות היה עבודתם של פול כריסטיאנו ועמיתיו מ-OpenAI ו-DeepMind ב-2017. הם הראו כי העדפות אנושיות יכולות להחליף פונקציית תגמול המוגדרת ידנית במשימות RL מורכבות. בניסוי שלהם צפה אדם בקטעי התנהגות של הסוכן (לדוגמה, במשחק Atari) ובחר בגרסה המועדפת. על בסיס השוואות זוגיות אלה אומן מודל תגמול, מה שאפשר לפתור בהצלחה מספר משימות מורכבות תוך קבלת משוב על פחות מ-1% מפעולות הסוכן[3].

בשנים שלאחר מכן החלו ליישם את השיטה לאימון מודלי שפה. ב-2020 יישמו חוקרי OpenAI לראשונה RLHF למשימת סיכום טקסט. הם אימנו מודל תגמול שמנבא איזה סיכום יועדף על ידי אדם, ובאמצעות RL עדכנו את המודל כדי לאפטם הערכה זו. התוצאה הראתה איכות סיכום גבוהה משמעותית, שעלתה אפילו על מודלים שאומנו על דוגמאות ייחוס אנושיות[4].

RLHF במודלי שפה גדולים

מודלי שפה גדולים הפיקו תועלת ניכרת מיישום RLHF לשיפור תשובותיהם מבחינת שימושיות, דיוק וציות להוראות.

InstructGPT ו-ChatGPT

אחד הצעדים המרכזיים היה מחקר OpenAI שהציג את המודלים InstructGPT (2022) — גרסאות של GPT-3 שעודכנו בהשתתפות אנשים[5]. המתודולוגיה כללה שלושה שלבים:

  1. Supervised Fine-Tuning (SFT): המודל מעודכן על מערך קטן של הדגמות איכותיות, שבהן מעריכים אנושיים כותבים ידנית דוגמאות לתשובות הרצויות לבקשות שונות.
  2. אימון מודל התגמול (Reward Model): עבור בקשות רבות נוצרות מספר תשובות של המודל. מעריכים אנושיים מדרגים תשובות אלה מהטובה לגרועה. על בסיס נתוני ההעדפות הללו מאומן מודל תגמול, אשר לומד להעניק ציונים גבוהים יותר לתשובות שבני אדם מעדיפים.
  3. אופטימיזציה באמצעות RL: מודל השפה המקורי מעודכן באמצעות אלגוריתם Proximal Policy Optimization (PPO) כדי למקסם את הציון שמעניק מודל התגמול. בתהליך האופטימיזציה מוטל גם קנס על סטייה חזקה מהמודל המקורי SFT, כדי למנוע ירידה ביכולות השפה.

הניסויים הראו שאפילו מודל InstructGPT קטן יחסית (1.3 מיליארד פרמטרים) עלה על המודל הענק GPT-3 (175 מיליארד פרמטרים) מבחינת שימושיות. מודלי InstructGPT גם הפיקו תוכן רעיל, מוטה או לא אמין בתדירות נמוכה הרבה יותר[5].

פיתוח קו זה הוביל ליצירת מודלים דיאלוגיים, שהמפורסם שבהם הוא ChatGPT (OpenAI, סוף 2022). ChatGPT הוא מודל מסדרת GPT-3.5, שעודכן במיוחד לניהול דיאלוג באמצעות RLHF לפי מתודולוגיה דומה[6].

אימוץ בתעשייה

שיטת RLHF אומצה גם על ידי ארגונים מובילים אחרים. DeepMind פיתחה את הסוכן הדיאלוגי Sparrow (2022), שאומן באמצעות RLHF בתוספת מערך כללים בשפה טבעית (לדוגמה, «אל תתן עצות מסוכנות»)[7]. החברה Anthropic גם היא השתמשה בעקרונות דומים לאימון מודליה. עד 2023 הפך RLHF למעשה למרכיב סטנדרטי ביצירת מודלי השפה המתקדמים ביותר[1].

יתרונות השימוש ב-RLHF

  • התאמה לכוונות המשתמש: מודלים שעברו RLHF fine-tuning עוקבים אחר הוראות טוב בהרבה ונותנים תשובות רלוונטיות ושימושיות יותר[5].
  • הפחתת רעילות ותוכן מזיק: שילוב האדם במחזור האימון מאפשר לענוש באופן מפורש צורות תשובה בלתי רצויות. כתוצאה מכך מודלי RLHF מייצרים תוכן רעיל ומוטה פחות בהרבה[5].
  • שיפור האמינות והפחתת «הזיות»: המעריכים יכולים להוריד את דירוג התשובות עם עובדות בדויות, ובכך לעודד את המודל להיות מדויק יותר. מודלי InstructGPT ו-ChatGPT «ממציאים» עובדות לעיתים רחוקות יותר בהשוואה לקודמיהם[5].
  • יעילות האימון: RLHF מאפשר לשפר את המודל ללא הגדלה פרופורציונלית של מערך האימון. נדרשות לא כמויות עצומות של נתונים, אלא הערכות איכותיות של העדפות.

מגבלות ובעיות

למרות ההצלחות, לשיטת RLHF יש מספר מגבלות ובעיות פתוחות.

  • איכות ועלות איסוף הנתונים האנושיים: יעילות RLHF תלויה ישירות באיכות המשוב. איסוף dataset כזה הוא תהליך עתיר עבודה ויקר. בנוסף, אם מדגם המעריכים או קריטריוניהם אינם אובייקטיביים, המודל עלול לרשת את ההטיות שלהם[2].
  • סיכון של «ציות נלמד» (Reward Hacking): מודל המאופטם לפונקציית תגמול מסוימת עשוי להתחיל להתאים את עצמו לפונקציה זו דווקא, ולא למטרה האמיתית. לדוגמה, הוא עשוי ללמוד לתת תשובות ארוכות ככל האפשר אם המעריכים מעריכים אורך, או להימנע מהצהרות אם מענישים אותו על אי-דיוקים.
  • היעדר ערבויות לאמת: RLHF אינו מכניס למודל ידע עובדתי חדש, אלא רק מלמד אותו את צורת התשובה שבני אדם מעדיפים. לכן בעיית ההזיות אינה נפתרת לגמרי. המודל עשוי ללמוד להסתיר אי-וודאות טוב יותר, אך לא תמיד יוכל לאמת עובדות[6].
  • הרחבת ההעדפות: שאלות מעוררת גם העברת מודל התגמול למשימות אחרות. מודל שאומן על העדפות עבור מערך בקשות אחד עשוי לפעול בצורה בלתי צפויה כאשר הוא נתקל במשימות חדשות מבחינת סגנון או נושא.

סיכום

RLHF התבסס כשיטה חשובה ל«יישור» מודלי שפה גדולים עם התפיסות האנושיות של תשובות טובות. הוא אפשר לשפר ניכרות את איכות האינטראקציה עם עוזרי AI, תוך הפיכת תשובותיהם לשימושיות ובטוחות יותר. RLHF נתפס ככלי מרכזי בדרך ליצירת מודלים המסוגלים לא רק לייצר טקסט סביר, אלא גם לקחת בחשבון ערכים, העדפות וכוונות אנושיות במהלך התקשורת[8].

קישורים

  • מאמר OpenAI על fine-tuning של מודלים לציות להוראות
  • סקירת RLHF מאת IBM

ספרות

  • Christiano, P. et al. (2017). Deep Reinforcement Learning from Human Preferences. arXiv:1706.03741.
  • Stiennon, N. et al. (2020). Learning to Summarize from Human Feedback. arXiv:2009.01325.
  • Nakano, R. et al. (2021). WebGPT: Browser-Assisted Question-Answering with Human Feedback. arXiv:2112.09332.
  • Ouyang, L. et al. (2022). Training Language Models to Follow Instructions with Human Feedback. arXiv:2203.02155.
  • Glaese, A. et al. (2022). Improving Alignment of Dialogue Agents via Targeted Human Judgements. arXiv:2209.14375.
  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Lee, H. et al. (2023). RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback. arXiv:2309.00267.
  • Liu, T. et al. (2023). A Survey of Reinforcement Learning from Human Feedback. arXiv:2312.14925.
  • Zhang, Y. et al. (2024). A Survey on Human Preference Learning for Large Language Models. arXiv:2406.11191.
  • Li, P. et al. (2024). Advancing Translation Preference Modeling with RLHF. arXiv:2402.11525.
  • McAleese, N. et al. (2024). LLM Critics Help Catch LLM Bugs. arXiv:2407.00215.

הערות

  1. 1.0 1.1 «What Is Reinforcement Learning From Human Feedback (RLHF)?». IBM. [1]
  2. 2.0 2.1 «Reinforcement learning from human feedback». In Wikipedia. [2]
  3. Christiano, P. et al. «Deep reinforcement learning from human preferences». arXiv:1706.03741, 2017. [3]
  4. Stiennon, N. et al. «Learning to summarize from human feedback». arXiv:2009.01325, 2020. [4]
  5. 5.0 5.1 5.2 5.3 5.4 Ouyang, L. et al. «Training language models to follow instructions with human feedback». arXiv:2203.02155, 2022. [5]
  6. 6.0 6.1 «Introducing ChatGPT». OpenAI, 2022. [6]
  7. Glaese, A. et al. «Improving alignment of dialogue agents via targeted human judgements». arXiv:2209.14375, 2022. [7]
  8. «Aligning language models to follow instructions». OpenAI. [8]