Stochastic parrot — תוכי סטוכסטי

From Systems analysis Wiki
Jump to navigation Jump to search

תוכי סטוכסטי (באנגלית: Stochastic parrot) — מטאפורה המשמשת בתחום הבינה המלאכותית לתיאור מודלי שפה גדולים (LLM) כמערכות המסוגלות לשלב צורות לשוניות באופן סטטיסטי סביר, אך חסרות הבנה אמיתית של משמעותן[1].

המונח הוצג במרץ 2021 במאמר מדעי בשם «On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?» (על הסכנות של תוכים סטוכסטיים: האם מודלי שפה יכולים להיות גדולים מדי?), שפורסם בכנס FAccT. המחברים הם אמילי מ. בנדר, טימניט גברו, אנג'לינה מקמילן-מייג'ור ומרגרט מיטשל[2].

הגדרה ומושג

לפי מחברי המאמר, תוכי סטוכסטי הוא «מערכת לחיבור אקראי של רצפים של צורות לשוניות הנצפות בנתוני האימון הנרחבים שלה, בהתאם למידע הסתברותי על אופן שילובן, אך ללא כל קשר למשמעות»[2].

המונח מורכב משני חלקים:

  • סטוכסטי — מן היוונית העתיקה στοχαστικός («מבוסס על ניחוש»), במתמטיקה המודרנית מציין תהליך הנקבע על ידי התפלגות הסתברות אקראית[1].
  • תוכי — הפניה לכושרם של תוכים לחקות דיבור אנושי מבלי להבין את משמעותו[1].

המושג טוען כי LLM המאומנים לחזות את המילה הבאה ברצף הם למעשה מערכות השלמה אוטומטית מורכבות, המתמרנות סמלים ללא גישה למשמעותם.

טיעוני המפתח של המאמר «On the Dangers of Stochastic Parrots»

העבודה מזהה ארבע קטגוריות עיקריות של סיכונים הקשורים לפיתוח מודלי שפה גדולים מדי.

1. נתוני אימון בלתי ניתנים להכרה מלאה

LLM מאומנים על מערכי נתונים עצומים ובלתי מתויגים, שנאספו מהאינטרנט (לדוגמה, Common Crawl). מערכי נתונים כאלה מכילים בהכרח הטיות, שפה רעילה ונקודות מבט הגמוניות הפוגעות בקבוצות פגיעות. לדוגמה, תוכן האינטרנט מייצג באופן לא פרופורציונלי גברים לבנים ממדינות מפותחות (67% ממשתמשי Reddit בארה"ב הם גברים)[2].

2. היעדר הבנת שפה אמיתית

המחברים טוענים כי LLM אינם בעלי הבנת שפה אמיתית. הם מסתמכים על התיאוריה לפיה שפה היא מערכת סימנים שבה הצורה (המילה) קשורה קשר בל ינותק למשמעות. נתוני האימון עבור LLM מכילים רק צורה, ומונעים מהמודל גישה למשמעות. לפיכך, LLM אינם אלא מחקים דיבור בעל משמעות.

3. טקסט סינתטי ונזק פוטנציאלי

מאחר ש-LLM מייצרים טקסט דקדוקי ומשכנע, בני אדם נוטים לייחס לו משמעות ולבטוח בו. הדבר יוצר סיכון להפצת מידע שגוי, שפת שנאה והונאות. ככל שהחיקוי מושלם יותר, כך גדל הסיכון שבני אדם יעריכו יתר על המידה את יכולות הבינה המלאכותית ויאצילו לה החלטות קריטיות.

השפעה מדעית והמחלוקת סביב הפרסום

המאמר הפך למוקד שערוריה גדולה ב-Google, שם עבדו באותה עת השותפות לכתיבה טימניט גברו ומרגרט מיטשל. בסוף 2020, במהלך הביקורת הפנימית, דרשה הנהלת Google מהמחברים לחזור בהם מהמאמר או להסיר ממנו את שמות עובדי Google[3].

טימניט גברו, חוקרת מובילה באתיקה של בינה מלאכותית, סירבה למלא דרישה זו, מה שהוביל לפיטוריה מ-Google בדצמבר 2020. בפברואר 2021 פוטרה גם מרגרט מיטשל, שתמכה בגברו[4]. אירועים אלה עוררו הדים ציבוריים רחבים. יותר מ-2200 עובדי Google ואלפי נציגי הקהילה האקדמית חתמו על מכתב מחאה, שבו האשימו את החברה בצנזורה מדעית ובדיכוי מחקרים שעלולים לפגוע באינטרסים המסחריים שלה[5]. בסופו של דבר, המאמר פורסם במרץ 2021 בכנס FAccT.

תגובות, דיונים ואבולוציה של השקפות

המטאפורה «תוכי סטוכסטי» התפשטה במהירות והפכה לנקודת מרכז בדיונים על טבע הבינה המלאכותית. האיגוד האמריקאי לדיאלקטולוגיה (ADS) בחר ב-«stochastic parrot» כמילת השנה בתחום הבינה המלאכותית לשנת 2023, שבה גברה אפילו על «ChatGPT» ו-«LLM»[1].

ביקורת על המושג וראיות להבנה

המושג הוטל בספק על ידי חוקרים מובילים רבים.

  • ג'פרי הינטון, אחד מ«אבות הגדולים» של למידה עמוקה, טען כי «כדי לחזות במדויק את המילה הבאה, יש צורך להבין את המשפט»[1]. בשנת 2023, לאחר שעזב את Google, הצהיר כי מודלים גדולים כבר «מבינים» את מה שמלמדים אותם ויכולים להסיק מסקנות עצמאיות[6].
  • יכולות אמרג'נטיות (Emergent Abilities): מחקרים הראו כי עם הגעה לסקאלה מסוימת, LLM מפגינים הופעה פתאומית של יכולות חדשות, כגון פתרון בעיות אריתמטיות, שלא הוטמעו בהם במפורש[7].
  • מודלים פנימיים של העולם: מחקר משנת 2022 הראה כי מודל שאומן לשחק אוטלו על בסיס רשומות טקסטואליות של מהלכים, יצר ספונטנית ייצוג פנימי של לוח המשחק, מה שמצביע על פיתוח מודל מופשט של העולם המתואר[3].
  • ביצועים על benchmark: מודלים עכשוויים כגון GPT-4 מציגים תוצאות ברמת אדם (או גבוהה ממנה) בבחינות מקצועיות מורכבות, מה שלדעת חלק מהחוקרים אינו אפשרי ללא הבנה[8].

שימוש אירוני ושיח ציבורי

המונח הפך כה פופולרי עד שאפילו מנכ"ל OpenAI סם אלטמן השתמש בו בצורה אירונית, כשכתב ב-Twitter: «אני תוכי סטוכסטי, וגם אתם» (i am a stochastic parrot, and so r u). בכך רמז כי דיבור אנושי אף הוא במידה רבה חיזוי הסתברותי של המילה הבאה, תוך שהוא משחק עם הביקורת כלפי הבינה המלאכותית[1].

השפעה על השיח המדעי

המטאפורה «תוכי סטוכסטי» נותרת מרכזית בדיונים על יכולות ומגבלות LLM. היא סייעה לנסח את בעיית היעדר ההבנה האמיתית במודלי שפה ומשכה תשומת לב לסיכונים הכרוכים בפיתוחם. יחד עם זאת, ההתקדמות המהירה בתחום LLM מחייבת לפרש מחדש את המטאפורה ללא הרף, שכן המודלים החדישים ביותר מפגינים התנהגות מורכבת יותר ויותר שאינה מתאימה לדימוי «התוכי חסר המשמעות». המונח ממשיך להשפיע על השיח המדעי, תוך שהוא מדגיש את חשיבות הניתוח הביקורתי של יכולות מערכות הבינה המלאכותית והשלכותיהן החברתיות[8].

ספרות

  • Bender, E. M.; Gebru, T.; McMillan-Major, A.; Mitchell, M. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. FAccT 2021.
  • Floridi, L.; Chiriatti, M. (2020). GPT-3: Its Nature, Scope, Limits, and Consequences. Minds & Machines, 30(4), 681-694.
  • Bommasani, R. et al. (2021). On the Opportunities and Risks of Foundation Models. arXiv:2108.07258.
  • Weidinger, L. et al. (2021). Ethical and Social Risks of Harm from Language Models. arXiv:2112.04359.
  • Kaplan, J. et al. (2020). Scaling Laws for Neural Language Models. arXiv:2001.08361.
  • Wei, J. et al. (2022). Emergent Abilities of Large Language Models. arXiv:2206.07682.
  • Perez, E. et al. (2022). Red Teaming Language Models with Language Models. EMNLP 2022.
  • Bai, Y. et al. (2022). Constitutional AI: Harmlessness from AI Feedback. arXiv:2212.08073.
  • Du, Z. et al. (2024). Understanding Emergent Abilities of Language Models from the Loss Perspective. arXiv:2403.15796.
  • Gerstgrasser, M. et al. (2024). Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data. arXiv:2404.01413.

הערות

  1. 1.0 1.1 1.2 1.3 1.4 1.5 'Stochastic Parrot': A Name for AI That Sounds a Bit Less Intelligent. Mint. [1]
  2. 2.0 2.1 2.2 Bender, Emily M., et al. «On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?». Conference on Fairness, Accountability, and Transparency (FAccT '21). [2]
  3. 3.0 3.1 «Протестующие пчёлы и стохастические попугаи: дайджест публикаций с критикой и поддержкой развития AI». Хабр. [3]
  4. Hao, Karen. «We read the paper that forced Timnit Gebru out of Google. Here's what it says». MIT Technology Review. [4]
  5. Vincent, James. «Timnit Gebru's actual paper may explain why Google ejected her». The Verge. [5]
  6. «Geoffrey Hinton on the promise, risks of artificial intelligence». 60 Minutes - CBS News. [6]
  7. «Stochastic parrot». Wikipedia. [7]
  8. 8.0 8.1 «The debate over understanding in AI's large language models». PMC. [8]