Bias in large language models — הטיה ודעה קדומה ב-LLM
הטיה במודלים שפתיים גדולים (באנגלית: bias in large language models) — היא סטיות שיטתיות בפעולת מודלים שפתיים גדולים (LLM), המובילות לייצור תשובות המשקפות את המציאות באופן לא הוגן או לא מדויק, ומשכפלות ומגבירות סטריאוטיפים קיימים בחברה[1]. בניגוד לשגיאות אקראיות, ההטיה היא בעלת אופי סדיר ונובעת מתכונות נתוני האימון והאלגוריתמים. LLM עשויים לשכפל סטריאוטיפים מגדריים, אתניים ואחרים, דבר המהווה בעיה חמורה, במיוחד בתחומים אחראיים כמו רפואה, משפטים ופיננסים[2].
מקורות ההטיה
הטיה ב-LLM נוצרת משני מקורות עיקריים: נתונים מוטים ותכונות האלגוריתמים עצמם.
נתוני אימון מוטים
הסיבה העיקרית להופעת הטיה היא נתוני האימון, המשקפים עיוותים היסטוריים, חברתיים ותרבותיים הקיימים בעולם. LLM מאומנים על קורפוסי טקסט עצומים מהאינטרנט, מספרים וממקורות אחרים שנוצרו על ידי בני אדם, ועל כן יורשים את כל הסטריאוטיפים הגלומים בהם[3].
- ייצוג לא מאוזן: אם קבוצות דמוגרפיות מסוימות אינן מיוצגות בצורה מספקת בנתונים (למשל, מיעוטים אתניים, נשים במקצועות מסוימים), המודל מפתח תפיסה מעוותת לגביהן. לדוגמה, LLM מקשרים לעיתים קרובות את המילה "רופא" עם המין הזכרי, ו"אחות" עם המין הנקבי, ובכך משכפלים סטריאוטיפים מגדריים היסטוריים[1].
- עיוותים היסטוריים ותרבותיים: הנתונים משקפים לעיתים קרובות השקפות תרבותיות דומיננטיות ודעות קדומות היסטוריות. מודל שאומן על טקסטים כאלה ישכפל השקפות אלו תוך התעלמות מנקודות מבט חלופיות[4].
הגברה אלגוריתמית
הארכיטקטורה ואלגוריתם האימון של LLM עשויים לא רק לשכפל אלא גם להגביר את ההטיות הקיימות בנתונים. רוב ה-LLM המודרניים מבוססים על transformer ומנבאים את המילה הבאה על בסיס דפוסים סטטיסטיים. הדבר מוביל לכך שהמודל נוטה לקראת הדפוסים הנפוצים ביותר, מה שמגבש ומחזק דעות וסטריאוטיפים דומיננטיים, בעוד שמקרים נדירים ולא אופייניים מתעלמים מהם[2]. מנגנון זה עשוי להפוך הטיה קלה בנתונים להטיה בולטת בתשובות המודל[1].
סוגי דעות קדומות ודוגמאות
דעות קדומות חברתיות ודמוגרפיות
זהו סוג ההטיה הנחקר ביותר, הכולל סטריאוטיפים הקשורים למין, גזע, גיל, דת ומאפיינים חברתיים אחרים.
- סטריאוטיפים מגדריים: LLM מקשרים לעיתים קרובות מקצועות ותכונות מסוימים למין ספציפי. לדוגמה, לבקשה על "מנהיג חזק" המודל צפוי יותר לייצר תיאור של גבר.
- סטריאוטיפים גזעיים ואתניים: מודלים עשויים לשכפל סטריאוטיפים שליליים על קבוצות אתניות שונות. מחקרים הראו כי אלגוריתמי מידור המבוססים על LLM עשויים להעריך בחומרה רבה יותר הודעות בניב אפרו-אמריקאי (AAVE), בטעות רואים אותן כפוגעניות יותר[5].
- הטיה קבוצתית ("שלנו מול שלהם"): מחקר משנת 2024 הראה כי LLM מפגינים הטיה קבוצתית בולטת. כאשר ניתנת הנחיה המקשרת אותם לקבוצה מסוימת ("אנחנו..."), המודל נוטה להתייחס לאותה קבוצה בחיוב ולקבוצה ה"זרה" בבוז[4].
עיוותים מבניים וקוגניטיביים
עיוותים אלו קשורים לתכונות הארכיטקטורה ועיבוד המידע.
- הטיה מיקומית: מחקר של המכון הטכנולוגי של מסצ'וסטס (MIT) גילה כי מודלים מביאים בחשבון באופן לא פרופורציונלי מידע מתחילת המסמך ומסופו, ולעיתים קרובות "מחמיצים" פרטים מהאמצע. הדבר עשוי להשפיע על הדיוק בעבודה עם טקסטים ארוכים[6].
- נטייה לממוצע: כמודלים הסתברותיים, LLM שואפים לייצר תשובות נפוצות (ממוצעות), מה שמוביל להתעלמות מעובדות, חריגים ודעות מיעוט נדירים אך חשובים[2].
- אפקט האישור: LLM עשויים להפגין נטייה לשכפל תבניות לוגיות הנוכחות בנתוני האימון, גם אם הן מכילות דעות קדומות, ולהתעלם ממידע הסותר אותן[2].
דוגמה מהשטח
מחקר של הבנק העולמי גילה כי בניתוח ראיונות עם פליטים, LLM עיוותה באופן שיטתי את משמעות דבריהם בהתאם למוצאם ומינם. המודל פירש בצורה שגויה את שאיפת הורים פליטים להצלחת ילדיהם, ככל הנראה עקב היעדר נרטיבים כאלה בנתוני האימון, המורכבים בעיקר מטקסטים של "סופרים לבנים ממעמד הביניים"[7][7].
סיכונים ותוצאות
- הגברת אפליה: בתחומים כמו גיוס עובדים, מתן אשראי ומשפטים, LLM מוטים עשויים לקבל החלטות מפלות, מה שמגביר אי-שוויון חברתי[1].
- הפצת סטריאוטיפים: שימוש מסיבי ב-LLM במנועי חיפוש ובצ'אטבוטים עשוי להוביל להפצה ולנורמליזציה של סטריאוטיפים מזיקים.
- פגיעה באמון בטכנולוגיה: כאשר משתמשים נתקלים בהטיה שיטתית, הדבר פוגע באמונם בטכנולוגיות בינה מלאכותית בכלל.
- יצירת בועות מידע: אלגוריתמים עשויים לעצב את הפלט כך שיתאים להשקפות המשוערות של המשתמש, מה שמחזק echo chambers ומדיר דעות מיעוט[1].
שיטות לזיהוי והפחתת הטיה
למאבק בעיוותים, חוקרים ומפתחים מיישמים גישה מקיפה, הפועלת בשלושה רמות: נתונים, מודל ועיבוד לאחר[1].
התערבויות ברמת הנתונים
זוהי הגישה הבסיסית ביותר. היא כוללת[1]:
- ניקוי ואיזון: הסרת תוכן רעיל ומוטה מנתוני האימון.
- הגדלת נתונים (Data Augmentation): הוספת דוגמאות עם קבוצות מיוצגות בצורה לא מספקת לאיזון הפרופורציות.
שינויים ברמת המודל
גישה זו מכוונת לשינוי אלגוריתם האימון עצמו[1]:
- אילוצי הוגנות: פונקציית ההפסד מצוידת באילוצים מיוחדים ה"מעניישים" את המודל על הפגנת סוגי הטיה מסוימים.
- שינוי ארכיטקטורה: נחקרים שינויים במנגנוני ה-attention או הוספת מודולים בקרה העוקבים אחר קשרים מוטים ומתקנים אותם.
עיבוד לאחר התוצאות
שיטה זו מיושמת בשלב ייצור התשובות[1]:
- סינון ותיקון: אלגוריתמים מיוחדים מנתחים את הטקסט שנוצר ומרככים או מסירים ניסוחים שעלולים להיות מפלים.
- כיוונון עדין עם חיזוק מבני אדם (RLHF): המודל מאומן במיוחד לספק תשובות ניטרליות ובטוחות יותר על בסיס הערכות שניתנו על ידי בני אדם.
למרות ההתקדמות המשמעותית, טרם הצליחו לפטור את ה-LLM מהטיה לחלוטין. זה נותר אחד מתחומי המחקר המרכזיים שמטרתם יצירת מערכות בינה מלאכותית הוגנות ואמינות יותר[4].
קישורים חיצוניים
- Generative language models exhibit social identity biases — מחקר ב-Nature Computational Science
- Unpacking the bias of large language models — מאמר ב-MIT News
ספרות
- Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
- Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
- Wu, X. et al. (2025). On the Emergence of Position Bias in Transformers. arXiv:2502.01951.
- Hu, T. et al. (2024). Generative Language Models Exhibit Social Identity Biases. Nature Computational Science, 5, 65-75. Full text.
- Sheng, E. et al. (2019). The Woman Worked as a Babysitter: On Biases in Language Generation. In EMNLP-2019. PDF.
- Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. In ACM FAccT 2021. DOI:10.1145/3442188.3445922.
- Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
- Ma, C. et al. (2024). Debiasing Large Language Models with Structured Knowledge. In Findings of ACL 2024, pp. 10274-10287. [7].
- Mohammadi, B. (2024). Creativity Has Left the Chat: The Price of Debiasing Language Models. arXiv:2406.05587.
- Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.
- Benedetto, L. & Stella, M. (2023). Cognitive Network Science Reveals Bias in GPT-3, GPT-3.5-Turbo, and GPT-4 Mirroring Math Anxiety in High-School Students. Applied Sciences, 13(3). Open access.
הערות
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Zhang, A.; et al. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [1]
- ↑ 2.0 2.1 2.2 2.3 «Предвзятость в больших языковых моделях: этические вызовы и пути решения». medet.rsmu.press. [2]
- ↑ «Large Language Models». Энциклопедия BigdataSchool. [3]
- ↑ 4.0 4.1 4.2 «Generative language models exhibit social identity biases». Nature Computational Science. [4]
- ↑ «Study shows moderation algorithms are stricter on African American Vernacular English». [источник не указан в тексте].
- ↑ «Unpacking the bias of large language models». MIT News. [5]
- ↑ 7.0 7.1 «Прочитал статью про bias LLM». ChatGPT на vc.ru. [6]