Generation bias (LLM) (HE)
הטיה במודלי שפה גדולים (LLM) — היא עיוות שיטתי של טקסטים מיוצרים, שבו המודל משקף או מגביר סטריאוטיפים ודעות קדומות הקיימות בחברה, הקשורים למגדר, גזע, תרבות, השקפות פוליטיות וקטגוריות חברתיות אחרות. תופעה זו נוצרת מכך ש-LLM מאומנים על מסות עצומות של נתונים אנושיים, המכילים בהכרח מידע מוטה[1].
הטיה היא אחת מהבעיות האתיות והטכניות המרכזיות בפיתוח AI, שכן היא עלולה להוביל לאפליה, להפצת מידע שגוי ולפגיעה באמון בטכנולוגיות.
סוגי הטיה ב-LLM
הטיה ב-LLM יכולה להתבטא בצורות שונות.
הטיה מגדרית
מודלים נוטים לשחזר סטריאוטיפים מגדריים מסורתיים, ומשייכים מקצועות ותכונות למין מסוים.
- מחקר של אונסק"ו משנת 2024 הראה ש-LLM מתארים נשים בתפקידים ביתיים ("בית", "משפחה", "ילדים") פי ארבעה יותר מאשר גברים, ואילו גברים משויכים למושגים "עסק" ו"קריירה"[2].
- מחקר ב-Nature Scientific Reports חשף הטיה מגדרית וגזעית משמעותית בתוכן המיוצר על ידי שבעה LLM מובילים, כולל ChatGPT ו-LLaMA[3].
- בהקשר דובר הרוסית, מודלים משתמשים לעתים קרובות כברירת מחדל בצורת זכר עבור תפקידים ניטרליים (כגון "רופא", "מנהל") ומתקשים לייצר צורות נקבה[4].
הטיה גזעית ואתנית
LLM עלולים להפגין אפליה סמויה כלפי קבוצות אתניות שונות.
- מחקר של Bloomberg הראה ש-ChatGPT 3.5 העדיף קורות חיים של מועמדים ממוצא אסייתי על פני מועמדים שחורים[5].
- בהקשר דובר הרוסית, dataset בשם RuBia חשף שמודלים עשויים לשחזר סטריאוטיפים אנטישמיים ואנטי-מהגרים (כגון הסכמה לטענה "מהגרים עצלנים"), אם אלה נוכחים בקורפוס האימון[6].
הטיה פוליטית ואידיאולוגית
למרות הצהרות על ניטרליות, LLM רבים מפגינים נטייה לספקטרום פוליטי מסוים.
- מחקר של Centre for Policy Studies חשף הטיה שמאל-ליברלית ב-23 מתוך 24 LLM שנבדקו[7].
- בדיקות של אוניברסיטת וושינגטון ואוניברסיטת קרנגי מלון הראו ש-ChatGPT ו-GPT-4 היו השמאל-ליברטריאנים ביותר, בעוד ש-LLaMA של Meta היה הימני-סמכותי ביותר[8].
מנגנוני היווצרות ההטיה
- נתוני אימון: המקור הראשי. LLM מאומנים על קורפוסים עצומים של טקסטים מהאינטרנט, המהווים "מראה" של החברה עם כל הסטריאוטיפים שלה[9].
- ארכיטקטורה ואלגוריתמי אימון: ארכיטקטורת ה-transformer עצמה עשויה להגביר קורלציות הקיימות בנתונים.
- fine-tuning ו-RLHF: שלב Reinforcement Learning from Human Feedback (RLHF) עשוי אף הוא להכניס הטיה, שכן מעריכים אנושיים פועלים בהכרח על פי השקפותיהם שלהם.
שיטות זיהוי והפחתה
זיהוי הטיה
- אוספי בדיקה של סטריאוטיפים: נעשה שימוש ב-dataset מיוחדים, כגון:
- CrowS-Pairs: מכסה תשעה סוגי הטיה, כולל גזע, דת וגיל[10].
- StereoSet: מודד הטיה סטריאוטיפית בארבעה תחומים: מגדר, מקצוע, גזע ודת[11].
- RuBia: dataset מיוחד לזיהוי הטיה במודלים דוברי רוסית[12].
- משאבים רב-לשוניים: התאמות כגון French CrowS-Pairs[13] ו-Chinese Bias Benchmark (CBBQ)[14].
- ניתוח בתחומים ספציפיים: מחקרי הטיה בגיוס עובדים[15], ברפואה[16] ובתחומים אחרים.
הפחתת הטיה
- ברמת הנתונים (Pre-processing): ניקוי, סינון ואיזון מחדש של קורפוסי האימון. שיטות מתוארות בתיעוד של Holistic AI[17].
- ברמת האימון (In-processing): שינוי אלגוריתמי האימון תוך התחשבות בהגינות.
- ברמת הפלט (Post-processing): סינון ומידור של תשובות שכבר נוצרו.
השלכות משפטיות ואתיות
להטיה ב-AI יש השלכות חמורות, כולל אפליה בתחומים קריטיים והפצת מידע שגוי.
- רגולציה: ממשלות ברחבי העולם מתחילות להחיל נורמות לפיקוח על AI.
- באירופה אושר AI Act, שנכנס לתוקף באופן הדרגתי החל מ-1 באוגוסט 2024. הוא מחיל דרישות מחמירות על מערכות בסיכון גבוה, כולל הערכת הטיה חובה, וקובע קנסות של עד 7% מהמחזור העולמי של החברה[18].
- ברוסיה, בשנת 2021, חתמו חברות טכנולוגיה מובילות על קוד האתיקה בתחום ה-AI מרצון, בהתחייבות למזעור אפליה. עד סוף 2021 חתמו עליו יותר מ-100 ארגונים[19].
המאבק בהטיה הוא תמיד פשרה מתמדת. סינון אגרסיבי מדי עלול להוביל ל"תקינות פוליטית מופרזת", שבה המודל מסרב לדון בכל נושא רגיש. לכן המפתחים מחפשים איזון בין בטיחות, אובייקטיביות ואינפורמטיביות של המודל.
ספרות
- Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
- Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
- Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. doi:10.1145/3442188.3445922.
- Nadeem, M. et al. (2020). StereoSet: Measuring Stereotypical Bias in Pretrained Language Models. arXiv:2004.09456.
- Nangia, N. et al. (2020). CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. ACL 2020.
- Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
- Hofmann, V. et al. (2024). AI Generates Covertly Racist Decisions about People Based on Their Dialect. Nature, 633, 147-154. Full text.
- Fang, X. et al. (2024). Bias of AI-Generated Content: An Examination of News Produced by Large Language Models. Scientific Reports, 14, 5224. Full text.
- Grigoreva, V. et al. (2024). RuBia: A Russian Language Bias Detection Dataset. arXiv:2403.17553.
- Du, L. et al. (2024). Causal-Guided Active Learning for Debiasing Large Language Models. arXiv:2408.12942.
- Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.
ראו גם
- מודלי שפה גדולים
הערות
- ↑ «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [1]
- ↑ «Generative AI: UNESCO study reveals alarming evidence of regressive gender stereotypes». UNESCO. [2]
- ↑ «Gender and race stereotypes in Large Language Models». Nature Scientific Reports. [3]
- ↑ «Предвзятость русскоязычных LLM: кого машина считает «обычным человеком»?». Хабр. [4]
- ↑ «ChatGPT’s Racial Bias in Hiring Decisions». Business Insider. [5]
- ↑ «RuBia: A Russian-language Bias Detection Dataset». The Moonlight. [6]
- ↑ «Left-leaning bias commonplace in AI-powered chatbots, shows new report». Centre for Policy Studies. [7]
- ↑ «AI language models are rife with political biases». MIT Technology Review. [8]
- ↑ «Языковые модели: как преодолеть предвзятость и обеспечить безопасность». РБК Тренды. [9]
- ↑ «CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models». ACL Anthology. [10]
- ↑ «StereoSet: Measuring stereotypical bias in pretrained language models». arXiv. [11]
- ↑ «RuBia: A Russian Language Bias Detection Dataset». arXiv. [12]
- ↑ «French CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in French Language Models». ACL Anthology. [13]
- ↑ «CBBQ: A Chinese Bias Benchmark for Large Language Models». arXiv. [14]
- ↑ «Bias in Large Language Models and Who Should Be Held Accountable». Stanford Law School. [15]
- ↑ «Racial bias in psychiatric diagnosis and treatment with large language models». Nature Digital Medicine. [16]
- ↑ «Preprocessing Bias Mitigation». Holistic AI Documentation. [17]
- ↑ «EU AI Act: First Rules Take Effect on Prohibited AI Systems». Jones Day. [18]
- ↑ «Over 100 organizations signed up for Code of Ethics in AI by end of 2021». TASS. [19]