Generation bias (LLM) (FA)
پیشداوری در مدلهای زبانی بزرگ (LLM) — عبارت است از انحراف سیستماتیک در متون تولیدشده، که در آن مدل کلیشهها و تعصبات موجود در جامعه را بازتولید یا تقویت میکند؛ تعصباتی که به جنسیت، نژاد، فرهنگ، دیدگاههای سیاسی و سایر مقولههای اجتماعی مربوط میشوند. این پدیده از آنجا ناشی میشود که LLMها بر روی حجم عظیمی از دادههای انسانی آموزش میبینند که بهناگزیر حاوی اطلاعات متعصبانه هستند[1].
پیشداوری یکی از مهمترین چالشهای اخلاقی و فنی در توسعه هوش مصنوعی بهشمار میرود، زیرا میتواند به تبعیض، گسترش اطلاعات نادرست و تضعیف اعتماد به فناوری منجر شود.
انواع پیشداوری در LLM
پیشداوری در LLM میتواند در اشکال گوناگونی بروز کند.
پیشداوری جنسیتی
مدلها تمایل دارند کلیشههای جنسیتی سنتی را بازتولید کنند و مشاغل و ویژگیها را با جنس خاصی مرتبط سازند.
- پژوهش یونسکو در سال ۲۰۲۴ نشان داد که LLMها چهار برابر بیشتر زنان را در نقشهای خانگی («خانه»، «خانواده»، «فرزندان») توصیف میکنند تا مردان، در حالی که مردان را با مفاهیم «کسبوکار» و «شغل» مرتبط میدانند[2].
- پژوهشی در Nature Scientific Reports پیشداوری قابل توجه جنسیتی و نژادی را در محتوای تولیدشده توسط هفت LLM پیشرو، از جمله ChatGPT و LLaMA، شناسایی کرد[3].
- در بافت زبان روسی، مدلها اغلب بهطور پیشفرض برای نقشهای خنثی (مانند «پزشک»، «مدیر») از جنس مذکر استفاده میکنند و در تولید صورتهای مؤنث با مشکل روبهرو میشوند[4].
پیشداوری نژادی و قومیتی
LLMها میتوانند تبعیض پنهانی نسبت به گروههای قومی مختلف نشان دهند.
- پژوهش Bloomberg نشان داد که ChatGPT 3.5 رزومههای داوطلبان آسیاییتبار را نسبت به افراد سیاهپوست ترجیح میداد[5].
- در بافت زبان روسی، dataset RuBia آشکار ساخت که مدلها ممکن است کلیشههای یهودستیزانه و ضدمهاجرتی را بازتولید کنند (برای مثال با موافقت با این ادعا که «مهاجران تنبل هستند»)، در صورتی که این کلیشهها در corpus آموزشی وجود داشته باشند[6].
پیشداوری سیاسی و ایدئولوژیک
علیرغم ادعاهای بیطرفی، بسیاری از LLMها گرایش به طیف سیاسی خاصی از خود نشان میدهند.
- پژوهش Centre for Policy Studies پیشداوری چپ-لیبرال را در ۲۳ مدل از ۲۴ LLM آزمودهشده شناسایی کرد[7].
- آزمایشهای دانشگاه واشنگتن و دانشگاه کارنگی ملون نشان داد که ChatGPT و GPT-4 بیشترین گرایش چپ-آزادیخواه را داشتند، در حالی که LLaMA از Meta بیشترین گرایش راست-اقتدارگرا را نشان میداد[8].
سازوکارهای شکلگیری پیشداوری
- دادههای آموزشی: منبع اصلی. LLMها بر روی corpusهای عظیم متنی از اینترنت آموزش میبینند که «آینه» جامعه با تمام کلیشههایش هستند[9].
- معماری و الگوریتمهای آموزش: خود معماری transformer میتواند همبستگیهای موجود در دادهها را تقویت کند.
- Fine-tuning و RLHF: مرحله Reinforcement Learning from Human Feedback نیز میتواند پیشداوری وارد کند، چراکه ارزیابهای انسانی ناگزیر از دیدگاههای شخصی خود تأثیر میپذیرند.
روشهای شناسایی و کاهش پیشداوری
شناسایی پیشداوری
- مجموعههای آزمایشی کلیشه: از datasetهای تخصصی استفاده میشود، از جمله:
- CrowS-Pairs: نه نوع پیشداوری را پوشش میدهد، از جمله نژاد، مذهب و سن[10].
- StereoSet: پیشداوری کلیشهای را در چهار حوزه اندازهگیری میکند: جنسیت، شغل، نژاد و مذهب[11].
- RuBia: یک dataset تخصصی برای شناسایی پیشداوری در مدلهای زبان روسی[12].
- منابع چندزبانه: اقتباسهایی مانند French CrowS-Pairs[13] و Chinese Bias Benchmark (CBBQ)[14].
- تحلیل در حوزههای خاص: پژوهشهایی درباره پیشداوری در استخدام[15]، پزشکی[16] و سایر حوزهها.
کاهش پیشداوری
- در سطح دادهها (Pre-processing): پاکسازی، فیلترسازی و متعادلسازی مجدد corpusهای آموزشی. روشها در مستندات Holistic AI شرح داده شدهاند[17].
- در سطح آموزش (In-processing): اصلاح الگوریتمهای آموزش برای لحاظ کردن انصاف.
- در سطح خروجی (Post-processing): فیلترسازی و مدیریت پاسخهای از پیش تولیدشده.
پیامدهای حقوقی و اخلاقی
پیشداوری در هوش مصنوعی پیامدهای جدی در بر دارد، از جمله تبعیض در حوزههای حیاتی و گسترش اطلاعات نادرست.
- قانونگذاری: دولتهای سراسر جهان در حال تدوین مقررات برای نظارت بر هوش مصنوعی هستند.
- در اروپا AI Act تصویب شده که از اول اوت ۲۰۲۴ بهصورت تدریجی لازمالاجرا میشود. این قانون الزامات سختگیرانهای برای سیستمهای پرخطر وضع میکند، از جمله ارزیابی اجباری پیشداوری، و جریمههایی تا ۷ درصد از گردش مالی جهانی شرکت پیشبینی میکند[18].
- در روسیه در سال ۲۰۲۱ شرکتهای فناوری پیشرو کدکس اخلاق در حوزه هوش مصنوعی داوطلبانه را امضا کردند و متعهد شدند تبعیض را به حداقل برسانند. تا پایان سال ۲۰۲۱ بیش از ۱۰۰ سازمان آن را امضا کرده بودند[19].
مبارزه با پیشداوری یک سازش دائمی است. فیلترسازی بیش از حد تهاجمی میتواند به «صحت سیاسی افراطی» منجر شود، یعنی حالتی که مدل از بحث درباره هر موضوع حساسی خودداری میکند. به همین دلیل توسعهدهندگان در جستجوی تعادل میان ایمنی، بیطرفی و اطلاعرسانی مدل هستند.
همچنین ببینید
- مدلهای زبانی بزرگ
منابع
- Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
- Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
- Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. doi:10.1145/3442188.3445922.
- Nadeem, M. et al. (2020). StereoSet: Measuring Stereotypical Bias in Pretrained Language Models. arXiv:2004.09456.
- Nangia, N. et al. (2020). CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. ACL 2020.
- Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
- Hofmann, V. et al. (2024). AI Generates Covertly Racist Decisions about People Based on Their Dialect. Nature, 633, 147-154. Full text.
- Fang, X. et al. (2024). Bias of AI-Generated Content: An Examination of News Produced by Large Language Models. Scientific Reports, 14, 5224. Full text.
- Grigoreva, V. et al. (2024). RuBia: A Russian Language Bias Detection Dataset. arXiv:2403.17553.
- Du, L. et al. (2024). Causal-Guided Active Learning for Debiasing Large Language Models. arXiv:2408.12942.
- Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.
یادداشتها
- ↑ «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [۱]
- ↑ «Generative AI: UNESCO study reveals alarming evidence of regressive gender stereotypes». UNESCO. [۲]
- ↑ «Gender and race stereotypes in Large Language Models». Nature Scientific Reports. [۳]
- ↑ «Предвзятость русскоязычных LLM: кого машина считает «обычным человеком»?». Хабр. [۴]
- ↑ «ChatGPT’s Racial Bias in Hiring Decisions». Business Insider. [۵]
- ↑ «RuBia: A Russian-language Bias Detection Dataset». The Moonlight. [۶]
- ↑ «Left-leaning bias commonplace in AI-powered chatbots, shows new report». Centre for Policy Studies. [۷]
- ↑ «AI language models are rife with political biases». MIT Technology Review. [۸]
- ↑ «Языковые модели: как преодолеть предвзятость и обеспечить безопасность». РБК Тренды. [۹]
- ↑ «CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models». ACL Anthology. [۱۰]
- ↑ «StereoSet: Measuring stereotypical bias in pretrained language models». arXiv. [۱۱]
- ↑ «RuBia: A Russian Language Bias Detection Dataset». arXiv. [۱۲]
- ↑ «French CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in French Language Models». ACL Anthology. [۱۳]
- ↑ «CBBQ: A Chinese Bias Benchmark for Large Language Models». arXiv. [۱۴]
- ↑ «Bias in Large Language Models and Who Should Be Held Accountable». Stanford Law School. [۱۵]
- ↑ «Racial bias in psychiatric diagnosis and treatment with large language models». Nature Digital Medicine. [۱۶]
- ↑ «Preprocessing Bias Mitigation». Holistic AI Documentation. [۱۷]
- ↑ «EU AI Act: First Rules Take Effect on Prohibited AI Systems». Jones Day. [۱۸]
- ↑ «Over 100 organizations signed up for Code of Ethics in AI by end of 2021». TASS. [۱۹]