Generation bias (LLM) (FA)

From Systems analysis Wiki
Jump to navigation Jump to search

پیش‌داوری در مدل‌های زبانی بزرگ (LLM) — عبارت است از انحراف سیستماتیک در متون تولیدشده، که در آن مدل کلیشه‌ها و تعصبات موجود در جامعه را بازتولید یا تقویت می‌کند؛ تعصباتی که به جنسیت، نژاد، فرهنگ، دیدگاه‌های سیاسی و سایر مقوله‌های اجتماعی مربوط می‌شوند. این پدیده از آن‌جا ناشی می‌شود که LLMها بر روی حجم عظیمی از داده‌های انسانی آموزش می‌بینند که به‌ناگزیر حاوی اطلاعات متعصبانه هستند[1].

پیش‌داوری یکی از مهم‌ترین چالش‌های اخلاقی و فنی در توسعه هوش مصنوعی به‌شمار می‌رود، زیرا می‌تواند به تبعیض، گسترش اطلاعات نادرست و تضعیف اعتماد به فناوری منجر شود.

انواع پیش‌داوری در LLM

پیش‌داوری در LLM می‌تواند در اشکال گوناگونی بروز کند.

پیش‌داوری جنسیتی

مدل‌ها تمایل دارند کلیشه‌های جنسیتی سنتی را بازتولید کنند و مشاغل و ویژگی‌ها را با جنس خاصی مرتبط سازند.

  • پژوهش یونسکو در سال ۲۰۲۴ نشان داد که LLMها چهار برابر بیشتر زنان را در نقش‌های خانگی («خانه»، «خانواده»، «فرزندان») توصیف می‌کنند تا مردان، در حالی که مردان را با مفاهیم «کسب‌وکار» و «شغل» مرتبط می‌دانند[2].
  • پژوهشی در Nature Scientific Reports پیش‌داوری قابل توجه جنسیتی و نژادی را در محتوای تولیدشده توسط هفت LLM پیشرو، از جمله ChatGPT و LLaMA، شناسایی کرد[3].
  • در بافت زبان روسی، مدل‌ها اغلب به‌طور پیش‌فرض برای نقش‌های خنثی (مانند «پزشک»، «مدیر») از جنس مذکر استفاده می‌کنند و در تولید صورت‌های مؤنث با مشکل روبه‌رو می‌شوند[4].

پیش‌داوری نژادی و قومیتی

LLMها می‌توانند تبعیض پنهانی نسبت به گروه‌های قومی مختلف نشان دهند.

  • پژوهش Bloomberg نشان داد که ChatGPT 3.5 رزومه‌های داوطلبان آسیایی‌تبار را نسبت به افراد سیاه‌پوست ترجیح می‌داد[5].
  • در بافت زبان روسی، dataset RuBia آشکار ساخت که مدل‌ها ممکن است کلیشه‌های یهودستیزانه و ضدمهاجرتی را بازتولید کنند (برای مثال با موافقت با این ادعا که «مهاجران تنبل هستند»)، در صورتی که این کلیشه‌ها در corpus آموزشی وجود داشته باشند[6].

پیش‌داوری سیاسی و ایدئولوژیک

علی‌رغم ادعاهای بی‌طرفی، بسیاری از LLMها گرایش به طیف سیاسی خاصی از خود نشان می‌دهند.

  • پژوهش Centre for Policy Studies پیش‌داوری چپ-لیبرال را در ۲۳ مدل از ۲۴ LLM آزموده‌شده شناسایی کرد[7].
  • آزمایش‌های دانشگاه واشنگتن و دانشگاه کارنگی ملون نشان داد که ChatGPT و GPT-4 بیشترین گرایش چپ-آزادی‌خواه را داشتند، در حالی که LLaMA از Meta بیشترین گرایش راست-اقتدارگرا را نشان می‌داد[8].

سازوکارهای شکل‌گیری پیش‌داوری

  • داده‌های آموزشی: منبع اصلی. LLMها بر روی corpus‌های عظیم متنی از اینترنت آموزش می‌بینند که «آینه» جامعه با تمام کلیشه‌هایش هستند[9].
  • معماری و الگوریتم‌های آموزش: خود معماری transformer می‌تواند همبستگی‌های موجود در داده‌ها را تقویت کند.
  • Fine-tuning و RLHF: مرحله Reinforcement Learning from Human Feedback نیز می‌تواند پیش‌داوری وارد کند، چراکه ارزیاب‌های انسانی ناگزیر از دیدگاه‌های شخصی خود تأثیر می‌پذیرند.

روش‌های شناسایی و کاهش پیش‌داوری

شناسایی پیش‌داوری

  • مجموعه‌های آزمایشی کلیشه: از dataset‌های تخصصی استفاده می‌شود، از جمله:
    • CrowS-Pairs: نه نوع پیش‌داوری را پوشش می‌دهد، از جمله نژاد، مذهب و سن[10].
    • StereoSet: پیش‌داوری کلیشه‌ای را در چهار حوزه اندازه‌گیری می‌کند: جنسیت، شغل، نژاد و مذهب[11].
    • RuBia: یک dataset تخصصی برای شناسایی پیش‌داوری در مدل‌های زبان روسی[12].
    • منابع چندزبانه: اقتباس‌هایی مانند French CrowS-Pairs[13] و Chinese Bias Benchmark (CBBQ)[14].
    • تحلیل در حوزه‌های خاص: پژوهش‌هایی درباره پیش‌داوری در استخدام[15]، پزشکی[16] و سایر حوزه‌ها.

کاهش پیش‌داوری

  • در سطح داده‌ها (Pre-processing): پاک‌سازی، فیلترسازی و متعادل‌سازی مجدد corpus‌های آموزشی. روش‌ها در مستندات Holistic AI شرح داده شده‌اند[17].
  • در سطح آموزش (In-processing): اصلاح الگوریتم‌های آموزش برای لحاظ کردن انصاف.
  • در سطح خروجی (Post-processing): فیلترسازی و مدیریت پاسخ‌های از پیش تولیدشده.

پیامدهای حقوقی و اخلاقی

پیش‌داوری در هوش مصنوعی پیامدهای جدی در بر دارد، از جمله تبعیض در حوزه‌های حیاتی و گسترش اطلاعات نادرست.

  • قانون‌گذاری: دولت‌های سراسر جهان در حال تدوین مقررات برای نظارت بر هوش مصنوعی هستند.
  • در اروپا AI Act تصویب شده که از اول اوت ۲۰۲۴ به‌صورت تدریجی لازم‌الاجرا می‌شود. این قانون الزامات سختگیرانه‌ای برای سیستم‌های پرخطر وضع می‌کند، از جمله ارزیابی اجباری پیش‌داوری، و جریمه‌هایی تا ۷ درصد از گردش مالی جهانی شرکت پیش‌بینی می‌کند[18].
  • در روسیه در سال ۲۰۲۱ شرکت‌های فناوری پیشرو کدکس اخلاق در حوزه هوش مصنوعی داوطلبانه را امضا کردند و متعهد شدند تبعیض را به حداقل برسانند. تا پایان سال ۲۰۲۱ بیش از ۱۰۰ سازمان آن را امضا کرده بودند[19].

مبارزه با پیش‌داوری یک سازش دائمی است. فیلترسازی بیش از حد تهاجمی می‌تواند به «صحت سیاسی افراطی» منجر شود، یعنی حالتی که مدل از بحث درباره هر موضوع حساسی خودداری می‌کند. به همین دلیل توسعه‌دهندگان در جستجوی تعادل میان ایمنی، بی‌طرفی و اطلاع‌رسانی مدل هستند.

همچنین ببینید

  • مدل‌های زبانی بزرگ

منابع

  • Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
  • Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
  • Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. doi:10.1145/3442188.3445922.
  • Nadeem, M. et al. (2020). StereoSet: Measuring Stereotypical Bias in Pretrained Language Models. arXiv:2004.09456.
  • Nangia, N. et al. (2020). CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. ACL 2020.
  • Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
  • Hofmann, V. et al. (2024). AI Generates Covertly Racist Decisions about People Based on Their Dialect. Nature, 633, 147-154. Full text.
  • Fang, X. et al. (2024). Bias of AI-Generated Content: An Examination of News Produced by Large Language Models. Scientific Reports, 14, 5224. Full text.
  • Grigoreva, V. et al. (2024). RuBia: A Russian Language Bias Detection Dataset. arXiv:2403.17553.
  • Du, L. et al. (2024). Causal-Guided Active Learning for Debiasing Large Language Models. arXiv:2408.12942.
  • Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.

یادداشت‌ها

  1. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [۱]
  2. «Generative AI: UNESCO study reveals alarming evidence of regressive gender stereotypes». UNESCO. [۲]
  3. «Gender and race stereotypes in Large Language Models». Nature Scientific Reports. [۳]
  4. «Предвзятость русскоязычных LLM: кого машина считает «обычным человеком»?». Хабр. [۴]
  5. «ChatGPT’s Racial Bias in Hiring Decisions». Business Insider. [۵]
  6. «RuBia: A Russian-language Bias Detection Dataset». The Moonlight. [۶]
  7. «Left-leaning bias commonplace in AI-powered chatbots, shows new report». Centre for Policy Studies. [۷]
  8. «AI language models are rife with political biases». MIT Technology Review. [۸]
  9. «Языковые модели: как преодолеть предвзятость и обеспечить безопасность». РБК Тренды. [۹]
  10. «CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models». ACL Anthology. [۱۰]
  11. «StereoSet: Measuring stereotypical bias in pretrained language models». arXiv. [۱۱]
  12. «RuBia: A Russian Language Bias Detection Dataset». arXiv. [۱۲]
  13. «French CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in French Language Models». ACL Anthology. [۱۳]
  14. «CBBQ: A Chinese Bias Benchmark for Large Language Models». arXiv. [۱۴]
  15. «Bias in Large Language Models and Who Should Be Held Accountable». Stanford Law School. [۱۵]
  16. «Racial bias in psychiatric diagnosis and treatment with large language models». Nature Digital Medicine. [۱۶]
  17. «Preprocessing Bias Mitigation». Holistic AI Documentation. [۱۷]
  18. «EU AI Act: First Rules Take Effect on Prohibited AI Systems». Jones Day. [۱۸]
  19. «Over 100 organizations signed up for Code of Ethics in AI by end of 2021». TASS. [۱۹]