Generation bias (LLM) (UR)

From Systems analysis Wiki
Jump to navigation Jump to search

بڑے لسانی ماڈلز (LLM) میں تعصب — یہ تیار کردہ متون میں ایک منظم تحریف ہے، جس میں ماڈل معاشرے میں موجود دقیانوسی تصورات اور تعصبات کو ظاہر کرتا یا ان کو تقویت دیتا ہے، جو صنف، نسل، ثقافت، سیاسی خیالات اور دیگر سماجی زمروں سے متعلق ہوتے ہیں۔ یہ ظاہرہ اس لیے پیدا ہوتا ہے کیونکہ LLM کو انسانی ڈیٹا کے بہت بڑے ذخیروں پر تربیت دی جاتی ہے، جن میں لازمی طور پر متعصبانہ معلومات موجود ہوتی ہیں[1]۔

تعصب، AI کی ترقی میں ایک اہم اخلاقی اور تکنیکی مسئلہ ہے، کیونکہ یہ امتیازی سلوک، غلط معلومات کی اشاعت اور ٹیکنالوجی پر اعتماد کو نقصان پہنچانے کا سبب بن سکتا ہے۔

LLM میں تعصب کی اقسام

LLM میں تعصب مختلف شکلوں میں ظاہر ہو سکتا ہے۔

صنفی تعصب

ماڈلز روایتی صنفی دقیانوسی تصورات کو دہرانے کی طرف مائل ہوتے ہیں، پیشوں اور خصوصیات کو ایک مخصوص جنس سے جوڑتے ہیں۔

  • یونیسکو کی 2024 کی تحقیق سے پتہ چلا کہ LLM خواتین کو گھریلو کرداروں («گھر»، «خاندان»، «بچے») میں مردوں کے مقابلے چار گنا زیادہ بیان کرتے ہیں، جبکہ مردوں کو «کاروبار» اور «کیریئر» کے تصورات سے جوڑتے ہیں[2]۔
  • Nature Scientific Reports میں شائع تحقیق نے ChatGPT اور LLaMA سمیت سات معروف LLM کے تیار کردہ مواد میں نمایاں صنفی اور نسلی تعصب کا انکشاف کیا[3]۔
  • روسی زبان کے تناظر میں، ماڈلز اکثر بطور ڈیفالٹ غیر جانبدار کرداروں کے لیے مذکر صنف استعمال کرتے ہیں (مثلاً «ڈاکٹر»، «ڈائریکٹر») اور مؤنث اشکال تیار کرنے میں مشکل محسوس کرتے ہیں[4]۔

نسلی اور قومی تعصب

LLM مختلف نسلی گروہوں کے خلاف پوشیدہ امتیاز ظاہر کر سکتے ہیں۔

  • Bloomberg کی تحقیق نے ظاہر کیا کہ ChatGPT 3.5 سیاہ فام امیدواروں کے مقابلے میں ایشیائی نژاد امیدواروں کے سی وی کو ترجیح دیتا تھا[5]۔
  • روسی زبان کے تناظر میں، dataset RuBia نے انکشاف کیا کہ ماڈلز یہود مخالف اور تارکین وطن مخالف دقیانوسی تصورات کو دہرا سکتے ہیں (مثلاً اس دعوے سے اتفاق کرتے ہوئے کہ «تارکین وطن سست ہوتے ہیں»)، اگر یہ تربیتی corpus میں موجود ہوں[6]۔

سیاسی اور نظریاتی تعصب

غیر جانبداری کے دعووں کے باوجود، بہت سے LLM ایک مخصوص سیاسی میلان ظاہر کرتے ہیں۔

  • Centre for Policy Studies کی تحقیق نے 24 میں سے 23 آزمائے گئے LLM میں بائیں بازو کا آزاد خیال تعصب پایا[7]۔
  • یونیورسٹی آف واشنگٹن اور Carnegie Mellon کی جانچ نے ظاہر کیا کہ ChatGPT اور GPT-4 سب سے زیادہ بائیں آزاد خیال تھے، جبکہ Meta کا LLaMA سب سے زیادہ دائیں آمرانہ تھا[8]۔

تعصب کے ظہور کے طریقہ کار

  • تربیتی ڈیٹا: سب سے بڑا ذریعہ۔ LLM کو انٹرنیٹ سے لیے گئے متون کے بہت بڑے corpus پر تربیت دی جاتی ہے، جو اپنے تمام دقیانوسی تصورات سمیت معاشرے کا «آئینہ» ہوتے ہیں[9]۔
  • آرکیٹیکچر اور تربیتی الگورتھم: transformer آرکیٹیکچر خود ڈیٹا میں موجود ارتباطات کو تقویت دے سکتا ہے۔
  • Fine-tuning اور RLHF: انسانی تقویت سے سیکھنے (RLHF) کا مرحلہ بھی تعصب کو داخل کر سکتا ہے، کیونکہ انسانی جائزہ نگار لازمی طور پر اپنے ذاتی نقطہ نظر سے رہنمائی لیتے ہیں۔

تعصب کی شناخت اور تخفیف کے طریقے

تعصب کی شناخت

  • دقیانوسی تصورات کے ٹیسٹ سیٹ: خصوصی dataset استعمال کیے جاتے ہیں، جیسے:
    • CrowS-Pairs: نسل، مذہب اور عمر سمیت نو قسم کے تعصب کا احاطہ کرتا ہے[10]۔
    • StereoSet: چار شعبوں میں دقیانوسی تعصب کی پیمائش کرتا ہے: صنف، پیشہ، نسل اور مذہب[11]۔
    • RuBia: روسی زبان کے ماڈلز میں تعصب کی نشاندہی کے لیے خصوصی dataset[12]۔
    • کثیر لسانی وسائل: موافقت شدہ اشکال جیسے French CrowS-Pairs[13] اور Chinese Bias Benchmark (CBBQ)[14]۔
    • مخصوص شعبوں میں تجزیہ: بھرتی[15]، طب[16] اور دیگر شعبوں میں تعصب کی تحقیقات۔

تعصب کی تخفیف

  • ڈیٹا کی سطح پر (Pre-processing): تربیتی corpus کی صفائی، فلٹرنگ اور دوبارہ توازن۔ طریقے Holistic AI کی دستاویزات میں بیان کیے گئے ہیں[17]۔
  • تربیت کی سطح پر (In-processing): انصاف کو مدنظر رکھتے ہوئے تربیتی الگورتھم میں ترمیم۔
  • نتائج کی سطح پر (Post-processing): پہلے سے تیار کردہ جوابات کی فلٹرنگ اور نگرانی۔

قانونی اور اخلاقی نتائج

AI میں تعصب کے سنگین نتائج ہیں، جن میں انتہائی اہم شعبوں میں امتیازی سلوک اور غلط معلومات کی اشاعت شامل ہے۔

  • ضابطہ کاری: دنیا بھر کی حکومتیں AI کنٹرول کے لیے قوانین متعارف کرانا شروع کر رہی ہیں۔
  • یورپ میں AI Act منظور ہو چکا ہے، جو یکم اگست 2024 سے بتدریج نافذ ہو رہا ہے۔ یہ اعلیٰ خطرے کے نظاموں کے لیے سخت تقاضے عائد کرتا ہے، جن میں تعصب کی لازمی جانچ شامل ہے، اور کمپنی کے عالمی ٹرن اوور کے 7% تک جرمانے کا التزام ہے[18]۔
  • روس میں 2021 میں معروف ٹیکنالوجی کمپنیوں نے AI کے شعبے میں رضاکارانہ ضابطۂ اخلاق پر دستخط کیے، جس میں امتیاز کو کم سے کم کرنے کا عہد کیا گیا۔ 2021 کے اختتام تک 100 سے زیادہ تنظیمیں اس پر دستخط کر چکی تھیں[19]۔

تعصب سے مقابلہ ایک مستقل سمجھوتے کا عمل ہے۔ حد سے زیادہ جارحانہ فلٹرنگ «ضرورت سے زیادہ سیاسی درستگی» کا باعث بن سکتی ہے، جب ماڈل کسی بھی حساس موضوع پر بات کرنے سے انکار کر دیتا ہے۔ اس لیے ڈویلپرز ماڈل کی حفاظت، معروضیت اور معلوماتی افادیت کے درمیان توازن تلاش کرتے ہیں۔

ادبیات

  • Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
  • Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
  • Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. doi:10.1145/3442188.3445922.
  • Nadeem, M. et al. (2020). StereoSet: Measuring Stereotypical Bias in Pretrained Language Models. arXiv:2004.09456.
  • Nangia, N. et al. (2020). CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. ACL 2020.
  • Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
  • Hofmann, V. et al. (2024). AI Generates Covertly Racist Decisions about People Based on Their Dialect. Nature, 633, 147-154. Full text.
  • Fang, X. et al. (2024). Bias of AI-Generated Content: An Examination of News Produced by Large Language Models. Scientific Reports, 14, 5224. Full text.
  • Grigoreva, V. et al. (2024). RuBia: A Russian Language Bias Detection Dataset. arXiv:2403.17553.
  • Du, L. et al. (2024). Causal-Guided Active Learning for Debiasing Large Language Models. arXiv:2408.12942.
  • Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.

مزید دیکھیں

  • بڑے لسانی ماڈلز

حواشی

  1. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [1]
  2. «Generative AI: UNESCO study reveals alarming evidence of regressive gender stereotypes». UNESCO. [2]
  3. «Gender and race stereotypes in Large Language Models». Nature Scientific Reports. [3]
  4. «Предвзятость русскоязычных LLM: кого машина считает «обычным человеком»?». Хабр. [4]
  5. «ChatGPT’s Racial Bias in Hiring Decisions». Business Insider. [5]
  6. «RuBia: A Russian-language Bias Detection Dataset». The Moonlight. [6]
  7. «Left-leaning bias commonplace in AI-powered chatbots, shows new report». Centre for Policy Studies. [7]
  8. «AI language models are rife with political biases». MIT Technology Review. [8]
  9. «Языковые модели: как преодолеть предвзятость и обеспечить безопасность». РБК Тренды. [9]
  10. «CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models». ACL Anthology. [10]
  11. «StereoSet: Measuring stereotypical bias in pretrained language models». arXiv. [11]
  12. «RuBia: A Russian Language Bias Detection Dataset». arXiv. [12]
  13. «French CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in French Language Models». ACL Anthology. [13]
  14. «CBBQ: A Chinese Bias Benchmark for Large Language Models». arXiv. [14]
  15. «Bias in Large Language Models and Who Should Be Held Accountable». Stanford Law School. [15]
  16. «Racial bias in psychiatric diagnosis and treatment with large language models». Nature Digital Medicine. [16]
  17. «Preprocessing Bias Mitigation». Holistic AI Documentation. [17]
  18. «EU AI Act: First Rules Take Effect on Prohibited AI Systems». Jones Day. [18]
  19. «Over 100 organizations signed up for Code of Ethics in AI by end of 2021». TASS. [19]