Generation bias (LLM) (TL)

From Systems analysis Wiki
Jump to navigation Jump to search

Pagkiling sa malalaking modelo ng wika (LLM) — ito ay sistematikong pagbaluktot ng mga tekstong nalilikha, kung saan ang modelo ay sumasalamin o nagpapalaki ng mga umiiral na stereotipo at pagkiling sa lipunan na may kaugnayan sa kasarian, lahi, kultura, pampulitikang pananaw, at iba pang kategoryang panlipunan. Ang penomenong ito ay nagmumula sa katotohanang ang mga LLM ay sinasamahan ng napakalaking dami ng datos mula sa tao, na hindi maiiwasang naglalaman ng impormasyon na may pagkiling[1].

Ang pagkiling ay isa sa mga pangunahing etikal at teknikal na problema sa pagbuo ng AI, dahil maaari itong humantong sa diskriminasyon, pagkalat ng maling impormasyon, at pagkawasak ng tiwala sa teknolohiya.

Mga Uri ng Pagkiling sa LLM

Ang pagkiling sa mga LLM ay maaaring lumabas sa iba't ibang anyo.

Pagkiling sa Kasarian

Ang mga modelo ay may hilig na muling ilabas ang tradisyonal na mga stereotipo sa kasarian, na inuugnay ang mga propesyon at katangian sa isang tiyak na kasarian.

  • Ipinakita ng pag-aaral ng UNESCO noong 2024 na apat na beses na mas madalas na inilalarawan ng mga LLM ang mga babae sa mga tungkulin sa tahanan («tahanan», «pamilya», «mga bata») kaysa sa mga lalaki, habang inuugnay ang mga lalaki sa mga konsepto ng «negosyo» at «karera»[2].
  • Isang pag-aaral sa Nature Scientific Reports ang natuklasang may malaking pagkiling sa kasarian at lahi sa nilalaman na nililikha ng pitong nangungunang LLM, kabilang ang ChatGPT at LLaMA[3].
  • Sa kontekstong Ruso, ang mga modelo ay madalas na gumagamit ng panlalaking anyo bilang default para sa mga neutral na tungkulin (halimbawa, «doktor», «direktor») at nahihirapan sa paglikha ng mga panlalakin na anyo ng mga propesyon[4].

Pagkiling sa Lahi at Etnisidad

Ang mga LLM ay maaaring magpakita ng nakatagong diskriminasyon laban sa iba't ibang grupong etniko.

  • Ipinakita ng pag-aaral ng Bloomberg na mas pinaboran ng ChatGPT 3.5 ang mga resume ng mga kandidatong may pinanggalingang Asyano kumpara sa mga itim[5].
  • Sa kontekstong Ruso, ang dataset na RuBia ay natuklasang ang mga modelo ay maaaring muling ipakalat ang mga anti-Semitiko at anti-imigranteng stereotipo (halimbawa, pagsang-ayon sa pahayag na «ang mga imigrante ay tamad»), kung ang mga ito ay naroroon sa corpus ng pagsasanay[6].

Pampulitika at Ideolohikal na Pagkiling

Sa kabila ng mga pahayag ng neutralidad, maraming LLM ang nagpapakita ng hilig sa isang tiyak na bahagi ng pampulitikang espektro.

  • Ang pag-aaral ng Centre for Policy Studies ay natuklasang may kaliwa-liberal na pagkiling sa 23 sa 24 na LLM na nasuri[7].
  • Ipinakita ng pagsubok ng Unibersidad ng Washington at Carnegie Mellon na ang ChatGPT at GPT-4 ay pinaka-kaliwa-libertaryan, habang ang LLaMA ng Meta ay pinaka-kanan-awtoritaryan[8].

Mga Mekanismo ng Pagsibol ng Pagkiling

  • Datos ng pagsasanay: Ang pangunahing pinagmulan. Ang mga LLM ay sinasamahan ng napakalaking corpus ng mga teksto mula sa internet, na siyang «salamin» ng lipunan kasama ang lahat ng mga stereotipo nito[9].
  • Arkitektura at mga algorithm ng pagsasanay: Ang mismong arkitektura ng transformer ay maaaring magpalaki ng mga umiiral na kaugnayan sa datos.
  • Fine-tuning at RLHF: Ang yugto ng Reinforcement Learning mula sa tao (RLHF) ay maaari ring magdulot ng pagkiling, dahil ang mga taong tagasuri ay hindi maiiwasang ginagabayan ng kanilang sariling mga pananaw.

Mga Pamamaraan ng Pagtuklas at Pagpapahina

Pagtuklas ng Pagkiling

  • Mga test set ng stereotipo: Ginagamit ang mga espesyalisadong dataset, tulad ng:
    • CrowS-Pairs: Sumasaklaw sa siyam na uri ng pagkiling, kabilang ang lahi, relihiyon, at edad[10].
    • StereoSet: Sinusukat ang stereotipikong pagkiling sa apat na domain: kasarian, propesyon, lahi, at relihiyon[11].
    • RuBia: Isang espesyalisadong dataset para sa pagtuklas ng pagkiling sa mga modelong Ruso[12].
    • Mga mapagkukunang maraming wika: Mga adaptasyon tulad ng French CrowS-Pairs[13] at Chinese Bias Benchmark (CBBQ)[14].
    • Pagsusuri sa mga tiyak na larangan: Mga pag-aaral ng pagkiling sa recruitment[15], medisina[16], at iba pang mga lugar.

Pagpapahina ng Pagkiling

  • Sa antas ng datos (Pre-processing): Paglilinis, pag-filter, at muling pagbabalanse ng mga corpus ng pagsasanay. Ang mga pamamaraan ay inilarawan sa dokumentasyon ng Holistic AI[17].
  • Sa antas ng pagsasanay (In-processing): Pagbabago ng mga algorithm ng pagsasanay upang isaalang-alang ang pagiging makatarungan.
  • Sa antas ng output (Post-processing): Pag-filter at moderasyon ng mga sagot na nalikha na.

Ang pagkiling sa AI ay may m심alalim na mga kahihinatnan, kabilang ang diskriminasyon sa mga kritikal na larangan at pagkalat ng maling impormasyon.

  • Regulasyon: Ang mga pamahalaan sa buong mundo ay nagsisimulang magpakilala ng mga pamantayan para sa kontrol ng AI.
  • Sa Europa, ang AI Act ay pinagtibay, na unti-unting nagkakabisa mula noong 1 Agosto 2024. Nagpapakilala ito ng mahigpit na mga kinakailangan para sa mga sistema ng mataas na panganib, kabilang ang obligadong pagtatasa sa pagkiling, at nagtatakda ng mga multa na hanggang 7% ng pandaigdigang kita ng kumpanya[18].
  • Sa Russia noong 2021, ang mga nangungunang kumpanya ng teknolohiya ay pumirma ng boluntaryong Kodigo ng Etika sa Larangan ng AI, na nangako na bawasan ang diskriminasyon. Sa katapusan ng 2021, mahigit 100 organisasyon ang pumirma nito[19].

Ang paglaban sa pagkiling ay isang patuloy na kompromiso. Ang labis na agresibong pag-filter ay maaaring humantong sa «labis na political correctness», kung saan ang modelo ay tumatanggi na talakayin ang anumang maselang paksa. Kaya naman, ang mga developer ay naghahanap ng balanse sa pagitan ng kaligtasan, objectivity, at kapakinabangang impormasyon ng modelo.

Panitikan

  • Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
  • Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
  • Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. doi:10.1145/3442188.3445922.
  • Nadeem, M. et al. (2020). StereoSet: Measuring Stereotypical Bias in Pretrained Language Models. arXiv:2004.09456.
  • Nangia, N. et al. (2020). CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. ACL 2020.
  • Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
  • Hofmann, V. et al. (2024). AI Generates Covertly Racist Decisions about People Based on Their Dialect. Nature, 633, 147-154. Full text.
  • Fang, X. et al. (2024). Bias of AI-Generated Content: An Examination of News Produced by Large Language Models. Scientific Reports, 14, 5224. Full text.
  • Grigoreva, V. et al. (2024). RuBia: A Russian Language Bias Detection Dataset. arXiv:2403.17553.
  • Du, L. et al. (2024). Causal-Guided Active Learning for Debiasing Large Language Models. arXiv:2408.12942.
  • Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.

Tingnan Din

  • Malalaking Modelo ng Wika

Mga Tala

  1. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [1]
  2. «Generative AI: UNESCO study reveals alarming evidence of regressive gender stereotypes». UNESCO. [2]
  3. «Gender and race stereotypes in Large Language Models». Nature Scientific Reports. [3]
  4. «Предвзятость русскоязычных LLM: кого машина считает «обычным человеком»?». Хабр. [4]
  5. «ChatGPT’s Racial Bias in Hiring Decisions». Business Insider. [5]
  6. «RuBia: A Russian-language Bias Detection Dataset». The Moonlight. [6]
  7. «Left-leaning bias commonplace in AI-powered chatbots, shows new report». Centre for Policy Studies. [7]
  8. «AI language models are rife with political biases». MIT Technology Review. [8]
  9. «Языковые модели: как преодолеть предвзятость и обеспечить безопасность». РБК Тренды. [9]
  10. «CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models». ACL Anthology. [10]
  11. «StereoSet: Measuring stereotypical bias in pretrained language models». arXiv. [11]
  12. «RuBia: A Russian Language Bias Detection Dataset». arXiv. [12]
  13. «French CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in French Language Models». ACL Anthology. [13]
  14. «CBBQ: A Chinese Bias Benchmark for Large Language Models». arXiv. [14]
  15. «Bias in Large Language Models and Who Should Be Held Accountable». Stanford Law School. [15]
  16. «Racial bias in psychiatric diagnosis and treatment with large language models». Nature Digital Medicine. [16]
  17. «Preprocessing Bias Mitigation». Holistic AI Documentation. [17]
  18. «EU AI Act: First Rules Take Effect on Prohibited AI Systems». Jones Day. [18]
  19. «Over 100 organizations signed up for Code of Ethics in AI by end of 2021». TASS. [19]