Generation bias (LLM) (PL)

From Systems analysis Wiki
Jump to navigation Jump to search

Stronniczość w dużych modelach językowych (LLM) — to systematyczne zniekształcenie generowanych tekstów, w którym model odzwierciedla lub wzmacnia istniejące w społeczeństwie stereotypy i uprzedzenia związane z płcią, rasą, kulturą, poglądami politycznymi i innymi kategoriami społecznymi. Zjawisko to powstaje dlatego, że LLM są trenowane na ogromnych zbiorach danych ludzkich, które nieuchronnie zawierają stronnicze informacje[1].

Stronniczość jest jednym z kluczowych problemów etycznych i technicznych w rozwoju AI, ponieważ może prowadzić do dyskryminacji, rozprzestrzeniania dezinformacji i podważania zaufania do technologii.

Rodzaje stronniczości w LLM

Stronniczość w LLM może przejawiać się w różnych formach.

Stronniczość płciowa

Modele mają tendencję do odtwarzania tradycyjnych stereotypów płciowych, kojarząc zawody i cechy z określoną płcią.

  • Badanie UNESCO z 2024 roku wykazało, że LLM cztery razy częściej opisują kobiety w rolach domowych («dom», «rodzina», «dzieci») niż mężczyzn, a mężczyzn kojarzą z pojęciami «biznes» i «kariera»[2].
  • Badanie opublikowane w Nature Scientific Reports ujawniło istotną stronniczość płciową i rasową w treściach generowanych przez siedem wiodących LLM, w tym ChatGPT i LLaMA[3].
  • W kontekście rosyjskojęzycznym modele często domyślnie używają rodzaju męskiego dla neutralnych ról (na przykład «lekarz», «dyrektor») i mają trudności z generowaniem feminatywów[4].

Stronniczość rasowa i etniczna

LLM mogą przejawiać ukrytą dyskryminację wobec różnych grup etnicznych.

  • Badanie Bloomberg wykazało, że ChatGPT 3.5 preferował życiorysy kandydatów azjatyckiego pochodzenia w porównaniu z czarnoskórymi[5].
  • W kontekście rosyjskojęzycznym dataset RuBia wykazał, że modele mogą odtwarzać antysemickie i antyimigranckie stereotypy (na przykład zgadzając się ze stwierdzeniem «imigranci są leniwi»), jeśli są one obecne w korpusie treningowym[6].

Stronniczość polityczna i ideologiczna

Pomimo deklaracji neutralności, wiele LLM wykazuje skłonność do określonego spektrum politycznego.

  • Badanie Centre for Policy Studies ujawniło lewicowo-liberalną stronniczość u 23 spośród 24 przetestowanych LLM[7].
  • Testy przeprowadzone przez Uniwersytet Waszyngtoński i Carnegie Mellon wykazały, że ChatGPT i GPT-4 były najbardziej lewicowo-libertariańskie, podczas gdy LLaMA od Meta — najbardziej prawicowo-autorytarna[8].

Mechanizmy powstawania stronniczości

  • Dane treningowe: Główne źródło. LLM są trenowane na ogromnych korpusach tekstów z internetu, które stanowią «lustro» społeczeństwa ze wszystkimi jego stereotypami[9].
  • Architektura i algorytmy uczenia: Sama architektura transformer może wzmacniać istniejące w danych korelacje.
  • Fine-tuning i RLHF: Etap Reinforcement Learning from Human Feedback (RLHF) również może wprowadzać stronniczość, ponieważ ludzcy oceniający nieuchronnie kierują się własnymi poglądami.

Metody wykrywania i łagodzenia

Wykrywanie stronniczości

  • Zestawy testowe stereotypów: Stosowane są specjalistyczne datasety, takie jak:
    • CrowS-Pairs: Obejmuje dziewięć typów stronniczości, w tym rasę, religię i wiek[10].
    • StereoSet: Mierzy stronniczość stereotypową w czterech domenach: płeć, zawód, rasa i religia[11].
    • RuBia: Specjalistyczny dataset do wykrywania stronniczości w modelach rosyjskojęzycznych[12].
    • Zasoby wielojęzyczne: Adaptacje takie jak French CrowS-Pairs[13] i Chinese Bias Benchmark (CBBQ)[14].
    • Analiza w konkretnych dziedzinach: Badania stronniczości w rekrutacji[15], medycynie[16] i innych obszarach.

Łagodzenie stronniczości

  • Na poziomie danych (Pre-processing): Czyszczenie, filtrowanie i rebalansowanie korpusów treningowych. Metody opisane są w dokumentacji Holistic AI[17].
  • Na poziomie uczenia (In-processing): Modyfikacja algorytmów uczenia z uwzględnieniem sprawiedliwości.
  • Na poziomie wyjścia (Post-processing): Filtrowanie i moderacja już wygenerowanych odpowiedzi.

Konsekwencje prawne i etyczne

Stronniczość w AI ma poważne konsekwencje, w tym dyskryminację w krytycznie ważnych obszarach i rozprzestrzenianie dezinformacji.

  • Regulacje: Rządy na całym świecie zaczynają wprowadzać normy kontrolujące AI.
  • W Europie przyjęto AI Act, który wchodzi w życie stopniowo od 1 sierpnia 2024 roku. Wprowadza on rygorystyczne wymagania dla systemów wysokiego ryzyka, w tym obowiązkową ocenę pod kątem stronniczości, i przewiduje kary do 7% globalnych obrotów firmy[18].
  • W Rosji w 2021 roku wiodące firmy technologiczne podpisały dobrowolny Kodeks etyki w dziedzinie AI, zobowiązując się do minimalizacji dyskryminacji. Do końca 2021 roku podpisało go ponad 100 organizacji[19].

Walka ze stronniczością to nieustanny kompromis. Zbyt agresywna filtracja może prowadzić do «nadmiernej poprawności politycznej», gdy model odmawia omawiania jakichkolwiek drażliwych tematów. Dlatego twórcy poszukują równowagi między bezpieczeństwem, obiektywizmem a informatywnością modelu.

Literatura

  • Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
  • Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
  • Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. doi:10.1145/3442188.3445922.
  • Nadeem, M. et al. (2020). StereoSet: Measuring Stereotypical Bias in Pretrained Language Models. arXiv:2004.09456.
  • Nangia, N. et al. (2020). CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. ACL 2020.
  • Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
  • Hofmann, V. et al. (2024). AI Generates Covertly Racist Decisions about People Based on Their Dialect. Nature, 633, 147-154. Full text.
  • Fang, X. et al. (2024). Bias of AI-Generated Content: An Examination of News Produced by Large Language Models. Scientific Reports, 14, 5224. Full text.
  • Grigoreva, V. et al. (2024). RuBia: A Russian Language Bias Detection Dataset. arXiv:2403.17553.
  • Du, L. et al. (2024). Causal-Guided Active Learning for Debiasing Large Language Models. arXiv:2408.12942.
  • Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.

Zobacz też

  • Duże modele językowe

Przypisy

  1. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [1]
  2. «Generative AI: UNESCO study reveals alarming evidence of regressive gender stereotypes». UNESCO. [2]
  3. «Gender and race stereotypes in Large Language Models». Nature Scientific Reports. [3]
  4. «Предвзятость русскоязычных LLM: кого машина считает «обычным человеком»?». Хабр. [4]
  5. «ChatGPT’s Racial Bias in Hiring Decisions». Business Insider. [5]
  6. «RuBia: A Russian-language Bias Detection Dataset». The Moonlight. [6]
  7. «Left-leaning bias commonplace in AI-powered chatbots, shows new report». Centre for Policy Studies. [7]
  8. «AI language models are rife with political biases». MIT Technology Review. [8]
  9. «Языковые модели: как преодолеть предвзятость и обеспечить безопасность». РБК Тренды. [9]
  10. «CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models». ACL Anthology. [10]
  11. «StereoSet: Measuring stereotypical bias in pretrained language models». arXiv. [11]
  12. «RuBia: A Russian Language Bias Detection Dataset». arXiv. [12]
  13. «French CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in French Language Models». ACL Anthology. [13]
  14. «CBBQ: A Chinese Bias Benchmark for Large Language Models». arXiv. [14]
  15. «Bias in Large Language Models and Who Should Be Held Accountable». Stanford Law School. [15]
  16. «Racial bias in psychiatric diagnosis and treatment with large language models». Nature Digital Medicine. [16]
  17. «Preprocessing Bias Mitigation». Holistic AI Documentation. [17]
  18. «EU AI Act: First Rules Take Effect on Prohibited AI Systems». Jones Day. [18]
  19. «Over 100 organizations signed up for Code of Ethics in AI by end of 2021». TASS. [19]