Generation bias (LLM) (PL)
Stronniczość w dużych modelach językowych (LLM) — to systematyczne zniekształcenie generowanych tekstów, w którym model odzwierciedla lub wzmacnia istniejące w społeczeństwie stereotypy i uprzedzenia związane z płcią, rasą, kulturą, poglądami politycznymi i innymi kategoriami społecznymi. Zjawisko to powstaje dlatego, że LLM są trenowane na ogromnych zbiorach danych ludzkich, które nieuchronnie zawierają stronnicze informacje[1].
Stronniczość jest jednym z kluczowych problemów etycznych i technicznych w rozwoju AI, ponieważ może prowadzić do dyskryminacji, rozprzestrzeniania dezinformacji i podważania zaufania do technologii.
Rodzaje stronniczości w LLM
Stronniczość w LLM może przejawiać się w różnych formach.
Stronniczość płciowa
Modele mają tendencję do odtwarzania tradycyjnych stereotypów płciowych, kojarząc zawody i cechy z określoną płcią.
- Badanie UNESCO z 2024 roku wykazało, że LLM cztery razy częściej opisują kobiety w rolach domowych («dom», «rodzina», «dzieci») niż mężczyzn, a mężczyzn kojarzą z pojęciami «biznes» i «kariera»[2].
- Badanie opublikowane w Nature Scientific Reports ujawniło istotną stronniczość płciową i rasową w treściach generowanych przez siedem wiodących LLM, w tym ChatGPT i LLaMA[3].
- W kontekście rosyjskojęzycznym modele często domyślnie używają rodzaju męskiego dla neutralnych ról (na przykład «lekarz», «dyrektor») i mają trudności z generowaniem feminatywów[4].
Stronniczość rasowa i etniczna
LLM mogą przejawiać ukrytą dyskryminację wobec różnych grup etnicznych.
- Badanie Bloomberg wykazało, że ChatGPT 3.5 preferował życiorysy kandydatów azjatyckiego pochodzenia w porównaniu z czarnoskórymi[5].
- W kontekście rosyjskojęzycznym dataset RuBia wykazał, że modele mogą odtwarzać antysemickie i antyimigranckie stereotypy (na przykład zgadzając się ze stwierdzeniem «imigranci są leniwi»), jeśli są one obecne w korpusie treningowym[6].
Stronniczość polityczna i ideologiczna
Pomimo deklaracji neutralności, wiele LLM wykazuje skłonność do określonego spektrum politycznego.
- Badanie Centre for Policy Studies ujawniło lewicowo-liberalną stronniczość u 23 spośród 24 przetestowanych LLM[7].
- Testy przeprowadzone przez Uniwersytet Waszyngtoński i Carnegie Mellon wykazały, że ChatGPT i GPT-4 były najbardziej lewicowo-libertariańskie, podczas gdy LLaMA od Meta — najbardziej prawicowo-autorytarna[8].
Mechanizmy powstawania stronniczości
- Dane treningowe: Główne źródło. LLM są trenowane na ogromnych korpusach tekstów z internetu, które stanowią «lustro» społeczeństwa ze wszystkimi jego stereotypami[9].
- Architektura i algorytmy uczenia: Sama architektura transformer może wzmacniać istniejące w danych korelacje.
- Fine-tuning i RLHF: Etap Reinforcement Learning from Human Feedback (RLHF) również może wprowadzać stronniczość, ponieważ ludzcy oceniający nieuchronnie kierują się własnymi poglądami.
Metody wykrywania i łagodzenia
Wykrywanie stronniczości
- Zestawy testowe stereotypów: Stosowane są specjalistyczne datasety, takie jak:
- CrowS-Pairs: Obejmuje dziewięć typów stronniczości, w tym rasę, religię i wiek[10].
- StereoSet: Mierzy stronniczość stereotypową w czterech domenach: płeć, zawód, rasa i religia[11].
- RuBia: Specjalistyczny dataset do wykrywania stronniczości w modelach rosyjskojęzycznych[12].
- Zasoby wielojęzyczne: Adaptacje takie jak French CrowS-Pairs[13] i Chinese Bias Benchmark (CBBQ)[14].
- Analiza w konkretnych dziedzinach: Badania stronniczości w rekrutacji[15], medycynie[16] i innych obszarach.
Łagodzenie stronniczości
- Na poziomie danych (Pre-processing): Czyszczenie, filtrowanie i rebalansowanie korpusów treningowych. Metody opisane są w dokumentacji Holistic AI[17].
- Na poziomie uczenia (In-processing): Modyfikacja algorytmów uczenia z uwzględnieniem sprawiedliwości.
- Na poziomie wyjścia (Post-processing): Filtrowanie i moderacja już wygenerowanych odpowiedzi.
Konsekwencje prawne i etyczne
Stronniczość w AI ma poważne konsekwencje, w tym dyskryminację w krytycznie ważnych obszarach i rozprzestrzenianie dezinformacji.
- Regulacje: Rządy na całym świecie zaczynają wprowadzać normy kontrolujące AI.
- W Europie przyjęto AI Act, który wchodzi w życie stopniowo od 1 sierpnia 2024 roku. Wprowadza on rygorystyczne wymagania dla systemów wysokiego ryzyka, w tym obowiązkową ocenę pod kątem stronniczości, i przewiduje kary do 7% globalnych obrotów firmy[18].
- W Rosji w 2021 roku wiodące firmy technologiczne podpisały dobrowolny Kodeks etyki w dziedzinie AI, zobowiązując się do minimalizacji dyskryminacji. Do końca 2021 roku podpisało go ponad 100 organizacji[19].
Walka ze stronniczością to nieustanny kompromis. Zbyt agresywna filtracja może prowadzić do «nadmiernej poprawności politycznej», gdy model odmawia omawiania jakichkolwiek drażliwych tematów. Dlatego twórcy poszukują równowagi między bezpieczeństwem, obiektywizmem a informatywnością modelu.
Literatura
- Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
- Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
- Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. doi:10.1145/3442188.3445922.
- Nadeem, M. et al. (2020). StereoSet: Measuring Stereotypical Bias in Pretrained Language Models. arXiv:2004.09456.
- Nangia, N. et al. (2020). CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. ACL 2020.
- Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
- Hofmann, V. et al. (2024). AI Generates Covertly Racist Decisions about People Based on Their Dialect. Nature, 633, 147-154. Full text.
- Fang, X. et al. (2024). Bias of AI-Generated Content: An Examination of News Produced by Large Language Models. Scientific Reports, 14, 5224. Full text.
- Grigoreva, V. et al. (2024). RuBia: A Russian Language Bias Detection Dataset. arXiv:2403.17553.
- Du, L. et al. (2024). Causal-Guided Active Learning for Debiasing Large Language Models. arXiv:2408.12942.
- Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.
Zobacz też
- Duże modele językowe
Przypisy
- ↑ «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [1]
- ↑ «Generative AI: UNESCO study reveals alarming evidence of regressive gender stereotypes». UNESCO. [2]
- ↑ «Gender and race stereotypes in Large Language Models». Nature Scientific Reports. [3]
- ↑ «Предвзятость русскоязычных LLM: кого машина считает «обычным человеком»?». Хабр. [4]
- ↑ «ChatGPT’s Racial Bias in Hiring Decisions». Business Insider. [5]
- ↑ «RuBia: A Russian-language Bias Detection Dataset». The Moonlight. [6]
- ↑ «Left-leaning bias commonplace in AI-powered chatbots, shows new report». Centre for Policy Studies. [7]
- ↑ «AI language models are rife with political biases». MIT Technology Review. [8]
- ↑ «Языковые модели: как преодолеть предвзятость и обеспечить безопасность». РБК Тренды. [9]
- ↑ «CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models». ACL Anthology. [10]
- ↑ «StereoSet: Measuring stereotypical bias in pretrained language models». arXiv. [11]
- ↑ «RuBia: A Russian Language Bias Detection Dataset». arXiv. [12]
- ↑ «French CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in French Language Models». ACL Anthology. [13]
- ↑ «CBBQ: A Chinese Bias Benchmark for Large Language Models». arXiv. [14]
- ↑ «Bias in Large Language Models and Who Should Be Held Accountable». Stanford Law School. [15]
- ↑ «Racial bias in psychiatric diagnosis and treatment with large language models». Nature Digital Medicine. [16]
- ↑ «Preprocessing Bias Mitigation». Holistic AI Documentation. [17]
- ↑ «EU AI Act: First Rules Take Effect on Prohibited AI Systems». Jones Day. [18]
- ↑ «Over 100 organizations signed up for Code of Ethics in AI by end of 2021». TASS. [19]