Generation bias (LLM) (CS)

From Systems analysis Wiki
Jump to navigation Jump to search

Předpojatost ve velkých jazykových modelech (LLM) — je systematické zkreslení generovaných textů, při němž model odráží nebo zesiluje existující společenské stereotypy a předsudky týkající se pohlaví, rasy, kultury, politických názorů a dalších sociálních kategorií. Tento jev vzniká proto, že LLM jsou trénovány na obrovských souborech lidských dat, která nevyhnutelně obsahují zaujaté informace[1].

Předpojatost je jedním z klíčových etických a technických problémů ve vývoji AI, protože může vést k diskriminaci, šíření dezinformací a podkopávání důvěry v technologie.

Druhy předpojatosti v LLM

Předpojatost v LLM se může projevovat v různých formách.

Genderová předpojatost

Modely mají tendenci reprodukovat tradiční genderové stereotypy, přičemž spojují profese a vlastnosti s určitým pohlavím.

  • Výzkum UNESCO z roku 2024 ukázal, že LLM čtyřikrát častěji popisují ženy v domácích rolích („dům", „rodina", „děti") než muže, zatímco muže spojují s pojmy „byznys" a „kariéra"[2].
  • Výzkum v Nature Scientific Reports odhalil výraznou genderovou a rasovou předpojatost v obsahu generovaném sedmi předními LLM, včetně ChatGPT a LLaMA[3].
  • V ruskojazyčném kontextu modely často standardně používají mužský rod pro neutrální role (například „lékař", „ředitel") a obtížně generují feminina[4].

Rasová a etnická předpojatost

LLM mohou projevovat skrytou diskriminaci vůči různým etnickým skupinám.

  • Výzkum Bloomberg ukázal, že ChatGPT 3.5 upřednostňoval životopisy kandidátů asijského původu ve srovnání s černošskými kandidáty[5].
  • V ruskojazyčném kontextu dataset RuBia odhalil, že modely mohou reprodukovat antisemitské a protiimigrantské stereotypy (například souhlasit s tvrzením „imigranti jsou líní"), pokud jsou přítomny v trénovacím korpusu[6].

Politická a ideologická předpojatost

Navzdory deklarované neutralitě mnoho LLM vykazuje sklony k určitému politickému spektru.

  • Výzkum Centre for Policy Studies odhalil levo-liberální předpojatost u 23 z 24 testovaných LLM[7].
  • Testování Washingtonské univerzity a Carnegie Mellon ukázalo, že ChatGPT a GPT-4 byly nejvíce levo-libertariánské, zatímco LLaMA od Meta — nejvíce pravo-autoritářské[8].

Mechanismy vzniku předpojatosti

  • Trénovací data: Hlavní zdroj. LLM jsou trénovány na obrovských korpusech textů z internetu, které jsou „zrcadlem" společnosti se všemi jeho stereotypy[9].
  • Architektura a algoritmy trénování: Samotná architektura transformerů může zesilovat existující korelace v datech.
  • Fine-tuning a RLHF: Fáze Reinforcement Learning from Human Feedback (RLHF) může také vnášet předpojatost, protože lidští hodnotitelé se nevyhnutelně řídí vlastními názory.

Metody detekce a zmírňování

Detekce předpojatosti

  • Testovací sady stereotypů: Používají se specializované datasety, jako například:
    • CrowS-Pairs: Pokrývá devět typů předpojatosti, včetně rasy, náboženství a věku[10].
    • StereoSet: Měří stereotypní předpojatost ve čtyřech doménách: pohlaví, povolání, rasa a náboženství[11].
    • RuBia: Specializovaný dataset pro odhalování předpojatosti v ruskojazyčných modelech[12].
    • Vícejazyčné zdroje: Adaptace jako French CrowS-Pairs[13] a Chinese Bias Benchmark (CBBQ)[14].
    • Analýza v konkrétních oblastech: Výzkumy předpojatosti v náboru[15], medicíně[16] a dalších oblastech.

Zmírňování předpojatosti

  • Na úrovni dat (Pre-processing): Čištění, filtrování a vyvažování trénovacích korpusů. Metody jsou popsány v dokumentaci Holistic AI[17].
  • Na úrovni trénování (In-processing): Modifikace trénovacích algoritmů s ohledem na spravedlnost.
  • Na úrovni výstupu (Post-processing): Filtrování a moderování již vygenerovaných odpovědí.

Právní a etické důsledky

Předpojatost v AI má závažné důsledky, včetně diskriminace v kriticky důležitých oblastech a šíření dezinformací.

  • Regulace: Vlády po celém světě začínají zavádět normy pro kontrolu nad AI.
  • V Evropě byl přijat AI Act, který vstupuje v platnost postupně od 1. srpna 2024. Zavádí přísné požadavky pro vysoce rizikové systémy, včetně povinného hodnocení předpojatosti, a stanoví pokuty až do výše 7 % celosvětového obratu společnosti[18].
  • V Rusku v roce 2021 přední technologické společnosti podepsaly dobrovolný Kodex etiky v oblasti AI, v němž se zavázaly minimalizovat diskriminaci. Do konce roku 2021 jej podepsalo více než 100 organizací[19].

Boj s předpojatostí je neustálým kompromisem. Příliš agresivní filtrování může vést k „nadměrné politické korektnosti", kdy model odmítá diskutovat o jakýchkoli citlivých tématech. Proto vývojáři hledají rovnováhu mezi bezpečností, objektivitou a informativností modelu.

Literatura

  • Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
  • Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
  • Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. doi:10.1145/3442188.3445922.
  • Nadeem, M. et al. (2020). StereoSet: Measuring Stereotypical Bias in Pretrained Language Models. arXiv:2004.09456.
  • Nangia, N. et al. (2020). CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. ACL 2020.
  • Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
  • Hofmann, V. et al. (2024). AI Generates Covertly Racist Decisions about People Based on Their Dialect. Nature, 633, 147-154. Full text.
  • Fang, X. et al. (2024). Bias of AI-Generated Content: An Examination of News Produced by Large Language Models. Scientific Reports, 14, 5224. Full text.
  • Grigoreva, V. et al. (2024). RuBia: A Russian Language Bias Detection Dataset. arXiv:2403.17553.
  • Du, L. et al. (2024). Causal-Guided Active Learning for Debiasing Large Language Models. arXiv:2408.12942.
  • Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.

Viz také

  • Velké jazykové modely

Poznámky

  1. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [1]
  2. «Generative AI: UNESCO study reveals alarming evidence of regressive gender stereotypes». UNESCO. [2]
  3. «Gender and race stereotypes in Large Language Models». Nature Scientific Reports. [3]
  4. «Предвзятость русскоязычных LLM: кого машина считает «обычным человеком»?». Хабр. [4]
  5. «ChatGPT’s Racial Bias in Hiring Decisions». Business Insider. [5]
  6. «RuBia: A Russian-language Bias Detection Dataset». The Moonlight. [6]
  7. «Left-leaning bias commonplace in AI-powered chatbots, shows new report». Centre for Policy Studies. [7]
  8. «AI language models are rife with political biases». MIT Technology Review. [8]
  9. «Языковые модели: как преодолеть предвзятость и обеспечить безопасность». РБК Тренды. [9]
  10. «CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models». ACL Anthology. [10]
  11. «StereoSet: Measuring stereotypical bias in pretrained language models». arXiv. [11]
  12. «RuBia: A Russian Language Bias Detection Dataset». arXiv. [12]
  13. «French CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in French Language Models». ACL Anthology. [13]
  14. «CBBQ: A Chinese Bias Benchmark for Large Language Models». arXiv. [14]
  15. «Bias in Large Language Models and Who Should Be Held Accountable». Stanford Law School. [15]
  16. «Racial bias in psychiatric diagnosis and treatment with large language models». Nature Digital Medicine. [16]
  17. «Preprocessing Bias Mitigation». Holistic AI Documentation. [17]
  18. «EU AI Act: First Rules Take Effect on Prohibited AI Systems». Jones Day. [18]
  19. «Over 100 organizations signed up for Code of Ethics in AI by end of 2021». TASS. [19]