Zkreslení dat a bias
Předpojatost ve velkých jazykových modelech (angl. bias in large language models) — to jsou systematické odchylky ve fungování velkých jazykových modelů (LLM), které vedou ke generování odpovědí, jež nespravedlivě nebo nepřesně odrážejí skutečnost, reprodukují a zesilují ve společnosti existující stereotypy[1]. Na rozdíl od náhodných chyb má předpojatost zákonomerný charakter a je podmíněna zvláštnostmi trénovacích dat a algoritmů. LLM mohou reprodukovat genderové, etnické a jiné stereotypy, což představuje závažný problém zejména v odpovědných oblastech, jako je medicína, jurisprudence a finance[2].
Zdroje předpojatosti
Předpojatost v LLM vzniká ze dvou hlavních zdrojů: ze zkreslených dat a ze zvláštností samotných algoritmů.
Zkreslená trénovací data
Hlavní příčinou vzniku předpojatosti jsou trénovací data, která odrážejí historické, sociální a kulturní deformace existující ve světě. LLM jsou trénovány na obrovských korpusech textů z internetu, knih a dalších zdrojů vytvořených lidmi, a v důsledku toho přebírají veškeré v nich obsažené stereotypy[3].
- Nevyvážené zastoupení: Pokud jsou v datech nedostatečně zastoupeny určité demografické skupiny (například etnické menšiny, ženy v určitých profesích), model si o nich vytváří zkreslený obraz. Například LLM často asociují slovo „lékař" s mužským pohlavím a „zdravotní sestra" s ženským, čímž reprodukují historické genderové stereotypy[1].
- Historické a kulturní deformace: Data často odrážejí dominantní kulturní pohledy a historické předsudky. Model trénovaný na takových textech bude tyto pohledy reprodukovat a ignorovat alternativní perspektivy[4].
Algoritmické zesilování
Architektura a algoritmus tréninku LLM mohou nejen reprodukovat, ale i zesilovat zkreslení existující v datech. Většina moderních LLM je založena na transformerech a předpovídá následující slovo na základě statistických zákonitostí. To vede k tomu, že model inklinuje k nejčastěji se vyskytujícím vzorcům, čímž upevňuje a zesiluje dominantní názory a stereotypy, zatímco vzácné a netypické případy jsou ignorovány[2]. Tento mechanismus může proměnit nepatrné zkreslení v datech ve výraznou předpojatost v odpovědích modelu[1].
Typy předsudků a příklady
Sociální a demografické předsudky
Toto je nejprozkoumanější typ předpojatosti, který zahrnuje stereotypy spojené s pohlavím, rasou, věkem, náboženstvím a dalšími sociálními charakteristikami.
- Genderové stereotypy: LLM často spojují určité profese a vlastnosti s konkrétním pohlavím. Například na dotaz o „silném lídrovi" model s větší pravděpodobností vygeneruje popis muže.
- Rasové a etnické stereotypy: Modely mohou reprodukovat negativní stereotypy o různých etnických skupinách. Výzkumy ukázaly, že moderační algoritmy založené na LLM mohou přísněji hodnotit zprávy v afroamerickém hovorovém jazyce (AAVE) a chybně je považovat za urážlivější[5].
- Skupinová předpojatost („my proti nim"): Výzkum z roku 2024 ukázal, že LLM vykazují výraznou skupinovou předpojatost. Pokud model dostane podnět asociující ho s určitou skupinou („My..."), inklinuje k příznivému hodnocení této skupiny a pohrdlivému hodnocení „cizích"[4].
Strukturální a kognitivní zkreslení
Tato zkreslení souvisejí se zvláštnostmi architektury a zpracování informací.
- Poziční zkreslení: Výzkum Massachusettského technologického institutu (MIT) odhalil, že modely neproporcionálně silně zohledňují informace ze začátku a konce dokumentu a často „přehlížejí" detaily z jeho středu. To může ovlivňovat přesnost při práci s dlouhými texty[6].
- Sklon k průměrování: Jakožto pravděpodobnostní modely LLM tíhnou ke generování nejfrekventovanějších (průměrných) odpovědí, což vede k ignorování vzácných, ale důležitých faktů, výjimek a názorů menšin[2].
- Efekt potvrzení: LLM mohou vykazovat sklon reprodukovat logické vzorce přítomné v trénovacích datech, i když obsahují předsudky, a ignorovat jim odporující informace[2].
Příklad z praxe
Výzkum Světové banky odhalil, že při analýze rozhovorů s uprchlíky LLM systematicky zkreslovala smysl jejich výpovědí v závislosti na původu a pohlaví. Model nesprávně interpretoval snahu rodičů-uprchlíků o úspěch jejich dětí, pravděpodobně kvůli absenci podobných narativů v trénovacích datech složených převážně z textů „bílých autorů střední třídy"[7][7].
Rizika a důsledky
- Zesilování diskriminace: V oblastech, jako je nábor zaměstnanců, poskytování úvěrů a jurisprudence, mohou předpojaté LLM přijímat diskriminační rozhodnutí a prohlubovat sociální nerovnost[1].
- Šíření stereotypů: Masové využívání LLM ve vyhledávačích a chatbotech může vést k rozšiřování a normalizaci škodlivých stereotypů.
- Podkopávání důvěry v technologie: Pokud se uživatelé setkávají se systematickou předpojatostí, podkopává to jejich důvěru v technologie umělé inteligence jako celku.
- Vytváření informačních bublin: Algoritmy mohou formovat výstupy tak, aby odpovídaly předpokládaným názorům uživatele, čímž podporují echo chambers a marginalizují názory menšin[1].
Metody odhalování a snižování předpojatosti
Pro boj se zkreslením používají výzkumníci a vývojáři komplexní přístup, pracující na třech úrovních: data, model a postprocesing[1].
Intervence na úrovni dat
Toto je nejfundamentálnější přístup. Zahrnuje[1]:
- Čištění a vyvažování: Odstraňování toxického a předpojatého obsahu z trénovacích dat.
- Augmentace dat (Data Augmentation): Přidávání příkladů s nedostatečně zastoupenými skupinami za účelem vyrovnání proporcí.
Modifikace na úrovni modelu
Tento přístup je zaměřen na změnu samotného trénovacího algoritmu[1]:
- Omezení spravedlnosti: Do ztrátové funkce jsou zavedena speciální omezení, která model „penalizují" za projevy určitých typů předpojatosti.
- Změna architektury: Jsou zkoumány varianty úpravy mechanismů attention nebo přidávání kontrolních modulů, které sledují a korigují předpojaté asociace.
Postprocesing výsledků
Tato metoda je aplikována již ve fázi generování odpovědí[1]:
- Filtrování a korekce: Speciální algoritmy analyzují vygenerovaný text a zmírňují nebo odstraňují potenciálně diskriminační formulace.
- Dotrénování s posilováním od člověka (RLHF): Model je speciálně dotrénován tak, aby poskytoval neutrálnější a bezpečnější odpovědi na základě hodnocení poskytnutých lidmi.
Navzdory výraznému pokroku se dosud nepodařilo LLM zcela zbavit předpojatosti. To zůstává jednou z klíčových oblastí výzkumu zaměřeného na vytváření spravedlivějších a spolehlivějších systémů umělé inteligence[4].
Odkazy
- Generative language models exhibit social identity biases — výzkum v Nature Computational Science
- Unpacking the bias of large language models — článek MIT News
Literatura
- Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
- Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
- Wu, X. et al. (2025). On the Emergence of Position Bias in Transformers. arXiv:2502.01951.
- Hu, T. et al. (2024). Generative Language Models Exhibit Social Identity Biases. Nature Computational Science, 5, 65-75. Full text.
- Sheng, E. et al. (2019). The Woman Worked as a Babysitter: On Biases in Language Generation. In EMNLP-2019. PDF.
- Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. In ACM FAccT 2021. DOI:10.1145/3442188.3445922.
- Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
- Ma, C. et al. (2024). Debiasing Large Language Models with Structured Knowledge. In Findings of ACL 2024, pp. 10274-10287. [7].
- Mohammadi, B. (2024). Creativity Has Left the Chat: The Price of Debiasing Language Models. arXiv:2406.05587.
- Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.
- Benedetto, L. & Stella, M. (2023). Cognitive Network Science Reveals Bias in GPT-3, GPT-3.5-Turbo, and GPT-4 Mirroring Math Anxiety in High-School Students. Applied Sciences, 13(3). Open access.
Poznámky
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Zhang, A.; et al. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [1]
- ↑ 2.0 2.1 2.2 2.3 «Предвзятость в больших языковых моделях: этические вызовы и пути решения». medet.rsmu.press. [2]
- ↑ «Large Language Models». Энциклопедия BigdataSchool. [3]
- ↑ 4.0 4.1 4.2 «Generative language models exhibit social identity biases». Nature Computational Science. [4]
- ↑ «Study shows moderation algorithms are stricter on African American Vernacular English». [источник не указан в тексте].
- ↑ «Unpacking the bias of large language models». MIT News. [5]
- ↑ 7.0 7.1 «Прочитал статью про bias LLM». ChatGPT на vc.ru. [6]