Datasnedvridning och bias
Partiskhet i stora språkmodeller (eng. bias in large language models) — är systematiska avvikelser i stora språkmodellers (LLM) funktionssätt som leder till att genererade svar på ett orättvist eller felaktigt sätt återspeglar verkligheten och reproducerar samt förstärker samhälleliga stereotyper[1]. Till skillnad från slumpmässiga fel är partiskhet av regelbunden karaktär och betingas av egenskaper hos träningsdata och algoritmer. LLM kan reproducera köns-, etnicitets- och andra stereotyper, vilket utgör ett allvarligt problem, särskilt inom ansvarsfulla områden som medicin, juridik och ekonomi[2].
Källor till partiskhet
Partiskhet i LLM uppstår från två huvudsakliga källor: snedvridna data och egenskaper hos algoritmerna själva.
Snedvridna träningsdata
Den primära orsaken till partiskhet är träningsdata som återspeglar historiska, sociala och kulturella snedvridningar som existerar i världen. LLM tränas på enorma textkorpusar från internet, böcker och andra mänskligt skapade källor och ärver därmed alla stereotyper som finns i dem[3].
- Obalanserad representation: Om vissa demografiska grupper (t.ex. etniska minoriteter, kvinnor inom vissa yrken) är otillräckligt representerade i data, bildar modellen en förvrängd bild av dem. LLM associerar exempelvis ofta ordet "läkare" med manligt kön och "sjuksköterska" med kvinnligt kön, och reproducerar därigenom historiska könsstereotyper[1].
- Historiska och kulturella snedvridningar: Data återspeglar ofta dominerande kulturella synsätt och historiska fördomar. En modell tränad på sådana texter kommer att reproducera dessa synsätt och ignorera alternativa perspektiv[4].
Algoritmisk förstärkning
LLM:s arkitektur och träningsalgoritm kan inte bara reproducera utan även förstärka de snedvridningar som finns i data. De flesta moderna LLM är baserade på transformers och förutsäger nästa ord utifrån statistiska mönster. Detta leder till att modellen tenderar mot de vanligast förekommande mönstren, vilket befäster och förstärker dominerande åsikter och stereotyper, medan sällsynta och atypiska fall ignoreras[2]. Denna mekanism kan omvandla en liten snedvridning i data till en tydligt märkbar partiskhet i modellens svar[1].
Typer av fördomar och exempel
Sociala och demografiska fördomar
Detta är den mest välstuderade typen av partiskhet och innefattar stereotyper kopplade till kön, ras, ålder, religion och andra sociala egenskaper.
- Könsstereotyper: LLM kopplar ofta bestämda yrken och egenskaper till ett specifikt kön. Vid en förfrågan om en "stark ledare" genererar modellen exempelvis med större sannolikhet en beskrivning av en man.
- Rasliga och etniska stereotyper: Modeller kan reproducera negativa stereotyper om olika etniska grupper. Forskning har visat att modereringsalgoritmer baserade på LLM kan bedöma meddelanden på afroamerikansk vardagsspråk (AAVE) strängare och felaktigt uppfatta dem som mer kränkande[5].
- Grupppartiskhet ("vi mot dem"): En studie från 2024 visade att LLM uppvisar tydlig grupppartiskhet. När modellen ges en ledtråd som associerar den med en viss grupp ("Vi...") tenderar den att tala väl om denna grupp och nedlåtande om "de andra"[4].
Strukturella och kognitiva snedvridningar
Dessa snedvridningar är kopplade till arkitekturens och informationsbearbetningens egenskaper.
- Positionssnedvridning: En studie vid Massachusetts Institute of Technology (MIT) visade att modeller oproportionerligt starkt beaktar information från dokumentets början och slut och ofta "missar" detaljer i mitten. Detta kan påverka noggrannheten vid arbete med långa texter[6].
- Tendens till medelvärdesbildning: Eftersom LLM är probabilistiska modeller strävar de efter att generera de vanligast förekommande (genomsnittliga) svaren, vilket leder till att sällsynta men viktiga fakta, undantag och minoriteters åsikter ignoreras[2].
- Bekräftelsebias: LLM kan uppvisa en tendens att reproducera logiska mönster som förekommer i träningsdata, även om dessa innehåller fördomar, och ignorera information som motsäger dem[2].
Praktiskt exempel
En studie från Världsbanken visade att LLM systematiskt förvrängde innebörden i flyktingars uttalanden vid analys av intervjuer med dem, beroende på ursprung och kön. Modellen feltolkade flyktingföräldrars strävan efter sina barns framgång, förmodligen på grund av avsaknaden av liknande berättelser i träningsdata som till övervägande del bestod av texter av "vita medelklassförfattare"[7][7].
Risker och konsekvenser
- Förstärkning av diskriminering: Inom områden som rekrytering, kreditgivning och juridik kan partiska LLM fatta diskriminerande beslut och förstärka social ojämlikhet[1].
- Spridning av stereotyper: Den omfattande användningen av LLM i sökmotorer och chattbotar kan leda till reproduktion och normalisering av skadliga stereotyper.
- Undergrävande av förtroende för teknologi: Om användare stöter på systematisk partiskhet undergräver det deras förtroende för AI-teknologi i stort.
- Skapande av informationsbubblor: Algoritmer kan utforma sökresultat så att de stämmer överens med användarens förmodade åsikter, vilket stödjer echo chambers och marginaliserar minoriteters åsikter[1].
Metoder för att identifiera och minska partiskhet
För att bekämpa snedvridningar tillämpar forskare och utvecklare ett heltäckande tillvägagångssätt som verkar på tre nivåer: data, modell och efterbearbetning[1].
Insatser på datanivå
Detta är det mest fundamentala tillvägagångssättet. Det innefattar[1]:
- Rensning och balansering: Borttagning av toxiskt och partiskt innehåll från träningsdata.
- Dataaugmentering (Data Augmentation): Tillägg av exempel med otillräckligt representerade grupper för att jämna ut proportionerna.
Modifiering på modellnivå
Detta tillvägagångssätt syftar till att förändra själva träningsalgoritmen[1]:
- Rättvisebegränsningar: Särskilda begränsningar införs i förlustfunktionen som "straffar" modellen för att uppvisa vissa typer av partiskhet.
- Arkitekturförändringar: Varianter av förändrade uppmärksamhetsmekanismer eller tillägg av kontrollerande moduler som spårar och korrigerar partiska associationer undersöks.
Efterbearbetning av resultat
Denna metod tillämpas redan i fasen för generering av svar[1]:
- Filtrering och korrigering: Särskilda algoritmer analyserar den genererade texten och mildrar eller tar bort potentiellt diskriminerande formuleringar.
- Fine-tuning med Reinforcement Learning from Human Feedback (RLHF): Modellen tränas specifikt om för att ge mer neutrala och säkra svar baserat på bedömningar från människor.
Trots betydande framsteg har det ännu inte lyckats att helt befria LLM från partiskhet. Detta förblir ett av de viktigaste forskningsområdena som syftar till att skapa mer rättvisa och tillförlitliga AI-system[4].
Externa länkar
- Generative language models exhibit social identity biases — studie i Nature Computational Science
- Unpacking the bias of large language models — artikel i MIT News
Litteratur
- Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
- Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
- Wu, X. et al. (2025). On the Emergence of Position Bias in Transformers. arXiv:2502.01951.
- Hu, T. et al. (2024). Generative Language Models Exhibit Social Identity Biases. Nature Computational Science, 5, 65-75. Full text.
- Sheng, E. et al. (2019). The Woman Worked as a Babysitter: On Biases in Language Generation. In EMNLP-2019. PDF.
- Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. In ACM FAccT 2021. DOI:10.1145/3442188.3445922.
- Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
- Ma, C. et al. (2024). Debiasing Large Language Models with Structured Knowledge. In Findings of ACL 2024, pp. 10274-10287. [7].
- Mohammadi, B. (2024). Creativity Has Left the Chat: The Price of Debiasing Language Models. arXiv:2406.05587.
- Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.
- Benedetto, L. & Stella, M. (2023). Cognitive Network Science Reveals Bias in GPT-3, GPT-3.5-Turbo, and GPT-4 Mirroring Math Anxiety in High-School Students. Applied Sciences, 13(3). Open access.
Noter
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 1.7 1.8 Zhang, A.; et al. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [1]
- ↑ 2.0 2.1 2.2 2.3 «Предвзятость в больших языковых моделях: этические вызовы и пути решения». medet.rsmu.press. [2]
- ↑ «Large Language Models». Энциклопедия BigdataSchool. [3]
- ↑ 4.0 4.1 4.2 «Generative language models exhibit social identity biases». Nature Computational Science. [4]
- ↑ «Study shows moderation algorithms are stricter on African American Vernacular English». [источник не указан в тексте].
- ↑ «Unpacking the bias of large language models». MIT News. [5]
- ↑ 7.0 7.1 «Прочитал статью про bias LLM». ChatGPT на vc.ru. [6]