Generation bias (LLM) (IT)

From Systems analysis Wiki
Jump to navigation Jump to search

Bias nei modelli linguistici di grandi dimensioni (LLM) — è una distorsione sistematica dei testi generati, in cui il modello riflette o amplifica gli stereotipi e i pregiudizi presenti nella società, legati al genere, alla razza, alla cultura, alle opinioni politiche e ad altre categorie sociali. Questo fenomeno si verifica perché gli LLM vengono addestrati su enormi masse di dati umani, che inevitabilmente contengono informazioni distorte[1].

Il bias è uno dei principali problemi etici e tecnici nello sviluppo dell'IA, poiché può portare a discriminazioni, alla diffusione di disinformazione e all'erosione della fiducia nelle tecnologie.

Tipi di bias negli LLM

Il bias negli LLM può manifestarsi in varie forme.

Bias di genere

I modelli tendono a riprodurre i tradizionali stereotipi di genere, associando professioni e caratteristiche a un determinato sesso.

  • Uno studio UNESCO del 2024 ha mostrato che gli LLM descrivono le donne in ruoli domestici («casa», «famiglia», «bambini») quattro volte più spesso degli uomini, mentre gli uomini vengono associati ai concetti di «affari» e «carriera»[2].
  • Una ricerca pubblicata su Nature Scientific Reports ha evidenziato un significativo bias di genere e razziale nei contenuti generati da sette LLM di punta, tra cui ChatGPT e LLaMA[3].
  • Nel contesto della lingua russa, i modelli utilizzano spesso per impostazione predefinita il genere maschile per ruoli neutri (ad esempio, «medico», «direttore») e faticano a generare forme femminili[4].

Bias razziale ed etnico

Gli LLM possono manifestare discriminazioni latenti nei confronti di diversi gruppi etnici.

  • Uno studio di Bloomberg ha dimostrato che ChatGPT 3.5 preferiva i curriculum di candidati di origine asiatica rispetto a quelli di candidati neri[5].
  • Nel contesto della lingua russa, il dataset RuBia ha rilevato che i modelli possono riprodurre stereotipi antisemiti e anti-immigrazione (ad esempio, concordando con l'affermazione «gli immigrati sono pigri»), se questi sono presenti nel corpus di addestramento[6].

Bias politico e ideologico

Nonostante le dichiarazioni di neutralità, molti LLM mostrano una tendenza verso un determinato spettro politico.

  • Una ricerca del Centre for Policy Studies ha rilevato un bias liberal-progressista in 23 dei 24 LLM testati[7].
  • I test condotti dall'Università di Washington e dalla Carnegie Mellon hanno mostrato che ChatGPT e GPT-4 erano i più orientati verso il libertarismo di sinistra, mentre LLaMA di Meta risultava il più orientato verso l'autoritarismo di destra[8].

Meccanismi di origine del bias

  • Dati di addestramento: La fonte principale. Gli LLM vengono addestrati su enormi corpus di testi provenienti da internet, che costituiscono uno «specchio» della società con tutti i suoi stereotipi[9].
  • Architettura e algoritmi di addestramento: L'architettura stessa dei transformer può amplificare le correlazioni presenti nei dati.
  • Fine-tuning e RLHF: La fase di Reinforcement Learning from Human Feedback (RLHF) può anch'essa introdurre bias, poiché gli evaluatori umani sono inevitabilmente influenzati dalle proprie opinioni.

Metodi di rilevamento e mitigazione

Rilevamento del bias

  • Dataset di test sugli stereotipi: Vengono utilizzati dataset specializzati, come:
    • CrowS-Pairs: Copre nove tipi di bias, tra cui razza, religione ed età[10].
    • StereoSet: Misura il bias stereotipico in quattro domini: genere, professione, razza e religione[11].
    • RuBia: Un dataset specializzato per il rilevamento del bias nei modelli in lingua russa[12].
    • Risorse multilingue: Adattamenti come French CrowS-Pairs[13] e Chinese Bias Benchmark (CBBQ)[14].
    • Analisi in ambiti specifici: Ricerche sul bias nel recruiting[15], in medicina[16] e in altri settori.

Mitigazione del bias

  • A livello di dati (Pre-processing): Pulizia, filtraggio e ribilanciamento dei corpus di addestramento. I metodi sono descritti nella documentazione di Holistic AI[17].
  • A livello di addestramento (In-processing): Modifica degli algoritmi di addestramento per tenere conto dell'equità.
  • A livello di output (Post-processing): Filtraggio e moderazione delle risposte già generate.

Conseguenze giuridiche ed etiche

Il bias nell'IA ha conseguenze serie, tra cui la discriminazione in ambiti critici e la diffusione di disinformazione.

  • Regolamentazione: I governi di tutto il mondo stanno iniziando a introdurre norme per il controllo dell'IA.
  • In Europa è stato adottato l'AI Act, che entra in vigore gradualmente a partire dal 1° agosto 2024. Esso introduce requisiti stringenti per i sistemi ad alto rischio, tra cui una valutazione obbligatoria del bias, e prevede sanzioni fino al 7% del fatturato mondiale dell'azienda[18].
  • In Russia, nel 2021, le principali aziende tecnologiche hanno firmato un Codice etico volontario nel settore dell'IA, impegnandosi a ridurre al minimo la discriminazione. Entro la fine del 2021, lo aveva firmato più di 100 organizzazioni[19].

La lotta al bias è un compromesso costante. Un filtraggio eccessivamente aggressivo può portare a una «sovra-correttezza politica», in cui il modello si rifiuta di discutere qualsiasi argomento delicato. Per questo motivo, gli sviluppatori cercano un equilibrio tra sicurezza, obiettività e informatività del modello.

Vedi anche

  • Modelli linguistici di grandi dimensioni

Letteratura

  • Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
  • Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
  • Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. doi:10.1145/3442188.3445922.
  • Nadeem, M. et al. (2020). StereoSet: Measuring Stereotypical Bias in Pretrained Language Models. arXiv:2004.09456.
  • Nangia, N. et al. (2020). CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. ACL 2020.
  • Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
  • Hofmann, V. et al. (2024). AI Generates Covertly Racist Decisions about People Based on Their Dialect. Nature, 633, 147-154. Full text.
  • Fang, X. et al. (2024). Bias of AI-Generated Content: An Examination of News Produced by Large Language Models. Scientific Reports, 14, 5224. Full text.
  • Grigoreva, V. et al. (2024). RuBia: A Russian Language Bias Detection Dataset. arXiv:2403.17553.
  • Du, L. et al. (2024). Causal-Guided Active Learning for Debiasing Large Language Models. arXiv:2408.12942.
  • Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.

Note

  1. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [1]
  2. «Generative AI: UNESCO study reveals alarming evidence of regressive gender stereotypes». UNESCO. [2]
  3. «Gender and race stereotypes in Large Language Models». Nature Scientific Reports. [3]
  4. «Предвзятость русскоязычных LLM: кого машина считает «обычным человеком»?». Хабр. [4]
  5. «ChatGPT’s Racial Bias in Hiring Decisions». Business Insider. [5]
  6. «RuBia: A Russian-language Bias Detection Dataset». The Moonlight. [6]
  7. «Left-leaning bias commonplace in AI-powered chatbots, shows new report». Centre for Policy Studies. [7]
  8. «AI language models are rife with political biases». MIT Technology Review. [8]
  9. «Языковые модели: как преодолеть предвзятость и обеспечить безопасность». РБК Тренды. [9]
  10. «CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models». ACL Anthology. [10]
  11. «StereoSet: Measuring stereotypical bias in pretrained language models». arXiv. [11]
  12. «RuBia: A Russian Language Bias Detection Dataset». arXiv. [12]
  13. «French CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in French Language Models». ACL Anthology. [13]
  14. «CBBQ: A Chinese Bias Benchmark for Large Language Models». arXiv. [14]
  15. «Bias in Large Language Models and Who Should Be Held Accountable». Stanford Law School. [15]
  16. «Racial bias in psychiatric diagnosis and treatment with large language models». Nature Digital Medicine. [16]
  17. «Preprocessing Bias Mitigation». Holistic AI Documentation. [17]
  18. «EU AI Act: First Rules Take Effect on Prohibited AI Systems». Jones Day. [18]
  19. «Over 100 organizations signed up for Code of Ethics in AI by end of 2021». TASS. [19]