Generation bias (LLM) (RO)

From Systems analysis Wiki
Jump to navigation Jump to search

Părtinirea în modelele lingvistice mari (LLM) reprezintă o distorsiune sistematică a textelor generate, prin care modelul reflectă sau amplifică stereotipurile și prejudecățile existente în societate, legate de gen, rasă, cultură, opinii politice și alte categorii sociale. Acest fenomen apare deoarece LLM-urile sunt antrenate pe volume imense de date umane, care conțin inevitabil informații părtinite[1].

Părtinirea reprezintă una dintre problemele etice și tehnice cheie în dezvoltarea IA, deoarece poate conduce la discriminare, răspândirea dezinformării și subminarea încrederii în tehnologii.

Tipuri de părtinire în LLM

Părtinirea în LLM se poate manifesta în diverse forme.

Părtinirea de gen

Modelele tind să reproducă stereotipurile tradiționale de gen, asociind profesii și caracteristici cu un anumit sex.

  • Un studiu UNESCO din 2024 a arătat că LLM-urile descriu femeile în roluri casnice („casă", „familie", „copii") de patru ori mai frecvent decât bărbații, iar bărbații sunt asociați cu noțiunile de „afaceri" și „carieră"[2].
  • Un studiu publicat în Nature Scientific Reports a identificat o părtinire semnificativă de gen și rasă în conținutul generat de șapte LLM-uri de top, inclusiv ChatGPT și LLaMA[3].
  • În contextul limbii ruse, modelele folosesc adesea implicit genul masculin pentru roluri neutre (de exemplu, „medic", „director") și au dificultăți în a genera forme feminine[4].

Părtinirea rasială și etnică

LLM-urile pot manifesta discriminare latentă față de diverse grupuri etnice.

  • Un studiu Bloomberg a arătat că ChatGPT 3.5 acorda preferință CV-urilor candidaților de origine asiatică față de cei de culoare[5].
  • În contextul limbii ruse, dataset-ul RuBia a evidențiat că modelele pot reproduce stereotipuri antisemite și antiimigranți (de exemplu, acceptând afirmația „imigranții sunt leneși"), dacă acestea sunt prezente în corpusul de antrenament[6].

Părtinirea politică și ideologică

În ciuda declarațiilor de neutralitate, multe LLM-uri demonstrează o înclinație spre un anumit spectru politic.

  • Un studiu al Centre for Policy Studies a identificat o părtinire de stânga-liberală la 23 din 24 de LLM-uri testate[7].
  • Testele efectuate de Universitatea din Washington și Carnegie Mellon au arătat că ChatGPT și GPT-4 au fost cele mai pronunțat libertariene de stânga, în timp ce LLaMA de la Meta a fost cel mai autoritar de dreapta[8].

Mecanisme de apariție a părtinirii

  • Date de antrenament: Principala sursă. LLM-urile sunt antrenate pe corpusuri imense de texte din internet, care reprezintă o „oglindă" a societății cu toate stereotipurile sale[9].
  • Arhitectura și algoritmii de antrenament: Arhitectura transformer în sine poate amplifica corelațiile existente în date.
  • Fine-tuning și RLHF: Etapa de Reinforcement Learning from Human Feedback (RLHF) poate introduce, de asemenea, părtinire, deoarece evaluatorii umani se ghidează inevitabil după propriile convingeri.

Metode de detectare și atenuare

Detectarea părtinirii

  • Seturi de date pentru testarea stereotipurilor: Se utilizează dataset-uri specializate, precum:
    • CrowS-Pairs: Acoperă nouă tipuri de părtinire, inclusiv rasă, religie și vârstă[10].
    • StereoSet: Măsoară părtinirea stereotipică în patru domenii: gen, profesie, rasă și religie[11].
    • RuBia: Dataset specializat pentru detectarea părtinirii în modelele de limbă rusă[12].
    • Resurse multilingve: Adaptări precum French CrowS-Pairs[13] și Chinese Bias Benchmark (CBBQ)[14].
    • Analiză în domenii specifice: Studii privind părtinirea în recrutare[15], medicină[16] și alte sectoare.

Atenuarea părtinirii

  • La nivelul datelor (Pre-processing): Curățarea, filtrarea și reechilibrarea corpusurilor de antrenament. Metodele sunt descrise în documentația Holistic AI[17].
  • La nivelul antrenamentului (In-processing): Modificarea algoritmilor de antrenament pentru a lua în considerare echitatea.
  • La nivelul inferenței (Post-processing): Filtrarea și moderarea răspunsurilor deja generate.

Consecințe juridice și etice

Părtinirea în IA are consecințe grave, inclusiv discriminarea în domenii critice și răspândirea dezinformării.

  • Reglementare: Guvernele din întreaga lume încep să introducă norme pentru controlul IA.
  • În Europa a fost adoptat AI Act, care intră în vigoare etapizat începând cu 1 august 2024. Acesta introduce cerințe stricte pentru sistemele cu risc ridicat, inclusiv evaluarea obligatorie a părtinirii, și prevede amenzi de până la 7% din cifra de afaceri globală a companiei[18].
  • În Rusia, în 2021, principalele companii tehnologice au semnat voluntar Codul de etică în domeniul IA, angajându-se să minimizeze discriminarea. Până la sfârșitul anului 2021, documentul a fost semnat de peste 100 de organizații[19].

Lupta împotriva părtinirii reprezintă un compromis permanent. O filtrare prea agresivă poate conduce la o „corectitudine politică excesivă", când modelul refuză să discute orice subiect sensibil. De aceea, dezvoltatorii caută un echilibru între siguranța, obiectivitatea și caracterul informativ al modelului.

Bibliografie

  • Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
  • Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
  • Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. doi:10.1145/3442188.3445922.
  • Nadeem, M. et al. (2020). StereoSet: Measuring Stereotypical Bias in Pretrained Language Models. arXiv:2004.09456.
  • Nangia, N. et al. (2020). CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. ACL 2020.
  • Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
  • Hofmann, V. et al. (2024). AI Generates Covertly Racist Decisions about People Based on Their Dialect. Nature, 633, 147-154. Full text.
  • Fang, X. et al. (2024). Bias of AI-Generated Content: An Examination of News Produced by Large Language Models. Scientific Reports, 14, 5224. Full text.
  • Grigoreva, V. et al. (2024). RuBia: A Russian Language Bias Detection Dataset. arXiv:2403.17553.
  • Du, L. et al. (2024). Causal-Guided Active Learning for Debiasing Large Language Models. arXiv:2408.12942.
  • Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.

Vezi și

  • Modele lingvistice mari

Note

  1. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [1]
  2. «Generative AI: UNESCO study reveals alarming evidence of regressive gender stereotypes». UNESCO. [2]
  3. «Gender and race stereotypes in Large Language Models». Nature Scientific Reports. [3]
  4. «Предвзятость русскоязычных LLM: кого машина считает «обычным человеком»?». Хабр. [4]
  5. «ChatGPT’s Racial Bias in Hiring Decisions». Business Insider. [5]
  6. «RuBia: A Russian-language Bias Detection Dataset». The Moonlight. [6]
  7. «Left-leaning bias commonplace in AI-powered chatbots, shows new report». Centre for Policy Studies. [7]
  8. «AI language models are rife with political biases». MIT Technology Review. [8]
  9. «Языковые модели: как преодолеть предвзятость и обеспечить безопасность». РБК Тренды. [9]
  10. «CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models». ACL Anthology. [10]
  11. «StereoSet: Measuring stereotypical bias in pretrained language models». arXiv. [11]
  12. «RuBia: A Russian Language Bias Detection Dataset». arXiv. [12]
  13. «French CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in French Language Models». ACL Anthology. [13]
  14. «CBBQ: A Chinese Bias Benchmark for Large Language Models». arXiv. [14]
  15. «Bias in Large Language Models and Who Should Be Held Accountable». Stanford Law School. [15]
  16. «Racial bias in psychiatric diagnosis and treatment with large language models». Nature Digital Medicine. [16]
  17. «Preprocessing Bias Mitigation». Holistic AI Documentation. [17]
  18. «EU AI Act: First Rules Take Effect on Prohibited AI Systems». Jones Day. [18]
  19. «Over 100 organizations signed up for Code of Ethics in AI by end of 2021». TASS. [19]