Generation bias (LLM) (BG)

From Systems analysis Wiki
Jump to navigation Jump to search

Предвзятост в големите езикови модели (LLM) — това е систематично изкривяване на генерираните текстове, при което моделът отразява или усилва съществуващите в обществото стереотипи и предразсъдъци, свързани с пола, расата, културата, политическите възгледи и други социални категории. Това явление възниква поради това, че LLM се обучават върху огромни масиви от човешки данни, които неизбежно съдържат предвзета информация[1].

Предвзятостта е един от ключовите етични и технически проблеми в разработването на ИИ, тъй като може да води до дискриминация, разпространение на дезинформация и подкопаване на доверието към технологиите.

Видове предвзятост в LLM

Предвзятостта в LLM може да се проявява в различни форми.

Полова предвзятост

Моделите са склонни да възпроизвеждат традиционни полови стереотипи, свързвайки професии и характеристики с определен пол.

  • Изследване на ЮНЕСКО от 2024 година показа, че LLM четири пъти по-често описват жените в домашни роли („дом", „семейство", „деца"), отколкото мъжете, а мъжете се асоциират с понятията „бизнес" и „кариера"[2].
  • Изследване в Nature Scientific Reports установи съществена полова и расова предвзятост в съдържанието, генерирано от седем водещи LLM, включително ChatGPT и LLaMA[3].
  • В българскоезичния контекст моделите често по подразбиране използват мъжки род за неутрални роли (например „лекар", „директор") и трудно генерират феминитиви[4].

Расова и етническа предвзятост

LLM могат да проявяват скрита дискриминация по отношение на различни етнически групи.

  • Изследване на Bloomberg показа, че ChatGPT 3.5 предпочита автобиографии на кандидати от азиатски произход пред тези на чернокожи[5].
  • В руско­езичния контекст dataset RuBia установи, че моделите могат да възпроизвеждат антисемитски и антиимигрантски стереотипи (например като се съгласяват с твърдението „имигрантите са мързеливи"), ако те присъстват в обучителния корпус[6].

Политическа и идеологическа предвзятост

Въпреки декларираната неутралност, много LLM демонстрират склонност към определен политически спектър.

  • Изследване на Centre for Policy Studies установи лявo-либерална предвзятост при 23 от 24 тествани LLM[7].
  • Тестване от Университета на Вашингтон и Карнеги Мелон показа, че ChatGPT и GPT-4 са най-лявo-либертариански, докато LLaMA на Meta е най-дясно-авторитарен[8].

Механизми на възникване на предвзятост

  • Обучителни данни: Главен източник. LLM се обучават върху огромни корпуси от текстове от интернет, които са „огледало" на обществото с всичките му стереотипи[9].
  • Архитектура и алгоритми за обучение: Самата архитектура на transformer може да усилва съществуващите в данните корелации.
  • Fine-tuning и RLHF: Етапът на Reinforcement Learning от човек (RLHF) също може да внася предвзятост, тъй като хората-оценители неизбежно се ръководят от собствените си възгледи.

Методи за откриване и смекчаване

Откриване на предвзятост

  • Тестови набори от стереотипи: Използват се специализирани dataset-и, като:
    • CrowS-Pairs: Обхваща девет вида предвзятост, включително раса, религия и възраст[10].
    • StereoSet: Измерва стереотипната предвзятост в четири домейна: пол, професия, раса и религия[11].
    • RuBia: Специализиран dataset за откриване на предвзятост в руско­езичните модели[12].
    • Многоезични ресурси: Адаптации като French CrowS-Pairs[13] и Chinese Bias Benchmark (CBBQ)[14].
    • Анализ в конкретни области: Изследвания на предвзятостта в подбора на персонал[15], медицината[16] и други сфери.

Смекчаване на предвзятост

  • На ниво данни (Pre-processing): Почистване, филтриране и ребалансиране на обучителните корпуси. Методите са описани в документацията на Holistic AI[17].
  • На ниво обучение (In-processing): Модификация на алгоритмите за обучение с оглед на справедливостта.
  • На ниво извод (Post-processing): Филтриране и модериране на вече генерираните отговори.

Правни и етични последствия

Предвзятостта в ИИ има сериозни последствия, включително дискриминация в критично важни области и разпространение на дезинформация.

  • Регулиране: Правителства по целия свят започват да въвеждат норми за контрол върху ИИ.
  • В Европа е приет AI Act, който влиза в сила поетапно от 1 август 2024 година. Той въвежда строги изисквания за системи с висок риск, включително задължителна оценка за предвзятост, и предвижда глоби до 7% от световния оборот на компанията[18].
  • В Русия през 2021 година водещи технологични компании подписаха доброволен Кодекс за етика в сферата на ИИ, като се ангажираха да минимизират дискриминацията. До края на 2021 година той беше подписан от над 100 организации[19].

Борбата с предвзятостта е постоянен компромис. Прекалено агресивната филтрация може да доведе до „прекомерна политическа коректност", при която моделът отказва да обсъжда каквито и да е чувствителни теми. Затова разработчиците търсят баланс между безопасност, обективност и информативност на модела.

Литература

  • Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
  • Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
  • Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. doi:10.1145/3442188.3445922.
  • Nadeem, M. et al. (2020). StereoSet: Measuring Stereotypical Bias in Pretrained Language Models. arXiv:2004.09456.
  • Nangia, N. et al. (2020). CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. ACL 2020.
  • Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
  • Hofmann, V. et al. (2024). AI Generates Covertly Racist Decisions about People Based on Their Dialect. Nature, 633, 147-154. Full text.
  • Fang, X. et al. (2024). Bias of AI-Generated Content: An Examination of News Produced by Large Language Models. Scientific Reports, 14, 5224. Full text.
  • Grigoreva, V. et al. (2024). RuBia: A Russian Language Bias Detection Dataset. arXiv:2403.17553.
  • Du, L. et al. (2024). Causal-Guided Active Learning for Debiasing Large Language Models. arXiv:2408.12942.
  • Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.

Вижте също

  • Големи езикови модели

Бележки

  1. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [1]
  2. «Generative AI: UNESCO study reveals alarming evidence of regressive gender stereotypes». UNESCO. [2]
  3. «Gender and race stereotypes in Large Language Models». Nature Scientific Reports. [3]
  4. «Предвзятость русскоязычных LLM: кого машина считает «обычным человеком»?». Хабр. [4]
  5. «ChatGPT’s Racial Bias in Hiring Decisions». Business Insider. [5]
  6. «RuBia: A Russian-language Bias Detection Dataset». The Moonlight. [6]
  7. «Left-leaning bias commonplace in AI-powered chatbots, shows new report». Centre for Policy Studies. [7]
  8. «AI language models are rife with political biases». MIT Technology Review. [8]
  9. «Языковые модели: как преодолеть предвзятость и обеспечить безопасность». РБК Тренды. [9]
  10. «CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models». ACL Anthology. [10]
  11. «StereoSet: Measuring stereotypical bias in pretrained language models». arXiv. [11]
  12. «RuBia: A Russian Language Bias Detection Dataset». arXiv. [12]
  13. «French CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in French Language Models». ACL Anthology. [13]
  14. «CBBQ: A Chinese Bias Benchmark for Large Language Models». arXiv. [14]
  15. «Bias in Large Language Models and Who Should Be Held Accountable». Stanford Law School. [15]
  16. «Racial bias in psychiatric diagnosis and treatment with large language models». Nature Digital Medicine. [16]
  17. «Preprocessing Bias Mitigation». Holistic AI Documentation. [17]
  18. «EU AI Act: First Rules Take Effect on Prohibited AI Systems». Jones Day. [18]
  19. «Over 100 organizations signed up for Code of Ethics in AI by end of 2021». TASS. [19]