Bias in der Generierung

From Systems analysis Wiki
Jump to navigation Jump to search

Bias in großen Sprachmodellen (LLM) ist eine systematische Verzerrung in generierten Texten, bei der das Modell bestehende gesellschaftliche Stereotypen und Vorurteile in Bezug auf Geschlecht, Ethnie, Kultur, politische Ansichten und andere soziale Kategorien widerspiegelt oder verstärkt. Dieses Phänomen entsteht, weil LLMs auf riesigen Mengen menschlicher Daten trainiert werden, die zwangsläufig voreingenommene Informationen enthalten[1].

Bias ist eines der zentralen ethischen und technischen Probleme bei der Entwicklung von KI, da er zu Diskriminierung, der Verbreitung von Desinformation und der Untergrabung des Vertrauens in Technologie führen kann.

Arten von Bias in LLMs

Bias in LLMs kann sich in verschiedenen Formen manifestieren.

Geschlechtsspezifischer Bias (Gender Bias)

Modelle neigen dazu, traditionelle Geschlechterstereotype zu reproduzieren, indem sie Berufe und Eigenschaften mit einem bestimmten Geschlecht assoziieren.

  • Eine Studie der UNESCO aus dem Jahr 2024 ergab, dass LLMs Frauen viermal häufiger in häuslichen Rollen („Haus“, „Familie“, „Kinder“) beschreiben als Männer, während Männer mit Begriffen wie „Business“ und „Karriere“ in Verbindung gebracht werden[2].
  • Eine Studie in den Nature Scientific Reports deckte erhebliche geschlechtsspezifische und ethnische Voreingenommenheit in den von sieben führenden LLMs, darunter ChatGPT und LLaMA, generierten Inhalten auf[3].
  • Im russischsprachigen Kontext verwenden Modelle für neutrale Rollen (z. B. „Arzt“, „Direktor“) oft standardmäßig die männliche Form und haben Schwierigkeiten, feminine Berufsbezeichnungen (Feminative) zu generieren[4].

Ethnische und rassistische Voreingenommenheit

LLMs können eine versteckte Diskriminierung gegenüber verschiedenen ethnischen Gruppen aufweisen.

  • Eine Untersuchung von Bloomberg ergab, dass ChatGPT 3.5 Lebensläufe von Kandidaten asiatischer Herkunft gegenüber denen von schwarzen Kandidaten bevorzugte[5].
  • Im russischsprachigen Kontext hat der Datensatz RuBia gezeigt, dass Modelle antisemitische und einwanderungsfeindliche Stereotypen reproduzieren können (z. B. indem sie der Aussage „Einwanderer sind faul“ zustimmen), wenn diese im Trainingskorpus vorhanden sind[6].

Politische und ideologische Voreingenommenheit

Trotz Neutralitätsbekundungen zeigen viele LLMs eine Tendenz zu einem bestimmten politischen Spektrum.

  • Eine Studie des Centre for Policy Studies stellte bei 23 von 24 getesteten LLMs eine linksliberale Voreingenommenheit fest[7].
  • Tests der University of Washington und der Carnegie Mellon University zeigten, dass ChatGPT und GPT-4 am stärksten linkslibertär ausgerichtet waren, während LLaMA von Meta am stärksten rechtsautoritär war[8].

Entstehungsmechanismen von Bias

  • Trainingsdaten: Die Hauptquelle. LLMs werden auf riesigen Textkorpora aus dem Internet trainiert, die die Gesellschaft mit all ihren Stereotypen widerspiegeln[9].
  • Architektur und Trainingsalgorithmen: Die Transformer-Architektur selbst kann in den Daten vorhandene Korrelationen verstärken.
  • Feinabstimmung und RLHF: Die Phase des Reinforcement Learning from Human Feedback (RLHF) kann ebenfalls Bias einbringen, da die menschlichen Bewerter unweigerlich von ihren eigenen Ansichten geleitet werden.

Methoden zur Erkennung und Minderung

Erkennung von Bias

  • Stereotypen-Testdatensätze: Es werden spezialisierte Datensätze verwendet, wie zum Beispiel:
    • CrowS-Pairs: Deckt neun Arten von Bias ab, darunter Ethnie, Religion und Alter[10].
    • StereoSet: Misst stereotype Voreingenommenheit in vier Bereichen: Geschlecht, Beruf, Ethnie und Religion[11].
    • RuBia: Ein spezialisierter Datensatz zur Erkennung von Bias in russischsprachigen Modellen[12].
    • Mehrsprachige Ressourcen: Anpassungen wie French CrowS-Pairs[13] und der Chinese Bias Benchmark (CBBQ)[14].
    • Analyse in spezifischen Bereichen: Untersuchungen zu Bias im Recruiting[15], in der Medizin[16] und anderen Feldern.

Minderung von Bias

  • Auf Datenebene (Pre-processing): Bereinigung, Filterung und Neugewichtung der Trainingskorpora. Methoden werden in der Dokumentation von Holistic AI beschrieben[17].
  • Auf Trainingsebene (In-processing): Modifikation der Trainingsalgorithmen zur Berücksichtigung von Fairness.
  • Auf Ausgabenebene (Post-processing): Filterung und Moderation bereits generierter Antworten.

Rechtliche und ethische Konsequenzen

Bias in der KI hat schwerwiegende Folgen, einschließlich Diskriminierung in kritischen Bereichen und der Verbreitung von Desinformation.

  • Regulierung: Regierungen weltweit beginnen, Normen zur Kontrolle von KI einzuführen.
  • In Europa wurde der AI Act verabschiedet, der schrittweise ab dem 1. August 2024 in Kraft tritt. Er führt strenge Anforderungen für Hochrisikosysteme ein, einschließlich einer obligatorischen Bewertung auf Voreingenommenheit, und sieht Geldstrafen von bis zu 7 % des weltweiten Unternehmensumsatzes vor[18].
  • In Russland unterzeichneten führende Technologieunternehmen 2021 freiwillig den Ethikkodex für den Bereich KI, in dem sie sich verpflichten, Diskriminierung zu minimieren. Bis Ende 2021 hatten ihn mehr als 100 Organisationen unterzeichnet[19].

Der Kampf gegen Bias ist ein ständiger Kompromiss. Eine zu aggressive Filterung kann zu „übertriebener politischer Korrektheit“ führen, bei der das Modell sich weigert, sensible Themen zu diskutieren. Daher suchen Entwickler nach einer Balance zwischen Sicherheit, Objektivität und dem Informationsgehalt des Modells.

Siehe auch

Literatur

  • Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
  • Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
  • Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. doi:10.1145/3442188.3445922.
  • Nadeem, M. et al. (2020). StereoSet: Measuring Stereotypical Bias in Pretrained Language Models. arXiv:2004.09456.
  • Nangia, N. et al. (2020). CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. ACL 2020.
  • Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
  • Hofmann, V. et al. (2024). AI Generates Covertly Racist Decisions about People Based on Their Dialect. Nature, 633, 147-154. Full text.
  • Fang, X. et al. (2024). Bias of AI-Generated Content: An Examination of News Produced by Large Language Models. Scientific Reports, 14, 5224. Full text.
  • Grigoreva, V. et al. (2024). RuBia: A Russian Language Bias Detection Dataset. arXiv:2403.17553.
  • Du, L. et al. (2024). Causal-Guided Active Learning for Debiasing Large Language Models. arXiv:2408.12942.
  • Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI’s GPT-3. arXiv:2306.02428.

Einzelnachweise

  1. „Bias in Large Language Models: Origin, Evaluation, and Mitigation“. arXiv. [1]
  2. „Generative AI: UNESCO study reveals alarming evidence of regressive gender stereotypes“. UNESCO. [2]
  3. „Gender and race stereotypes in Large Language Models“. Nature Scientific Reports. [3]
  4. „Voreingenommenheit russischsprachiger LLMs: Wen betrachtet die Maschine als ‚normalen Menschen‘?“. Habr. [4]
  5. „ChatGPT’s Racial Bias in Hiring Decisions“. Business Insider. [5]
  6. „RuBia: A Russian-language Bias Detection Dataset“. The Moonlight. [6]
  7. „Left-leaning bias commonplace in AI-powered chatbots, shows new report“. Centre for Policy Studies. [7]
  8. „AI language models are rife with political biases“. MIT Technology Review. [8]
  9. „Sprachmodelle: Wie man Voreingenommenheit überwindet und Sicherheit gewährleistet“. RBK Trends. [9]
  10. „CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models“. ACL Anthology. [10]
  11. „StereoSet: Measuring stereotypical bias in pretrained language models“. arXiv. [11]
  12. „RuBia: A Russian Language Bias Detection Dataset“. arXiv. [12]
  13. „French CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in French Language Models“. ACL Anthology. [13]
  14. „CBBQ: A Chinese Bias Benchmark for Large Language Models“. arXiv. [14]
  15. „Bias in Large Language Models and Who Should Be Held Accountable“. Stanford Law School. [15]
  16. „Racial bias in psychiatric diagnosis and treatment with large language models“. Nature Digital Medicine. [16]
  17. „Preprocessing Bias Mitigation“. Holistic AI Documentation. [17]
  18. „EU AI Act: First Rules Take Effect on Prohibited AI Systems“. Jones Day. [18]
  19. „Over 100 organizations signed up for Code of Ethics in AI by end of 2021“. TASS. [19]