Generation bias (LLM) (VI)

From Systems analysis Wiki
Jump to navigation Jump to search

Sự thiên lệch trong các mô hình ngôn ngữ lớn (LLM) là sự bóp méo có hệ thống trong các văn bản được sinh ra, trong đó mô hình phản ánh hoặc khuếch đại các khuôn mẫu và định kiến xã hội hiện có liên quan đến giới tính, chủng tộc, văn hóa, quan điểm chính trị và các phạm trù xã hội khác. Hiện tượng này phát sinh do LLM được huấn luyện trên khối lượng dữ liệu khổng lồ của con người, vốn không thể tránh khỏi việc chứa đựng thông tin mang tính thiên lệch[1].

Sự thiên lệch là một trong những vấn đề đạo đức và kỹ thuật trọng yếu trong phát triển AI, vì nó có thể dẫn đến phân biệt đối xử, lan truyền thông tin sai lệch và làm xói mòn niềm tin vào công nghệ.

Các loại thiên lệch trong LLM

Sự thiên lệch trong LLM có thể biểu hiện dưới nhiều hình thức khác nhau.

Thiên lệch giới tính

Các mô hình có xu hướng tái tạo các khuôn mẫu giới tính truyền thống, gán nghề nghiệp và đặc điểm cho một giới tính nhất định.

  • Nghiên cứu của UNESCO năm 2024 cho thấy LLM mô tả phụ nữ trong các vai trò gia đình («nhà», «gia đình», «con cái») nhiều gấp bốn lần so với nam giới, trong khi nam giới được liên kết với các khái niệm «kinh doanh» và «sự nghiệp»[2].
  • Nghiên cứu trên Nature Scientific Reports phát hiện sự thiên lệch đáng kể về giới tính và chủng tộc trong nội dung được sinh ra bởi bảy LLM hàng đầu, bao gồm ChatGPT và LLaMA[3].
  • Trong ngữ cảnh tiếng Nga, các mô hình thường mặc định sử dụng giống đực cho các vai trò trung tính (ví dụ: «bác sĩ», «giám đốc») và gặp khó khăn khi sinh ra các dạng từ giống cái[4].

Thiên lệch chủng tộc và sắc tộc

LLM có thể biểu hiện sự phân biệt đối xử tiềm ẩn đối với các nhóm dân tộc khác nhau.

  • Nghiên cứu của Bloomberg cho thấy ChatGPT 3.5 ưu tiên hồ sơ của ứng viên gốc châu Á hơn so với ứng viên da đen[5].
  • Trong ngữ cảnh tiếng Nga, dataset RuBia phát hiện rằng các mô hình có thể tái tạo các khuôn mẫu bài Do Thái và bài nhập cư (ví dụ: đồng ý với tuyên bố «người nhập cư lười biếng»), nếu chúng xuất hiện trong kho dữ liệu huấn luyện[6].

Thiên lệch chính trị và ý thức hệ

Bất chấp các tuyên bố về tính trung lập, nhiều LLM thể hiện xu hướng nghiêng về một phổ chính trị nhất định.

  • Nghiên cứu của Centre for Policy Studies phát hiện thiên lệch tả-tự do ở 23 trong số 24 LLM được kiểm tra[7].
  • Kiểm tra của Đại học Washington và Carnegie Mellon cho thấy ChatGPT và GPT-4 có xu hướng tự do cánh tả nhất, trong khi LLaMA của Meta có xu hướng độc đoán cánh hữu nhất[8].

Cơ chế hình thành thiên lệch

  • Dữ liệu huấn luyện: Nguồn gốc chính. LLM được huấn luyện trên các kho văn bản khổng lồ từ internet, vốn là «tấm gương» phản chiếu xã hội với tất cả các khuôn mẫu của nó[9].
  • Kiến trúc và thuật toán huấn luyện: Bản thân kiến trúc transformer có thể khuếch đại các mối tương quan hiện có trong dữ liệu.
  • Fine-tuning và RLHF: Giai đoạn Reinforcement Learning from Human Feedback (RLHF) cũng có thể đưa vào thiên lệch, vì những người đánh giá không thể tránh khỏi việc bị ảnh hưởng bởi quan điểm cá nhân của họ.

Phương pháp phát hiện và giảm thiểu

Phát hiện thiên lệch

  • Bộ dữ liệu kiểm tra khuôn mẫu: Sử dụng các dataset chuyên biệt, chẳng hạn như:
    • CrowS-Pairs: Bao gồm chín loại thiên lệch, trong đó có chủng tộc, tôn giáo và độ tuổi[10].
    • StereoSet: Đo lường thiên lệch khuôn mẫu trong bốn lĩnh vực: giới tính, nghề nghiệp, chủng tộc và tôn giáo[11].
    • RuBia: Dataset chuyên biệt để phát hiện thiên lệch trong các mô hình tiếng Nga[12].
    • Tài nguyên đa ngôn ngữ: Các phiên bản thích nghi như French CrowS-Pairs[13]Chinese Bias Benchmark (CBBQ)[14].
    • Phân tích trong các lĩnh vực cụ thể: Nghiên cứu thiên lệch trong tuyển dụng[15], y tế[16] và các lĩnh vực khác.

Giảm thiểu thiên lệch

  • Ở cấp độ dữ liệu (Pre-processing): Làm sạch, lọc và tái cân bằng các kho dữ liệu huấn luyện. Các phương pháp được mô tả trong tài liệu của Holistic AI[17].
  • Ở cấp độ huấn luyện (In-processing): Sửa đổi các thuật toán huấn luyện để tính đến tính công bằng.
  • Ở cấp độ đầu ra (Post-processing): Lọc và kiểm duyệt các câu trả lời đã được sinh ra.

Hậu quả pháp lý và đạo đức

Sự thiên lệch trong AI có những hậu quả nghiêm trọng, bao gồm phân biệt đối xử trong các lĩnh vực quan trọng và lan truyền thông tin sai lệch.

  • Quy định: Các chính phủ trên toàn thế giới bắt đầu ban hành các quy chuẩn để kiểm soát AI.
  • Ở châu Âu, AI Act đã được thông qua, có hiệu lực theo từng giai đoạn từ ngày 1 tháng 8 năm 2024. Văn bản này đưa ra các yêu cầu nghiêm ngặt đối với các hệ thống rủi ro cao, bao gồm đánh giá thiên lệch bắt buộc, và quy định mức phạt lên tới 7% doanh thu toàn cầu của công ty[18].
  • Tại Nga vào năm 2021, các công ty công nghệ hàng đầu đã ký kết Bộ quy tắc đạo đức trong lĩnh vực AI tự nguyện, cam kết giảm thiểu phân biệt đối xử. Đến cuối năm 2021, hơn 100 tổ chức đã ký kết văn bản này[19].

Cuộc chiến chống thiên lệch là một sự đánh đổi liên tục. Việc lọc quá mức có thể dẫn đến «sự chính xác chính trị thái quá», khi mô hình từ chối thảo luận bất kỳ chủ đề nhạy cảm nào. Do đó, các nhà phát triển tìm kiếm sự cân bằng giữa tính an toàn, tính khách quan và tính thông tin của mô hình.

Tài liệu tham khảo

  • Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
  • Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
  • Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. doi:10.1145/3442188.3445922.
  • Nadeem, M. et al. (2020). StereoSet: Measuring Stereotypical Bias in Pretrained Language Models. arXiv:2004.09456.
  • Nangia, N. et al. (2020). CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. ACL 2020.
  • Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
  • Hofmann, V. et al. (2024). AI Generates Covertly Racist Decisions about People Based on Their Dialect. Nature, 633, 147-154. Full text.
  • Fang, X. et al. (2024). Bias of AI-Generated Content: An Examination of News Produced by Large Language Models. Scientific Reports, 14, 5224. Full text.
  • Grigoreva, V. et al. (2024). RuBia: A Russian Language Bias Detection Dataset. arXiv:2403.17553.
  • Du, L. et al. (2024). Causal-Guided Active Learning for Debiasing Large Language Models. arXiv:2408.12942.
  • Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.

Xem thêm

  • Mô hình ngôn ngữ lớn

Chú thích

  1. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [1]
  2. «Generative AI: UNESCO study reveals alarming evidence of regressive gender stereotypes». UNESCO. [2]
  3. «Gender and race stereotypes in Large Language Models». Nature Scientific Reports. [3]
  4. «Предвзятость русскоязычных LLM: кого машина считает «обычным человеком»?». Хабр. [4]
  5. «ChatGPT’s Racial Bias in Hiring Decisions». Business Insider. [5]
  6. «RuBia: A Russian-language Bias Detection Dataset». The Moonlight. [6]
  7. «Left-leaning bias commonplace in AI-powered chatbots, shows new report». Centre for Policy Studies. [7]
  8. «AI language models are rife with political biases». MIT Technology Review. [8]
  9. «Языковые модели: как преодолеть предвзятость и обеспечить безопасность». РБК Тренды. [9]
  10. «CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models». ACL Anthology. [10]
  11. «StereoSet: Measuring stereotypical bias in pretrained language models». arXiv. [11]
  12. «RuBia: A Russian Language Bias Detection Dataset». arXiv. [12]
  13. «French CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in French Language Models». ACL Anthology. [13]
  14. «CBBQ: A Chinese Bias Benchmark for Large Language Models». arXiv. [14]
  15. «Bias in Large Language Models and Who Should Be Held Accountable». Stanford Law School. [15]
  16. «Racial bias in psychiatric diagnosis and treatment with large language models». Nature Digital Medicine. [16]
  17. «Preprocessing Bias Mitigation». Holistic AI Documentation. [17]
  18. «EU AI Act: First Rules Take Effect on Prohibited AI Systems». Jones Day. [18]
  19. «Over 100 organizations signed up for Code of Ethics in AI by end of 2021». TASS. [19]