Generation bias (LLM) (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

อคติในโมเดลภาษาขนาดใหญ่ (LLM) คือการบิดเบือนอย่างเป็นระบบในข้อความที่สร้างขึ้น ซึ่งโมเดลสะท้อนหรือขยายอคติและภาพจำแผ่นเสียงที่มีอยู่ในสังคม เกี่ยวกับเพศสภาพ เชื้อชาติ วัฒนธรรม มุมมองทางการเมือง และหมวดหมู่ทางสังคมอื่นๆ ปรากฏการณ์นี้เกิดขึ้นเนื่องจาก LLM ได้รับการฝึกฝนบนชุดข้อมูลขนาดใหญ่จากมนุษย์ ซึ่งหลีกเลี่ยงไม่ได้ที่จะมีข้อมูลที่มีอคติ[1].

อคติถือเป็นหนึ่งในปัญหาด้านจริยธรรมและเทคนิคที่สำคัญในการพัฒนา AI เนื่องจากอาจนำไปสู่การเลือกปฏิบัติ การแพร่กระจายข้อมูลบิดเบือน และการสูญเสียความไว้วางใจในเทคโนโลยี

ประเภทของอคติใน LLM

อคติใน LLM อาจปรากฏในรูปแบบต่างๆ

อคติทางเพศสภาพ

โมเดลมีแนวโน้มที่จะผลิตซ้ำภาพจำแผ่นเสียงทางเพศสภาพแบบดั้งเดิม โดยเชื่อมโยงอาชีพและคุณลักษณะกับเพศใดเพศหนึ่ง

  • การศึกษาของ UNESCO ในปี 2024 พบว่า LLM บรรยายผู้หญิงในบทบาทภายในบ้าน («บ้าน», «ครอบครัว», «เด็ก») มากกว่าผู้ชายถึงสี่เท่า ในขณะที่ผู้ชายมักถูกเชื่อมโยงกับแนวคิด «ธุรกิจ» และ «อาชีพ»[2].
  • การศึกษาใน Nature Scientific Reports ตรวจพบอคติทางเพศสภาพและเชื้อชาติอย่างมีนัยสำคัญในเนื้อหาที่สร้างโดย LLM ชั้นนำเจ็ดตัว รวมถึง ChatGPT และ LLaMA[3].
  • ในบริบทภาษาอื่นๆ โมเดลมักใช้รูปแบบที่เป็นกลางหรือรูปแบบเพศใดเพศหนึ่งโดยค่าเริ่มต้นสำหรับบทบาทที่เป็นกลาง และประสบปัญหาในการสร้างคำที่ระบุเพศสภาพ[4].

อคติทางเชื้อชาติและชาติพันธุ์

LLM อาจแสดงการเลือกปฏิบัติอย่างแอบแฝงต่อกลุ่มชาติพันธุ์ต่างๆ

  • การศึกษาของ Bloomberg พบว่า ChatGPT 3.5 ให้ความสำคัญกับประวัติย่อของผู้สมัครที่มีเชื้อสายเอเชียมากกว่าเชื้อสายแอฟริกัน[5].
  • dataset RuBia เปิดเผยว่าโมเดลอาจผลิตซ้ำภาพจำแผ่นเสียงที่เป็นปฏิปักษ์ต่อกลุ่มชาติพันธุ์และผู้อพยพ (เช่น การยอมรับข้อความที่ว่า «ผู้อพยพขี้เกียจ») หากสิ่งเหล่านั้นมีอยู่ใน corpus การฝึก[6].

อคติทางการเมืองและอุดมการณ์

แม้จะมีการประกาศความเป็นกลาง แต่ LLM หลายตัวแสดงให้เห็นถึงแนวโน้มในการเอนเอียงไปทางกลุ่มการเมืองบางกลุ่ม

  • การศึกษาของ Centre for Policy Studies พบอคติแบบเสรีนิยมฝ่ายซ้ายใน 23 จาก 24 LLM ที่ทดสอบ[7].
  • การทดสอบของมหาวิทยาลัยวอชิงตันและ Carnegie Mellon พบว่า ChatGPT และ GPT-4 มีแนวโน้มเสรีนิยม-ซ้ายมากที่สุด ในขณะที่ LLaMA จาก Meta มีแนวโน้มอำนาจนิยม-ขวามากที่สุด[8].

กลไกการเกิดอคติ

  • ข้อมูลการฝึก: แหล่งที่มาหลัก LLM ได้รับการฝึกบน corpus ข้อความขนาดใหญ่จากอินเทอร์เน็ต ซึ่งเป็น «กระจกสะท้อน» ของสังคมพร้อมกับภาพจำแผ่นเสียงทั้งหมด[9].
  • สถาปัตยกรรมและอัลกอริทึมการฝึก: สถาปัตยกรรม transformer เองก็อาจขยายความสัมพันธ์ที่มีอยู่ในข้อมูล
  • Fine-tuning และ RLHF: ขั้นตอน Reinforcement Learning from Human Feedback (RLHF) ก็อาจนำอคติเข้ามาได้เช่นกัน เนื่องจากผู้ประเมินที่เป็นมนุษย์หลีกเลี่ยงไม่ได้ที่จะได้รับอิทธิพลจากมุมมองของตนเอง

วิธีการตรวจจับและลดอคติ

การตรวจจับอคติ

  • ชุดทดสอบ stereotype: ใช้ dataset เฉพาะทาง เช่น:
    • CrowS-Pairs: ครอบคลุมอคติเก้าประเภท รวมถึงเชื้อชาติ ศาสนา และอายุ[10].
    • StereoSet: วัดอคติแบบ stereotype ในสี่โดเมน ได้แก่ เพศสภาพ อาชีพ เชื้อชาติ และศาสนา[11].
    • RuBia: dataset เฉพาะทางสำหรับตรวจจับอคติในโมเดลภาษา[12].
    • ทรัพยากรหลายภาษา: การดัดแปลง เช่น French CrowS-Pairs[13] และ Chinese Bias Benchmark (CBBQ)[14].
    • การวิเคราะห์ในด้านเฉพาะ: การศึกษาอคติในการสรรหาบุคลากร[15] การแพทย์[16] และด้านอื่นๆ

การลดอคติ

  • ระดับข้อมูล (Pre-processing): การทำความสะอาด กรอง และปรับสมดุล corpus การฝึก วิธีการอธิบายไว้ในเอกสารของ Holistic AI[17].
  • ระดับการฝึก (In-processing): การปรับเปลี่ยนอัลกอริทึมการฝึกเพื่อคำนึงถึงความเป็นธรรม
  • ระดับการอนุมาน (Post-processing): การกรองและกลั่นกรองคำตอบที่สร้างขึ้นแล้ว

ผลกระทบทางกฎหมายและจริยธรรม

อคติใน AI มีผลกระทบร้ายแรง รวมถึงการเลือกปฏิบัติในด้านที่มีความสำคัญสูงและการแพร่กระจายข้อมูลบิดเบือน

  • การกำกับดูแล: รัฐบาลทั่วโลกเริ่มนำกฎระเบียบมาใช้เพื่อควบคุม AI
  • ในยุโรปได้มีการประกาศใช้ AI Act ซึ่งมีผลบังคับใช้เป็นระยะตั้งแต่วันที่ 1 สิงหาคม 2024 โดยกำหนดข้อกำหนดที่เข้มงวดสำหรับระบบความเสี่ยงสูง รวมถึงการประเมินอคติภาคบังคับ และกำหนดโทษปรับสูงถึง 7% ของยอดขายทั่วโลกของบริษัท[18].
  • ในปี 2021 บริษัทเทคโนโลยีชั้นนำได้ลงนามใน จรรยาบรรณด้าน AI โดยสมัครใจ โดยให้คำมั่นที่จะลดการเลือกปฏิบัติให้น้อยที่สุด ภายในสิ้นปี 2021 มีองค์กรมากกว่า 100 แห่งที่ได้ลงนาม[19].

การต่อสู้กับอคติเป็นการประนีประนอมอย่างต่อเนื่อง การกรองที่รุนแรงเกินไปอาจนำไปสู่ «ความเป็นการเมืองที่ถูกต้องมากเกินไป» เมื่อโมเดลปฏิเสธที่จะพูดคุยเกี่ยวกับหัวข้อที่ละเอียดอ่อนใดๆ ดังนั้นนักพัฒนาจึงแสวงหาความสมดุลระหว่างความปลอดภัย ความเป็นกลาง และความมีข้อมูลของโมเดล

วรรณกรรม

  • Guo, Y. et al. (2024). Bias in Large Language Models: Origin, Evaluation, and Mitigation. arXiv:2411.10915.
  • Gallegos, I. O. et al. (2023). Bias and Fairness in Large Language Models: A Survey. arXiv:2309.00770.
  • Bender, E. M. et al. (2021). On the Dangers of Stochastic Parrots: Can Language Models Be Too Big?. doi:10.1145/3442188.3445922.
  • Nadeem, M. et al. (2020). StereoSet: Measuring Stereotypical Bias in Pretrained Language Models. arXiv:2004.09456.
  • Nangia, N. et al. (2020). CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models. ACL 2020.
  • Bai, X. et al. (2024). Measuring Implicit Bias in Explicitly Unbiased Large Language Models. arXiv:2402.04105.
  • Hofmann, V. et al. (2024). AI Generates Covertly Racist Decisions about People Based on Their Dialect. Nature, 633, 147-154. Full text.
  • Fang, X. et al. (2024). Bias of AI-Generated Content: An Examination of News Produced by Large Language Models. Scientific Reports, 14, 5224. Full text.
  • Grigoreva, V. et al. (2024). RuBia: A Russian Language Bias Detection Dataset. arXiv:2403.17553.
  • Du, L. et al. (2024). Causal-Guided Active Learning for Debiasing Large Language Models. arXiv:2408.12942.
  • Ayaz, A. et al. (2023). Taught by the Internet: Exploring Bias in OpenAI's GPT-3. arXiv:2306.02428.

ดูเพิ่มเติม

  • โมเดลภาษาขนาดใหญ่

หมายเหตุ

  1. «Bias in Large Language Models: Origin, Evaluation, and Mitigation». arXiv. [1]
  2. «Generative AI: UNESCO study reveals alarming evidence of regressive gender stereotypes». UNESCO. [2]
  3. «Gender and race stereotypes in Large Language Models». Nature Scientific Reports. [3]
  4. «Предвзятость русскоязычных LLM: кого машина считает «обычным человеком»?». Хабр. [4]
  5. «ChatGPT’s Racial Bias in Hiring Decisions». Business Insider. [5]
  6. «RuBia: A Russian-language Bias Detection Dataset». The Moonlight. [6]
  7. «Left-leaning bias commonplace in AI-powered chatbots, shows new report». Centre for Policy Studies. [7]
  8. «AI language models are rife with political biases». MIT Technology Review. [8]
  9. «Языковые модели: как преодолеть предвзятость и обеспечить безопасность». РБК Тренды. [9]
  10. «CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models». ACL Anthology. [10]
  11. «StereoSet: Measuring stereotypical bias in pretrained language models». arXiv. [11]
  12. «RuBia: A Russian Language Bias Detection Dataset». arXiv. [12]
  13. «French CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in French Language Models». ACL Anthology. [13]
  14. «CBBQ: A Chinese Bias Benchmark for Large Language Models». arXiv. [14]
  15. «Bias in Large Language Models and Who Should Be Held Accountable». Stanford Law School. [15]
  16. «Racial bias in psychiatric diagnosis and treatment with large language models». Nature Digital Medicine. [16]
  17. «Preprocessing Bias Mitigation». Holistic AI Documentation. [17]
  18. «EU AI Act: First Rules Take Effect on Prohibited AI Systems». Jones Day. [18]
  19. «Over 100 organizations signed up for Code of Ethics in AI by end of 2021». TASS. [19]