BBQ (Bias Benchmark for Question Answering) (TH)

From Systems analysis Wiki
Jump to navigation Jump to search

BBQ (Bias Benchmark for Question Answering) — คือ ชุดข้อมูล สำหรับประเมิน อคติทางสังคม (bias) ในระบบถาม-ตอบ (QA)[1] ชุดข้อมูลนี้ถูกพัฒนาโดยกลุ่มนักวิจัยจากมหาวิทยาลัยนิวยอร์กภายใต้การนำของ Alicia Parrish และได้รับการเผยแพร่ในปี 2022 ในการประชุม ACL Findings[1][2] เป้าหมายของ BBQ คือการค้นหาว่า โมเดลภาษาขนาดใหญ่ (Large Language Models) และโมเดล QA อื่น ๆ แสดงออกถึงอคติและภาพจำในการตอบคำถามอย่างไร โดยเฉพาะในงานประยุกต์ด้านการตอบคำถามในภาษาธรรมชาติ[1] BBQ ได้กลายเป็นหนึ่งใน benchmark ที่ครอบคลุมที่สุดสำหรับการประเมิน social bias ใน NLP โดยครอบคลุมภาพจำในวงกว้างภายใต้เก้าหมวดหมู่ทางสังคม[3]

ชุดข้อมูลนี้เป็นการต่อยอดจากงานก่อนหน้า เช่น dataset UnQover (2020) ซึ่งวัดอคติจากลักษณะที่จำกัด (เพศ-อาชีพ สัญชาติ เชื้อชาติ ศาสนา) และพึ่งพาความน่าจะเป็นของโมเดลมากกว่าตัวคำตอบเอง[3] ต่างจาก UnQover ตรงที่ BBQ วิเคราะห์เนื้อหาของคำตอบโมเดลและการเลือกจากตัวเลือกที่มีให้โดยตรง ซึ่งช่วยให้ประเมินอคติได้ในระดับของผลลัพธ์ที่โมเดลส่งออกมาจริง[1]

ผู้สร้าง BBQ นำเสนอเครื่องมือนี้ในฐานะเครื่องมือวินิจฉัย ภาพจำทางสังคมที่เป็นอันตราย ในโมเดล และลดความเสี่ยงจากผลกระทบเชิงลบของภาพจำดังกล่าวต่อกลุ่มประชากรเปราะบาง[1] ชุดข้อมูลมุ่งเน้นที่ภาพจำที่เกี่ยวข้องกับวัฒนธรรมภาษาอังกฤษในสหรัฐอเมริกา และไม่ครอบคลุมบริบททางวัฒนธรรมทั้งหมดที่เป็นไปได้[1] อย่างไรก็ตาม BBQ ได้วางรากฐานสำหรับงานวิจัยในอนาคตเกี่ยวกับการวัดและการลด social bias ใน NLP และกลายเป็นจุดอ้างอิงสำหรับการเปรียบเทียบโมเดลในแง่ความถูกต้องทางจริยธรรม

องค์ประกอบและโครงสร้างของชุดข้อมูล

BBQ มีคำถามและคำตอบประมาณ 58,500 รายการ จัดกลุ่มเป็นชุดพิเศษที่มุ่งเปิดเผยภาพจำเฉพาะเจาะจง[4] ตัวอย่างทั้งหมดถูกสร้างขึ้น ด้วยมือ โดยผู้เขียนบนพื้นฐานของกรณีอคติและภาพจำที่บันทึกไว้ซึ่งก่อให้เกิดอันตรายต่อสมาชิกของกลุ่มสังคมต่าง ๆ[4] ในการสร้างสถานการณ์ มีการใช้ข้อมูลจากงานวิจัยทางวิทยาศาสตร์ บทความสื่อ รายงาน และแหล่งข้อมูลที่เชื่อถือได้อื่น ๆ ที่ยืนยันการมีอยู่ของภาพจำนั้น ๆ และผลกระทบที่เป็นอันตราย[1] สำหรับแต่ละสถานการณ์ ผู้เขียนระบุการอ้างอิงแหล่งที่มาซึ่งอธิบายภาพจำนั้นว่าเป็นสิ่งลบหรือเป็นอันตราย (เช่น บทความวิทยาศาสตร์หรือข่าว)[1]

หมวดหมู่ทางสังคม

BBQ ครอบคลุม เก้าหมวดหมู่ทางสังคมหลัก (ส่วนใหญ่สอดคล้องกับกลุ่มที่ได้รับการคุ้มครองตามคำนิยามของคณะกรรมการโอกาสการจ้างงานที่เท่าเทียมแห่งสหรัฐอเมริกา)[1]:

  • อายุ – อคติต่อกลุ่มอายุ (เช่น ภาพจำเรื่องการลดลงของความสามารถทางปัญญาในผู้สูงอายุ)[1]
  • ความพิการ – ภาพจำเกี่ยวกับความสามารถทางสติปัญญาหรือคุณสมบัติอื่น ๆ ของผู้พิการ (เช่น มุมมองที่ว่าผู้พิการทางร่างกายมีความสามารถทางสติปัญญาน้อยกว่า)[1]
  • อัตลักษณ์ทางเพศ – ภาพจำทางเพศ (เช่น แนวคิดที่ว่า «เด็กผู้หญิงไม่ถนัดคณิตศาสตร์»)[1]
  • สัญชาติ – อคติทางชาติพันธุ์และสัญชาติ (เช่น ภาพจำเรื่องการขาดทักษะเทคโนโลยีของผู้ที่มาจากแอฟริกา)[1]
  • รูปลักษณ์ภายนอก – การเลือกปฏิบัติโดยพิจารณาจากรูปลักษณ์หรือรูปร่าง (เช่น ความเชื่อที่ว่าผู้ที่มีน้ำหนักเกินมีสติปัญญาหรือความขยันน้อยกว่า)[1]
  • เชื้อชาติ/ชาติพันธุ์ – ภาพจำทางเชื้อชาติ (เช่น การเชื่อมโยงเชื้อชาติหนึ่งกับอาชญากรรมหรือยาเสพติดอย่างมีอคติ)[1]
  • ศาสนา – ภาพจำทางศาสนา (เช่น มุมมองที่ว่าชาวยิวตระหนี่ มุสลิมมีแนวโน้มใช้ความรุนแรง เป็นต้น)[1]
  • สถานะทางเศรษฐกิจและสังคม – อคติต่อชนชั้นยากจนหรือร่ำรวย (เช่น ความเชื่อที่ว่าผู้ที่มาจากครอบครัวยากจนจะเป็นพ่อแม่ที่ไม่ดี)[1]
  • รสนิยมทางเพศ – ภาพจำแบบกลัวคนรักเพศเดียวกัน (เช่น การเชื่อมโยงที่ผิดพลาดระหว่างการรักเพศเดียวกันกับการติดเชื้อ HIV)[1]

นอกจากเก้าหมวดหมู่เหล่านี้ BBQ ยังนำเสนอ หมวดหมู่แบบตัดกัน สองประเภท (intersectional biases) ที่รวมลักษณะสองอย่างเข้าด้วยกัน ได้แก่ (1) เพศร่วมกับเชื้อชาติ/ชาติพันธุ์ และ (2) สถานะทางเศรษฐกิจและสังคมร่วมกับเชื้อชาติ[1] กรณีเหล่านี้คำนึงถึงภาพจำที่จุดตัดของกลุ่มต่าง ๆ (เช่น อคติที่มีต่อผู้หญิงผิวดำโดยเฉพาะ หรือต่อชาติพันธุ์บางกลุ่มจากชนชั้นทางสังคมที่ต่ำกว่า)

แม่แบบและการสร้างตัวอย่าง

สำหรับแต่ละหมวดหมู่ ทีมงานได้เขียน แม่แบบสถานการณ์ — บทย่อสั้น ๆ ที่มีตัวละครสองคนซึ่งแตกต่างกันตามลักษณะเป้าหมาย (เช่น คนหนุ่มสาวและผู้สูงอายุ ผู้ชายและผู้หญิง คนรวยและคนจน เป็นต้น)[4] แม่แบบมีสถานการณ์ที่อาจยืนยันหรือหักล้างภาพจำที่รู้จักกัน ในแต่ละสถานการณ์จะมีคำถามและตัวเลือกคำตอบประกอบ

โดยรวมแล้ว มีการพัฒนาแม่แบบที่ไม่ซ้ำกัน 25 แม่แบบสำหรับแต่ละหมวดหมู่หลักทั้งเก้า บวกกับแม่แบบเพิ่มเติมอีก 25 แม่แบบสำหรับหมวดหมู่เชื้อชาติและเพศที่ใช้ชื่อจริง (เพื่อทดสอบ bias ในระดับชื่อเฉพาะ)[1] นอกจากนี้ ยังสร้างแม่แบบ 25 แม่แบบสำหรับสองทิศทางแบบตัดกัน[1] ดังนั้น จำนวนสถานการณ์พื้นฐานทั้งหมดจึงเกิน 300 รายการ

แต่ละแม่แบบมี ช่องสำหรับตัวแปร — ชื่อกลุ่มหรือคำอธิบาย — ที่จะถูกแทนที่ในข้อความ (เช่น ในแม่แบบด้านอายุ ตัวเลขต่าง ๆ จะถูกแทนที่แทน «คนอายุ _» หรือในด้านรูปลักษณ์ — คำคุณศัพท์อย่าง «อ้วน»/«ผอม» เป็นต้น)[1] ด้วยการแทนที่ค่าต่าง ๆ และสลับลำดับการกล่าวถึงตัวละครสองคน แต่ละแม่แบบจะขยายออกเป็นตัวอย่างเฉพาะจำนวนมาก (อย่างน้อย 8 และมากถึงประมาณ 200 รูปแบบ)[1] โดยทั่วไป จากแม่แบบเดียวจะมีการสร้างคำถามสุดท้ายอย่างน้อย 100 คำถาม และในบางกรณีสูงถึงสองร้อยคำถาม[1] รวมแล้วได้คลังข้อมูลที่มี 58,492 ตัวอย่าง (การผสมผสานที่ไม่ซ้ำกันของสถานการณ์ คำถาม และคำตอบ)[4]

บริบทและประเภทของคำถาม

ลักษณะสำคัญของ BBQ คือ แต่ละสถานการณ์ถูกนำเสนอในสองรูปแบบบริบทและสองรูปแบบคำถาม ก่อให้เกิดชุด สี่คำถาม (เรียกว่ากลุ่มจากสี่)[1] สิ่งนี้ทำขึ้นเพื่อแยกผลของการขาดข้อมูลออกจากภาพจำของโมเดลเอง ในแต่ละชุดสี่[1]:

  • บริบทที่กำกวม (under-informative or ambiguous context): ข้อความที่อธิบายสถานการณ์ที่มีบุคคลสองคนจากกลุ่มต่างกัน แต่ไม่มีข้อมูลเพียงพอที่จะตอบคำถามที่ตั้งไว้อย่างชัดเจน[1] คำตอบที่ถูกต้องในกรณีดังกล่าวจะเป็นตัวเลือก «ไม่ทราบ» เสมอ (นั่นคือ การไม่มีข้อมูลเพียงพอ)[1] ตัวอย่างเหล่านี้มีไว้เพื่อตรวจสอบว่าโมเดลจะสรุปผลโดยอาศัยภาพจำหรือไม่
  • บริบทที่ชัดเจน (disambiguated context): สถานการณ์ที่ขยายออกซึ่งมีการเพิ่มรายละเอียดที่ช่วยระบุว่าใครในสองคนที่กล่าวถึงสอดคล้องกับคำถาม[1] ในกรณีนี้ ตัวละครหนึ่งในสองคือคำตอบที่ถูกต้องอย่างชัดเจน (และตัวเลือก «ไม่ทราบ» ไม่ถูกต้องแล้ว) บริบทที่ชัดเจนทำหน้าที่ตรวจสอบว่าโมเดลสามารถเอาชนะ bias ที่อาจมีและเลือกคำตอบที่ถูกต้องได้หรือไม่ แม้ว่าภาพจำจะชี้ไปในทิศทางตรงกันข้าม[1]
  • คำถามเชิงลบ (e.g., «ใครในสองคนรู้เรื่องนี้น้อยกว่า?» «ใครเป็นคนก่ออาชญากรรม?»)[1] คำถามดังกล่าวเมื่อใช้ร่วมกับบริบทที่กำกวมจะตรวจสอบว่าโมเดลมีแนวโน้มที่จะเชื่อมโยงการกระทำเชิงลบกับกลุ่มใดกลุ่มหนึ่งในกรณีที่ขาดข้อเท็จจริงหรือไม่[1]
  • คำถามที่ไม่เชิงลบ (เปรียบเทียบ) (e.g., «ใครในสองคนรู้เรื่องนี้ดีกว่า?» หรือ «ใครละเว้นจากการกระทำที่ไม่ดี?»)[1] คำถามที่ไม่เชิงลบถูกออกแบบมาเพื่อไม่ให้ฟังดูเหมือนการสนับสนุนภาพจำโดยตรง แต่ในขณะเดียวกันก็ให้ตรวจสอบความสมดุลของคำตอบโมเดลได้[1] การเปรียบเทียบคำตอบสำหรับเวอร์ชันเชิงลบและเวอร์ชันกลาง ๆ จะเผยให้เห็นความเอนเอียงเชิงระบบ

แต่ละตัวอย่างในกลุ่มทั้งสี่นี้มี ตัวเลือกคำตอบสามตัวเลือก: สองตัวเลือกเฉพาะเจาะจง (ระบุแต่ละกลุ่มจากสองกลุ่มที่ปรากฏ) และหนึ่งตัวเลือกที่บ่งบอกถึงการขาดข้อมูลเพียงพอ (ทำเครื่องหมายว่า «Unknown» และวลีที่เทียบเท่า)[1] ตัวอย่างเช่น ในฉากที่มีคริสเตียนและมุสลิม ตัวเลือกคำตอบจะเป็น «คริสเตียน» «มุสลิม» หรือ «ไม่ทราบ»[1] ทั้งนี้ คำว่า «ไม่ทราบ» ไม่ได้มีรูปแบบเดียวเสมอไป — มีการใช้การแสดงออกที่มีความหมายเหมือนกัน 10 แบบ[1]

นอกจากนี้ ในแต่ละแม่แบบจะมีการสลับ ลำดับการกล่าวถึงสองกลุ่ม โดยอัตโนมัติ[1] สิ่งนี้ทำเพื่อลด ผลของลำดับ — ปัจจัยที่ทราบกันดีซึ่งโมเดลอาจเลือกเอนทิตีแรกที่กล่าวถึงบ่อยกว่าโดยไม่คำนึงถึงเนื้อหา[1]

การทำคำอธิบายประกอบและการตรวจสอบคุณภาพ

ตัวอย่างแต่ละรายการของ BBQ ได้รับการประเมินโดยผู้ทำคำอธิบายประกอบแบบ crowdsourcing: มีผู้คนอิสระอย่างน้อย 5 คนตอบคำถาม และจะรวมเฉพาะตัวอย่างที่ อย่างน้อย 4 ใน 5 ของผู้ทำคำอธิบายประกอบเห็นด้วยกับคำตอบที่ถูกต้อง (โดยการโหวต) ลงใน dataset สุดท้ายเท่านั้น[1] หากคำถามใดผ่านเกณฑ์นี้ไม่ได้ แม่แบบทั้งหมดจะถูกทบทวนและแก้ไข[1] ด้วยกระบวนการนี้ ความแม่นยำของมนุษย์บน BBQ จึงสูงมาก: ผู้ทำคำอธิบายประกอบแต่ละคนตอบถูกต้องประมาณ 95.7% ของคำถาม และเมื่อคำนึงถึงเสียงข้างมาก ความแม่นยำของมาตรฐานทองคำจะสูงถึง 99.7%[1] ค่า Krippendorff's alpha สำหรับความสอดคล้องอยู่ที่ 0.883 ซึ่งบ่งชี้ถึง ความสอดคล้องสูง ระหว่างผู้คนเกี่ยวกับคำตอบที่ถูกต้อง[1] มาตรการเหล่านี้ยืนยันว่างาน BBQ เข้าใจได้สำหรับมนุษย์และมีคำตอบที่ถูกต้องอย่างเป็นวัตถุวิสัย ดังนั้น ข้อผิดพลาดของโมเดลในตัวอย่างเหล่านี้จึงสามารถตีความได้อย่างสมเหตุสมผลว่าเป็นการแสดงออกถึง bias ไม่ใช่เพราะความกำกวมของคำถามเอง

การประเมินอคติของโมเดล

BBQ ถูกออกแบบมาเพื่อประเมินพฤติกรรมของโมเดลในสภาวะที่กระตุ้น social bias แบบหลายมิติ เมื่อทดสอบ โมเดล QA จะได้รับบริบทและคำถามเป็น input จากนั้นต้องเลือกหนึ่งใน three ตัวเลือกคำตอบ การวิเคราะห์ผลลัพธ์ดำเนินการในสองระดับ[1]:

กรณีบริบทที่กำกวม

วัดว่าโมเดลตอบคำถามผิดบ่อยแค่ไหนในกรณีที่ขาดข้อมูลที่จำเป็น นั่นคือ อาศัยภาพจำ[1] ในอุดมคติ โมเดลควรตอบว่า «ไม่ทราบ» สำหรับคำถามใด ๆ ที่มีบริบทไม่เพียงพอ แต่หากเลือกกลุ่มใดกลุ่มหนึ่ง นั่นถือว่าเป็นการฉายภาพจำที่ฝังอยู่[1] ความถี่ของข้อผิดพลาดดังกล่าวและการกระจายตามหมวดหมู่ให้ภาพรวมของแนวโน้มของโมเดลในการทำให้ภาพจำที่เป็นอันตรายคงอยู่

กรณีบริบทที่มีข้อมูลเพียงพอ

ประเมินความแม่นยำของโมเดลเมื่อบริบทมีคำตอบที่ถูกต้องอย่างชัดเจน[1] ในที่นี้ มักจะคำนวณ metric มาตรฐาน accuracy (ร้อยละของคำตอบที่ถูกต้อง) — ซึ่งแสดงให้เห็นว่าโมเดลรับมือกับงานถาม-ตอบได้โดยทั่วไปหรือไม่ อย่างไรก็ตาม ความสนใจพิเศษจะมุ่งไปที่กรณีที่คำตอบที่ถูกต้องขัดแย้งกับภาพจำ[1] ผู้พัฒนา BBQ วิเคราะห์ว่าความแม่นยำของโมเดลจะลดลงหรือไม่หากคำตอบที่ถูกต้องขัดแย้งกับภาพจำที่ฝังรากลึก (และในทางกลับกัน ความแม่นยำจะสูงกว่าหรือไม่เมื่อความจริงตรงกับความคาดหวังตามภาพจำ)[1] ผลดังกล่าวจะชี้ว่าแม้มีข้อเท็จจริง โมเดลก็อาจเกิดข้อผิดพลาดเนื่องจาก bias

Bias Score

เพื่อวัดระดับอคติเชิงปริมาณ จึงมีการนำ metric พิเศษมาใช้ — ค่าคะแนนอคติ (bias score)[1] โดยทั่วไป bias score สะท้อนถึงร้อยละของคำตอบของโมเดล (ในบรรดาคำตอบผิดหรือทั้งหมด ขึ้นอยู่กับเงื่อนไข) ที่สอดคล้องกับภาพจำ[1]

  • ค่า +100% หมายความว่าโมเดลเลือกตัวเลือกคำตอบที่กำหนดคุณสมบัติเชิงลบให้กับกลุ่มเป้าหมายตามภาพจำในทุกกรณี
  • 0% — ไม่มีการแสดงออกถึง bias (โมเดลตอบถูกต้อง/«ไม่ทราบ» เสมอ หรือเกิดข้อผิดพลาดเท่ากันทั้งสองทาง)
  • ค่าคะแนนติดลบ (ถึง -100%) — แนวโน้มตรงกันข้าม เมื่อโมเดลตอบขัดแย้งกับความคาดหวังของภาพจำเสมอ[1]

ค่าคะแนนจะคำนวณแยกกันสำหรับบริบทที่กำกวมและบริบทที่ชัดเจน เนื่องจากลักษณะของข้อผิดพลาดในทั้งสองกรณีแตกต่างกัน[1]

  • สำหรับ คำถามที่กำกวม bias score ถูกกำหนดโดยสัดส่วนของกรณีที่โมเดลเลือกคำตอบเฉพาะแทน «ไม่ทราบ» และคำตอบนั้นสอดคล้องกับภาพจำเชิงลบ[1] ยิ่งคำตอบดังกล่าวเกิดขึ้นบ่อยเท่าใด ค่าคะแนนบวกก็ยิ่งสูงขึ้นเท่านั้น ทั้งนี้ ความแม่นยำจะถูกคำนึงถึงด้วย: หากโมเดลเกิดข้อผิดพลาดและตอบถูก («ไม่ทราบ») เท่า ๆ กัน แม้จะมีข้อผิดพลาดตามภาพจำบ้าง ค่าคะแนนก็จะต่ำกว่าโมเดลที่เลือกคำตอบตามภาพจำเสมอ[1] ดังนั้น ทั้งความถี่และความมั่นใจของคำตอบแบบ bias จะถูกลงโทษ (สำหรับบริบทที่กำกวม metric จะถูกปรับขนาดตามร้อยละของคำตอบ «ไม่ทราบ» ที่ถูกต้อง)[1]
  • สำหรับ คำถามที่ชัดเจน bias score จะคำนวณแตกต่างออกไปเล็กน้อย เนื่องจากในที่นี้คำตอบที่ถูกต้องคือกลุ่มใดกลุ่มหนึ่ง[1] ในกรณีเหล่านี้ จะพิจารณา คำตอบผิด ของโมเดล: สัดส่วนของข้อผิดพลาดที่โมเดลเลือกไม่ใช่ตัวเลือกที่ถูกต้อง แต่เป็นตัวเลือกอื่นที่สอดคล้องกับภาพจำ[1] กล่าวอีกนัยหนึ่ง หากโมเดลผิดพลาดโดยให้ความสำคัญกับอคติ (เช่น ไม่เชื่อข้อเท็จจริงและตอบตามภาพจำ) ก็จะเพิ่มค่าคะแนน[1]

การวิเคราะห์ bias score ควบคู่กับความแม่นยำโดยรวมช่วยให้สามารถอธิบายพฤติกรรมของโมเดลบน BBQ ได้อย่างละเอียด ผู้เขียนชี้ให้เห็นว่า accuracy ที่เท่ากันอาจซ่อนลักษณะข้อผิดพลาดที่แตกต่างกัน[1] ดังนั้น ค่าคะแนนนี้จึงแสดง ทิศทางของข้อผิดพลาด และเปิดเผยกรณีละเอียดอ่อนที่ไม่สามารถมองเห็นได้จากความแม่นยำเพียงอย่างเดียว

ผลลัพธ์และรูปแบบที่ตรวจพบ

การทดสอบเบื้องต้นของโมเดล QA ที่ได้รับความนิยมหลายตัวบนชุดข้อมูล BBQ แสดงให้เห็นการแสดงออกถึง bias ที่ชัดเจนหลายประการ[1] ในการวิจัยของ Parrish และคณะ (2022) มีการทดสอบทั้งโมเดลอเนกประสงค์ขนาดใหญ่ (เช่น UnifiedQA — โมเดลทั่วไปสำหรับ QA บนพื้นฐาน T5) และโมเดล multiple-choice มาตรฐาน (เช่น RoBERTa ที่ fine-tune สำหรับ QA)[1]

ข้อสรุปหลักจากผลการทดลอง:

  • ข้อผิดพลาดตามภาพจำที่รุนแรงเมื่อขาดข้อมูล ในทุกระบบที่ทดสอบ มีแนวโน้มที่จะตอบตามภาพจำเมื่อบริบทไม่ให้เบาะแสที่จำเป็น[1] กล่าวคือ โมเดลมักไม่เลือกตัวเลือก «ไม่ทราบ» แต่กลับเลือกคำตอบเฉพาะที่สัมพันธ์กับความคาดหวังตามภาพจำนั้น ๆ[1] ตัวอย่างเช่น ในคำถามกำกวมเกี่ยวกับอาชญากรรมที่ไม่มีผู้กระทำผิดชัดเจน โมเดลมักชี้ไปที่บุคคลจากกลุ่มใดกลุ่มหนึ่ง (ที่สอดคล้องกับอคติ)[1] bias score ที่คำนวณได้สำหรับบริบทแบบ ambiguous สูงกว่าศูนย์อย่างมีนัยสำคัญ และบางครั้งเข้าใกล้ +100% ในบางหมวดหมู่สำหรับโมเดลบางตัว[1] โมเดลแสดงแนวโน้มตอบตามภาพจำสูงเป็นพิเศษในสถานการณ์ที่เกี่ยวกับ รูปลักษณ์ภายนอก (โรคอ้วน เป็นต้น) — หมวดหมู่นี้ให้ bias สูงกว่าหมวดหมู่เชื้อชาติหรือรสนิยมทางเพศอย่างเห็นได้ชัด[1] สิ่งนี้บ่งชี้ถึงความไม่เป็นเนื้อเดียวกันของ bias ภายในโมเดล — ภาพจำบางประเภทถูก «เรียนรู้» มากกว่าประเภทอื่น
  • ความดีขึ้นเมื่อมีข้อเท็จจริง แต่ bias แฝงยังคงอยู่ เมื่อโมเดลได้รับบริบทที่ชัดเจนพร้อมการระบุคำตอบที่ถูกต้องอย่างชัดเจน ความแม่นยำของโมเดลเพิ่มขึ้นอย่างเห็นได้ชัด (เมื่อเทียบกับสถานการณ์ที่ไม่แน่นอน)[1] อย่างไรก็ตาม การวิเคราะห์โดยละเอียดเผยให้เห็นผลลัพธ์ที่ละเอียดอ่อน: ความแม่นยำ ไม่สม่ำเสมอขึ้นอยู่กับความสัมพันธ์ของคำตอบที่ถูกต้องกับภาพจำ[1] โดยเฉลี่ย โมเดลมีความแม่นยำสูงกว่า 3-3.5 เปอร์เซ็นต์สำหรับตัวอย่างที่คำตอบที่ถูกต้องสอดคล้องกับภาพจำที่แพร่หลาย เมื่อเทียบกับตัวอย่างที่คำตอบที่ถูกต้องขัดแย้งกับภาพจำนั้น[1] กล่าวอีกนัยหนึ่ง เมื่อข้อเท็จจริงยืนยันอคติ โมเดลก็แทบจะให้คำตอบที่ถูกต้องเสมอ แต่หากต้องระบุตัวเลือก «ที่ไม่ตรงแบบ» สำหรับภาพจำ ความน่าจะเป็นของข้อผิดพลาดก็จะสูงขึ้น ช่องว่างในประสิทธิภาพนี้แม้จะไม่มากนัก แต่ก็ปรากฏทางสถิติในหลายหมวดหมู่[1] ความแตกต่างสูงสุดพบสำหรับคำถามที่เกี่ยวกับภาพจำทางเพศ: สูงถึง 5 เปอร์เซ็นต์[1] ดังนั้น อิทธิพลแฝงของ bias จึงมีให้เห็น: โดยเฉลี่ยแล้ว โมเดลทำงานได้แย่กว่าเล็กน้อยเมื่อ «ต่อต้านภาพจำ»
  • การเปรียบเทียบหมวดหมู่และแม่แบบ นักวิจัย BBQ วิเคราะห์ bias score แยกตามหมวดหมู่ทั้งเก้า และพบว่าในบริบทที่กำกวม ค่าคะแนนเป็นบวกในทุกหมวดหมู่ แต่ขนาดของค่าแตกต่างกัน[1] ดังที่กล่าวถึง bias สูงสุดพบในหมวดหมู่รูปลักษณ์ภายนอก สถานะทางเศรษฐกิจและสังคม และบางหมวดหมู่ที่ตัดกัน[1] bias score ที่ «ต่ำกว่า» แต่ก็ยังไม่ใช่ศูนย์ พบในหมวดหมู่เชื้อชาติ/ชาติพันธุ์และรสนิยมทางเพศ[1] ในบริบทที่ชัดเจน bias score โดยรวมใกล้เคียงกับศูนย์มากกว่า (เนื่องจากโมเดลมักตอบถูกต้อง) แต่ก็ยังคงเป็นบวกสำหรับแม่แบบบางอัน ซึ่งสะท้อนถึงความเอนเอียงที่เห็นได้ชัดในลักษณะของข้อผิดพลาดที่เกิดขึ้น[1] ตัวอย่างเช่น ในหมวดหมู่ศาสนา ข้อผิดพลาดส่วนใหญ่ไปในทิศทางเดียว — โดยทั่วไป เมื่อโมเดลผิดพลาดก็มักเลือกคำตอบบนพื้นฐานของอคติ[1]

โดยรวมแล้ว BBQ แสดงให้เห็นว่าแม้แต่โมเดลภาษาขนาดใหญ่สมัยใหม่ที่แข็งแกร่ง ก็ยังชัดเจนว่าไม่ปลอดจากอคติทางสังคม[1] โมเดลเหล่านี้มีแนวโน้มที่จะทำให้ภาพจำคงอยู่หากอยู่ในสถานการณ์ที่ไม่แน่นอน และอาจแสดง bias ที่ละเอียดอ่อนแม้มีข้อเท็จจริงที่ต้องการคำตอบตรงกันข้าม[1] ทั้งนี้ ขนาดของผลกระทบเหล่านี้ไม่เท่ากันสำหรับกลุ่มต่าง ๆ: ภาพจำบางอย่างถูกโมเดล «เรียนรู้» มากกว่า[1] ผู้เขียน BBQ เน้นย้ำว่าความแตกต่างที่ค้นพบแม้จะสังเกตเห็นได้ แต่ก็ไม่ได้ร้ายแรงอย่างมาก — bias score ของโมเดลส่วนใหญ่ไม่ถึงค่าสุดโต่ง และมักอยู่ในระดับสิบกว่าเปอร์เซ็นต์[1] อย่างไรก็ตาม แม้แต่ความเบี่ยงเบนเชิงระบบเพียงเล็กน้อยในทิศทางของภาพจำก็อาจเป็นอันตรายในการใช้งาน Large Language Models ในวงกว้าง ดังนั้นการระบุและขจัด bias ดังกล่าวจึงเป็นงานสำคัญ[3] BBQ ได้มอบวิธีที่ชัดเจนและวัดได้เชิงปริมาณแก่นักวิจัยในการติดตามความก้าวหน้าในด้านนี้[3]

อิทธิพลและการวิจัยต่อเนื่อง

ชุดข้อมูล BBQ ได้รับการยอมรับอย่างรวดเร็วในฐานะเครื่องมือมาตรฐานสำหรับประเมินคุณลักษณะ fairness ของโมเดลภาษา[4] โค้ดต้นฉบับเปิดและข้อมูล ของ BBQ มีให้ในที่เก็บข้อมูล (สัญญาอนุญาต CC BY 4.0)[4] ซึ่งช่วยให้ชุมชนนักวิจัยในวงกว้างสามารถนำ BBQ ไปใช้ในการพัฒนาและทดสอบโมเดลใหม่ได้ ในบทสำรวจหลายฉบับ BBQ ถูกกล่าวถึงควบคู่กับ benchmark อื่น ๆ (เช่น StereoSet, WinoBias, ToxiGen) ในฐานะจุดเปลี่ยนสำคัญในการศึกษา social bias ใน NLP[3] นับตั้งแต่เผยแพร่ BBQ มีผลงานวิจัยที่พัฒนาแนวคิดและปรับให้เข้ากับเงื่อนไขใหม่:

  • การขยายรูปแบบคำถาม (Open-BBQ) BBQ ต้นฉบับนำเสนองานในรูปแบบ multiple-choice[3] ในปี 2024 มีการเสนอการดัดแปลง BBQ สำหรับ คำตอบแบบเปิด รวมถึงงานเติมคำในช่องว่างและข้อความตอบสั้น ๆ[3] เวอร์ชันนี้ซึ่งเรียกกันว่า Open-BBQ ช่วยให้สามารถประเมิน bias ในสภาพแวดล้อมการสนทนาที่เป็นอิสระมากขึ้น โดยที่โมเดลไม่มีตัวเลือกคำตอบที่กำหนดไว้[3] การวิจัยพบว่า Large Language Models เมื่อสร้างข้อความอิสระก็แสดง bias ที่เพิ่มขึ้นต่อกลุ่มบางกลุ่มเช่นกัน[3] ผู้เขียน Open-BBQ ยังทดลองใช้วิธีการลด bias โดยผสมผสาน zero-shot และ few-shot prompting และ chain-of-thought (การให้เหตุผลทีละขั้น)[3] วิธีการเหล่านี้ช่วยลดระดับ bias ในคำตอบได้อย่างเห็นได้ชัด[3] Open-BBQ เป็นการเสริม dataset ต้นฉบับ ทำให้สามารถทดสอบโมเดลเชิงสร้างสรรค์ในรูปแบบที่ใกล้เคียงกับคำขอของผู้ใช้มากขึ้น
  • การปรับให้เข้ากับวัฒนธรรม (การแปลภาษาท้องถิ่น) เนื่องจาก BBQ ผูกพันกับความจริงทางสังคมของสหรัฐอเมริกา นักวิจัยจึงสนใจการปรับให้เข้ากับภาษาและวัฒนธรรมอื่น ๆ[5] ในปี 2023 นักวิทยาศาสตร์ชาวเกาหลีได้นำเสนอ dataset KoBBQ (Korean BBQ) — เวอร์ชันเกาหลีของ Bias Benchmark[5] พวกเขาพัฒนาแนวทางทั่วไปสำหรับการแปลภาษาท้องถิ่น BBQ โดยแบ่งแม่แบบต้นฉบับออกเป็นสามประเภท — ที่สามารถแปลได้เลย ที่ต้องการเปลี่ยนกลุ่มเป็นเทียบเท่าท้องถิ่น และที่ไม่สามารถใช้ได้เลยในบริบทของเกาหลี[5] นอกจากนี้ KoBBQ ยังนำเสนอหมวดหมู่ภาพจำใหม่ 4 หมวดหมู่ที่เฉพาะเจาะจงสำหรับสังคมเกาหลีและลบตัวอย่างที่ไม่เหมาะสมบางส่วนออก[5] ผลลัพธ์ที่ได้คือชุดข้อมูลที่มี 268 แม่แบบและ 76,048 ตัวอย่างในภาษาเกาหลี ครอบคลุม 12 หมวดหมู่ social bias (รวมทั้งต้นฉบับและใหม่)[5] การทดสอบโมเดลหลายภาษาบน KoBBQ เผยให้เห็นความแตกต่างที่มีนัยสำคัญในระดับอคติเมื่อเทียบกับการแปล BBQ ต้นฉบับโดยตรงเป็นภาษาเกาหลีด้วยเครื่อง[5] สิ่งนี้เน้นย้ำว่า การแปลโดยตรงไม่เพียงพอ — จำเป็นต้องมี benchmark เฉพาะทางวัฒนธรรมที่คำนึงถึงภาพจำและบริบทเฉพาะของแต่ละประเทศ[5] งานวิจัยเกี่ยวกับ KoBBQ แสดงให้เห็นถึงความเป็นไปได้ในการขยายวิธีการ BBQ ในระดับโลก

BBQ ได้กลายเป็นส่วนหนึ่งที่ขาดไม่ได้ของการวิจัยด้าน 윤리ความถูกต้องทางจริยธรรมของปัญญาประดิษฐ์[3] อิทธิพลของ BBQ ปรากฏในการเกิดขึ้นของวิธีการ debiasing โมเดลใหม่ ๆ การสร้าง dataset ที่ครอบคลุมมากขึ้น และ metric สำหรับการวิเคราะห์ bias อย่างละเอียด นักวิจัยตั้งข้อสังเกตว่าหนึ่งในจุดแข็งของ BBQ คือความกว้างของความครอบคลุมและความพิถีพิถันในการสร้างตัวอย่าง[3] เพื่อตอบสนองต่อความท้าทายที่ BBQ ระบุ ปัจจุบันมีการพัฒนา กลยุทธ์การลด bias อย่างแข็งขัน ตั้งแต่การกรองข้อมูลการฝึกอบรมไปจนถึงอัลกอริธึมการประมวลผลหลังการฝึกพิเศษและการปรับ Large Language Models ให้ตอบสนองอย่างเป็นธรรม[3]

โดยสรุป BBQ (Bias Benchmark for QA) พิสูจน์ตัวเองในฐานะเครื่องมือที่มีคุณค่าและเชื่อถือได้สำหรับการวัดอคติทางสังคมในโมเดลภาษา ชุดข้อมูลนี้มอบชุดการตรวจสอบมาตรฐานแก่ชุมชนนักวิจัย ซึ่งช่วยให้สามารถเปรียบเทียบโมเดลในแง่ของการมีภาพจำและติดตามความก้าวหน้าในการปรับปรุงความเป็นกลางของโมเดลได้[3] BBQ ยังคงขยายตัวและปรับตัวต่อไป สะท้อนถึงความสนใจระดับโลกในการสร้าง ระบบ AI ที่เป็นธรรมและปลอดภัยยิ่งขึ้น[3] ซึ่งปราศจาก bias ที่เป็นอันตรายอย่างมีนัยสำคัญแม้จะมองไม่เห็น

ลิงก์

  • บทความต้นฉบับ BBQ (arXiv)
  • ที่เก็บข้อมูล BBQ บน GitHub
  • หน้า dataset BBQ บน Papers With Code
  • บทความ BBQ บน ACL Anthology
  • บทความเกี่ยวกับ dataset KoBBQ (arXiv)
  • บทความเกี่ยวกับ dataset Open-BBQ (arXiv)

เอกสารอ้างอิง

  • Liang, P. et al. (2022). Holistic Evaluation of Language Models (HELM). arXiv:2211.09110.
  • Chang, Y. et al. (2023). A Survey on Evaluation of Large Language Models. arXiv:2307.03109.
  • Ni, S. et al. (2025). A Survey on Large Language Model Benchmarks. arXiv:2508.15361.
  • Biderman, S. et al. (2024). The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned. arXiv:2405.14782.
  • Kiela, D. et al. (2021). Dynabench: Rethinking Benchmarking in NLP. arXiv:2104.14337.
  • Ma, Z. et al. (2021). Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking. arXiv:2106.06052.
  • Goel, K. et al. (2021). Robustness Gym: Unifying the NLP Evaluation Landscape. arXiv:2101.04840.
  • Xu, C. et al. (2024). Benchmark Data Contamination of Large Language Models: A Survey. arXiv:2406.04244.
  • Liu, S. et al. (2025). A Comprehensive Survey on Safety Evaluation of LLMs. arXiv:2506.11094.
  • Chiang, W.-L. et al. (2024). Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference. arXiv:2403.04132.
  • Boubdir, M. et al. (2023). Elo Uncovered: Robustness and Best Practices in Language Model Evaluation. arXiv:2311.17295.
  • Huang, L. et al. (2023). A Survey on Hallucination in Large Language Models. arXiv:2311.05232.

หมายเหตุ

[1] [2] [3] [4] [5] </references>

  1. 1.00 1.01 1.02 1.03 1.04 1.05 1.06 1.07 1.08 1.09 1.10 1.11 1.12 1.13 1.14 1.15 1.16 1.17 1.18 1.19 1.20 1.21 1.22 1.23 1.24 1.25 1.26 1.27 1.28 1.29 1.30 1.31 1.32 1.33 1.34 1.35 1.36 1.37 1.38 1.39 1.40 1.41 1.42 1.43 1.44 1.45 1.46 1.47 1.48 1.49 1.50 1.51 1.52 1.53 1.54 1.55 1.56 1.57 1.58 1.59 1.60 1.61 1.62 1.63 1.64 1.65 1.66 1.67 1.68 1.69 1.70 1.71 1.72 1.73 1.74 1.75 1.76 1.77 1.78 1.79 1.80 1.81 Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». arXiv. [1]
  2. 2.0 2.1 Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». ACL Anthology. [2]
  3. 3.00 3.01 3.02 3.03 3.04 3.05 3.06 3.07 3.08 3.09 3.10 3.11 3.12 3.13 3.14 3.15 3.16 Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». arXiv preprint. [3]
  4. 4.0 4.1 4.2 4.3 4.4 4.5 4.6 «BBQ Dataset». Papers With Code. [4]
  5. 5.0 5.1 5.2 5.3 5.4 5.5 5.6 5.7 Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». arXiv preprint. [5]