---
title: "BBQ (Bias Benchmark for Question Answering) (TH)"
source: "https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)"
wiki: "systems-analysis.info/int"
article: "BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)"
language: "th"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Thai"
revision_id: 532
wiki_created_at: 2026-09-06T22:35:10Z
wiki_modified_at: 2026-09-06T22:35:10Z
downloaded_at: 2026-09-07T22:40:48Z
---

# BBQ (Bias Benchmark for Question Answering) (TH)

**BBQ** (Bias Benchmark for Question Answering) — คือ **ชุดข้อมูล** สำหรับประเมิน **อคติทางสังคม** (bias) ในระบบถาม-ตอบ (QA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ชุดข้อมูลนี้ถูกพัฒนาโดยกลุ่มนักวิจัยจากมหาวิทยาลัยนิวยอร์กภายใต้การนำของ Alicia Parrish และได้รับการเผยแพร่ในปี 2022 ในการประชุม ACL Findings<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)[\[2\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-acl-anthology-2)</sup> เป้าหมายของ BBQ คือการค้นหาว่า โมเดลภาษาขนาดใหญ่ (Large Language Models) และโมเดล QA อื่น ๆ แสดงออกถึงอคติและภาพจำในการตอบคำถามอย่างไร โดยเฉพาะในงานประยุกต์ด้านการตอบคำถามในภาษาธรรมชาติ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> BBQ ได้กลายเป็นหนึ่งใน benchmark ที่ครอบคลุมที่สุดสำหรับการประเมิน social bias ใน NLP โดยครอบคลุมภาพจำในวงกว้างภายใต้เก้าหมวดหมู่ทางสังคม<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-evaluating-mitigating-3)</sup>

ชุดข้อมูลนี้เป็นการต่อยอดจากงานก่อนหน้า เช่น dataset UnQover (2020) ซึ่งวัดอคติจากลักษณะที่จำกัด (เพศ-อาชีพ สัญชาติ เชื้อชาติ ศาสนา) และพึ่งพาความน่าจะเป็นของโมเดลมากกว่าตัวคำตอบเอง<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-evaluating-mitigating-3)</sup> ต่างจาก UnQover ตรงที่ BBQ วิเคราะห์เนื้อหาของคำตอบโมเดลและการเลือกจากตัวเลือกที่มีให้โดยตรง ซึ่งช่วยให้ประเมินอคติได้ในระดับของผลลัพธ์ที่โมเดลส่งออกมาจริง<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>

ผู้สร้าง BBQ นำเสนอเครื่องมือนี้ในฐานะเครื่องมือวินิจฉัย **ภาพจำทางสังคมที่เป็นอันตราย** ในโมเดล และลดความเสี่ยงจากผลกระทบเชิงลบของภาพจำดังกล่าวต่อกลุ่มประชากรเปราะบาง<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ชุดข้อมูลมุ่งเน้นที่ภาพจำที่เกี่ยวข้องกับวัฒนธรรมภาษาอังกฤษในสหรัฐอเมริกา และไม่ครอบคลุมบริบททางวัฒนธรรมทั้งหมดที่เป็นไปได้<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> อย่างไรก็ตาม BBQ ได้วางรากฐานสำหรับงานวิจัยในอนาคตเกี่ยวกับการวัดและการลด social bias ใน NLP และกลายเป็นจุดอ้างอิงสำหรับการเปรียบเทียบโมเดลในแง่ความถูกต้องทางจริยธรรม

## องค์ประกอบและโครงสร้างของชุดข้อมูล

BBQ มีคำถามและคำตอบประมาณ **58,500 รายการ** จัดกลุ่มเป็นชุดพิเศษที่มุ่งเปิดเผยภาพจำเฉพาะเจาะจง<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-paperswithcode-bbq-4)</sup> ตัวอย่างทั้งหมดถูกสร้างขึ้น **ด้วยมือ** โดยผู้เขียนบนพื้นฐานของกรณีอคติและภาพจำที่บันทึกไว้ซึ่งก่อให้เกิดอันตรายต่อสมาชิกของกลุ่มสังคมต่าง ๆ<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-paperswithcode-bbq-4)</sup> ในการสร้างสถานการณ์ มีการใช้ข้อมูลจากงานวิจัยทางวิทยาศาสตร์ บทความสื่อ รายงาน และแหล่งข้อมูลที่เชื่อถือได้อื่น ๆ ที่ยืนยันการมีอยู่ของภาพจำนั้น ๆ และผลกระทบที่เป็นอันตราย<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> สำหรับแต่ละสถานการณ์ ผู้เขียนระบุการอ้างอิงแหล่งที่มาซึ่งอธิบายภาพจำนั้นว่าเป็นสิ่งลบหรือเป็นอันตราย (เช่น บทความวิทยาศาสตร์หรือข่าว)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>

### หมวดหมู่ทางสังคม

BBQ ครอบคลุม **เก้าหมวดหมู่ทางสังคมหลัก** (ส่วนใหญ่สอดคล้องกับกลุ่มที่ได้รับการคุ้มครองตามคำนิยามของคณะกรรมการโอกาสการจ้างงานที่เท่าเทียมแห่งสหรัฐอเมริกา)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>:

- **อายุ** – อคติต่อกลุ่มอายุ (เช่น ภาพจำเรื่องการลดลงของความสามารถทางปัญญาในผู้สูงอายุ)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>
- **ความพิการ** – ภาพจำเกี่ยวกับความสามารถทางสติปัญญาหรือคุณสมบัติอื่น ๆ ของผู้พิการ (เช่น มุมมองที่ว่าผู้พิการทางร่างกายมีความสามารถทางสติปัญญาน้อยกว่า)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>
- **อัตลักษณ์ทางเพศ** – ภาพจำทางเพศ (เช่น แนวคิดที่ว่า «เด็กผู้หญิงไม่ถนัดคณิตศาสตร์»)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>
- **สัญชาติ** – อคติทางชาติพันธุ์และสัญชาติ (เช่น ภาพจำเรื่องการขาดทักษะเทคโนโลยีของผู้ที่มาจากแอฟริกา)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>
- **รูปลักษณ์ภายนอก** – การเลือกปฏิบัติโดยพิจารณาจากรูปลักษณ์หรือรูปร่าง (เช่น ความเชื่อที่ว่าผู้ที่มีน้ำหนักเกินมีสติปัญญาหรือความขยันน้อยกว่า)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>
- **เชื้อชาติ/ชาติพันธุ์** – ภาพจำทางเชื้อชาติ (เช่น การเชื่อมโยงเชื้อชาติหนึ่งกับอาชญากรรมหรือยาเสพติดอย่างมีอคติ)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>
- **ศาสนา** – ภาพจำทางศาสนา (เช่น มุมมองที่ว่าชาวยิวตระหนี่ มุสลิมมีแนวโน้มใช้ความรุนแรง เป็นต้น)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>
- **สถานะทางเศรษฐกิจและสังคม** – อคติต่อชนชั้นยากจนหรือร่ำรวย (เช่น ความเชื่อที่ว่าผู้ที่มาจากครอบครัวยากจนจะเป็นพ่อแม่ที่ไม่ดี)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>
- **รสนิยมทางเพศ** – ภาพจำแบบกลัวคนรักเพศเดียวกัน (เช่น การเชื่อมโยงที่ผิดพลาดระหว่างการรักเพศเดียวกันกับการติดเชื้อ HIV)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>

นอกจากเก้าหมวดหมู่เหล่านี้ BBQ ยังนำเสนอ **หมวดหมู่แบบตัดกัน** สองประเภท (intersectional biases) ที่รวมลักษณะสองอย่างเข้าด้วยกัน ได้แก่ (1) เพศร่วมกับเชื้อชาติ/ชาติพันธุ์ และ (2) สถานะทางเศรษฐกิจและสังคมร่วมกับเชื้อชาติ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> กรณีเหล่านี้คำนึงถึงภาพจำที่จุดตัดของกลุ่มต่าง ๆ (เช่น อคติที่มีต่อผู้หญิงผิวดำโดยเฉพาะ หรือต่อชาติพันธุ์บางกลุ่มจากชนชั้นทางสังคมที่ต่ำกว่า)

### แม่แบบและการสร้างตัวอย่าง

สำหรับแต่ละหมวดหมู่ ทีมงานได้เขียน **แม่แบบสถานการณ์** — บทย่อสั้น ๆ ที่มีตัวละครสองคนซึ่งแตกต่างกันตามลักษณะเป้าหมาย (เช่น คนหนุ่มสาวและผู้สูงอายุ ผู้ชายและผู้หญิง คนรวยและคนจน เป็นต้น)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-paperswithcode-bbq-4)</sup> แม่แบบมีสถานการณ์ที่อาจยืนยันหรือหักล้างภาพจำที่รู้จักกัน ในแต่ละสถานการณ์จะมีคำถามและตัวเลือกคำตอบประกอบ

โดยรวมแล้ว มีการพัฒนาแม่แบบที่ไม่ซ้ำกัน 25 แม่แบบสำหรับแต่ละหมวดหมู่หลักทั้งเก้า บวกกับแม่แบบเพิ่มเติมอีก 25 แม่แบบสำหรับหมวดหมู่เชื้อชาติและเพศที่ใช้ชื่อจริง (เพื่อทดสอบ bias ในระดับชื่อเฉพาะ)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> นอกจากนี้ ยังสร้างแม่แบบ 25 แม่แบบสำหรับสองทิศทางแบบตัดกัน<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ดังนั้น จำนวนสถานการณ์พื้นฐานทั้งหมดจึงเกิน 300 รายการ

แต่ละแม่แบบมี **ช่องสำหรับตัวแปร** — ชื่อกลุ่มหรือคำอธิบาย — ที่จะถูกแทนที่ในข้อความ (เช่น ในแม่แบบด้านอายุ ตัวเลขต่าง ๆ จะถูกแทนที่แทน «คนอายุ \_» หรือในด้านรูปลักษณ์ — คำคุณศัพท์อย่าง «อ้วน»/«ผอม» เป็นต้น)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ด้วยการแทนที่ค่าต่าง ๆ และสลับลำดับการกล่าวถึงตัวละครสองคน แต่ละแม่แบบจะขยายออกเป็นตัวอย่างเฉพาะจำนวนมาก (อย่างน้อย 8 และมากถึงประมาณ 200 รูปแบบ)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> โดยทั่วไป จากแม่แบบเดียวจะมีการสร้างคำถามสุดท้ายอย่างน้อย 100 คำถาม และในบางกรณีสูงถึงสองร้อยคำถาม<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> รวมแล้วได้คลังข้อมูลที่มี 58,492 ตัวอย่าง (การผสมผสานที่ไม่ซ้ำกันของสถานการณ์ คำถาม และคำตอบ)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-paperswithcode-bbq-4)</sup>

### บริบทและประเภทของคำถาม

ลักษณะสำคัญของ BBQ คือ แต่ละสถานการณ์ถูกนำเสนอในสองรูปแบบบริบทและสองรูปแบบคำถาม ก่อให้เกิดชุด **สี่คำถาม** (เรียกว่ากลุ่มจากสี่)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> สิ่งนี้ทำขึ้นเพื่อแยกผลของการขาดข้อมูลออกจากภาพจำของโมเดลเอง ในแต่ละชุดสี่<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>:

- **บริบทที่กำกวม** (under-informative or ambiguous context): ข้อความที่อธิบายสถานการณ์ที่มีบุคคลสองคนจากกลุ่มต่างกัน แต่ไม่มีข้อมูลเพียงพอที่จะตอบคำถามที่ตั้งไว้อย่างชัดเจน<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> คำตอบที่ถูกต้องในกรณีดังกล่าวจะเป็นตัวเลือก «ไม่ทราบ» เสมอ (นั่นคือ การไม่มีข้อมูลเพียงพอ)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ตัวอย่างเหล่านี้มีไว้เพื่อตรวจสอบว่าโมเดลจะสรุปผลโดยอาศัยภาพจำหรือไม่
- **บริบทที่ชัดเจน** (disambiguated context): สถานการณ์ที่ขยายออกซึ่งมีการเพิ่มรายละเอียดที่ช่วยระบุว่าใครในสองคนที่กล่าวถึงสอดคล้องกับคำถาม<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ในกรณีนี้ ตัวละครหนึ่งในสองคือคำตอบที่ถูกต้องอย่างชัดเจน (และตัวเลือก «ไม่ทราบ» ไม่ถูกต้องแล้ว) บริบทที่ชัดเจนทำหน้าที่ตรวจสอบว่าโมเดลสามารถเอาชนะ bias ที่อาจมีและเลือกคำตอบที่ถูกต้องได้หรือไม่ แม้ว่าภาพจำจะชี้ไปในทิศทางตรงกันข้าม<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>
- **คำถามเชิงลบ** (e.g., «ใครในสองคนรู้เรื่องนี้น้อยกว่า?» «ใครเป็นคนก่ออาชญากรรม?»)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> คำถามดังกล่าวเมื่อใช้ร่วมกับบริบทที่กำกวมจะตรวจสอบว่าโมเดลมีแนวโน้มที่จะเชื่อมโยงการกระทำเชิงลบกับกลุ่มใดกลุ่มหนึ่งในกรณีที่ขาดข้อเท็จจริงหรือไม่<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>
- **คำถามที่ไม่เชิงลบ (เปรียบเทียบ)** (e.g., «ใครในสองคนรู้เรื่องนี้ดีกว่า?» หรือ «ใครละเว้นจากการกระทำที่ไม่ดี?»)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> คำถามที่ไม่เชิงลบถูกออกแบบมาเพื่อไม่ให้ฟังดูเหมือนการสนับสนุนภาพจำโดยตรง แต่ในขณะเดียวกันก็ให้ตรวจสอบความสมดุลของคำตอบโมเดลได้<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> การเปรียบเทียบคำตอบสำหรับเวอร์ชันเชิงลบและเวอร์ชันกลาง ๆ จะเผยให้เห็นความเอนเอียงเชิงระบบ

แต่ละตัวอย่างในกลุ่มทั้งสี่นี้มี **ตัวเลือกคำตอบสามตัวเลือก**: สองตัวเลือกเฉพาะเจาะจง (ระบุแต่ละกลุ่มจากสองกลุ่มที่ปรากฏ) และหนึ่งตัวเลือกที่บ่งบอกถึงการขาดข้อมูลเพียงพอ (ทำเครื่องหมายว่า «Unknown» และวลีที่เทียบเท่า)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ตัวอย่างเช่น ในฉากที่มีคริสเตียนและมุสลิม ตัวเลือกคำตอบจะเป็น «คริสเตียน» «มุสลิม» หรือ «ไม่ทราบ»<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ทั้งนี้ คำว่า «ไม่ทราบ» ไม่ได้มีรูปแบบเดียวเสมอไป — มีการใช้การแสดงออกที่มีความหมายเหมือนกัน 10 แบบ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>

นอกจากนี้ ในแต่ละแม่แบบจะมีการสลับ **ลำดับการกล่าวถึงสองกลุ่ม** โดยอัตโนมัติ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> สิ่งนี้ทำเพื่อลด **ผลของลำดับ** — ปัจจัยที่ทราบกันดีซึ่งโมเดลอาจเลือกเอนทิตีแรกที่กล่าวถึงบ่อยกว่าโดยไม่คำนึงถึงเนื้อหา<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>

### การทำคำอธิบายประกอบและการตรวจสอบคุณภาพ

ตัวอย่างแต่ละรายการของ BBQ ได้รับการประเมินโดยผู้ทำคำอธิบายประกอบแบบ crowdsourcing: มีผู้คนอิสระอย่างน้อย 5 คนตอบคำถาม และจะรวมเฉพาะตัวอย่างที่ **อย่างน้อย 4 ใน 5 ของผู้ทำคำอธิบายประกอบเห็นด้วยกับคำตอบที่ถูกต้อง** (โดยการโหวต) ลงใน dataset สุดท้ายเท่านั้น<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> หากคำถามใดผ่านเกณฑ์นี้ไม่ได้ แม่แบบทั้งหมดจะถูกทบทวนและแก้ไข<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ด้วยกระบวนการนี้ ความแม่นยำของมนุษย์บน BBQ จึงสูงมาก: ผู้ทำคำอธิบายประกอบแต่ละคนตอบถูกต้องประมาณ 95.7% ของคำถาม และเมื่อคำนึงถึงเสียงข้างมาก ความแม่นยำของมาตรฐานทองคำจะสูงถึง 99.7%<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ค่า Krippendorff's alpha สำหรับความสอดคล้องอยู่ที่ 0.883 ซึ่งบ่งชี้ถึง **ความสอดคล้องสูง** ระหว่างผู้คนเกี่ยวกับคำตอบที่ถูกต้อง<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> มาตรการเหล่านี้ยืนยันว่างาน BBQ เข้าใจได้สำหรับมนุษย์และมีคำตอบที่ถูกต้องอย่างเป็นวัตถุวิสัย ดังนั้น ข้อผิดพลาดของโมเดลในตัวอย่างเหล่านี้จึงสามารถตีความได้อย่างสมเหตุสมผลว่าเป็นการแสดงออกถึง bias ไม่ใช่เพราะความกำกวมของคำถามเอง

## การประเมินอคติของโมเดล

BBQ ถูกออกแบบมาเพื่อประเมินพฤติกรรมของโมเดลในสภาวะที่กระตุ้น social bias แบบหลายมิติ เมื่อทดสอบ โมเดล QA จะได้รับบริบทและคำถามเป็น input จากนั้นต้องเลือกหนึ่งใน three ตัวเลือกคำตอบ การวิเคราะห์ผลลัพธ์ดำเนินการในสองระดับ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>:

### กรณีบริบทที่กำกวม

วัดว่าโมเดลตอบคำถามผิดบ่อยแค่ไหนในกรณีที่ขาดข้อมูลที่จำเป็น นั่นคือ **อาศัยภาพจำ**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ในอุดมคติ โมเดลควรตอบว่า «ไม่ทราบ» สำหรับคำถามใด ๆ ที่มีบริบทไม่เพียงพอ แต่หากเลือกกลุ่มใดกลุ่มหนึ่ง นั่นถือว่าเป็นการฉายภาพจำที่ฝังอยู่<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ความถี่ของข้อผิดพลาดดังกล่าวและการกระจายตามหมวดหมู่ให้ภาพรวมของแนวโน้มของโมเดลในการทำให้ภาพจำที่เป็นอันตรายคงอยู่

### กรณีบริบทที่มีข้อมูลเพียงพอ

ประเมินความแม่นยำของโมเดลเมื่อบริบทมีคำตอบที่ถูกต้องอย่างชัดเจน<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ในที่นี้ มักจะคำนวณ metric มาตรฐาน **accuracy** (ร้อยละของคำตอบที่ถูกต้อง) — ซึ่งแสดงให้เห็นว่าโมเดลรับมือกับงานถาม-ตอบได้โดยทั่วไปหรือไม่ อย่างไรก็ตาม ความสนใจพิเศษจะมุ่งไปที่กรณีที่คำตอบที่ถูกต้องขัดแย้งกับภาพจำ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ผู้พัฒนา BBQ วิเคราะห์ว่าความแม่นยำของโมเดลจะลดลงหรือไม่หากคำตอบที่ถูกต้องขัดแย้งกับภาพจำที่ฝังรากลึก (และในทางกลับกัน ความแม่นยำจะสูงกว่าหรือไม่เมื่อความจริงตรงกับความคาดหวังตามภาพจำ)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ผลดังกล่าวจะชี้ว่าแม้มีข้อเท็จจริง โมเดลก็อาจเกิดข้อผิดพลาดเนื่องจาก bias

### Bias Score

เพื่อวัดระดับอคติเชิงปริมาณ จึงมีการนำ metric พิเศษมาใช้ — **ค่าคะแนนอคติ** (bias score)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> โดยทั่วไป bias score สะท้อนถึงร้อยละของคำตอบของโมเดล (ในบรรดาคำตอบผิดหรือทั้งหมด ขึ้นอยู่กับเงื่อนไข) ที่สอดคล้องกับภาพจำ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>

- ค่า **+100%** หมายความว่าโมเดลเลือกตัวเลือกคำตอบที่กำหนดคุณสมบัติเชิงลบให้กับกลุ่มเป้าหมายตามภาพจำในทุกกรณี
- **0%** — ไม่มีการแสดงออกถึง bias (โมเดลตอบถูกต้อง/«ไม่ทราบ» เสมอ หรือเกิดข้อผิดพลาดเท่ากันทั้งสองทาง)
- **ค่าคะแนนติดลบ** (ถึง -100%) — แนวโน้มตรงกันข้าม เมื่อโมเดลตอบขัดแย้งกับความคาดหวังของภาพจำเสมอ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>

ค่าคะแนนจะคำนวณแยกกันสำหรับบริบทที่กำกวมและบริบทที่ชัดเจน เนื่องจากลักษณะของข้อผิดพลาดในทั้งสองกรณีแตกต่างกัน<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>

- สำหรับ **คำถามที่กำกวม** bias score ถูกกำหนดโดยสัดส่วนของกรณีที่โมเดลเลือกคำตอบเฉพาะแทน «ไม่ทราบ» และคำตอบนั้นสอดคล้องกับภาพจำเชิงลบ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ยิ่งคำตอบดังกล่าวเกิดขึ้นบ่อยเท่าใด ค่าคะแนนบวกก็ยิ่งสูงขึ้นเท่านั้น ทั้งนี้ ความแม่นยำจะถูกคำนึงถึงด้วย: หากโมเดลเกิดข้อผิดพลาดและตอบถูก («ไม่ทราบ») เท่า ๆ กัน แม้จะมีข้อผิดพลาดตามภาพจำบ้าง ค่าคะแนนก็จะต่ำกว่าโมเดลที่เลือกคำตอบตามภาพจำเสมอ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ดังนั้น **ทั้งความถี่และความมั่นใจของคำตอบแบบ bias จะถูกลงโทษ** (สำหรับบริบทที่กำกวม metric จะถูกปรับขนาดตามร้อยละของคำตอบ «ไม่ทราบ» ที่ถูกต้อง)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>
- สำหรับ **คำถามที่ชัดเจน** bias score จะคำนวณแตกต่างออกไปเล็กน้อย เนื่องจากในที่นี้คำตอบที่ถูกต้องคือกลุ่มใดกลุ่มหนึ่ง<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ในกรณีเหล่านี้ จะพิจารณา **คำตอบผิด** ของโมเดล: สัดส่วนของข้อผิดพลาดที่โมเดลเลือกไม่ใช่ตัวเลือกที่ถูกต้อง แต่เป็นตัวเลือกอื่นที่สอดคล้องกับภาพจำ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> กล่าวอีกนัยหนึ่ง หากโมเดลผิดพลาดโดยให้ความสำคัญกับอคติ (เช่น ไม่เชื่อข้อเท็จจริงและตอบตามภาพจำ) ก็จะเพิ่มค่าคะแนน<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>

การวิเคราะห์ bias score ควบคู่กับความแม่นยำโดยรวมช่วยให้สามารถอธิบายพฤติกรรมของโมเดลบน BBQ ได้อย่างละเอียด ผู้เขียนชี้ให้เห็นว่า accuracy ที่เท่ากันอาจซ่อนลักษณะข้อผิดพลาดที่แตกต่างกัน<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ดังนั้น ค่าคะแนนนี้จึงแสดง **ทิศทางของข้อผิดพลาด** และเปิดเผยกรณีละเอียดอ่อนที่ไม่สามารถมองเห็นได้จากความแม่นยำเพียงอย่างเดียว

## ผลลัพธ์และรูปแบบที่ตรวจพบ

การทดสอบเบื้องต้นของโมเดล QA ที่ได้รับความนิยมหลายตัวบนชุดข้อมูล BBQ แสดงให้เห็นการแสดงออกถึง bias ที่ชัดเจนหลายประการ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ในการวิจัยของ Parrish และคณะ (2022) มีการทดสอบทั้งโมเดลอเนกประสงค์ขนาดใหญ่ (เช่น UnifiedQA — โมเดลทั่วไปสำหรับ QA บนพื้นฐาน T5) และโมเดล multiple-choice มาตรฐาน (เช่น RoBERTa ที่ fine-tune สำหรับ QA)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>

ข้อสรุปหลักจากผลการทดลอง:

- **ข้อผิดพลาดตามภาพจำที่รุนแรงเมื่อขาดข้อมูล** ในทุกระบบที่ทดสอบ มีแนวโน้มที่จะตอบตามภาพจำเมื่อบริบทไม่ให้เบาะแสที่จำเป็น<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> กล่าวคือ โมเดลมักไม่เลือกตัวเลือก «ไม่ทราบ» แต่กลับเลือกคำตอบเฉพาะที่สัมพันธ์กับความคาดหวังตามภาพจำนั้น ๆ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ตัวอย่างเช่น ในคำถามกำกวมเกี่ยวกับอาชญากรรมที่ไม่มีผู้กระทำผิดชัดเจน โมเดลมักชี้ไปที่บุคคลจากกลุ่มใดกลุ่มหนึ่ง (ที่สอดคล้องกับอคติ)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> bias score ที่คำนวณได้สำหรับบริบทแบบ ambiguous สูงกว่าศูนย์อย่างมีนัยสำคัญ และบางครั้งเข้าใกล้ +100% ในบางหมวดหมู่สำหรับโมเดลบางตัว<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> โมเดลแสดงแนวโน้มตอบตามภาพจำสูงเป็นพิเศษในสถานการณ์ที่เกี่ยวกับ **รูปลักษณ์ภายนอก** (โรคอ้วน เป็นต้น) — หมวดหมู่นี้ให้ bias สูงกว่าหมวดหมู่เชื้อชาติหรือรสนิยมทางเพศอย่างเห็นได้ชัด<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> สิ่งนี้บ่งชี้ถึงความไม่เป็นเนื้อเดียวกันของ bias ภายในโมเดล — ภาพจำบางประเภทถูก «เรียนรู้» มากกว่าประเภทอื่น
- **ความดีขึ้นเมื่อมีข้อเท็จจริง แต่ bias แฝงยังคงอยู่** เมื่อโมเดลได้รับบริบทที่ชัดเจนพร้อมการระบุคำตอบที่ถูกต้องอย่างชัดเจน **ความแม่นยำของโมเดลเพิ่มขึ้นอย่างเห็นได้ชัด** (เมื่อเทียบกับสถานการณ์ที่ไม่แน่นอน)<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> อย่างไรก็ตาม การวิเคราะห์โดยละเอียดเผยให้เห็นผลลัพธ์ที่ละเอียดอ่อน: ความแม่นยำ **ไม่สม่ำเสมอขึ้นอยู่กับความสัมพันธ์ของคำตอบที่ถูกต้องกับภาพจำ**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> โดยเฉลี่ย โมเดลมีความแม่นยำสูงกว่า 3-3.5 เปอร์เซ็นต์สำหรับตัวอย่างที่คำตอบที่ถูกต้องสอดคล้องกับภาพจำที่แพร่หลาย เมื่อเทียบกับตัวอย่างที่คำตอบที่ถูกต้องขัดแย้งกับภาพจำนั้น<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> กล่าวอีกนัยหนึ่ง เมื่อข้อเท็จจริงยืนยันอคติ โมเดลก็แทบจะให้คำตอบที่ถูกต้องเสมอ แต่หากต้องระบุตัวเลือก «ที่ไม่ตรงแบบ» สำหรับภาพจำ ความน่าจะเป็นของข้อผิดพลาดก็จะสูงขึ้น ช่องว่างในประสิทธิภาพนี้แม้จะไม่มากนัก แต่ก็ปรากฏทางสถิติในหลายหมวดหมู่<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ความแตกต่างสูงสุดพบสำหรับคำถามที่เกี่ยวกับภาพจำทางเพศ: สูงถึง 5 เปอร์เซ็นต์<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ดังนั้น **อิทธิพลแฝงของ bias** จึงมีให้เห็น: โดยเฉลี่ยแล้ว โมเดลทำงานได้แย่กว่าเล็กน้อยเมื่อ «ต่อต้านภาพจำ»
- **การเปรียบเทียบหมวดหมู่และแม่แบบ** นักวิจัย BBQ วิเคราะห์ bias score แยกตามหมวดหมู่ทั้งเก้า และพบว่าในบริบทที่กำกวม ค่าคะแนนเป็นบวกในทุกหมวดหมู่ แต่ขนาดของค่าแตกต่างกัน<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ดังที่กล่าวถึง bias สูงสุดพบในหมวดหมู่รูปลักษณ์ภายนอก สถานะทางเศรษฐกิจและสังคม และบางหมวดหมู่ที่ตัดกัน<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> bias score ที่ «ต่ำกว่า» แต่ก็ยังไม่ใช่ศูนย์ พบในหมวดหมู่เชื้อชาติ/ชาติพันธุ์และรสนิยมทางเพศ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ในบริบทที่ชัดเจน bias score โดยรวมใกล้เคียงกับศูนย์มากกว่า (เนื่องจากโมเดลมักตอบถูกต้อง) แต่ก็ยังคงเป็นบวกสำหรับแม่แบบบางอัน ซึ่งสะท้อนถึงความเอนเอียงที่เห็นได้ชัดในลักษณะของข้อผิดพลาดที่เกิดขึ้น<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ตัวอย่างเช่น ในหมวดหมู่ศาสนา ข้อผิดพลาดส่วนใหญ่ไปในทิศทางเดียว — โดยทั่วไป เมื่อโมเดลผิดพลาดก็มักเลือกคำตอบบนพื้นฐานของอคติ<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup>

โดยรวมแล้ว BBQ แสดงให้เห็นว่าแม้แต่โมเดลภาษาขนาดใหญ่สมัยใหม่ที่แข็งแกร่ง **ก็ยังชัดเจนว่าไม่ปลอดจากอคติทางสังคม**<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> โมเดลเหล่านี้มีแนวโน้มที่จะทำให้ภาพจำคงอยู่หากอยู่ในสถานการณ์ที่ไม่แน่นอน และอาจแสดง bias ที่ละเอียดอ่อนแม้มีข้อเท็จจริงที่ต้องการคำตอบตรงกันข้าม<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ทั้งนี้ ขนาดของผลกระทบเหล่านี้ไม่เท่ากันสำหรับกลุ่มต่าง ๆ: ภาพจำบางอย่างถูกโมเดล «เรียนรู้» มากกว่า<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> ผู้เขียน BBQ เน้นย้ำว่าความแตกต่างที่ค้นพบแม้จะสังเกตเห็นได้ แต่ก็ไม่ได้ร้ายแรงอย่างมาก — bias score ของโมเดลส่วนใหญ่ไม่ถึงค่าสุดโต่ง และมักอยู่ในระดับสิบกว่าเปอร์เซ็นต์<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> อย่างไรก็ตาม แม้แต่ความเบี่ยงเบนเชิงระบบเพียงเล็กน้อยในทิศทางของภาพจำก็อาจเป็นอันตรายในการใช้งาน Large Language Models ในวงกว้าง ดังนั้นการระบุและขจัด bias ดังกล่าวจึงเป็นงานสำคัญ<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-evaluating-mitigating-3)</sup> BBQ ได้มอบวิธีที่ชัดเจนและวัดได้เชิงปริมาณแก่นักวิจัยในการติดตามความก้าวหน้าในด้านนี้<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-evaluating-mitigating-3)</sup>

## อิทธิพลและการวิจัยต่อเนื่อง

ชุดข้อมูล BBQ ได้รับการยอมรับอย่างรวดเร็วในฐานะเครื่องมือมาตรฐานสำหรับประเมินคุณลักษณะ fairness ของโมเดลภาษา<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-paperswithcode-bbq-4)</sup> **โค้ดต้นฉบับเปิดและข้อมูล** ของ BBQ มีให้ในที่เก็บข้อมูล (สัญญาอนุญาต CC BY 4.0)<sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-paperswithcode-bbq-4)</sup> ซึ่งช่วยให้ชุมชนนักวิจัยในวงกว้างสามารถนำ BBQ ไปใช้ในการพัฒนาและทดสอบโมเดลใหม่ได้ ในบทสำรวจหลายฉบับ BBQ ถูกกล่าวถึงควบคู่กับ benchmark อื่น ๆ (เช่น StereoSet, WinoBias, ToxiGen) ในฐานะจุดเปลี่ยนสำคัญในการศึกษา social bias ใน NLP<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-evaluating-mitigating-3)</sup> นับตั้งแต่เผยแพร่ BBQ มีผลงานวิจัยที่พัฒนาแนวคิดและปรับให้เข้ากับเงื่อนไขใหม่:

- **การขยายรูปแบบคำถาม (Open-BBQ)** BBQ ต้นฉบับนำเสนองานในรูปแบบ multiple-choice<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-evaluating-mitigating-3)</sup> ในปี 2024 มีการเสนอการดัดแปลง BBQ สำหรับ **คำตอบแบบเปิด** รวมถึงงานเติมคำในช่องว่างและข้อความตอบสั้น ๆ<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-evaluating-mitigating-3)</sup> เวอร์ชันนี้ซึ่งเรียกกันว่า Open-BBQ ช่วยให้สามารถประเมิน bias ในสภาพแวดล้อมการสนทนาที่เป็นอิสระมากขึ้น โดยที่โมเดลไม่มีตัวเลือกคำตอบที่กำหนดไว้<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-evaluating-mitigating-3)</sup> การวิจัยพบว่า Large Language Models เมื่อสร้างข้อความอิสระก็แสดง bias ที่เพิ่มขึ้นต่อกลุ่มบางกลุ่มเช่นกัน<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-evaluating-mitigating-3)</sup> ผู้เขียน Open-BBQ ยังทดลองใช้วิธีการลด bias โดยผสมผสาน zero-shot และ few-shot prompting และ chain-of-thought (การให้เหตุผลทีละขั้น)<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-evaluating-mitigating-3)</sup> วิธีการเหล่านี้ช่วยลดระดับ bias ในคำตอบได้อย่างเห็นได้ชัด<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-evaluating-mitigating-3)</sup> Open-BBQ เป็นการเสริม dataset ต้นฉบับ ทำให้สามารถทดสอบโมเดลเชิงสร้างสรรค์ในรูปแบบที่ใกล้เคียงกับคำขอของผู้ใช้มากขึ้น

<!-- -->

- **การปรับให้เข้ากับวัฒนธรรม (การแปลภาษาท้องถิ่น)** เนื่องจาก BBQ ผูกพันกับความจริงทางสังคมของสหรัฐอเมริกา นักวิจัยจึงสนใจการปรับให้เข้ากับภาษาและวัฒนธรรมอื่น ๆ<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-kobbg-5)</sup> ในปี 2023 นักวิทยาศาสตร์ชาวเกาหลีได้นำเสนอ dataset **KoBBQ** (Korean BBQ) — เวอร์ชันเกาหลีของ Bias Benchmark<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-kobbg-5)</sup> พวกเขาพัฒนาแนวทางทั่วไปสำหรับการแปลภาษาท้องถิ่น BBQ โดยแบ่งแม่แบบต้นฉบับออกเป็นสามประเภท — ที่สามารถแปลได้เลย ที่ต้องการเปลี่ยนกลุ่มเป็นเทียบเท่าท้องถิ่น และที่ไม่สามารถใช้ได้เลยในบริบทของเกาหลี<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-kobbg-5)</sup> นอกจากนี้ KoBBQ ยังนำเสนอหมวดหมู่ภาพจำใหม่ 4 หมวดหมู่ที่เฉพาะเจาะจงสำหรับสังคมเกาหลีและลบตัวอย่างที่ไม่เหมาะสมบางส่วนออก<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-kobbg-5)</sup> ผลลัพธ์ที่ได้คือชุดข้อมูลที่มี 268 แม่แบบและ 76,048 ตัวอย่างในภาษาเกาหลี ครอบคลุม 12 หมวดหมู่ social bias (รวมทั้งต้นฉบับและใหม่)<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-kobbg-5)</sup> การทดสอบโมเดลหลายภาษาบน KoBBQ เผยให้เห็นความแตกต่างที่มีนัยสำคัญในระดับอคติเมื่อเทียบกับการแปล BBQ ต้นฉบับโดยตรงเป็นภาษาเกาหลีด้วยเครื่อง<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-kobbg-5)</sup> สิ่งนี้เน้นย้ำว่า **การแปลโดยตรงไม่เพียงพอ** — จำเป็นต้องมี benchmark เฉพาะทางวัฒนธรรมที่คำนึงถึงภาพจำและบริบทเฉพาะของแต่ละประเทศ<sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-kobbg-5)</sup> งานวิจัยเกี่ยวกับ KoBBQ แสดงให้เห็นถึงความเป็นไปได้ในการขยายวิธีการ BBQ ในระดับโลก

BBQ ได้กลายเป็นส่วนหนึ่งที่ขาดไม่ได้ของการวิจัยด้าน **윤리ความถูกต้องทางจริยธรรมของปัญญาประดิษฐ์**<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-evaluating-mitigating-3)</sup> อิทธิพลของ BBQ ปรากฏในการเกิดขึ้นของวิธีการ debiasing โมเดลใหม่ ๆ การสร้าง dataset ที่ครอบคลุมมากขึ้น และ metric สำหรับการวิเคราะห์ bias อย่างละเอียด นักวิจัยตั้งข้อสังเกตว่าหนึ่งในจุดแข็งของ BBQ คือความกว้างของความครอบคลุมและความพิถีพิถันในการสร้างตัวอย่าง<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-evaluating-mitigating-3)</sup> เพื่อตอบสนองต่อความท้าทายที่ BBQ ระบุ ปัจจุบันมีการพัฒนา **กลยุทธ์การลด bias** อย่างแข็งขัน ตั้งแต่การกรองข้อมูลการฝึกอบรมไปจนถึงอัลกอริธึมการประมวลผลหลังการฝึกพิเศษและการปรับ Large Language Models ให้ตอบสนองอย่างเป็นธรรม<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-evaluating-mitigating-3)</sup>

โดยสรุป BBQ (Bias Benchmark for QA) พิสูจน์ตัวเองในฐานะเครื่องมือที่มีคุณค่าและเชื่อถือได้สำหรับการวัดอคติทางสังคมในโมเดลภาษา ชุดข้อมูลนี้มอบชุดการตรวจสอบมาตรฐานแก่ชุมชนนักวิจัย ซึ่งช่วยให้สามารถเปรียบเทียบโมเดลในแง่ของการมีภาพจำและติดตามความก้าวหน้าในการปรับปรุงความเป็นกลางของโมเดลได้<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-evaluating-mitigating-3)</sup> BBQ ยังคงขยายตัวและปรับตัวต่อไป สะท้อนถึงความสนใจระดับโลกในการสร้าง **ระบบ AI ที่เป็นธรรมและปลอดภัยยิ่งขึ้น**<sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-evaluating-mitigating-3)</sup> ซึ่งปราศจาก bias ที่เป็นอันตรายอย่างมีนัยสำคัญแม้จะมองไม่เห็น

## ลิงก์

- บทความต้นฉบับ BBQ (arXiv)
- ที่เก็บข้อมูล BBQ บน GitHub
- หน้า dataset BBQ บน Papers With Code
- บทความ BBQ บน ACL Anthology
- บทความเกี่ยวกับ dataset KoBBQ (arXiv)
- บทความเกี่ยวกับ dataset Open-BBQ (arXiv)

## เอกสารอ้างอิง

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## หมายเหตุ

<sup>[\[1\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-bbq-main-1)</sup> <sup>[\[2\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-acl-anthology-2)</sup> <sup>[\[3\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-evaluating-mitigating-3)</sup> <sup>[\[4\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-paperswithcode-bbq-4)</sup> <sup>[\[5\]](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_note-arxiv-kobbg-5)</sup> \</references\>

1.  <span id="cite_note-arxiv-bbq-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-80)</sup> <sup>[1.81](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-bbq-main_1-81)</sup> Parrish A. et al. «BBQ: A Hand-Built Bias Benchmark for Question Answering». *arXiv*. <a href="https://arxiv.org/abs/2110.08193" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-acl-anthology-2">↑ <sup>[2.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-acl-anthology_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-acl-anthology_2-1)</sup> Parrish A. et al. «BBQ: A hand-built bias benchmark for question answering». *ACL Anthology*. <a href="https://aclanthology.org/2022.findings-acl.165/" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-evaluating-mitigating-3">↑ <sup>[3.00](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-evaluating-mitigating_3-0)</sup> <sup>[3.01](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-evaluating-mitigating_3-1)</sup> <sup>[3.02](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-evaluating-mitigating_3-2)</sup> <sup>[3.03](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-evaluating-mitigating_3-3)</sup> <sup>[3.04](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-evaluating-mitigating_3-4)</sup> <sup>[3.05](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-evaluating-mitigating_3-5)</sup> <sup>[3.06](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-evaluating-mitigating_3-6)</sup> <sup>[3.07](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-evaluating-mitigating_3-7)</sup> <sup>[3.08](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-evaluating-mitigating_3-8)</sup> <sup>[3.09](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-evaluating-mitigating_3-9)</sup> <sup>[3.10](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-evaluating-mitigating_3-10)</sup> <sup>[3.11](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-evaluating-mitigating_3-11)</sup> <sup>[3.12](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-evaluating-mitigating_3-12)</sup> <sup>[3.13](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-evaluating-mitigating_3-13)</sup> <sup>[3.14](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-evaluating-mitigating_3-14)</sup> <sup>[3.15](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-evaluating-mitigating_3-15)</sup> <sup>[3.16](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-evaluating-mitigating_3-16)</sup> Liu Z. et al. (2024). «Evaluating and Mitigating Social Bias for Large Language Models in Open-ended Settings». *arXiv preprint*. <a href="https://arxiv.org/html/2412.06134v1" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-paperswithcode-bbq-4">↑ <sup>[4.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-paperswithcode-bbq_4-0)</sup> <sup>[4.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-paperswithcode-bbq_4-1)</sup> <sup>[4.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-paperswithcode-bbq_4-2)</sup> <sup>[4.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-paperswithcode-bbq_4-3)</sup> <sup>[4.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-paperswithcode-bbq_4-4)</sup> <sup>[4.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-paperswithcode-bbq_4-5)</sup> <sup>[4.6](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-paperswithcode-bbq_4-6)</sup> «BBQ Dataset». *Papers With Code*. <a href="https://paperswithcode.com/dataset/bbq" class="external autonumber" rel="nofollow">[4]</a></span>
5.  <span id="cite_note-arxiv-kobbg-5">↑ <sup>[5.0](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-kobbg_5-0)</sup> <sup>[5.1](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-kobbg_5-1)</sup> <sup>[5.2](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-kobbg_5-2)</sup> <sup>[5.3](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-kobbg_5-3)</sup> <sup>[5.4](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-kobbg_5-4)</sup> <sup>[5.5](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-kobbg_5-5)</sup> <sup>[5.6](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-kobbg_5-6)</sup> <sup>[5.7](https://systems-analysis.info/int/BBQ_(Bias_Benchmark_for_Question_Answering)_(TH)#cite_ref-arxiv-kobbg_5-7)</sup> Jin J. et al. (2024). «KoBBQ: Korean Bias Benchmark for Question Answering». *arXiv preprint*. <a href="https://arxiv.org/abs/2307.16778" class="external autonumber" rel="nofollow">[5]</a></span>
