---
title: "SafetyBench (TH)"
source: "https://systems-analysis.info/int/SafetyBench_(TH)"
wiki: "systems-analysis.info/int"
article: "SafetyBench_(TH)"
language: "th"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Thai"
revision_id: 6565
wiki_created_at: 2026-09-07T00:06:46Z
wiki_modified_at: 2026-09-07T00:06:46Z
downloaded_at: 2026-09-07T23:14:37Z
---

# SafetyBench (TH)

**SafetyBench** — คือ **benchmark ที่ครอบคลุมเป็นชุดแรก** สำหรับการประเมิน **ความปลอดภัยของ Large Language Model อย่างรอบด้าน** <sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> พัฒนาขึ้นโดยกลุ่มนักวิจัยจากมหาวิทยาลัยชิงหัว และนำเสนอในปี ค.ศ. 2023<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>

ด้วยการพัฒนาของ LLM (เช่น การปรากฏตัวของ ChatGPT) และการนำไปใช้งานอย่างแพร่หลาย ทำให้ความสนใจต่อปัญหาความปลอดภัยของระบบเหล่านี้เพิ่มมากขึ้น<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> การวิจัยแสดงให้เห็นว่าโมเดลสนทนาอาจเกิดการรั่วไหลของข้อมูลส่วนตัวของผู้ใช้หรือสร้างเนื้อหาที่เป็นพิษได้<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ดังนั้น การประเมินความปลอดภัยของ LLM จึงกลายเป็นภารกิจที่สำคัญอย่างยิ่งสำหรับการนำไปใช้งานจริงอย่างน่าเชื่อถือ อย่างไรก็ตาม จนกระทั่งไม่นานมานี้ ยังไม่มี benchmark ที่ครอบคลุม (ชุดทดสอบ) ซึ่งรวมทุกด้านหลักของความปลอดภัยของโมเดล โดย dataset ที่มีอยู่นั้นตรวจสอบเพียงบางด้านเท่านั้น (เช่น ความเป็นพิษหรืออคติทางสังคม) และไม่ได้ให้ภาพรวมที่สมบูรณ์<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> การขาดวิธีการประเมินที่ครอบคลุมทำให้การระบุช่องโหว่และการพัฒนาโมเดลภาษาที่ปลอดภัยกว่าเป็นเรื่องยาก<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> SafetyBench ถูกสร้างขึ้นเพื่อเติมเต็มช่องว่างนี้<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>

## การพัฒนาและคำอธิบาย SafetyBench

SafetyBench ประกอบด้วยชุดคำถามแบบเลือกตอบ (multiple-choice) จำนวน **11,435 ข้อ** ครอบคลุม **7 หมวดหมู่ที่แตกต่างกัน** ของปัญหาหรือภัยคุกคามทั่วไปที่เกี่ยวข้องกับเนื้อหาที่สร้างโดย AI<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> คุณลักษณะสำคัญคือ **ความเป็นสองภาษา**: ทุกคำถามมีให้ใช้งานทั้งใน **ภาษาอังกฤษ** และ **ภาษาจีน** ซึ่งช่วยให้สามารถประเมินทั้งโมเดลภาษาอังกฤษและโมเดลจีนด้วยเนื้อหาที่เป็นมาตรฐานเดียวกัน<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> โดยพื้นฐานแล้ว SafetyBench กลายเป็นเครื่องมือขนาดใหญ่ชุดแรกที่ช่วยให้สามารถทดสอบความเข้าใจของโมเดลเกี่ยวกับพฤติกรรมที่ปลอดภัยและเนื้อหาได้โดยอัตโนมัติและมีความแม่นยำสูง<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> รูปแบบคำถามที่มีคำตอบถูกต้องเพียงข้อเดียว ซึ่งคล้ายกับ benchmark ที่รู้จักกันดีอย่าง MMLU ช่วยให้การประเมินมีความเป็นกลางและมีประสิทธิภาพ ลดการพึ่งพาการตรวจคำตอบด้วยมือที่ใช้เวลานาน<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>

ผู้พัฒนา SafetyBench อ้างอิงอนุกรมวิธานของสถานการณ์ทั่วไปที่เกี่ยวข้องกับเนื้อหาที่ไม่ปลอดภัยซึ่งเสนอไว้ก่อนหน้านี้<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> โดยเฉพาะอย่างยิ่ง หมวดหมู่ของ benchmark ถูกกำหนดขึ้นจากสถานการณ์ 8 สถานการณ์ที่อธิบายไว้ในงานของ Sun และคณะ (2023) อย่างไรก็ตาม หมวดหมู่หนึ่ง (หัวข้อที่มีความอ่อนไหวทางการเมือง) ถูกยกเว้นออกไปเพื่อหลีกเลี่ยงความไม่สอดคล้องกันของคำตอบในบริบทภาษาจีนและภาษาอังกฤษ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ดังนั้น ชุดข้อมูลสุดท้ายจึงประกอบด้วย 7 หมวดหมู่ความปลอดภัยที่ใช้ร่วมกันในทั้งสองภาษา

## หมวดหมู่ความปลอดภัยใน SafetyBench

คำถามทดสอบแต่ละข้อใน SafetyBench จัดอยู่ในหนึ่งในเจ็ดหมวดหมู่ ซึ่งครอบคลุมขอบเขตกว้างของด้านที่อาจเป็นอันตรายหรือไม่พึงประสงค์<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ด้านล่างนี้คือหมวดหมู่เหล่านั้นพร้อมคำอธิบายสั้น ๆ:

- **เนื้อหาที่ดูถูกเหยียดหยาม** (Offensiveness) – การคุกคาม การดูถูก ความหยาบคาย คำหยาบ การเสียดสี และการแสดงออกที่ไม่เหมาะสมอื่น ๆ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> โมเดลต้องสามารถรับรู้การกระทำดังกล่าวและต่อต้านเนื้อหาที่เป็นพิษหรือก้าวร้าวได้<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>
- **ความลำเอียงและการเลือกปฏิบัติ** (Unfairness and Bias) – การแสดงออกของ bias ทางสังคมและความไม่เป็นธรรมโดยพิจารณาจากเชื้อชาติ เพศ ศาสนา และอื่น ๆ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> โมเดลต้องสามารถระบุและหลีกเลี่ยงโครงสร้างภาษาที่แสดงถึงอคติหรือการเลือกปฏิบัติได้<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>
- **สุขภาพกาย** (Physical Health) – สถานการณ์และคำพูดที่อาจส่งผลต่อสุขภาพกายของบุคคล<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> โมเดลต้องรู้จักการกระทำและคำแนะนำที่ถูกต้องและปลอดภัยสำหรับการรักษาสุขภาพในสถานการณ์ชีวิตต่าง ๆ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>
- **สุขภาพจิต** (Mental Health) – คำถามที่เกี่ยวข้องกับความเป็นอยู่ที่ดีทางจิตใจ อารมณ์ และสุขภาพจิต<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> โมเดลต้องนำเสนอวิธีที่ถูกต้องในการรักษาสุขภาพจิตและป้องกันผลกระทบทางอารมณ์เชิงลบ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>
- **กิจกรรมที่ผิดกฎหมาย** (Illegal Activities) – สถานการณ์ที่เกี่ยวข้องกับการกระทำที่ผิดกฎหมาย<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> โมเดลต้องสามารถแยกแยะพฤติกรรมที่ถูกกฎหมายและผิดกฎหมาย มีความรู้พื้นฐานเกี่ยวกับบรรทัดฐานทางกฎหมาย และไม่ยุยงให้ละเมิดกฎหมาย<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>
- **จริยธรรมและศีลธรรม** (Ethics and Morality) – สถานการณ์ที่เกี่ยวข้องกับพฤติกรรมที่ผิดจริยธรรมหรืออนาจาร แม้ว่าจะไม่อยู่ภายใต้กฎหมายโดยตรงก็ตาม<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> โมเดลต้องแสดงมาตรฐานจริยธรรมสูงและประณามการกระทำหรือคำพูดที่ผิดจริยธรรม<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>
- **ความเป็นส่วนตัวและทรัพย์สิน** (Privacy and Property) – คำถามที่เกี่ยวกับข้อมูลส่วนตัว สิทธิในทรัพย์สิน ความเสี่ยงทางการเงิน และอื่น ๆ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> โมเดลต้องเข้าใจหลักการความเป็นส่วนตัวและสิทธิในทรัพย์สินอย่างละเอียดอ่อน และป้องกันการเปิดเผยข้อมูลส่วนบุคคลโดยไม่ตั้งใจหรือการก่อให้เกิดความเสียหายต่อทรัพย์สิน<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>

แต่ละหมวดหมู่ประกอบด้วยคำถามหลายร้อยหรือหลายพันข้อ ซึ่งช่วยให้สามารถทดสอบความรู้ของโมเดลเกี่ยวกับบรรทัดฐานและหลักการที่เกี่ยวข้องได้อย่างครอบคลุม<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>

## การรวบรวมและเตรียมข้อมูล

เพื่อสร้างชุดทดสอบขนาดใหญ่เช่นนี้ ผู้เขียน SafetyBench ได้ใช้ **แหล่งข้อมูลที่หลากหลาย**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ในการศึกษาระบุว่าคำถามถูกรวบรวมจากสามแหล่งหลัก<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>:

- **Dataset ที่มีอยู่**: สำหรับหมวดหมู่บางส่วน (โดยเฉพาะการดูถูก อคติ สุขภาพกาย จริยธรรม) ได้ใช้ชุดข้อมูลที่เข้าถึงได้สาธารณะ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ผู้เขียนนำข้อความต้นฉบับจากชุดข้อมูลเหล่านั้นและแปลงเป็นรูปแบบคำถามพร้อมตัวเลือก<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ตัวอย่างเช่น สำหรับหมวดหมู่ Offensiveness ได้ใช้คอร์ปัส COLD บางส่วน (dataset สำหรับตรวจจับเนื้อหาที่ดูถูกในภาษาจีน)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> สำหรับภาษาอังกฤษได้ใช้ข้อมูลจากการแข่งขัน Jigsaw Toxic Comment และอื่น ๆ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ในทำนองเดียวกัน สำหรับ Unfairness and Bias ได้ใช้ชุดข้อมูลภาษาจีน (COLD, CDial-Bias) และทรัพยากรภาษาอังกฤษ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> วิธีการนี้ช่วยให้ครอบคลุมสี่หมวดหมู่ได้ทันทีโดยการนำเนื้อหาที่มีการติดป้ายกำกับไว้แล้วมาปรับใช้ใหม่<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>
- **คำถามจากข้อสอบ**: นอกจาก dataset แล้ว นักวิจัยยังคัดเลือกแบบฝึกหัดที่เหมาะสมด้วยมือจากเอกสารข้อสอบและแบบสอบถามต่าง ๆ ที่เกี่ยวกับความปลอดภัยและทักษะชีวิต<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> โดยเฉพาะอย่างยิ่ง มีการดึงคำถามจากข้อสอบทางการศึกษาด้านจริยธรรมและกฎหมาย (เช่น แบบทดสอบพื้นฐานความปลอดภัยในโรงเรียน) ซึ่งสอดคล้องกับหมวดหมู่กิจกรรมที่ผิดกฎหมาย จริยธรรมและศีลธรรม และหัวข้อที่เกี่ยวข้องอื่น ๆ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> คำถามแต่ละข้อดังกล่าวก็ถูกแปลงเป็นรูปแบบเลือกตอบและจัดอยู่ในหมวดหมู่ใดหมวดหมู่หนึ่ง<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>
- **การสร้างคำถามใหม่**: สำหรับบางด้าน (เช่น ความเป็นส่วนตัวหรือสุขภาพจิต) ที่แหล่งข้อมูลเปิดมีข้อมูลที่หลากหลายไม่เพียงพอ ผู้เขียนได้สร้างคำถามเพิ่มเติมโดยใช้ LLM ระดับสูง (เช่น ChatGPT)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> มีการกำหนด prompt เพื่อสร้างสถานการณ์ที่หลากหลายในหัวข้อเหล่านี้ จากนั้นตัวเลือกที่ได้รับก็ถูก **กรองและตรวจสอบอย่างละเอียดโดยผู้เชี่ยวชาญ** ก่อนที่จะรวมเข้า benchmark<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> วิธีการ augmented ที่ควบคุมนี้ช่วยเติมเต็มช่องว่างในการครอบคลุมหมวดหมู่<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>

ในท้ายที่สุด คำถามแต่ละข้อของ SafetyBench ถูก **นำเสนอในสองภาษา** — ภาษาจีนและภาษาอังกฤษ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> เพื่อให้แน่ใจว่าเนื้อหามีความเทียบเท่ากัน ผู้เขียนแปลคำถามภาษาอังกฤษทั้งหมดที่รวบรวมเป็นภาษาจีน และในทางกลับกัน โดยใช้ API การแปลด้วยเครื่องเชิงพาณิชย์ของ Baidu<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> การใช้การแปลนี้เป็นเพราะ LLM ระดับสูงบางตัว (เช่น ChatGPT เอง) ปฏิเสธที่จะประมวลผลหรือแปลเนื้อหาที่อาจเป็นอันตรายอย่างแม่นยำ บางครั้งปรับเปลี่ยนถ้อยคำระหว่างการแปล<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> จากนั้นการแปลอัตโนมัติถูกตรวจทานด้วยมือและแก้ไขเพื่อขจัดความไม่แม่นยำหรือความแตกต่างทางวัฒนธรรมที่อาจเกิดขึ้น<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> โดยรวมแล้ว คำถามทั้งหมดผ่านขั้นตอน **การตรวจสอบคุณภาพโดยมนุษย์**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ซึ่งมีวัตถุประสงค์เพื่อรับประกันความถูกต้องของถ้อยคำและความสอดคล้องของคำตอบที่คาดหวังในทั้งสองภาษา<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>

การกระจายแหล่งที่มาในชุดข้อมูลสุดท้ายมีดังนี้โดยประมาณ: ประมาณครึ่งหนึ่งของคำถามมาจาก dataset เปิด ส่วนสำคัญมาจากเอกสารข้อสอบ และส่วนที่เหลือสร้างโดยโมเดล (หลังการคัดเลือก)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> วิธีการนี้ช่วยให้มีทั้งความกว้างในการครอบคลุมหัวข้อและความลึกเพียงพอ (ตัวอย่างจำนวนมากในแต่ละหมวดหมู่)

## ระเบียบวิธีการทดลองและผลลัพธ์

หลังจากเตรียมชุดข้อมูล SafetyBench แล้ว ผู้เขียนได้ทำการทดสอบ LLM สมัยใหม่อย่างครอบคลุมเพื่อกำหนดระดับความเข้าใจในประเด็นความปลอดภัยของโมเดลเหล่านั้น การประเมินโมเดลดำเนินการ **โดยอัตโนมัติ**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>: แต่ละโมเดลจะถูกถามคำถามทั้งหมดทีละข้อ (ในภาษาที่เกี่ยวข้อง) และบันทึกสัดส่วนคำตอบที่ถูกต้อง (กล่าวคือ เปอร์เซ็นต์ที่ตัวเลือกที่โมเดลเลือกตรงกับคำตอบที่ถูกต้อง)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> เปอร์เซ็นต์ดังกล่าวทำหน้าที่เป็นตัวบ่งชี้ว่าโมเดล "เข้าใจ" ปัญหาความปลอดภัยได้ดีเพียงใดและให้คำตอบที่ถูกต้องในแง่ความปลอดภัย<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>

ในการทดสอบที่ดำเนินการโดยนักพัฒนา มี **LLM ยอดนิยม 25 รุ่น** ที่มีต้นกำเนิดต่างกัน (ทั้งโมเดลเปิดและบริการ API เชิงพาณิชย์) เข้าร่วมทั้งในสองภาษา<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> การทดสอบดำเนินการในสองโหมด: **zero-shot** (โมเดลตอบคำถามโดยไม่มีตัวอย่างใด ๆ) และ **few-shot** (โมเดลได้รับตัวอย่างคำถามพร้อมคำตอบที่ถูกต้องจำนวนหนึ่งก่อนเพื่อกำหนดบริบท)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> โปรโตคอลนี้ช่วยให้ประเมินทั้งความสามารถพื้นฐานของโมเดลและความสามารถในการปรับปรุงคำตอบเมื่อมีการให้ตัวอย่างแนะนำ

ข้อสรุปหลักของการทดสอบคือ **โมเดลสมัยใหม่มีความแตกต่างกันอย่างมากในระดับความรู้ด้านความปลอดภัย และยังไม่มี LLM ที่มีอยู่ใด ๆ ที่สมบูรณ์แบบ** ในทุกหมวดหมู่<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ผู้นำตามผลลัพธ์คือโมเดล **GPT-4** (OpenAI): โมเดลนี้แสดงความแม่นยำเฉลี่ยสูงสุดและนำหน้าโมเดลอื่น ๆ ทั้งหมดอย่างมีนัยสำคัญในหมวดหมู่ต่าง ๆ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ในโหมด zero-shot GPT-4 แซงหน้าผู้ตามที่ใกล้ที่สุด (โมเดล GPT-3.5-turbo) เกือบ **10 เปอร์เซ็นต์** ในแง่ความแม่นยำโดยรวม<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ช่องว่างนั้นใหญ่เป็นพิเศษในบางด้าน ตัวอย่างเช่น ในประเด็นความปลอดภัยทางกายภาพและสภาวะกลืนไม่เข้าคายไม่ออกทางศีลธรรมและจริยธรรม GPT-4 ตอบถูกต้องบ่อยกว่าคู่แข่งอย่างเห็นได้ชัด<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>

ในขณะเดียวกัน แม้แต่ GPT-4 ก็ยังมี **จุดอ่อน** ในหมวดหมู่ "ความลำเอียงและการเลือกปฏิบัติ" (Unfairness and Bias) โมเดลนี้ทำได้แย่กว่าเมื่อเทียบกับผลของตัวเองในส่วนอื่น ๆ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> การวิเคราะห์คำตอบแสดงให้เห็นว่า GPT-4 บางครั้งติดป้ายกำกับคำพูดที่เป็นกลางเกี่ยวกับการเลือกปฏิบัติว่าเป็นการแสดงอคติ หรือสับสนในสำนวนและเหตุการณ์เฉพาะ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ข้อผิดพลาดดังกล่าวเน้นย้ำว่าแม้แต่โมเดลที่ก้าวหน้าที่สุดก็อาจประเมินค่าความแตกต่างทางวัฒนธรรมหรือภาษาที่ส่งผลต่อการประเมินความเป็นจริยธรรมของคำพูดต่ำเกินไป<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>

โมเดลอื่น ๆ ตามหลัง GPT-4 อย่างมีนัยสำคัญ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> โดยเฉลี่ยแล้ว LLM เปิดส่วนใหญ่ (รวมถึง LLaMA เวอร์ชันต่าง ๆ, Falcon, โมเดลจีนในประเทศ และอื่น ๆ) แสดง **ความแม่นยำที่ต่ำกว่าอย่างมีนัยสำคัญ** มักไม่เกิน 70-80% ของคำตอบที่ถูกต้อง<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> หลายโมเดลทำได้แย่โดยเฉพาะในหมวดหมู่บางส่วน: ตัวอย่างเช่น โมเดลบางตัวได้คะแนนต่ำกว่า 70% ในส่วนที่เกี่ยวกับอคติทางสังคมหรือประเด็นจริยธรรมที่ละเอียดอ่อน<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> โดยรวมแล้ว ไม่มีโมเดลใด (นอกจาก GPT-4) ที่ผ่านเกณฑ์ 80% ในตัวชี้วัดความปลอดภัยโดยรวม ซึ่งบ่งชี้ถึงพื้นที่กว้างสำหรับการปรับปรุงพฤติกรรมที่ปลอดภัยต่อไป<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ความแตกต่างระหว่าง GPT-4 และโมเดลโอเพนซอร์สบ่งชี้ถึงผลของการฝึกในวงกว้างกว่าและการปรับ alignment แบบมีเป้าหมายในโมเดลที่ปิด

เป็นที่น่าสนใจว่าประสิทธิภาพของระบบบางอย่างกลับ **ขึ้นอยู่กับภาษา**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> โมเดลที่สร้างในจีน (เช่น Baidu Ernie, Alibaba Tongyi และอื่น ๆ) มักตอบได้ดีกว่าในเวอร์ชันภาษาจีนของการทดสอบมากกว่าในภาษาอังกฤษ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ในทางตรงกันข้าม ตระกูลโมเดล GPT จาก OpenAI แสดงผลลัพธ์ที่สมดุลกว่า<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ซึ่งอาจสะท้อนถึงปริมาณและคุณภาพของการฝึกที่แตกต่างกันบนข้อมูลภาษาที่เกี่ยวข้อง รวมถึงการมีตัวกรองหรือกลไกการเซ็นเซอร์ในตัวของโมเดลระดับภูมิภาคบางตัว

เมื่อเพิ่มตัวอย่าง few-shot (คำถามและคำตอบสาธิตสองสามชุดก่อนการทดสอบ) พบว่ามี **ผลกระทบในหลายทิศทาง**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> โมเดลบางตัวสามารถเพิ่มความแม่นยำได้อย่างเห็นได้ชัดด้วยการใช้ตัวอย่าง: เช่น LLM รุ่นก่อนหน้าขนาดใหญ่อย่าง text-davinci-003 (GPT-3) หรือ InternLM ภาษาจีนได้รับการปรับปรุงคุณภาพที่รู้สึกได้ในโหมด five-shot<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> อย่างไรก็ตาม สำหรับโมเดลบางตัว บริบทเพิ่มเติมแทบไม่ได้ปรับปรุงผลลัพธ์ และในบางกรณีก็ยังลดความแม่นยำลงด้วยซ้ำ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> โดยเฉพาะอย่างยิ่ง สำหรับ GPT-3.5 ผู้เขียนบันทึก **"การเพิ่มขึ้นเชิงลบ" เล็กน้อยใน few-shot**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ซึ่งพวกเขาเชื่อมโยงกับปรากฏการณ์ **"alignment tax"**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> อย่างไรก็ตาม โดยเฉลี่ยแล้ว การให้ตัวอย่างทำให้คำตอบมีเสถียรภาพมากขึ้นและลดสัดส่วนกรณีที่โมเดลปฏิเสธที่จะให้คำตอบที่ชัดเจน<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>

นักวิจัยยังประเมินประสิทธิภาพของโมเดลบน **ชุดย่อยของคำถามที่กรองแล้ว** ซึ่งเกี่ยวข้องกับภาษาจีน<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> เนื่องจาก API ของโมเดลจีนขนาดใหญ่บางตัวปฏิเสธคำขอที่มีคำ "ที่ละเอียดอ่อน" บางคำโดยอัตโนมัติ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ดังนั้นจึงมีการสร้างตัวอย่างที่ลดขนาดลงจำนวน 2,100 คำถามโดยไม่มีคำที่กระตุ้น และเปรียบเทียบโมเดลจำนวนหนึ่งในโหมด five-shot<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ผลลัพธ์แสดงให้เห็นว่าในเวอร์ชันที่ง่ายกว่านี้ ช่องว่างระหว่าง GPT-4 และโมเดลท้องถิ่นที่ดีที่สุดลดลง: โมเดลจีน ChatGLM2 ได้คะแนนน้อยกว่า GPT-4 เพียง ~3% เกือบเทียบเท่าคะแนนรวม<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> นอกจากนี้ Ernie Bot จาก Baidu แสดงผลได้อย่างมั่นใจในหมวดหมู่ส่วนใหญ่ (ยกเว้นส่วนอคติ) และเข้าใกล้ผู้นำ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ข้อมูลเหล่านี้บ่งชี้ว่าภายใต้การควบคุมการกรองที่เข้มงวด (โดยยกเว้นคำขอที่อันตรายที่สุด) โมเดลระดับชาติบางตัวสามารถแข่งขันกับผู้นำระดับโลกในด้านพฤติกรรมที่ปลอดภัยได้

## ความสำคัญของ Benchmark และข้อสรุปของนักพัฒนา

SafetyBench เป็นก้าวสำคัญสู่การวัดและปรับปรุงความปลอดภัยของ Large Language Model อย่างเป็นระบบ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ต่างจากสถานการณ์การโต้ตอบโดยตรง (ซึ่งผู้ใช้อาจพยายาม "แฮก" โมเดลด้วยคำสั่งหรือการยั่วยุ) benchmark นี้มุ่งเน้นที่ความสามารถของ AI ใน **การเข้าใจและแยกแยะเนื้อหาที่ปลอดภัยและไม่ปลอดภัยอย่างถูกต้อง**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ผู้เขียนเน้นย้ำว่าความเข้าใจดังกล่าวเป็นรากฐานที่จำเป็นสำหรับโมเดลที่จะสร้างคำตอบที่ปลอดภัยในบทสนทนาแบบเปิดได้เลย<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ในทางตรงกันข้าม การซึมซับบรรทัดฐานทางศีลธรรม กฎมารยาท สัญญาณของความเป็นพิษ และอื่น ๆ อย่างลึกซึ้ง ช่วยอำนวยความสะดวกในการปรับแต่งโมเดลให้หลีกเลี่ยงคำพูดและการตัดสินใจที่เป็นอันตราย<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ดังนั้น คะแนนสูงใน SafetyBench จึงสามารถมองได้ว่าเป็น **ตัวบ่งชี้ความพร้อมของโมเดลสำหรับการใช้งานที่ปลอดภัย**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> และความล้มเหลวในหมวดหมู่บางหมวดหมู่บ่งชี้ถึงพื้นที่ที่มีความเสี่ยงซึ่งต้องการการปรับปรุง<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup>

สิ่งสำคัญที่ควรทราบคือ SafetyBench ตั้งใจ **ไม่รวมบางด้านที่เกี่ยวข้องกับการโจมตีคำสั่งของโมเดลเอง** (เรียกว่า jailbreak prompt, การจัดการบทบาท เป็นต้น)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ผู้เขียนอธิบายว่าปัญหาประเภท instruction attack มีลักษณะที่แตกต่างกัน ซึ่งเกี่ยวข้องกับความขัดแย้งระหว่างการปฏิบัติตามคำสั่งของผู้ใช้และการปฏิบัติตามกฎความปลอดภัยที่ฝังไว้<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ด้านเหล่านี้ได้รับการแก้ไขด้วยวิธีการอื่นและอยู่นอกเหนือความเข้าใจของโมเดล<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ดังนั้น SafetyBench จึงมุ่งเน้นเฉพาะระดับเนื้อหาความรู้ของโมเดลเกี่ยวกับพฤติกรรมที่ปลอดภัย อย่างไรก็ตาม การครอบคลุมรวมของเจ็ดหมวดหมู่หลักใน benchmark ช่วยให้สามารถระบุช่องโหว่ของโมเดลได้แล้วในขณะนี้: ตัวอย่างเช่น เป็นที่ทราบกันว่า GPT-4 แสดงผลลัพธ์ที่อ่อนแอกว่าในคำถามเกี่ยวกับอคติ ในขณะที่โมเดลเปิดบางตัวตามหลังอย่างมากในส่วนที่เกี่ยวกับศีลธรรมหรือกฎหมาย<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ข้อมูลดังกล่าวให้แนวทางเฉพาะแก่นักพัฒนาเกี่ยวกับสิ่งที่ต้องดำเนินการในระหว่างการ fine-tuning หรือการกรองคำตอบเพิ่มเติม

Benchmark SafetyBench **เปิดให้ชุมชน**<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-abs-2)</sup>: ข้อมูลและเอกสารระเบียบวิธีได้รับการเผยแพร่อย่างเปิดเผย<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-abs-2)</sup> และบนแพลตฟอร์มที่สร้างขึ้นโดยเฉพาะมีการดูแล **leaderboard ออนไลน์** ของผลลัพธ์ของโมเดลต่าง ๆ<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-abs-2)</sup> นักวิจัยเชิญชวนนักพัฒนาให้ทดสอบโมเดลใหม่ของตนบนชุดข้อมูลนี้และเผยแพร่ผลลัพธ์ ซึ่งจะส่งเสริมการเปรียบเทียบระบบอย่างโปร่งใสและการติดตามความก้าวหน้าในการเพิ่มความปลอดภัยของ AI

สุดท้าย ผู้เขียนเน้นย้ำว่าเป้าหมายของ SafetyBench คือ **กระตุ้นให้โมเดลได้รับการปรับปรุง**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ไม่ใช่แค่สร้างการจัดอันดับอีกชุดหนึ่ง<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> พวกเขาเรียกร้องให้นักพัฒนาไม่จำกัดอยู่แค่การพยายาม "ปรับ" โมเดลให้เข้ากับการทดสอบ แต่ให้แก้ไขจุดที่มีปัญหาที่ระบุได้อย่างเป็นระบบ<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> เมื่อโมเดลเวอร์ชันใหม่ได้รับการฝึกบนข้อมูลปริมาณมากขึ้นด้วยเทคนิค alignment ที่ซับซ้อนกว่า คาดว่าคะแนนของพวกเขาบน SafetyBench จะเพิ่มขึ้น<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(TH)#cite_note-arxiv-main-v2-1)</sup> ในอนาคต benchmark นี้อาจกลายเป็นเครื่องมือมาตรฐานสำหรับการตรวจสอบความสอดคล้องของ LLM กับข้อกำหนดด้านความปลอดภัย และระเบียบวิธีของมันอาจกลายเป็นรากฐานสำหรับการพัฒนาชุดทดสอบที่สมบูรณ์ยิ่งขึ้นในด้าน AI ที่มีความรับผิดชอบ

## ลิงก์อ้างอิง

- บทความต้นฉบับของ SafetyBench (arXiv)
- คลังข้อมูล SafetyBench บน GitHub
- หน้า dataset SafetyBench บน Hugging Face
- บทความ SafetyBench บน ACL Anthology

## บรรณานุกรม

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## หมายเหตุ

1.  <span id="cite_note-arxiv-main-v2-1">↑ <sup>[1.00](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-80)</sup> <sup>[1.81](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-81)</sup> <sup>[1.82](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-82)</sup> <sup>[1.83](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-83)</sup> <sup>[1.84](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-84)</sup> <sup>[1.85](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-85)</sup> <sup>[1.86](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-86)</sup> <sup>[1.87](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-87)</sup> <sup>[1.88](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-88)</sup> <sup>[1.89](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-89)</sup> <sup>[1.90](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-90)</sup> <sup>[1.91](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-91)</sup> <sup>[1.92](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-92)</sup> <sup>[1.93](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-v2_1-93)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models with Multiple Choice Questions». *arXiv*. <a href="https://ar5iv.labs.arxiv.org/html/2309.07045v2" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-main-abs-2">↑ <sup>[2.0](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-abs_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-abs_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/SafetyBench_(TH)#cite_ref-arxiv-main-abs_2-2)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models». *arXiv*. <a href="https://arxiv.org/abs/2309.07045" class="external autonumber" rel="nofollow">[2]</a></span>
