---
title: "SafetyBench (HE)"
source: "https://systems-analysis.info/int/SafetyBench_(HE)"
wiki: "systems-analysis.info/int"
article: "SafetyBench_(HE)"
language: "he"
categories:
  - "Category:Hebrew"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 6554
wiki_created_at: 2026-09-07T00:06:33Z
wiki_modified_at: 2026-09-07T00:06:33Z
downloaded_at: 2026-09-07T23:14:32Z
---

# SafetyBench (HE)

**SafetyBench** — זהו ה**benchmark המקיף הראשון** להערכה מקיפה של **בטיחות מודלי שפה גדולים** <sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. הוא פותח על ידי קבוצת חוקרים מאוניברסיטת צינגחואה והוצג בשנת 2023<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.

עם התפתחות ה-LLM (לדוגמה, הופעת ChatGPT) ואימוצם ההמוני, גברה תשומת הלב לבעיות הבטיחות של מערכות כאלה<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. מחקרים הראו כי מודלים דיאלוגיים עלולים לאפשר דליפת מידע פרטי של משתמשים או לייצר אמירות רעילות<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. כך הפכה הערכת בטיחות ה-LLM למשימה קריטית ליישומם האמין בפועל. אולם עד לאחרונה לא היו קיימים benchmark-ים מקיפים (חבילות בדיקות) שמכסים את כל ההיבטים המרכזיים של בטיחות המודל; ה-dataset-ים הקיימים בדקו רק היבטים בודדים (לדוגמה, רעילות או הטיות חברתיות) ולא סיפקו תמונה כוללת<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. היעדר שיטת הערכה מקיפה הקשה הן על זיהוי פגיעויות והן על פיתוח מודלי שפה בטוחים יותר<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. SafetyBench נוצר כדי למלא פער זה<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.

## פיתוח ותיאור SafetyBench

SafetyBench הוא אוסף של **11,435 שאלות בחירה** (multiple-choice), המכסות **7 קטגוריות שונות** של בעיות או איומים אופייניים הקשורים לתוכן שנוצר על ידי AI<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. מאפיין חשוב הוא **הדו-לשוניות**: כל שאלה זמינה ב**אנגלית** ו**סינית**, מה שמאפשר להעריך הן מודלים דוברי אנגלית והן מודלים סיניים על חומר אחיד<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. למעשה, SafetyBench הפך לכלי הרחב-היקף הראשון המאפשר לבדוק באופן אוטומטי ובדיוק גבוה את הבנת המודל בנושאי התנהגות בטוחה ותוכן<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. פורמט המשימות עם תשובה נכונה אחת, הדומה ל-benchmark-ים מוכרים כגון MMLU, מבטיח אובייקטיביות ויעילות בהערכה, ומפחית תלות בבדיקה ידנית מייגעת של תשובות המודל<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.

מפתחי SafetyBench נסמכו על טקסונומיה שהוצעה קודם לכן של תרחישים אופייניים הקשורים לתוכן לא בטוח<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. בפרט, קטגוריות ה-benchmark הוגדרו על בסיס 8 תרחישים שתוארו בעבודה של Sun ועמיתים (2023), אולם קטגוריה אחת (נושאים רגישים מבחינה פוליטית) הוסרה כדי למנוע אי-השוואתיות של תשובות בהקשר סיני ואנגלי<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. כך, האוסף הסופי כולל 7 קטגוריות בטיחות משותפות לשתי השפות.

## קטגוריות הבטיחות ב-SafetyBench

כל שאלת בדיקה ב-SafetyBench שייכת לאחת משבע קטגוריות, המכסות מגוון רחב של היבטים שעלולים להיות מסוכנים או בלתי רצויים<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. להלן הקטגוריות ותיאורן הקצר:

- **תוכן פוגעני** (Offensiveness) – איומים, עלבונות, גסות, ניבול פה, סרקזם וביטויים אחרים של טון בלתי מקובל<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. המודל צריך להיות מסוגל לזהות ביטויים כאלה ולהתמודד עם תוכן רעיל או תוקפני<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.
- **הטיה ואפליה** (Unfairness and Bias) – ביטויים של הטיה חברתית ואי-צדק על בסיס גזע, מין, דת וכד'<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. המודל צריך לזהות ולהימנע מבנות לשון המבטאות דעות קדומות או אפליה<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.
- **בריאות גופנית** (Physical Health) – מצבים ואמירות העלולים להשפיע על הבריאות הגופנית של האדם<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. המודל צריך לדעת פעולות ועצות נכונות ובטוחות לשמירה על הבריאות בנסיבות חיים שונות<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.
- **בריאות נפשית** (Mental Health) – שאלות הקשורות לרווחה פסיכולוגית, רגשות ובריאות הנפש<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. המודל צריך להציע דרכים נכונות לשמירה על הבריאות הנפשית ולמניעת השפעות רגשיות שליליות<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.
- **פעילות בלתי חוקית** (Illegal Activities) – תרחישים המניחים פעולות שאינן כדין<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. המודל צריך להבחין בין התנהגות חוקית ולא חוקית, להחזיק ידע בסיסי על נורמות החוק ולא להסית לעבירה על החוק<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.
- **אתיקה ומוסר** (Ethics and Morality) – מצבים הקשורים להתנהגות לא אתית או לא מוסרית, גם אם אינה עומדת ישירות בניגוד לחוק<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. המודל צריך להפגין סטנדרטים אתיים גבוהים ולגנות מעשים או אמירות לא אתיים<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.
- **פרטיות וקניין** (Privacy and Property) – שאלות הנוגעות למידע פרטי, זכויות קניין, סיכונים פיננסיים וכד'<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. המודל צריך להבין באופן רגיש את עקרונות הפרטיות וזכויות הקניין ולמנוע חשיפה בלתי מכוונת של נתונים אישיים או גרימת נזק רכושי<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.

כל קטגוריה מיוצגת על ידי מאות או אלפי שאלות, מה שמאפשר לבדוק באופן מקיף את ידיעת המודל את הנורמות והעקרונות הרלוונטיים<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.

## איסוף והכנת הנתונים

לשם יצירת חבילת בדיקות בהיקף כזה, גייסו מחברי SafetyBench **מגוון מקורות נתונים**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. במחקר צוין כי השאלות נאספו משלושה מקורות עיקריים<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>:

- **dataset-ים קיימים**: עבור מספר קטגוריות (בפרט פוגענות, דעות קדומות, בריאות גופנית, אתיקה) נעשה שימוש ב-dataset-ים הזמינים לציבור<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. המחברים לקחו טקסטים מקוריים מאוספים אלה והמירו אותם לפורמט של שאלות עם אפשרויות תשובה<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. לדוגמה, עבור קטגוריית Offensiveness נעשה שימוש חלקי בקורפוס COLD (dataset לזיהוי פוגענות בשפה סינית)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>; לאנגלית הושתמש גם בנתונים מתחרות Jigsaw Toxic Comment ועוד<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. באופן דומה, עבור Unfairness and Bias נוצלו אוספים סינים (COLD, CDial-Bias) ומשאבים אנגלוסאקסים<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. גישה זו אפשרה לכסות ארבע קטגוריות באמצעות עיבוד מחדש של חומר מסומן<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.
- **שאלות בחינה**: מעבר ל-dataset-ים, החוקרים בחרו ידנית משימות מתאימות ממגוון חומרי בחינה ושאלוני סקר העוסקים בנושאי בטיחות ומיומנויות חיים<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. בפרט, חולצו שאלות מבחינות לימודיות באתיקה ומשפט (לדוגמה, בדיקות בית-ספריות ביסודות הבטיחות), המתאימות לקטגוריות פעילות בלתי חוקית, אתיקה ומוסר ונושאים קשורים אחרים<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. כל שאלה כזו הובאה אף היא לפורמט בחירה מרובה ושויכה לאחת הקטגוריות<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.
- **יצירת שאלות חדשות**: עבור היבטים מסוימים (לדוגמה, פרטיות או בריאות נפשית), שבהם נמצאו במקורות פתוחים נתונים מגוונים בלתי מספיקים, נעשה שימוש ביצירת שאלות נוספות באמצעות מודלי שפה ברמה גבוהה (כגון ChatGPT)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. נוסחו prompt-ים ליצירת מצבים מגוונים בנושאים אלה, ולאחר מכן הוגרסו הגרסאות שהתקבלו **בסינון קפדני ובדיקת מומחים** לפני הכללתן ב-benchmark<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. גישה augmented מבוקרת זו אפשרה למלא פערים בכיסוי הקטגוריות<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.

בסופו של דבר, כל שאלה ב-SafetyBench **יוצגה בשתי שפות** — בסינית ובאנגלית<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. להבטחת שקילות התוכן, תרגמו המחברים את כל השאלות האנגליות שנאספו לסינית ולהפך באמצעות API מסחרי של תרגום מכוני של Baidu<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. השימוש בתרגום זה נבע מכך שחלק מה-LLM ברמה גבוהה (לדוגמה, ChatGPT עצמו) סירבו לעבד או לתרגם במדויק תוכן שעלול להיות מסוכן, לעיתים מרככים ניסוחים בעת התרגום<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. התרגומים האוטומטיים נעברו לאחר מכן בקריאה ידנית ותוקנו כדי לסלק אי-דיוקים אפשריים או ניואנסים תרבותיים<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. בסך הכל, כל השאלות עברו שלב של **בדיקת איכות אנושית**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>, שנועד להבטיח נכונות הניסוחים ותאימות התשובות הצפויות בשתי השפות<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.

חלוקת המקורות ב-dataset הסופי היא בקירוב כדלקמן: כחצי מהשאלות נלקחו מ-dataset-ים פתוחים, חלק ניכר — מחומרי בחינה, והחלק הנותר נוצר על ידי מודלים (לאחר סינון)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. גישה זו הבטיחה הן רוחב כיסוי נושאי והן עומק מספיק (ריבוי דוגמאות לכל קטגוריה).

## מתודולוגיית הניסויים והתוצאות

לאחר הכנת החבילה, ערכו המחברים בדיקה נרחבת של מודלי שפה עכשוויים כדי לקבוע את רמת הבנתם בנושאי בטיחות. הערכת המודלים מתבצעת **באופן אוטומטי**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>: לכל מודל מוצגות כל השאלות ברצף (בשפה המתאימה), ונרשם שיעור התשובות הנכונות (כלומר, אחוז ההתאמה בין הגרסה שנבחרה על ידי המודל לתשובה הנכונה)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. אחוז זה משמש כמדד לכמה טוב המודל "מבין" בנושאי בטיחות ומספק תשובות נכונות מבחינת בטיחות<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.

בבדיקות שערכו המפתחים השתתפו **25 LLM פופולריים** ממוצאים שונים (הן מודלים פתוחים והן שירותי API קנייניים) בשתי השפות<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. הבדיקה בוצעה בשני מצבים: **zero-shot** (המודלים עונים על שאלות ללא כל דוגמאות) ו**few-shot** (למודלים מוצגות מספר דוגמאות של שאלות עם תשובות נכונות מראש לקביעת הקשר)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. פרוטוקול כזה מאפשר להעריך הן את יכולות הבסיס של המודל והן את יכולתו לשפר תשובות בנוכחות רמזים לדוגמה.

המסקנה העיקרית של הבדיקות — **מודלים עכשוויים שונים מאד ברמת ידע הבטיחות שלהם, ואף אחד מה-LLM הזמינים אינו מושלם** בכל הקטגוריות<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. המודל המוביל בתוצאות היה **GPT-4** (OpenAI): הוא הפגין את הדיוק הממוצע הגבוה ביותר ועלה משמעותית על כל שאר המודלים בקטגוריות רבות<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. במצב zero-shot, GPT-4 עלה על המתחרה הקרוב ביותר (מודל GPT-3.5-turbo) בכמעט **10 נקודות אחוז** בדיוק הכולל<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. הפער גדול במיוחד בתחומים מסוימים, לדוגמה, בשאלות בטיחות גופנית ודילמות מוסריות-אתיות ענה GPT-4 נכון לעיתים קרובות ניכרת יותר מהמתחרים<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.

עם זאת, אפילו ב-GPT-4 זוהו **נקודות חולשה**. בקטגוריית \\הטיה ואפליה\\ (Unfairness and Bias) מודל זה הצליח פחות טוב יחסית לתוצאותיו שלו בחלקים אחרים<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. ניתוח התשובות הראה כי GPT-4 לעיתים מסמן בטעות אמירות ניטרליות על אפליה כביטוי של דעות קדומות, או מתבלבל בביטויים ואירועים ספציפיים<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. שגיאות כאלה מדגישות כי אפילו המודל המתקדם ביותר עלול לזלזל בניואנסים תרבותיים או לשוניים המשפיעים על הערכת אתיות האמירה<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.

שאר המודלים פיגרו משמעותית אחרי GPT-4<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. בממוצע, רוב ה-LLM הפתוחים (כולל גרסאות שונות של LLaMA, Falcon, מודלים סיניים מקומיים וכד') הפגינו **דיוק נמוך משמעותית**, לעיתים קרובות ללא עלייה מעל 70-80% תשובות נכונות<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. רבים מהם מתמודדים גרוע במיוחד עם קטגוריות מסוימות: לדוגמה, מספר מודלים קיבלו פחות מ-70% בחלקים הקשורים להטיות חברתיות או לשאלות אתיות עדינות<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. בסך הכל, אף מודל (פרט ל-GPT-4) לא חצה את הסף המותנה של 80% במדד הבטיחות הכולל, מה שמעיד על מרחב גדול לשיפור נוסף של התנהגותם הבטוחה<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. פער כזה בין GPT-4 למודלים עם קוד פתוח מצביע על אפקט של אימון בהיקף גדול יותר וכוונון alignment ממוקד במודלים הסגורים.

מעניין כי הביצועים של מערכות מסוימות התגלו כ**תלויי שפה**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. מודלים שנוצרו בסין (לדוגמה, Baidu Ernie, Alibaba Tongyi ועוד) נטו לענות טוב יותר על הגרסה הסינית של הבדיקות מאשר על האנגלית<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. לעומת זאת, משפחת מודלי GPT של OpenAI הפגינה תוצאות מאוזנות יותר<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. דבר זה עשוי לשקף הבדלים בנפח ובאיכות האימון על נתוני השפות המתאימות, כמו גם נוכחות של מסננים מובנים או מנגנוני צנזורה במודלים אזוריים מסוימים.

עם הוספת דוגמאות few-shot (מספר Q&A לדוגמה לפני הבדיקה) נצפו **השפעות בכיוונים שונים**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. מספר מודלים הצליחו להעלות משמעותית את הדיוק בזכות הרמזים: כך, מודלי שפה גדולים מהדור הקודם כגון text-davinci-003 (GPT-3) או InternLM הסיני קיבלו עלייה מורגשת באיכות במצב חמישה-צעד<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. אולם אצל מספר מודלים ההקשר הנוסף כמעט ולא שיפר את התוצאה, ובמקרים מסוימים אף הוריד את הדיוק<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. בפרט, עבור GPT-3.5 תיעדו המחברים **\\רווח שלילי\\ קטן ב-few-shot**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>, שאותו הם מקשרים לתופעה של **\\מס ההתאמה\\** (alignment tax)<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. בכל זאת, בממוצע, מתן דוגמאות הפך את התשובות ליציבות יותר והפחית את שיעור המקרים שבהם המודל מסרב לתת תשובה ברורה<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.

בנפרד, החוקרים העריכו את ביצועי המודלים על **תת-קבוצה מסוננת של שאלות** הנוגעות לשפה הסינית<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. הדבר נובע מכך ש-API של מספר מודלים סיניים גדולים דוחים אוטומטית בקשות המכילות מילים \\רגישות\\ מסוימות<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. לפיכך, נוצרה מדגם מצומצם של 2,100 שאלות ללא מילות-טריגר, ועליו הושוו מספר מודלים במצב חמישה-צעד<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. התוצאות הראו שבגרסה מקלה זו הפער בין GPT-4 למודלים המקומיים הטובים ביותר מצטמצם: כך, המודל הסיני ChatGLM2 קיבל רק ~3% פחות מ-GPT-4, תוך כדי קירוב כמעט מלא אליו בציון המצטבר<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. גם Ernie Bot של Baidu הופיע בביטחון ברוב הקטגוריות (פרט לחלק ההטיה) והתקרב למובילים<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. נתונים אלה מצביעים על כך שתחת שליטת סינון קשוחה (תוך הוצאת הבקשות המסוכנות ביותר), מודלים לאומיים מסוימים מסוגלים להתחרות עם המובילים העולמיים מבחינת התנהגות בטוחה.

## משמעות ה-benchmark ומסקנות המפתחים

SafetyBench מהווה צעד חשוב לקראת מדידה שיטתית ושיפור הבטיחות של מודלי שפה גדולים<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. בניגוד לתרחישי אינטראקציה ישירה (שבהם משתמשים עלולים לנסות \\לפרוץ\\ את המודל באמצעות הוראות או פרובוקציות), benchmark זה מתמקד ביכולת ה-AI **להבין ולהבחין נכון בין תוכן בטוח ולא בטוח**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. המחברים מדגישים כי הבנה כזו היא הבסיס ההכרחי כדי שמודל יוכל בכלל לייצר תשובות בטוחות בדיאלוגים פתוחים<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. לעומת זאת, הפנמה עמוקה של נורמות מוסר, כללי נימוס, סימני רעילות ועוד מקלה על כוונון המודל להימנע מאמירות והחלטות מסוכנות<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. לפיכך, ניתן לראות בציונים גבוהים ב-SafetyBench **אינדיקטור למוכנות המודל לשימוש בטוח**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>, ואילו כישלונות בקטגוריות מסוימות מאותתים על אזורי סיכון הדורשים שיפור<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>.

חשוב לציין כי SafetyBench במכוון **אינו כולל היבטים מסוימים הקשורים לתקיפת ההוראות עצמן** של המודל (מה שנקרא jailbreak-prompt-ים, מניפולציית תפקידים וכד')<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. המחברים מסבירים כי בעיות מסוג instruction attacks הן מטבע אחר, הקשור לסתירה בין ביצוע פקודת המשתמש לבין שמירת כללי הבטיחות המובנים<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. היבטים אלה נפתרים בשיטות אחרות ויוצאים מגדר הבנת המודל<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. לפיכך, SafetyBench מתרכז דווקא ברמת תוכן ידיעות המודל על התנהגות בטוחה. עם זאת, הכיסוי המצטבר של שבע הקטגוריות המרכזיות ב-benchmark כבר עכשיו מאפשר לזהות פגיעויות של מודלים: לדוגמה, ידוע כי GPT-4 מפגין תוצאה חלשה יחסית בשאלות על הטיה, ומודלים פתוחים מסוימים פיגרים מאוד בחלקים הקשורים למוסר או לחוק<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. מידע כזה נותן למפתחים אמות מידה קונקרטיות לגבי מה שיש לעבוד עליו בהמשך האימון הנוסף או בסינון התשובות.

ה-benchmark SafetyBench **פתוח לקהילה**<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-abs-2)</sup>: הנתונים והחומרים המתודולוגיים שלו מונגשים בחינם לציבור<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-abs-2)</sup>, ובפלטפורמה שנוצרה במיוחד מתוחזק **לוח תוצאות מקוון** של מודלים שונים<sup>[\[2\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-abs-2)</sup>. החוקרים מזמינים מפתחים לבדוק את מודליהם החדשים על חבילה זו ולפרסם תוצאות, דבר שיתרום להשוואה שקופה של מערכות ולמעקב אחר ההתקדמות בשיפור בטיחות ה-AI.

לבסוף, המחברים מדגישים כי מטרת SafetyBench היא **לעודד שיפור מודלים**<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>, ולא רק ליצור עוד רשימת דירוג<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. הם קוראים למפתחים שלא להסתפק בניסיונות \\להתאים\\ את המודל לבדיקה, אלא לתקן באופן שיטתי את הנקודות הבעייתיות שזוהו<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. ככל שגרסאות חדשות של מודלים יאומנו על כמות גדולה יותר של נתונים, עם טכניקות alignment מתוחכמות יותר, צפויה עלייה בציוניהם גם ב-SafetyBench<sup>[\[1\]](https://systems-analysis.info/int/SafetyBench_(HE)#cite_note-arxiv-main-v2-1)</sup>. בטווח הרחוק, benchmark זה עשוי להפוך לכלי סטנדרטי לבדיקת עמידת מודלי שפה בדרישות בטיחות, ומתודולוגיתו — לבסיס לפיתוח חבילות בדיקה מתקדמות עוד יותר בתחום ה-AI האחראי.

## קישורים חיצוניים

- מאמר SafetyBench המקורי (arXiv)
- מאגר SafetyBench ב-GitHub
- עמוד ה-dataset של SafetyBench ב-Hugging Face
- מאמר SafetyBench ב-ACL Anthology

## ספרות

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## הערות

1.  <span id="cite_note-arxiv-main-v2-1">↑ <sup>[1.00](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-35)</sup> <sup>[1.36](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-36)</sup> <sup>[1.37](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-37)</sup> <sup>[1.38](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-38)</sup> <sup>[1.39](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-39)</sup> <sup>[1.40](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-40)</sup> <sup>[1.41](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-41)</sup> <sup>[1.42](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-42)</sup> <sup>[1.43](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-43)</sup> <sup>[1.44](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-44)</sup> <sup>[1.45](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-45)</sup> <sup>[1.46](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-46)</sup> <sup>[1.47](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-47)</sup> <sup>[1.48](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-48)</sup> <sup>[1.49](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-49)</sup> <sup>[1.50](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-50)</sup> <sup>[1.51](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-51)</sup> <sup>[1.52](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-52)</sup> <sup>[1.53](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-53)</sup> <sup>[1.54](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-54)</sup> <sup>[1.55](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-55)</sup> <sup>[1.56](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-56)</sup> <sup>[1.57](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-57)</sup> <sup>[1.58](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-58)</sup> <sup>[1.59](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-59)</sup> <sup>[1.60](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-60)</sup> <sup>[1.61](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-61)</sup> <sup>[1.62](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-62)</sup> <sup>[1.63](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-63)</sup> <sup>[1.64](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-64)</sup> <sup>[1.65](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-65)</sup> <sup>[1.66](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-66)</sup> <sup>[1.67](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-67)</sup> <sup>[1.68](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-68)</sup> <sup>[1.69](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-69)</sup> <sup>[1.70](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-70)</sup> <sup>[1.71](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-71)</sup> <sup>[1.72](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-72)</sup> <sup>[1.73](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-73)</sup> <sup>[1.74](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-74)</sup> <sup>[1.75](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-75)</sup> <sup>[1.76](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-76)</sup> <sup>[1.77](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-77)</sup> <sup>[1.78](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-78)</sup> <sup>[1.79](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-79)</sup> <sup>[1.80](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-80)</sup> <sup>[1.81](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-81)</sup> <sup>[1.82](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-82)</sup> <sup>[1.83](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-83)</sup> <sup>[1.84](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-84)</sup> <sup>[1.85](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-85)</sup> <sup>[1.86](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-86)</sup> <sup>[1.87](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-87)</sup> <sup>[1.88](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-88)</sup> <sup>[1.89](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-89)</sup> <sup>[1.90](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-90)</sup> <sup>[1.91](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-91)</sup> <sup>[1.92](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-92)</sup> <sup>[1.93](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-v2_1-93)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models with Multiple Choice Questions». *arXiv*. <a href="https://ar5iv.labs.arxiv.org/html/2309.07045v2" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-arxiv-main-abs-2">↑ <sup>[2.0](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-abs_2-0)</sup> <sup>[2.1](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-abs_2-1)</sup> <sup>[2.2](https://systems-analysis.info/int/SafetyBench_(HE)#cite_ref-arxiv-main-abs_2-2)</sup> Zhang, Yuntao et al. «SafetyBench: Evaluating the Safety of Large Language Models». *arXiv*. <a href="https://arxiv.org/abs/2309.07045" class="external autonumber" rel="nofollow">[2]</a></span>
