---
title: "PromptRobust (benchmark) (HE)"
source: "https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)"
wiki: "systems-analysis.info/int"
article: "PromptRobust_(benchmark)_(HE)"
language: "he"
categories:
  - "Category:Hebrew"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 5939
wiki_created_at: 2026-09-06T23:56:09Z
wiki_modified_at: 2026-09-06T23:56:09Z
downloaded_at: 2026-09-07T23:11:08Z
---

# PromptRobust (benchmark) (HE)

**PromptRobust** (המכונה גם **PromptBench**) — הוא benchmark מקיף להערכת עמידות מודלי שפה גדולים (LLM) בפני **שינויים אדברסריאליים בבקשה** — עיוותים קלים בניסוח המשימה שאינם משנים את משמעותה<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>. ה-benchmark פותח בשנת 2023 על ידי קבוצת חוקרים (Kaijie Zhu ואחרים) מ-Microsoft Research Asia<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. הופעתו של PromptRobust נובעת מהתצפית שמודלי שפה גדולים מודרניים רגישים לפרטי הניסוח: אפילו שינויים קלים (כגון שגיאות כתיב או ניסוח מחדש) עשויים להשפיע באופן ניכר על תשובות המודלים<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>. ה-benchmark נועד למדוד כמותית פגיעות זו ולתרום לפיתוח שיטות אמינות יותר לאינטראקציה עם מודלי שפה גדולים.

## מתודולוגיית הערכה

במסגרת מחקר PromptBench גובש קורפוס של **4788 הנחיות (פרומפטים) משונות**, השומרות על משמעות המשימות המקוריות<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-abs-3)</sup>. הנחיות אדברסריאליות אלו נוצרו בארבעה רמות של מורכבות השינויים<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>:

- **רמת תווים**: הכנסת שגיאות כתיב, החלפה או הזזת תווים (מחקה שגיאות קלט אקראיות).
- **רמת מילים**: החלפת מילים מסוימות במילים נרדפות, הכנסת מילים "רועשות" או שינויים לקסיקליים קלים אחרים.
- **רמת משפטים**: ניסוח מחדש של מבנה משפטים, הוספה או הזזת חלקי פסוקית ללא שינוי הנושא הכולל.
- **רמה סמנטית**: ניסוח מחדש מעמיק יותר של הבקשה תוך שמירה על המשימה (לדוגמה, ניסוחים חלופיים של אותה שאלה)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>.

מטרת ה"התקפות" הללו היא לבחון כיצד סטיות קלות (כגון שגיאות כתיב אקראיות או שימוש בניסוחים נרדפים) משפיעות על יכולת המודל לבצע נכונה את המשימה, כאשר המשימה עצמה לא השתנתה<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. כל הנחיה אדברסריאלית שנוצרה הופעלה על מספר משימות NLP סטנדרטיות, כולל **ניתוח סנטימנט**, **זיהוי תקינות דקדוקית**, **חיפוש משפטים כפולים**, **הסקה לוגית** (NLI), **קריאה והבנה**, **תרגום אוטומטי** ו**פתרון בעיות מתמטיות**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. לניסויים נבחרו 8 סוגי משימות שונים על 13 dataset-ים — מסדרות GLUE הקלאסיות (לדוגמה, SST-2 לניתוח סנטימנט, MNLI ל-NLI) ועד מבחנים מתמטיים ומרובי-שפות מתמחים<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>.

חשוב לציין כי נבדקה העמידות של **פורמטים שונים של prompt**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>:

- בקשות ישירות ללא דוגמאות (**zero-shot**, הוראה בלבד).
- בקשות עם מספר דוגמאות (**few-shot**, כאשר ההנחיה כוללת דוגמאות לפתרון).
- הנחיות תפקידיות (**in-context roles**, לדוגמה, "אתה מערכת לניתוח סנטימנט, קבע...").
- הנחיות המתארות את המשימה (**task-oriented**, תיאור ישיר של המשימה)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>.

כמו כן נבדקו מודלי שפה גדולים שונים — החל מ-Flan-T5-large הקטנה יחסית ומודל UL2 ועד ChatGPT ו-GPT-4 המתקדמות, וכן מודלים פתוחים ממשפחת LLaMA 2 ו-Vicuna הנגזרת מהם<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. ליצירת ההתקפות שימשו שיטות קיימות מתחום NLP אדברסריאלי (כגון TextBugger, DeepWordBug, TextFooler ואחרות), שהותאמו לשינוי הנחיות במקום נתוני קלט<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. נכונות ההנחיות ה"מעוותות" שהתקבלו נבדקה בשיטות אוטומטיות וידניות; לפי הדיווח, לא פחות מ-85% מהווריאציות האדברסריאליות שומרות על סמנטיקה נכונה ומובנות לאדם<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. כך, השפעת ההתקפות משקפת דווקא כשלים של המודל בהבנת המשימה המנוסחת מחדש, ולא אובדן משמעות המשימה עצמה.

## תוצאות ומסקנות

הניסויים הראו שמודלי שפה גדולים מודרניים **אינם עמידים דיים בפני שינויים קלים בניסוח הבקשה**<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-abs-3)</sup>. עבור כל המודלים שנבדקו נצפתה ירידה משמעותית באיכות התשובות תחת השפעת ההתקפות שנוצרו<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-abs-3)</sup>. בפרט, אפילו מקרים פשוטים — כגון שגיאת כתיב בטקסט בעיה מתמטית או החלפת מילת מפתח אחת במילה נרדפת לה — גרמו למודל לתת תוצאה שגויה, למרות שללא עיוות הוא הצליח לענות נכון<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. המסקנה הכללית של המחברים: "מודלי שפה גדולים מודרניים **אינם רובוסטיים** (עמידים) בפני הנחיות אדברסריאליות"<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-abs-3)</sup>, כלומר סטיות קלות ב-phrasing עשויות לבלבל אותם באופן שיטתי.

בניתוח סוגי ההתקפות השונים התברר שהשפעה המזיקה ביותר על פעולת מודלי שפה גדולים היא שינויים ב**רמת המילים**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>. החלפת מילים במילים נרדפות או עיוות מורפולוגי קל הביאו ל**ירידה הגדולה ביותר באיכות** — בממוצע ~33% ביחס לתוצאה המקורית על אותן משימות<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>. התקפות ב**רמת תווים** (שגיאות כתיב, תווים אקראיים) גרמו בממוצע לירידה של ~20% בדיוק<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>. שינוי איכותי או הוספת משפטים שלמים ל-prompt, לעומת זאת, הייתה בעלת השפעה חלשה הרבה יותר ולמעשה לא הכשילה את המודל<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. **ניסוחים מחדש סמנטיים** (פרפראזה מעמיקה של הבקשה בדרך אחרת) היו דומים בנזקיות לשגיאות כתיב פשוטות<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. עובדות אלו מדגישות שמודלי שפה גדולים פגיעים במיוחד לשינויים לקסיקליים עדינים ולשגיאות במילות מפתח<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. ראוי לציין שעיוותים דקדוקיים (שגיאות כתיב) ניתנים תיאורטית לסינון בכלי בדיקת איות סטנדרטיים, בעוד ששינויים ברמת המילים והמשמעות דורשים מהמודל הבנה סמנטית מפותחת, שלעיתים חסרה למודלים הנוכחיים<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>.

ניתוח הביצועים של מודלים שונים הראה פיזור משמעותי ברובוסטיות שלהם<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. **GPT-4** ו-**UL2** הפגינו את העמידות הטובה ביותר בפני הנחיות אדברסריאליות<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. מעט פחות פגיעים לכשלים נמצאו גם מודל Flan-T5-large ומודל הדיאלוג ChatGPT<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. מודלי משפחת LLaMA 2 תפסו עמדת ביניים, בעוד ש-**Vicuna** (13B) בלטה כהפגיעה ביותר לכל סוגי ההתקפות<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. מעניין ש-**גודל המודל לא היה גורם מכריע ברובוסטיות**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>: T5-large הקטנה יחסית לא נפלה כמעט מ-ChatGPT הגדולה הרבה יותר מבחינת יציבות התשובות<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. המחברים סבורים שתפקיד מפתח ממלאים **שיטות האימון וה-fine-tuning** של המודלים, ולא רק הגודל<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. כך, UL2 ו-T5-large עברו אימון מקדים מורחב על קורפוסי נתונים גדולים, וChatGPT אומנה בלמידה מחיזוק מהמשוב האנושי (RLHF), מה שעשוי לחזק את עמידותן<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. לעומת זאת, Vicuna אומנה על מערך נתונים מוגבל יחסית (כעתק פתוח), מה שעשוי להסביר את רגישותה הגבוהה לשינויי ניסוח<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. תוצאות אלו מצביעות על כך ששיפור שיטות fine-tuning עשוי להגביר את אמינות המודלים יותר מאשר הגדלת הגודל שלהם בלבד.

### השפעת פורמט ה-prompt

אופן הצגת הבקשה משפיע אף הוא על אמינות התשובה<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. נמצא כי **הנחיות עם דוגמאות (few-shot) מגבירות משמעותית את עמידות** המודל בהשוואה להוראות חד-שלביות ללא דוגמאות (zero-shot)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. נוכחות מספר דוגמאות הדגמה של המשימה ב-prompt מסייעת למודל לפרש את המשימה נכון יותר גם בנוכחות שינויים רועשים. הנחיות תפקידיות ותיאוריות (task-oriented) הפגינו רמת עמידות דומה בכלל, אם כי יעילותן השתנתה ממשימה למשימה<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. לדוגמה, בנתוני ניתוח סנטימנט וזיהוי משפטים כפולים הפורמט התפקידי היה מעט אמין יותר, בעוד שבמשימות קריאה והבנה ותרגום הוראות מפורשות של המשימה הצליחו יותר<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. תצפיות אלו יכולות לשמש הנחיה בעיצוב prompt-ים: הוספת דוגמאות מפורטות והקשר תפקידי מפחיתה את הסיכוי לטעות מצד המודל בניסוחים לא סטנדרטיים.

### העברת התקפות בין מודלים

העברה (טרנספר) של התקפות בין מודלים התבררה כמוגבלת<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. הנחיות אדברסריאליות שנועדו במיוחד נגד מודל אחד אינן תמיד יעילות באותה מידה נגד מודל אחר<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. כך, צוין שprompt-ים "מלכודת" שנוצרו עבור פגיעויות ChatGPT השפיעו הרבה פחות על GPT-4<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. האחרון הסתדר טוב יותר, ככל הנראה כיוון שההתקפות לא הועברו ישירות לארכיטקטורה שלו — מה שמבלבל מודל אחד עשוי שלא לפעול על מודל מתקדם יותר עם הכשרה שונה<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. עם זאת, חלק מסוגי העיוותים הפשוטים (כגון שגיאות כתיב) השפיעו לרעה על מספר מודלים בו-זמנית, מה שמעיד על נקודות תורפה דומות בבסיס הלשוני שלהם.

### המלצות מעשיות

במהלך עבודת PromptBench זוהו גם המלצות מעשיות למשתמשים ומפתחי מודלי שפה גדולים<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>. מסקנה פשוטה: יציבות הניסוח חשובה<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>. יש **להימנע משגיאות כתיב וניסוחים רשלניים בבקשה**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>. המחברים מראים שתיקון אפילו שגיאות קלות (איות, אותיות גדולות אקראיות, רווחים מיותרים) עשוי להגביר משמעותית את אמינות תשובת המודל<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>. בנוסף, **בחירת המילים בהוראה משפיעה על עמידותה**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>. ניתוח תדירות המונחים ב-prompt-ים עמידים לעומת פגיעים גילה שמילים מסוימות מופיעות לעיתים קרובות יותר ב-prompt-ים "אמינים", ואחרות — באלה שבהם המודל נכשל<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>. לדוגמה, הנחיות המכילות מילים כגון "acting", "provided", "detection" וכדומה הובילו לכשלים פחות תכופים, בעוד שמילים כגון "respond", "following" או "examine" הופיעו במקרים בעייתיים יותר<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>. הדבר מצביע על כך שסגנון ולקסיקון מסוים של בקשות עשויים להפחית או להגביר פגיעויות של המודל. בסך הכל מומלץ לנסח את הבקשה **בבהירות ובחד-משמעות מרבית ובמונחים המוכרים למודל**, במיוחד ליישומים קריטיים<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>.

תופעת לוואי מעניינת שצוינה על ידי החוקרים היא השפעת הוספת קטעי טקסט חסרי משמעות או לא רלוונטיים לבקשה<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>. התברר כי **הוספת רצף אקראי של תווים** (לדוגמה, "LKF0FZxMZ4") בסוף או באמצע ה-prompt עלולה להסיח את תשומת לב המודל ו**להפחית את דיוק תשובתו**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>. מצד שני, הוספת ביטוי ניטרלי אך תקין דקדוקית (לדוגמה, "and true is true") שיפרה במקרים מסוימים דווקא **את התשובה**, כאילו מיקדה את המודל על החלקים המשמעותיים של השאלה<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>. תופעה זו מדגישה עד כמה מודלי שפה גדולים מגיבים בצורה בלתי צפויה לפרטי קלט שנראים חסרי חשיבות. היא גם מעידה על מורכבות המבנה הפנימי של המודלים: שינויים זעירים בהקשר עשויים לפגוע או לשפר את פעולתם, בהתאם לאופן שבו מתחלק תשומת הלב של המודל.

## חשיבות ופיתוח נוסף

PromptRobust/PromptBench תרם תרומה משמעותית להבנת אמינות מודלי שפה גדולים<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>. ה-benchmark המוצע והנתונים שנאספו פתוחים לקהילה: הקוד ומערכי ההנחיות האדברסריאליות זמינים במאגר<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. הדבר מאפשר לחוקרים אחרים לבדוק מודלים חדשים על עמידותם בפני וריאציות בקשות ולהשוות תוצאות<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-arxiv-main-1)</sup>. הצעד הבא הוא פיתוח שיטות הגנה למודלים מפני התקפות כאלה — לדוגמה, אלגוריתמי אימון משופרים המביאים בחשבון שגיאות כתיב ופרפראזות אפשריות, או מערכות נרמול מובנות לקלט<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>. PromptBench כבר נחשב לבסיס למחקרים כאלה לשיפור **הרובוסטיות** (robustness) של מודלי שפה כלפי נתוני קלט לא מדויקים מהעולם האמיתי<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)</sup>.

בסופו של דבר, עבודתם של Zhu וקולגותיו מדגימה את חשיבות התחשבות בעמידות בפני prompt-ים בעת הטמעת מודלי שפה גדולים ביישומים מעשיים: המודלים צריכים לא רק להפגין דיוק גבוה על נתונים "נקיים", אלא גם לשמור על תקינות בפני סטיות קלות בקלט, בין אם מדובר בשגיאות מקריות של המשתמש ובין אם בהתקפות מכוונות<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-towardsai-2)[\[4\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_note-cmu-realer-4)</sup>.

## קישורים

- המאמר המקורי של PromptBench (arXiv)
- מאגר PromptBench ב-GitHub
- המאמר "Prompt Robustness: How to Measure and How to Enhance" (Towards AI)

## ספרות

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## הערות

1.  <span id="cite_note-arxiv-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-main_1-35)</sup> «PromptBench: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-towardsai-2">↑ <sup>[2.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-16)</sup> <sup>[2.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-17)</sup> <sup>[2.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-18)</sup> <sup>[2.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-towardsai_2-19)</sup> «Prompt Robustness: How to Measure and How to Enhance». *Towards AI*. <a href="https://towardsai.net/p/l/prompt-robustness-how-to-measure-and-how-to-enhance" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-abs-3">↑ <sup>[3.0](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-abs_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-abs_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-abs_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-arxiv-abs_3-3)</sup> «PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-cmu-realer-4">[↑](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HE)#cite_ref-cmu-realer_4-0) «Realer Toxicity Prompts (RTP-2.0): Multilingual and Adversarial Prompts for Evaluating Neural Toxic Degeneration in Large Language Models». *Language Technologies Institute - School of Computer Science - Carnegie Mellon University*. <a href="https://www.lti.cs.cmu.edu/research/research-articles/realer-toxicity-prompts.html" class="external autonumber" rel="nofollow">[4]</a></span>
