---
title: "PromptRobust (benchmark) (BG)"
source: "https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)"
wiki: "systems-analysis.info/int"
article: "PromptRobust_(benchmark)_(BG)"
language: "bg"
categories:
  - "Category:Bulgarian"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 5931
wiki_created_at: 2026-09-06T23:56:01Z
wiki_modified_at: 2026-09-06T23:56:01Z
downloaded_at: 2026-09-07T23:11:05Z
---

# PromptRobust (benchmark) (BG)

**PromptRobust** (известен също като **PromptBench**) — това е комплексен **benchmark** за оценка на устойчивостта на големи езикови модели (LLM) към **адверсарни изменения на заявката** — малки изкривявания на формулировката на заданието, които не променят смисъла му<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>. Benchmark-ът е разработен през 2023 година от група изследователи (Kaijie Zhu и др.) от Microsoft Research Asia<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Появата на PromptRobust е обусловена от наблюдението, че съвременните LLM са чувствителни към детайлите на формулировката: дори незначителни промени (например печатни грешки или перифразиране) могат осезаемо да влияят върху отговорите на моделите<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>. Benchmark-ът е предназначен да измери количествено тази уязвимост и да съдейства за разработването на по-надеждни методи за взаимодействие с LLM.

## Методология на оценяването

В рамките на изследването PromptBench е формиран корпус от **4788 видоизменени подсказки** (prompt-и), запазващи първоначалния смисъл на заданията<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-abs-3)</sup>. Тези адверсарни подсказки са генерирани на четири нива на сложност на измененията<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>:

- **Символно ниво**: Въвеждане на печатни грешки, замяна или разместване на символи (имитира случайни грешки при въвеждане).
- **Словно ниво**: Замяна на някои думи със синоними, въвеждане на „шумови" думи или други незначителни речникови изменения.
- **Ниво на изречението**: Перифразиране на структурата на изреченията, добавяне или разместване на части от фразата без промяна на общата тема.
- **Семантично ниво**: По-дълбоко преформулиране на заявката при запазване на нейната задача (например алтернативни формулировки на един и същ въпрос)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>.

Целта на подобни „атаки" е да се провери как незначителните отклонения (напр. случайни печатни грешки или използване на синонимни формулировки) влияят върху способността на модела правилно да изпълни задачата, при положение че самата задача не е променена<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Всяка генерирана адверсарна подсказка е прилагана към редица стандартни NLP задачи, включително **анализ на тоналността**, **разкриване на граматическа коректност**, **търсене на дублиращи се изречения**, **логически извод** (NLI), **четене с разбиране**, **машинен превод** и **решаване на математически задачи**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. За експериментите са подбрани 8 различни типа задачи върху 13 dataset-а — от класическите набори GLUE (например SST-2 за тоналност, MNLI за NLI) до специализирани математически и многоезикови тестове<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>.

Важно е, че беше проверявана устойчивостта на различни **формати на prompt**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>:

- Преки заявки без примери (**zero-shot**, само инструкция).
- Заявки с няколко примера (**few-shot**, когато в подсказката са дадени образци за решение).
- Ролеви подсказки (**in-context roles**, например „Вие сте система за анализ на тоналността, определете...").
- Подсказки, описващи задачата (**task-oriented**, пряко описание на заданието)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>.

Също така бяха тествани различни мащабни езикови модели — от сравнително малкия Flan-T5-large и модела UL2 до напредналите ChatGPT и GPT-4, а също и отворените модели от семейството LLaMA 2 и производният от тях Vicuna<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. За генериране на атаките бяха използвани съществуващи методи от областта на адверсарното NLP (като TextBugger, DeepWordBug, TextFooler и др.), адаптирани за модификация на подсказките вместо на входните данни<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Коректността на получените „изкривени" подсказки беше проверявана с автоматични и ръчни методи; според доклада не по-малко от 85% от адверсарните вариации запазват правилната семантика и са разбираеми за човек<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. По този начин влиянието на атаките отразява именно грешките на модела при възприемане на перифразираното задание, а не загубата на самия смисъл на задачата.

## Резултати и изводи

Изпитанията показаха, че съвременните LLM **не са достатъчно устойчиви към малки изменения в формулировката на заявката**<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-abs-3)</sup>. При всички тествани модели беше наблюдавано значително влошаване на качеството на отговорите под въздействието на генерираните атаки<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-abs-3)</sup>. По-специално, дори прости случаи — като печатна грешка в текста на математическа задача или замяна на една ключова дума с нейния синоним — водеха до това, че моделът даваше неверен резултат, въпреки че без изкривяване се справяше правилно<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Общият извод на авторите: „съвременните големи езикови модели **не са robust** (устойчиви) към адверсарни подсказки"<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-abs-3)</sup>, тоест незначителни отклонения в phrasing могат системно да ги въвеждат в заблуждение.

При анализа на различните видове атаки се установи, че най-разрушително върху работата на LLM влияят изменените на **словно ниво**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>. Замяната на думи със синоними или незначителното словообразувателно изкривяване водеха до **най-голям спад в качеството** — средно с ≈33% спрямо изходния резултат на същите задания<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>. Атаките на **символно ниво** (печатни грешки, случайни символи) предизвикваха средно ~20% намаляване на точността<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>. Качественото изменение или добавянето на цели изречения към prompt-а, напротив, имаше много по-слаб ефект и почти не объркваше модела<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. **Семантичните перифразирания** (дълбоко преразказване на заявката по друг начин) се оказаха сравними по вредоносност с обикновените печатни грешки<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Тези факти подчертават, че LLM са особено уязвими към тънки лексикални изменения и грешки в ключовите думи<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Характерно е, че граматическите изкривявания (печатни грешки) теоретично могат да бъдат филтрирани чрез стандартни средства за проверка на правописа, докато изменените на словно и смислово ниво изискват от модела развито семантично разбиране, което на текущите модели често им липсва<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>.

Анализът на производителността на различните модели показа значителен разброс в тяхната robustness<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. **GPT-4** и **UL2** демонстрираха най-добра устойчивост към адверсарни подсказки<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Малко по-малко склонни към грешки се оказаха също моделът Flan-T5-large и диалоговият модел ChatGPT<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Моделите от семейството LLaMA 2 заеха междинна позиция, докато **Vicuna** (13B) се открои като най-уязвима към всички видове атаки<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Интересно е, че **размерът на модела не се оказа решаващ фактор за robustness**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>: сравнително малкият T5-large по стабилност на отговора практически не отстъпваше на значително по-големия модел ChatGPT<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Авторите предполагат, че ключова роля играят **методите на обучение и fine-tuning** на моделите, а не само мащабът<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Така UL2 и T5-large са преминали разширено предобучение върху големи корпуси от данни, а ChatGPT е обучен с подкрепление от човешка обратна връзка (RLHF), което вероятно е укрепило тяхната устойчивост<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Напротив, Vicuna е обучен върху сравнително ограничен набор от данни (като отворена реплика), което вероятно е обусловило неговата висока чувствителност към изменения в формулировките<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Тези резултати сочат, че подобряването на методите за fine-tuning може да повиши надеждността на моделите в по-голяма степен, отколкото простото увеличаване на техния размер.

### Влияние на формата на prompt

Формата на подаване на заявката също влияе върху надеждността на отговора<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Установено е, че **подсказките с примери (few-shot) съществено повишават устойчивостта** на модела в сравнение с еднократните инструкции без примери (zero-shot)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Наличието в prompt-а на няколко демонстрационни примера на задачата помага на модела да интерпретира по-вярно заданието дори при наличие на шумови изменения. Ролевите подсказки и описателните (task-oriented) показаха съпоставимо ниво на устойчивост като цяло, въпреки че ефективността им варира в зависимост от задачата<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Например при данните за анализ на тоналността и дублиращи се изречения ролевият формат беше малко по-надежден, докато при задачите за четене с разбиране и превод по-добре се справиха явните инструкции на задачата<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Тези наблюдения могат да служат като ориентир при проектирането на prompt-и: добавянето на разгърнати примери и контекст на роля намалява вероятността от грешка на модела при нестандартни формулировки.

### Прехвърляемост на атаките между модели

Прехвърляемостта (трансферът) на атаките между моделите се оказа ограничена<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Адверсарните подсказки, специално подбрани срещу един модел, не винаги са еднакво ефективни срещу друг<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Така беше отбелязано, че prompt-ите „капани", генерирани за уязвимостите на ChatGPT, влияят значително по-слабо на GPT-4<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Последният се справяше по-добре, вероятно защото атаките не се пренасяха пряко върху неговата архитектура — това, което обърква един модел, може да не подействa на по-напреднал модел с различна подготовка<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Въпреки това някои видове прости изкривявания (например печатни грешки) оказваха негативен ефект едновременно върху няколко модела, което говори за сходни слабости в тяхната езикова основа.

### Практически препоръки

В хода на работата PromptBench бяха разкрити и практически препоръки за потребителите и разработчиците на LLM<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>. Простият извод: стабилността на формулировката има значение<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>. Необходимо е **да се избягват печатни грешки и небрежни формулировки в заявката**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>. Авторите показват, че поправянето дори на дребни грешки (правопис, случаен регистър, излишни интервали) може съществено да повиши надеждността на отговора на модела<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>. Освен това, **изборът на думи в инструкцията влияе върху нейната устойчивост**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>. Анализът на честотата на термините в устойчиви vs. уязвими подсказки разкри, че някои думи се срещат по-често в „надеждните" prompt-и, а други — в тези, при които моделът е сбъркал<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>. Например подсказките, съдържащи думи като „acting", „provided", „detection" и т.н., по-рядко водеха до грешки, докато думи като „respond", „following" или „examine" се срещаха в по-проблемните случаи<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>. Това сочи, че определен стил и лексика на заявките могат да смекчат или, обратно, да провокират уязвимостите на модела. Като цяло се препоръчва заявката да се формулира **максимално ясно, недвусмислено и с познати за модела термини**, особено за критично важни приложения<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>.

Интересен страничен ефект, отбелязан от изследователите, е влиянието на добавянето на безсмислени или нерелевантни фрагменти от текст в заявката<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>. Оказа се, че **вмъкването на случайна последователност от символи** (например „LKF0FZxMZ4") в края или средата на подсказката може да отвлече вниманието на модела и **да намали точността на неговия отговор**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>. От друга страна, добавянето на неутрална, но граматически правилна фраза (например „and true is true") в някои случаи напротив **подобрявало отговора**, сякаш фокусирайки модела върху значимите части на въпроса<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>. Този феномен подчертава колко непредсказуемо LLM реагират на привидно несъществени детайли на входните данни. Той свидетелства и за сложността на вътрешното устройство на моделите: най-малките изменения на контекста могат или да нарушат, или да подобрят тяхната работа, в зависимост от това как се преразпределя вниманието на модела.

## Значение и по-нататъшно развитие

PromptRobust/PromptBench внесе значителен принос в разбирането на надеждността на LLM<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>. Предложеният benchmark и събраните данни са отворени за общността: кодът и наборите от адверсарни подсказки са достъпни в репозиторията<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Това позволява на другите изследователи да тестват нови модели за устойчивост към вариации на заявките и да сравняват резултатите<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-arxiv-main-1)</sup>. Следващата стъпка е разработването на методи за защита на моделите от подобни атаки — например подобрени алгоритми за обучение, отчитащи възможните печатни грешки и перифразирания, или вградени системи за нормализиране на входния текст<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>. PromptBench вече се разглежда като основа за такива изследвания по повишаване на **robustness** (устойчивостта) на езиковите модели към реални неточни входни данни<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)</sup>.

В крайна сметка трудът на Zhu и колегите му демонстрира важността на отчитането на устойчивостта към prompt-и при внедряването на LLM в практически приложения: моделите трябва не само да показват висока точност върху „чисти" данни, но и да запазват коректност при незначителни отклонения във входните данни, независимо дали са случайни грешки на потребителя или преднамерени атакуващи въздействия<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-towardsai-2)[\[4\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_note-cmu-realer-4)</sup>.

## Препратки

- Оригинална статия PromptBench (arXiv)
- Репозитория PromptBench в GitHub
- Статия „Prompt Robustness: How to Measure and How to Enhance" (Towards AI)

## Литература

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Бележки

1.  <span id="cite_note-arxiv-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-main_1-35)</sup> «PromptBench: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-towardsai-2">↑ <sup>[2.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-16)</sup> <sup>[2.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-17)</sup> <sup>[2.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-18)</sup> <sup>[2.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-towardsai_2-19)</sup> «Prompt Robustness: How to Measure and How to Enhance». *Towards AI*. <a href="https://towardsai.net/p/l/prompt-robustness-how-to-measure-and-how-to-enhance" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-abs-3">↑ <sup>[3.0](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-abs_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-abs_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-abs_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-arxiv-abs_3-3)</sup> «PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-cmu-realer-4">[↑](https://systems-analysis.info/int/PromptRobust_(benchmark)_(BG)#cite_ref-cmu-realer_4-0) «Realer Toxicity Prompts (RTP-2.0): Multilingual and Adversarial Prompts for Evaluating Neural Toxic Degeneration in Large Language Models». *Language Technologies Institute - School of Computer Science - Carnegie Mellon University*. <a href="https://www.lti.cs.cmu.edu/research/research-articles/realer-toxicity-prompts.html" class="external autonumber" rel="nofollow">[4]</a></span>
