---
title: "PromptRobust"
source: "https://systems-analysis.info/wiki/PromptRobust"
wiki: "systems-analysis.info/wiki"
article: "PromptRobust"
language: "ru"
categories:
  - "Категория:Russian"
  - "Категория:Бенчмарки LLM"
  - "Категория:Большие языковые модели"
  - "Категория:Машинное обучение"
revision_id: 169
wiki_created_at: 2026-09-06T22:04:46Z
wiki_modified_at: 2026-09-06T22:04:46Z
downloaded_at: 2026-09-07T22:17:58Z
---

# PromptRobust

**PromptRobust** (также известный как **PromptBench**) — это комплексный **[бенчмарк](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM "Бенчмарки LLM")** для оценки устойчивости [больших языковых моделей](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") (LLM) к **адверсарным изменениям запроса** — небольшим искажениям формулировки задания, которые не меняют его смысла<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>. Бенчмарк был разработан в 2023 году группой исследователей (Каицзе Чжу (Kaijie Zhu) и др.) из Microsoft Research Asia<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Появление PromptRobust обусловлено наблюдением, что современные БЯМ чувствительны к деталям формулировки: даже незначительные изменения (например, опечатки или перефразирование) могут заметно влиять на ответы моделей<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>. Бенчмарк призван количественно измерить эту уязвимость и способствовать разработке более надёжных методов взаимодействия с БЯМ.

## Методология оценки

В рамках исследования PromptBench был сформирован корпус из **4788 видоизменённых подсказок** (промптов), сохраняющих изначальный смысл заданий<sup>[\[3\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-abs-3)</sup>. Эти адверсарные подсказки были сгенерированы на четырёх уровнях сложности изменений<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>:

- **Символьный уровень**: Внесение опечаток, замена или перестановка символов (имитирует случайные ошибки ввода).
- **Словесный уровень**: Замена некоторых слов синонимами, ввод «шумовых» слов или других незначительных словарных изменений.
- **Уровень предложения**: Перефразирование структуры предложений, добавление или перестановка частей фразы без изменения общей темы.
- **Семантический уровень**: Более глубокое переформулирование запроса с сохранением его задачи (например, альтернативные формулировки того же вопроса)<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>.

Цель подобных «атак» — проверить, как незначительные отклонения (напр., случайные опечатки или использование синонимичных формулировок) влияют на способность модели правильно выполнить задачу, при том что сама задача не изменилась<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Каждая сгенерированная адверсарная подсказка применялась к ряду стандартных NLP-заданий, включая **анализ тональности**, **выявление грамматической корректности**, **поиск дублирующихся предложений**, **логическое выводение** (NLI), **чтение с пониманием**, **машинный перевод** и **решение математических задач**<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Для экспериментов отобраны 8 разных типов задач на 13 датасетах — от классических наборов GLUE (например, SST-2 для тональности, MNLI для NLI) до специализированных математических и мультиязыковых тестов<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>.

Важно, что проверялась устойчивость разных **форматов промпта**<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>:

- Прямые запросы без примеров (**zero-shot**, только инструкция).
- Запросы с несколькими примерами (**few-shot**, когда в подсказке даны образцы решения).
- Ролевые подсказки (**in-context roles**, например, «Вы система анализа тональности, определите...»).
- Подсказки, описывающие задачу (**task-oriented**, прямое описание задания)<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>.

Также были протестированы различные масштабные [языковые модели](https://systems-analysis.info/wiki/%D0%91%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D0%B5_%D1%8F%D0%B7%D1%8B%D0%BA%D0%BE%D0%B2%D1%8B%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B8 "Большие языковые модели") от относительно небольшой Flan-T5-large и модели UL2 до продвинутых ChatGPT и GPT-4, а также открытые модели семейства LLaMA 2 и производная от них Vicuna<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Для генерации атак использовались существующие методы из области адверсариального NLP (такие как TextBugger, DeepWordBug, TextFooler и др.), адаптированные под модификацию подсказок вместо входных данных<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Корректность полученных «искажённых» подсказок проверялась автоматическими и ручными методами; согласно отчёту, не менее 85% адверсарных вариаций сохраняют правильную семантику и понятны человеку<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Таким образом, влияние атак отражает именно сбои модели в восприятии перефразированного задания, а не утрату самого смысла задачи.

## Результаты и выводы

Испытания показали, что современные БЯМ **недостаточно устойчивы к небольшим изменениям формулировки запроса**<sup>[\[3\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-abs-3)</sup>. Для всех протестированных моделей наблюдалось значительное снижение качества ответов под воздействием сгенерированных атак<sup>[\[3\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-abs-3)</sup>. В частности, даже простые случаи — такие как опечатка в тексте математической задачи или замена одного ключевого слова его синонимом — приводили к тому, что модель давала неверный результат, хотя без искажения справлялась правильно<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Общий вывод авторов: «современные большие языковые модели **не являются робастными** (устойчивыми) к адверсарным подсказкам»<sup>[\[3\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-abs-3)</sup>, то есть незначительные отклонения в phrasing могут систематически вводить их в заблуждение.

При анализе разных видов атак выяснилось, что наиболее разрушительно на работу БЯМ влияют изменения на **уровне слов**<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>. Замена слов на синонимы или незначительное словообразовательное искажение приводили к **наибольшему падению качества** — в среднем на ≈33% относительно исходного результата на тех же заданиях<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>. Атаки на **символьном уровне** (опечатки, случайные символы) вызывали в среднем ~20% снижение точности<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>. Качественное изменение или добавление целых предложений в промпт, напротив, имело гораздо более слабый эффект, почти не сбивая модель<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. **Семантические перефразирования** (глубокое пересказывание запроса другим способом) оказались сопоставимы по вредоносности с простыми опечатками<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Эти факты подчёркивают, что БЯМ особенно уязвимы к тонким лексическим изменениям и ошибкам в ключевых словах<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Характерно, что грамматические искажения (опечатки) теоретически можно отфильтровать стандартными средствами проверки правописания, тогда как изменения на уровне слов и смысла требуют от модели развитого семантического понимания, которого текущим моделям часто недостаёт<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>.

Анализ производительности различных моделей показал значительный разброс в их робастности<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. **GPT-4** и **UL2** продемонстрировали наилучшую устойчивость к адверсарным подсказкам<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Чуть менее подвержены сбоям оказались также модель Flan-T5-large и диалоговая модель ChatGPT<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Модели семейства LLaMA 2 заняли промежуточное положение, тогда как **Vicuna** (13B) выделилась как наиболее уязвимая ко всем видам атак<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Интересно, что **размер модели не оказался решающим фактором робастности**<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>: относительно небольшая T5-large по стабильности ответа практически не уступала гораздо более крупной модели ChatGPT<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Авторы предполагают, что ключевую роль играют **методы обучения и дообучения** моделей, а не только масштаб<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Так, UL2 и T5-large проходили расширенное предобучение на больших корпусах данных, а ChatGPT обучалась с подкреплением от человеческой обратной связи (RLHF), что могло укрепить их устойчивость<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Напротив, Vicuna обучалась на сравнительно ограниченном наборе данных (как открытая реплика), что вероятно обусловило её высокую чувствительность к изменению формулировок<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Эти результаты указывают на то, что улучшение методов fine-tuning может повысить надёжность моделей сильнее, чем просто увеличение их размеров.

### Влияние формата промпта

Форма подачи запроса также влияет на надёжность ответа<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Было установлено, что **подсказки с примерами (few-shot) существенно повышают устойчивость** модели по сравнению с одношаговыми инструкциями без примеров (zero-shot)<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Наличие в промпте нескольких демонстрационных примеров задачи помогает модели вернее интерпретировать задание даже при наличии шумовых изменений. Ролевые подсказки и описательные (task-oriented) показали сопоставимый уровень устойчивости в целом, хотя их эффективность варьировала от задачи к задаче<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Например, в данных по анализу тональности и дубликатов предложений ролевой формат был чуть надёжнее, тогда как в задачах чтения с пониманием и перевода лучше сработали явные инструкции задачи<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Эти наблюдения могут служить руководством при проектировании промптов: добавление развернутых примеров и контекста роли уменьшает вероятность ошибки модели на нестандартные формулировки.

### Передаваемость атак между моделями

Передаваемость (трансфер) атак между моделями оказалась ограниченной<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Адверсарные подсказки, специально подобранные против одной модели, не всегда одинаково эффективны против другой<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Так, было отмечено, что промпты-«ловушки», генерированные для уязвимостей ChatGPT, гораздо слабее влияют на GPT-4<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Последний справлялся лучше, вероятно, потому что атаки не переносились напрямую на его архитектуру – то, что сбивает с толку одну модель, может не подействовать на более продвинутую модель с иной подготовкой<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Тем не менее некоторые виды простых искажений (например, опечатки) оказывали негативный эффект сразу на несколько моделей, что говорит о сходных слабых местах в их языковой основе.

### Практические рекомендации

В ходе работы PromptBench были выявлены и практические рекомендации для пользователей и разработчиков БЯМ<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>. Простой вывод: стабильность формулировки имеет значение<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>. Необходимо **избегать опечаток и небрежных формулировок в запросе**<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>. Авторы показывают, что исправление даже мелких ошибок (правописание, случайный регистр, лишние пробелы) способно существенно повысить надёжность ответа модели<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>. Кроме того, **выбор слов в инструкции влияет на её устойчивость**<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>. Анализ частотности терминов в устойчивых vs. уязвимых подсказках выявил, что некоторые слова чаще встречаются в «надёжных» промптах, а другие — в тех, где модель сбилась<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>. Например, подсказки, содержащие слова «acting», «provided», «detection» и т.п., реже приводили к сбоям, тогда как слова вроде «respond» («ответь»), «following» («следующий») или «examine» («исследуй») встречались в более проблемных случаях<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>. Это указывает, что определённый стиль и лексика запросов могут смягчать или, напротив, провоцировать уязвимости модели. В целом рекомендуется формулировать запрос **максимально чётко, однозначно и в привычных для модели терминах**, особенно для критически важных приложений<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>.

Интересный побочный эффект, отмеченный исследователями, — влияние добавления бессмысленных или нерелевантных фрагментов текста в запрос<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>. Выяснилось, что **вставка случайной последовательности символов** (например, «LKF0FZxMZ4») в конец или середину подсказки способна отвлечь внимание модели и **снизить точность её ответа**<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>. С другой стороны, добавление нейтральной, но грамматически корректной фразы (например, «and true is true» — «и истинно есть истинно») в некоторых случаях наоборот **улучшало ответ**, как будто фокусируя модель на значимых частях вопроса<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>. Этот феномен подчёркивает, насколько непредсказуемо БЯМ реагируют на, казалось бы, несущественные детали ввода. Он же свидетельствует о сложности внутреннего устройства моделей: мельчайшие изменения контекста могут либо нарушить, либо улучшить их работу, в зависимости от того, как перераспределяется внимание модели.

## Значение и дальнейшее развитие

PromptRobust/PromptBench внёс значительный вклад в понимание надёжности БЯМ<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>. Предложенный бенчмарк и собранные данные открыты для сообщества: код и наборы адверсарных подсказок доступны в репозитории<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Это позволяет другим исследователям тестировать новые модели на устойчивость к вариациям запросов и сравнивать результаты<sup>[\[1\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-arxiv-main-1)</sup>. Следующим шагом становится разработка методов защиты моделей от подобных атак — например, улучшенные алгоритмы обучения, учитывающие возможные опечатки и перефразирования, или встроенные системы нормализации входной речи<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>. PromptBench уже рассматривается как основа для таких исследований по повышению **робастности** (robustness) языковых моделей к реальным неточным вводным данным<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)</sup>.

В конечном итоге работа Чжу и коллег демонстрирует важность учёта устойчивости к промптам при внедрении БЯМ в практические приложения: модели должны не только показывать высокую точность на «чистых» данных, но и сохранять корректность при незначительных отклонениях в вводе, будь то случайные ошибки пользователя или преднамеренные атакующие воздействия<sup>[\[2\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-towardsai-2)[\[4\]](https://systems-analysis.info/wiki/PromptRobust#cite_note-cmu-realer-4)</sup>.

## См. также

- [Оценка LLM](https://systems-analysis.info/wiki/%D0%9E%D1%86%D0%B5%D0%BD%D0%BA%D0%B0_LLM "Оценка LLM")
- [Бенчмарки LLM](https://systems-analysis.info/wiki/%D0%91%D0%B5%D0%BD%D1%87%D0%BC%D0%B0%D1%80%D0%BA%D0%B8_LLM "Бенчмарки LLM")
- [BIG-bench](https://systems-analysis.info/wiki/BIG-bench "BIG-bench")
- [ELO‑ранжирование моделей](https://systems-analysis.info/wiki/ELO%E2%80%91%D1%80%D0%B0%D0%BD%D0%B6%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%BC%D0%BE%D0%B4%D0%B5%D0%BB%D0%B5%D0%B9 "ELO‑ранжирование моделей")
- [HumanEval benchmark](https://systems-analysis.info/wiki/HumanEval_benchmark "HumanEval benchmark")

## Ссылки

- <a href="https://arxiv.org/abs/2306.04528" class="external text" rel="nofollow">Оригинальная статья PromptBench (arXiv)</a>
- <a href="https://github.com/microsoft/PromptBench" class="external text" rel="nofollow">Репозиторий PromptBench на GitHub</a>
- <a href="https://towardsai.net/p/l/prompt-robustness-how-to-measure-and-how-to-enhance" class="external text" rel="nofollow">Статья «Prompt Robustness: How to Measure and How to Enhance» (Towards AI)</a>

## Литература

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. <a href="https://arxiv.org/abs/2211.09110" class="external text" rel="nofollow">arXiv:2211.09110</a>.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. <a href="https://arxiv.org/abs/2307.03109" class="external text" rel="nofollow">arXiv:2307.03109</a>.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. <a href="https://arxiv.org/abs/2508.15361" class="external text" rel="nofollow">arXiv:2508.15361</a>.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. <a href="https://arxiv.org/abs/2405.14782" class="external text" rel="nofollow">arXiv:2405.14782</a>.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. <a href="https://arxiv.org/abs/2104.14337" class="external text" rel="nofollow">arXiv:2104.14337</a>.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. <a href="https://arxiv.org/abs/2106.06052" class="external text" rel="nofollow">arXiv:2106.06052</a>.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. <a href="https://arxiv.org/abs/2101.04840" class="external text" rel="nofollow">arXiv:2101.04840</a>.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. <a href="https://arxiv.org/abs/2406.04244" class="external text" rel="nofollow">arXiv:2406.04244</a>.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. <a href="https://arxiv.org/abs/2506.11094" class="external text" rel="nofollow">arXiv:2506.11094</a>.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. <a href="https://arxiv.org/abs/2403.04132" class="external text" rel="nofollow">arXiv:2403.04132</a>.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. <a href="https://arxiv.org/abs/2311.17295" class="external text" rel="nofollow">arXiv:2311.17295</a>.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. <a href="https://arxiv.org/abs/2311.05232" class="external text" rel="nofollow">arXiv:2311.05232</a>.

## Примечания

1.  <span id="cite_note-arxiv-main-1">↑ <sup>[1,00](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-0)</sup> <sup>[1,01](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-1)</sup> <sup>[1,02](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-2)</sup> <sup>[1,03](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-3)</sup> <sup>[1,04](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-4)</sup> <sup>[1,05](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-5)</sup> <sup>[1,06](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-6)</sup> <sup>[1,07](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-7)</sup> <sup>[1,08](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-8)</sup> <sup>[1,09](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-9)</sup> <sup>[1,10](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-10)</sup> <sup>[1,11](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-11)</sup> <sup>[1,12](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-12)</sup> <sup>[1,13](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-13)</sup> <sup>[1,14](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-14)</sup> <sup>[1,15](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-15)</sup> <sup>[1,16](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-16)</sup> <sup>[1,17](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-17)</sup> <sup>[1,18](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-18)</sup> <sup>[1,19](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-19)</sup> <sup>[1,20](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-20)</sup> <sup>[1,21](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-21)</sup> <sup>[1,22](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-22)</sup> <sup>[1,23](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-23)</sup> <sup>[1,24](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-24)</sup> <sup>[1,25](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-25)</sup> <sup>[1,26](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-26)</sup> <sup>[1,27](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-27)</sup> <sup>[1,28](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-28)</sup> <sup>[1,29](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-29)</sup> <sup>[1,30](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-30)</sup> <sup>[1,31](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-31)</sup> <sup>[1,32](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-32)</sup> <sup>[1,33](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-33)</sup> <sup>[1,34](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-34)</sup> <sup>[1,35](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-main_1-35)</sup> «PromptBench: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-towardsai-2">↑ <sup>[2,00](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-0)</sup> <sup>[2,01](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-1)</sup> <sup>[2,02](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-2)</sup> <sup>[2,03](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-3)</sup> <sup>[2,04](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-4)</sup> <sup>[2,05](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-5)</sup> <sup>[2,06](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-6)</sup> <sup>[2,07](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-7)</sup> <sup>[2,08](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-8)</sup> <sup>[2,09](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-9)</sup> <sup>[2,10](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-10)</sup> <sup>[2,11](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-11)</sup> <sup>[2,12](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-12)</sup> <sup>[2,13](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-13)</sup> <sup>[2,14](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-14)</sup> <sup>[2,15](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-15)</sup> <sup>[2,16](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-16)</sup> <sup>[2,17](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-17)</sup> <sup>[2,18](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-18)</sup> <sup>[2,19](https://systems-analysis.info/wiki/PromptRobust#cite_ref-towardsai_2-19)</sup> «Prompt Robustness: How to Measure and How to Enhance». *Towards AI*. <a href="https://towardsai.net/p/l/prompt-robustness-how-to-measure-and-how-to-enhance" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-abs-3">↑ <sup>[3,0](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-abs_3-0)</sup> <sup>[3,1](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-abs_3-1)</sup> <sup>[3,2](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-abs_3-2)</sup> <sup>[3,3](https://systems-analysis.info/wiki/PromptRobust#cite_ref-arxiv-abs_3-3)</sup> «PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-cmu-realer-4">[↑](https://systems-analysis.info/wiki/PromptRobust#cite_ref-cmu-realer_4-0) «Realer Toxicity Prompts (RTP-2.0): Multilingual and Adversarial Prompts for Evaluating Neural Toxic Degeneration in Large Language Models». *Language Technologies Institute - School of Computer Science - Carnegie Mellon University*. <a href="https://www.lti.cs.cmu.edu/research/research-articles/realer-toxicity-prompts.html" class="external autonumber" rel="nofollow">[4]</a></span>
