---
title: "PromptRobust (benchmark) (CS)"
source: "https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)"
wiki: "systems-analysis.info/int"
article: "PromptRobust_(benchmark)_(CS)"
language: "cs"
categories:
  - "Category:Czech"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 5933
wiki_created_at: 2026-09-06T23:56:03Z
wiki_modified_at: 2026-09-06T23:56:03Z
downloaded_at: 2026-09-07T23:11:05Z
---

# PromptRobust (benchmark) (CS)

**PromptRobust** (také známý jako **PromptBench**) — jde o komplexní **benchmark** pro hodnocení odolnosti velkých jazykových modelů (LLM) vůči **adversariálním změnám promptu** — drobným zkreslením formulace zadání, která nemění jeho smysl<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>. Benchmark byl vyvinut v roce 2023 skupinou výzkumníků (Kaijie Zhu a kol.) z Microsoft Research Asia<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Vznik PromptRobust byl podmíněn pozorováním, že moderní LLM jsou citlivé na detaily formulace: i nevýznamné změny (například překlepy nebo přeformulování) mohou znatelně ovlivňovat odpovědi modelů<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>. Benchmark si klade za cíl tuto zranitelnost kvantitativně změřit a přispět k vývoji spolehlivějších metod interakce s LLM.

## Metodologie hodnocení

V rámci výzkumu PromptBench byl sestaven korpus **4788 pozměněných promptů**, které zachovávají původní smysl zadání<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-abs-3)</sup>. Tyto adversariální prompty byly vygenerovány na čtyřech úrovních složitosti změn<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>:

- **Znaková úroveň**: Vnášení překlepů, záměna nebo přeskupení znaků (napodobuje náhodné chyby při zadávání).
- **Slovní úroveň**: Záměna některých slov synonymy, vkládání „šumových" slov nebo jiných drobných slovních změn.
- **Větná úroveň**: Přeformulování struktury vět, přidání nebo přeskupení částí fráze bez změny celkového tématu.
- **Sémantická úroveň**: Hlubší přeformulování dotazu při zachování jeho úkolu (například alternativní formulace téže otázky)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>.

Cílem těchto „útoků" je ověřit, jak drobné odchylky (např. náhodné překlepy nebo použití synonymních formulací) ovlivňují schopnost modelu správně splnit úkol, přičemž samotný úkol se nezměnil<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Každý vygenerovaný adversariální prompt byl aplikován na řadu standardních NLP zadání, včetně **analýzy sentimentu**, **detekce gramatické správnosti**, **vyhledávání duplicitních vět**, **logického usuzování** (NLI), **čtení s porozuměním**, **strojového překladu** a **řešení matematických úloh**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Pro experimenty bylo vybráno 8 různých typů úkolů na 13 datasetech — od klasických sad GLUE (například SST-2 pro sentiment, MNLI pro NLI) po specializované matematické a vícejazyčné testy<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>.

Důležité je, že byla testována odolnost různých **formátů promptu**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>:

- Přímé dotazy bez příkladů (**zero-shot**, pouze instrukce).
- Dotazy s několika příklady (**few-shot**, kdy jsou v promptu uvedeny ukázky řešení).
- Rolové prompty (**in-context roles**, například „Jste systém pro analýzu sentimentu, určete...").
- Prompty popisující úkol (**task-oriented**, přímý popis zadání)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>.

Byla také otestována různá rozsáhlá jazyková modely — od relativně malé Flan-T5-large a modelu UL2 až po pokročilé ChatGPT a GPT-4, jakož i otevřené modely rodiny LLaMA 2 a z nich odvozená Vicuna<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Pro generování útoků byly použity stávající metody z oblasti adversariálního NLP (jako TextBugger, DeepWordBug, TextFooler aj.), přizpůsobené pro modifikaci promptů namísto vstupních dat<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Správnost získaných „zkreslených" promptů byla ověřována automatickými i ručními metodami; podle zprávy si nejméně 85 % adversariálních variant zachovává správnou sémantiku a je srozumitelných pro člověka<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Vliv útoků tedy odráží právě selhání modelu při vnímání přeformulovaného zadání, nikoli ztrátu samotného smyslu úkolu.

## Výsledky a závěry

Testování ukázalo, že moderní LLM **nejsou dostatečně odolné vůči drobným změnám formulace dotazu**<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-abs-3)</sup>. U všech testovaných modelů bylo pozorováno výrazné snížení kvality odpovědí pod vlivem vygenerovaných útoků<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-abs-3)</sup>. Zejména i jednoduché případy — jako překlep v textu matematické úlohy nebo záměna jednoho klíčového slova jeho synonymem — vedly k tomu, že model podal nesprávný výsledek, přestože bez zkreslení odpovídal správně<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Celkový závěr autorů zní: „moderní velké jazykové modely **nejsou robustní** (odolné) vůči adversariálním promptům"<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-abs-3)</sup>, tedy drobné odchylky ve formulaci je mohou systematicky uvádět v omyl.

Při analýze různých druhů útoků se ukázalo, že na fungování LLM mají nejničivější vliv změny na **slovní úrovni**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>. Záměna slov za synonyma nebo drobné slovotvorné zkreslení vedly k **největšímu poklesu kvality** — v průměru o přibližně 33 % oproti původnímu výsledku na týchž úkolech<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>. Útoky na **znakové úrovni** (překlepy, náhodné znaky) způsobovaly v průměru přibližně 20% pokles přesnosti<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>. Kvalitativní změna nebo přidání celých vět do promptu měly naopak mnohem slabší efekt a model téměř nevyvedly z míry<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. **Sémantická přeformulování** (hluboké přetlumočení dotazu jiným způsobem) se ukázala být svou škodlivostí srovnatelná s jednoduchými překlepy<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Tyto skutečnosti zdůrazňují, že LLM jsou obzvláště zranitelné vůči jemným lexikálním změnám a chybám v klíčových slovech<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Příznačné je, že gramatická zkreslení (překlepy) lze teoreticky odfiltrovat standardními nástroji pro kontrolu pravopisu, zatímco změny na slovní a sémantické úrovni vyžadují od modelu rozvinuté sémantické porozumění, které současným modelům často chybí<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>.

Analýza výkonnosti různých modelů ukázala výrazné rozdíly v jejich robustnosti<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. **GPT-4** a **UL2** vykazovaly nejlepší odolnost vůči adversariálním promptům<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. O něco méně náchylné k chybám se ukázaly také model Flan-T5-large a dialogový model ChatGPT<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Modely rodiny LLaMA 2 zaujaly střední pozici, zatímco **Vicuna** (13B) se vyznačila jako nejzranitelnější vůči všem druhům útoků<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Zajímavé je, že **velikost modelu se neukázala jako rozhodující faktor robustnosti**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>: relativně malá T5-large ve stabilitě odpovědí prakticky nezaostávala za mnohem větším modelem ChatGPT<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Autoři předpokládají, že klíčovou roli hrají **metody trénování a dolaďování** modelů, a nikoli pouze jejich rozsah<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Například UL2 a T5-large prošly rozšířeným předtrénováním na rozsáhlých datových korpusech a ChatGPT byl trénován s posílením na základě lidské zpětné vazby (RLHF), což mohlo posílit jejich odolnost<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Naproti tomu Vicuna byla trénována na relativně omezeném souboru dat (jako otevřená replika), což pravděpodobně způsobilo její vysokou citlivost na změny formulací<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Tyto výsledky naznačují, že zlepšení metod fine-tuning může zvýšit spolehlivost modelů výrazněji než pouhé zvětšování jejich rozsahu.

### Vliv formátu promptu

Forma podání dotazu rovněž ovlivňuje spolehlivost odpovědi<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Bylo zjištěno, že **prompty s příklady (few-shot) výrazně zvyšují odolnost** modelu ve srovnání s jednokolovými instrukcemi bez příkladů (zero-shot)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Přítomnost několika demonstračních příkladů úkolu v promptu pomáhá modelu správněji interpretovat zadání i při přítomnosti šumových změn. Rolové prompty a popisné (task-oriented) vykazovaly celkově srovnatelnou úroveň odolnosti, přestože jejich efektivita se lišila úkol od úkolu<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Například u dat pro analýzu sentimentu a duplicitních vět byl rolový formát o něco spolehlivější, zatímco u úkolů čtení s porozuměním a překladu lépe fungovaly explicitní instrukce zadání<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Tato pozorování mohou sloužit jako vodítko při navrhování promptů: přidání rozsáhlých příkladů a kontextu role snižuje pravděpodobnost chyby modelu při nestandardních formulacích.

### Přenositelnost útoků mezi modely

Přenositelnost (transfer) útoků mezi modely se ukázala jako omezená<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Adversariální prompty speciálně přizpůsobené proti jednomu modelu nejsou vždy stejně účinné proti jinému<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Bylo například zaznamenáno, že prompty-„pasti" generované pro zranitelnosti ChatGPT mají na GPT-4 mnohem slabší vliv<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Ten si vedl lépe pravděpodobně proto, že útoky se přímo nepřenášely na jeho architekturu — co zmátlo jeden model, nemusí zapůsobit na pokročilejší model s odlišnou přípravou<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Nicméně některé druhy jednoduchých zkreslení (například překlepy) měly negativní efekt hned na několik modelů, což svědčí o podobných slabinách v jejich jazykových základech.

### Praktická doporučení

V průběhu práce PromptBench byla identifikována i praktická doporučení pro uživatele a vývojáře LLM<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>. Jednoduchý závěr: stabilita formulace má svůj význam<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>. Je nutné **vyhýbat se překlepům a nedbale formulovaným dotazům**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>. Autoři ukazují, že oprava i drobných chyb (pravopis, náhodné velikosti písmen, nadbytečné mezery) může výrazně zvýšit spolehlivost odpovědi modelu<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>. Kromě toho **výběr slov v instrukci ovlivňuje její odolnost**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>. Analýza četnosti termínů v odolných vs. zranitelných promptech odhalila, že některá slova se vyskytují častěji ve „spolehlivých" promptech, zatímco jiná — v těch, kde se model spletl<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>. Například prompty obsahující slova „acting", „provided", „detection" apod. méně často vedly k chybám, zatímco slova jako „respond", „following" nebo „examine" se vyskytovala v problematičtějších případech<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>. To naznačuje, že určitý styl a slovní zásoba dotazů mohou zmírňovat nebo naopak provokovat zranitelnosti modelu. Obecně se doporučuje formulovat dotaz **co nejjasněji, jednoznačně a v termínech, které jsou pro model přirozené**, zejména pro kriticky důležité aplikace<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>.

Zajímavý vedlejší efekt, zaznamenaný výzkumníky, je vliv přidávání nesmyslných nebo irelevantních fragmentů textu do dotazu<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>. Ukázalo se, že **vložení náhodné sekvence znaků** (například „LKF0FZxMZ4") na konec nebo doprostřed promptu může rozptýlit pozornost modelu a **snížit přesnost jeho odpovědi**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>. Na druhou stranu přidání neutrální, avšak gramaticky správné fráze (například „and true is true") v některých případech naopak **zlepšovalo odpověď**, jako by model zaostřoval na smysluplné části otázky<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>. Tento fenomén zdůrazňuje, jak nepředvídatelně LLM reagují na zdánlivě nepodstatné detaily vstupu. Svědčí rovněž o složitosti vnitřního uspořádání modelů: ty nejmenší změny kontextu mohou buď narušit, nebo zlepšit jejich fungování, v závislosti na tom, jak se přerozděluje pozornost modelu.

## Význam a další vývoj

PromptRobust/PromptBench přinesl významný příspěvek k pochopení spolehlivosti LLM<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>. Navržený benchmark a shromážděná data jsou otevřena komunitě: kód a sady adversariálních promptů jsou dostupné v repozitáři<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. To umožňuje ostatním výzkumníkům testovat nové modely na odolnost vůči variacím dotazů a porovnávat výsledky<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-arxiv-main-1)</sup>. Dalším krokem se stává vývoj metod ochrany modelů před podobnými útoky — například zdokonalené algoritmy trénování zohledňující možné překlepy a přeformulování, nebo integrované systémy normalizace vstupního textu<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>. PromptBench je již považován za základ pro takový výzkum zaměřený na zvyšování **robustnosti** (robustness) jazykových modelů vůči reálně nepřesným vstupním datům<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)</sup>.

V konečném důsledku práce Zhua a kolegů demonstruje důležitost zohledňování odolnosti vůči promptům při nasazení LLM do praktických aplikací: modely musí nejen dosahovat vysoké přesnosti na „čistých" datech, ale také si zachovávat správnost při drobných odchylkách ve vstupu, ať už jde o náhodné chyby uživatele nebo záměrné útočné vlivy<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-towardsai-2)[\[4\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_note-cmu-realer-4)</sup>.

## Odkazy

- Původní článek PromptBench (arXiv)
- Repozitář PromptBench na GitHubu
- Článek „Prompt Robustness: How to Measure and How to Enhance" (Towards AI)

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Poznámky

1.  <span id="cite_note-arxiv-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-main_1-35)</sup> «PromptBench: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-towardsai-2">↑ <sup>[2.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-16)</sup> <sup>[2.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-17)</sup> <sup>[2.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-18)</sup> <sup>[2.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-towardsai_2-19)</sup> «Prompt Robustness: How to Measure and How to Enhance». *Towards AI*. <a href="https://towardsai.net/p/l/prompt-robustness-how-to-measure-and-how-to-enhance" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-abs-3">↑ <sup>[3.0](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-abs_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-abs_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-abs_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-arxiv-abs_3-3)</sup> «PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-cmu-realer-4">[↑](https://systems-analysis.info/int/PromptRobust_(benchmark)_(CS)#cite_ref-cmu-realer_4-0) «Realer Toxicity Prompts (RTP-2.0): Multilingual and Adversarial Prompts for Evaluating Neural Toxic Degeneration in Large Language Models». *Language Technologies Institute - School of Computer Science - Carnegie Mellon University*. <a href="https://www.lti.cs.cmu.edu/research/research-articles/realer-toxicity-prompts.html" class="external autonumber" rel="nofollow">[4]</a></span>
