---
title: "PromptRobust (benchmark) (NL)"
source: "https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)"
wiki: "systems-analysis.info/int"
article: "PromptRobust_(benchmark)_(NL)"
language: "nl"
categories:
  - "Category:Dutch"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 5945
wiki_created_at: 2026-09-06T23:56:14Z
wiki_modified_at: 2026-09-06T23:56:14Z
downloaded_at: 2026-09-07T23:11:10Z
---

# PromptRobust (benchmark) (NL)

**PromptRobust** (ook bekend als **PromptBench**) — dit is een uitgebreide **benchmark** voor het evalueren van de robuustheid van grote taalmodellen (LLM) ten opzichte van **adversariale wijzigingen van de prompt** — kleine vervormingen in de formulering van een opdracht die de betekenis ervan niet veranderen<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>. De benchmark werd in 2023 ontwikkeld door een groep onderzoekers (Kaijie Zhu e.a.) van Microsoft Research Asia<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Het ontstaan van PromptRobust is ingegeven door de observatie dat moderne grote taalmodellen (GTM) gevoelig zijn voor details in de formulering: zelfs kleine wijzigingen (zoals typefouten of herformuleringen) kunnen de antwoorden van modellen merkbaar beïnvloeden<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>. De benchmark is bedoeld om deze kwetsbaarheid kwantitatief te meten en bij te dragen aan de ontwikkeling van betrouwbaardere methoden voor interactie met GTM.

## Methodologie van de evaluatie

In het kader van het PromptBench-onderzoek werd een corpus samengesteld van **4788 gewijzigde prompts**, die de oorspronkelijke betekenis van de opdrachten behouden<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-abs-3)</sup>. Deze adversariale prompts werden gegenereerd op vier niveaus van wijzigingscomplexiteit<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>:

- **Tekenniveau**: Het aanbrengen van typefouten, vervangen of verwisselen van tekens (imiteert willekeurige invoerfouten).
- **Woordniveau**: Het vervangen van bepaalde woorden door synoniemen, invoegen van 'ruis'-woorden of andere kleine woordenschatwijzigingen.
- **Zinsniveau**: Het herformuleren van de zinsstructuur, toevoegen of verplaatsen van delen van een zin zonder het algemene onderwerp te wijzigen.
- **Semantisch niveau**: Een diepgaandere herformulering van de prompt met behoud van de taakstelling (bijvoorbeeld alternatieve formuleringen van dezelfde vraag)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>.

Het doel van dergelijke 'aanvallen' is te controleren hoe kleine afwijkingen (bijv. willekeurige typefouten of het gebruik van synoniemformuleringen) de mogelijkheid van het model beïnvloeden om de taak correct uit te voeren, terwijl de taak zelf ongewijzigd blijft<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Elke gegenereerde adversariale prompt werd toegepast op een reeks standaard NLP-taken, waaronder **sentimentanalyse**, **detectie van grammaticale correctheid**, **zoeken naar dubbele zinnen**, **logisch redeneren** (NLI), **begrijpend lezen**, **machinevertaling** en **oplossen van wiskundige problemen**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Voor de experimenten werden 8 verschillende typen taken geselecteerd op 13 datasets — van klassieke GLUE-sets (bijvoorbeeld SST-2 voor sentiment, MNLI voor NLI) tot gespecialiseerde wiskundige en meertalige tests<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>.

Belangrijk is dat de robuustheid van verschillende **promptformaten** werd getest<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>:

- Directe verzoeken zonder voorbeelden (**zero-shot**, alleen instructie).
- Verzoeken met meerdere voorbeelden (**few-shot**, waarbij de prompt voorbeeldoplossingen bevat).
- Rolgerichte prompts (**in-context roles**, bijvoorbeeld 'U bent een sentimentanalysesysteem, bepaal...').
- Prompts die de taak beschrijven (**task-oriented**, directe beschrijving van de opdracht)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>.

Er werden ook verschillende grootschalige taalmodellen getest, van het relatief kleine Flan-T5-large en het UL2-model tot de geavanceerde ChatGPT en GPT-4, evenals open modellen uit de LLaMA 2-familie en het daarvan afgeleide Vicuna<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Voor het genereren van aanvallen werden bestaande methoden uit het domein van adversariaal NLP gebruikt (zoals TextBugger, DeepWordBug, TextFooler en andere), aangepast voor het wijzigen van prompts in plaats van invoergegevens<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. De correctheid van de verkregen 'vervormde' prompts werd gecontroleerd met automatische en handmatige methoden; volgens het rapport behoudt ten minste 85% van de adversariale varianten de juiste semantiek en is begrijpelijk voor een mens<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Zo weerspiegelt de impact van de aanvallen uitsluitend fouten van het model bij het interpreteren van de hergeformuleerde opdracht, en niet het verlies van de betekenis van de taak zelf.

## Resultaten en conclusies

De tests toonden aan dat moderne GTM **onvoldoende robuust zijn voor kleine wijzigingen in de formulering van de prompt**<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-abs-3)</sup>. Voor alle geteste modellen werd een significante verslechtering van de kwaliteit van de antwoorden waargenomen onder invloed van de gegenereerde aanvallen<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-abs-3)</sup>. Zo leidden zelfs eenvoudige gevallen — zoals een typefout in de tekst van een wiskundig probleem of het vervangen van een sleutelwoord door een synoniem — ertoe dat het model een onjuist resultaat gaf, terwijl het zonder de vervalsing correct antwoordde<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. De algemene conclusie van de auteurs: 'moderne grote taalmodellen **zijn niet robuust** ten opzichte van adversariale prompts'<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-abs-3)</sup>, dat wil zeggen dat kleine afwijkingen in de phrasing hen systematisch op het verkeerde been kunnen zetten.

Bij analyse van de verschillende soorten aanvallen bleek dat wijzigingen op **woordniveau** de meest destructieve invloed hebben op de werking van GTM<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>. Het vervangen van woorden door synoniemen of kleine woordvormelijke vervormingen leidde tot de **grootste kwaliteitsdaling** — gemiddeld ≈33% ten opzichte van het oorspronkelijke resultaat op dezelfde taken<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>. Aanvallen op **tekenniveau** (typefouten, willekeurige tekens) veroorzaakten gemiddeld ~20% nauwkeurigheidsafname<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>. Kwalitatieve wijziging of toevoeging van volledige zinnen aan de prompt had daarentegen een veel zwakker effect en bracht het model nauwelijks van de wijs<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. **Semantische herformuleringen** (diepgaande herformulering van het verzoek op een andere manier) bleken vergelijkbaar in schadelijkheid met eenvoudige typefouten<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Deze feiten benadrukken dat GTM bijzonder kwetsbaar zijn voor subtiele lexicale wijzigingen en fouten in sleutelwoorden<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Kenmerkend is dat grammaticale vervormingen (typefouten) theoretisch gefilterd kunnen worden met standaard spellingcontroles, terwijl wijzigingen op woord- en betekenisniveau een ontwikkeld semantisch begrip van het model vereisen, wat huidige modellen vaak ontbreekt<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>.

Analyse van de prestaties van de verschillende modellen toonde een aanzienlijke spreiding in hun robuustheid<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. **GPT-4** en **UL2** vertoonden de beste robuustheid ten opzichte van adversariale prompts<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Iets minder gevoelig voor fouten bleken ook het Flan-T5-large-model en het dialoogmodel ChatGPT<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Modellen uit de LLaMA 2-familie namen een tussenpositie in, terwijl **Vicuna** (13B) opviel als het meest kwetsbaar voor alle soorten aanvallen<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Interessant is dat **de modelomvang geen beslissende factor voor robuustheid bleek te zijn**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>: het relatief kleine T5-large deed qua antwoordstabiliteit nauwelijks onder voor het veel grotere ChatGPT-model<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. De auteurs veronderstellen dat **trainings- en fine-tuningmethoden** van modellen een sleutelrol spelen, en niet alleen de schaal<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Zo ondergingen UL2 en T5-large uitgebreide pre-training op grote datacorpora, en werd ChatGPT getraind met versterking op basis van menselijke feedback (RLHF), wat hun robuustheid mogelijk heeft vergroot<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Vicuna daarentegen werd getraind op een relatief beperkte dataset (als open replica), wat waarschijnlijk haar hoge gevoeligheid voor formuleringswijzigingen verklaart<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Deze resultaten wijzen erop dat het verbeteren van fine-tuningmethoden de betrouwbaarheid van modellen sterker kan verhogen dan louter het vergroten van hun omvang.

### Invloed van het promptformaat

De vorm van het verzoek beïnvloedt ook de betrouwbaarheid van het antwoord<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Er werd vastgesteld dat **prompts met voorbeelden (few-shot) de robuustheid** van het model aanzienlijk verhogen vergeleken met eenstapssinstructies zonder voorbeelden (zero-shot)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. De aanwezigheid van meerdere demonstratievoorbeelden van de taak in de prompt helpt het model de opdracht juister te interpreteren, zelfs bij ruis-wijzigingen. Rolgerichte en beschrijvende (task-oriented) prompts toonden een vergelijkbaar niveau van robuustheid in het algemeen, hoewel hun effectiviteit per taak varieerde<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Zo was het rolformaat bij sentimentanalyse en detectie van dubbele zinnen iets betrouwbaarder, terwijl bij begrijpend lezen en vertaling expliciete taakinstructies beter werkten<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Deze observaties kunnen als leidraad dienen bij het ontwerpen van prompts: het toevoegen van uitgebreide voorbeelden en rolcontext vermindert de kans op fouten van het model bij ongebruikelijke formuleringen.

### Overdraagbaarheid van aanvallen tussen modellen

De overdraagbaarheid (transfer) van aanvallen tussen modellen bleek beperkt<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Adversariale prompts die specifiek zijn ontworpen tegen één model, zijn niet altijd even effectief tegen een ander model<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Zo werd opgemerkt dat prompt-'vallen' gegenereerd voor kwetsbaarheden van ChatGPT, een veel zwakkere invloed hadden op GPT-4<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Dit laatste presteerde beter, waarschijnlijk omdat de aanvallen niet rechtstreeks overdroegen op zijn architectuur — wat één model in de war brengt, werkt mogelijk niet op een geavanceerder model met een andere training<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Toch hadden sommige soorten eenvoudige vervormingen (bijvoorbeeld typefouten) een negatief effect op meerdere modellen tegelijk, wat wijst op vergelijkbare zwakke punten in hun taalkundige basis.

### Praktische aanbevelingen

Tijdens het PromptBench-onderzoek werden ook praktische aanbevelingen geïdentificeerd voor gebruikers en ontwikkelaars van GTM<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>. Een eenvoudige conclusie: de stabiliteit van de formulering doet er toe<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>. Het is noodzakelijk **typefouten en slordig geformuleerde verzoeken te vermijden**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>. De auteurs tonen aan dat het corrigeren van zelfs kleine fouten (spelling, willekeurige hoofdletters, overtollige spaties) de betrouwbaarheid van het antwoord van het model aanzienlijk kan verbeteren<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>. Bovendien **beïnvloedt de woordkeuze in de instructie de robuustheid ervan**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>. Analyse van de termfrequentie in robuuste versus kwetsbare prompts onthulde dat bepaalde woorden vaker voorkomen in 'betrouwbare' prompts, terwijl andere vaker voorkomen in gevallen waarin het model faalde<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>. Zo leidden prompts die woorden bevatten als 'acting', 'provided', 'detection' e.d. minder vaak tot fouten, terwijl woorden als 'respond', 'following' of 'examine' vaker voorkwamen in meer problematische gevallen<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>. Dit duidt erop dat een bepaalde stijl en woordenschat van verzoeken kwetsbaarheden van het model kan verzachten of juist uitlokken. Over het algemeen wordt aanbevolen het verzoek **zo helder, eenduidig en in voor het model vertrouwde termen mogelijk te formuleren**, met name voor bedrijfskritische toepassingen<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>.

Een interessant neveneffect dat de onderzoekers opmerkten, is de invloed van het toevoegen van betekenisloze of irrelevante tekstfragmenten aan het verzoek<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>. Het bleek dat **het invoegen van een willekeurige reeks tekens** (bijvoorbeeld 'LKF0FZxMZ4') aan het einde of het midden van een prompt de aandacht van het model kan afleiden en **de nauwkeurigheid van het antwoord kan verminderen**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>. Aan de andere kant verbeterde het toevoegen van een neutrale maar grammaticaal correcte zin (bijvoorbeeld 'and true is true') in sommige gevallen juist **het antwoord**, alsof het model daardoor werd gefocust op de betekenisvolle delen van de vraag<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>. Dit fenomeen benadrukt hoe onvoorspelbaar GTM reageren op ogenschijnlijk onbelangrijke details van de invoer. Het wijst ook op de complexiteit van de interne werking van modellen: de kleinste contextwijzigingen kunnen hun werking zowel verstoren als verbeteren, afhankelijk van hoe de aandacht van het model wordt herverdeeld.

## Betekenis en verdere ontwikkeling

PromptRobust/PromptBench heeft een belangrijke bijdrage geleverd aan het begrip van de betrouwbaarheid van GTM<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>. De voorgestelde benchmark en verzamelde gegevens zijn openbaar voor de gemeenschap: de code en sets adversariale prompts zijn beschikbaar in de repository<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. Dit stelt andere onderzoekers in staat nieuwe modellen te testen op robuustheid voor promptvariaties en resultaten te vergelijken<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-arxiv-main-1)</sup>. De volgende stap is de ontwikkeling van methoden om modellen te beschermen tegen dergelijke aanvallen — bijvoorbeeld verbeterde trainingsalgoritmen die rekening houden met mogelijke typefouten en herformuleringen, of ingebouwde systemen voor normalisatie van invoergegevens<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>. PromptBench wordt al beschouwd als basis voor dergelijk onderzoek naar het verbeteren van de **robuustheid** (robustness) van taalmodellen ten opzichte van reële onnauwkeurige invoergegevens<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)</sup>.

Uiteindelijk toont het werk van Zhu en collega's het belang aan van het rekening houden met promptrobuustheid bij de implementatie van GTM in praktische toepassingen: modellen moeten niet alleen hoge nauwkeurigheid tonen op 'schone' gegevens, maar ook correctheid behouden bij kleine afwijkingen in de invoer, of het nu gaat om willekeurige gebruikersfouten of opzettelijke aanvallen<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-towardsai-2)[\[4\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_note-cmu-realer-4)</sup>.

## Verwijzingen

- Origineel PromptBench-artikel (arXiv)
- PromptBench-repository op GitHub
- Artikel 'Prompt Robustness: How to Measure and How to Enhance' (Towards AI)

## Literatuur

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Noten

1.  <span id="cite_note-arxiv-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-main_1-35)</sup> «PromptBench: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-towardsai-2">↑ <sup>[2.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-16)</sup> <sup>[2.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-17)</sup> <sup>[2.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-18)</sup> <sup>[2.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-towardsai_2-19)</sup> «Prompt Robustness: How to Measure and How to Enhance». *Towards AI*. <a href="https://towardsai.net/p/l/prompt-robustness-how-to-measure-and-how-to-enhance" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-abs-3">↑ <sup>[3.0](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-abs_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-abs_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-abs_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-arxiv-abs_3-3)</sup> «PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-cmu-realer-4">[↑](https://systems-analysis.info/int/PromptRobust_(benchmark)_(NL)#cite_ref-cmu-realer_4-0) «Realer Toxicity Prompts (RTP-2.0): Multilingual and Adversarial Prompts for Evaluating Neural Toxic Degeneration in Large Language Models». *Language Technologies Institute - School of Computer Science - Carnegie Mellon University*. <a href="https://www.lti.cs.cmu.edu/research/research-articles/realer-toxicity-prompts.html" class="external autonumber" rel="nofollow">[4]</a></span>
