---
title: "PromptRobust (benchmark) (SV)"
source: "https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)"
wiki: "systems-analysis.info/int"
article: "PromptRobust_(benchmark)_(SV)"
language: "sv"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Swedish"
revision_id: 5949
wiki_created_at: 2026-09-06T23:56:17Z
wiki_modified_at: 2026-09-06T23:56:17Z
downloaded_at: 2026-09-07T23:11:12Z
---

# PromptRobust (benchmark) (SV)

**PromptRobust** (även känt som **PromptBench**) är ett heltäckande **benchmark** för att utvärdera robustheten hos stora språkmodeller (LLM) mot **adversariella förändringar av prompten** — små förvrängningar i formuleringen av en uppgift som inte ändrar dess innebörd<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>. Benchmarket utvecklades 2023 av en forskargrupp (Kaijie Zhu m.fl.) från Microsoft Research Asia<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Tillkomsten av PromptRobust motiverades av observationen att moderna stora språkmodeller är känsliga för detaljer i formuleringen: även obetydliga ändringar (t.ex. stavfel eller omformuleringar) kan märkbart påverka modellernas svar<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>. Benchmarket syftar till att kvantitativt mäta denna sårbarhet och bidra till utvecklingen av mer tillförlitliga metoder för att interagera med stora språkmodeller.

## Utvärderingsmetodik

Innom ramen för PromptBench-studien skapades ett korpus bestående av **4 788 modifierade prompter** som bevarar uppgifternas ursprungliga innebörd<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-abs-3)</sup>. Dessa adversariella prompter genererades på fyra nivåer av förändringarnas komplexitet<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>:

- **Teckennivå**: Införande av stavfel, ersättning eller omplacering av tecken (simulerar slumpmässiga inmatningsfel).
- **Ordnivå**: Ersättning av vissa ord med synonymer, införande av "brus"-ord eller andra obetydliga lexikala ändringar.
- **Meningsnivå**: Omformulering av meningsstrukturer, tillägg eller omplacering av fraser utan att ändra det övergripande ämnet.
- **Semantisk nivå**: Djupare omformulering av förfrågan med bevarande av dess uppgift (t.ex. alternativa formuleringar av samma fråga)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>.

Syftet med dessa "attacker" är att undersöka hur obetydliga avvikelser (t.ex. slumpmässiga stavfel eller användning av synonyma formuleringar) påverkar modellens förmåga att korrekt utföra uppgiften, trots att uppgiften i sig inte har förändrats<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Varje genererad adversariell prompt tillämpades på ett antal standard-NLP-uppgifter, inklusive **sentimentanalys**, **identifiering av grammatisk korrekthet**, **sökning efter duplicerade meningar**, **logisk slutledning** (NLI), **läsförståelse**, **maskinöversättning** och **lösning av matematiska problem**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. För experimenten valdes 8 olika typer av uppgifter på 13 dataset — från klassiska GLUE-uppsättningar (t.ex. SST-2 för sentiment, MNLI för NLI) till specialiserade matematiska och flerspråkiga tester<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>.

Av stor vikt är att robustheten hos olika **promptformat** undersöktes<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>:

- Direkta förfrågningar utan exempel (**zero-shot**, endast instruktion).
- Förfrågningar med flera exempel (**few-shot**, där prompten innehåller exempellösningar).
- Rollbaserade prompter (**in-context roles**, t.ex. "Du är ett sentimentanalyssystem, avgör...").
- Prompter som beskriver uppgiften (**task-oriented**, direkt beskrivning av uppgiften)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>.

Även olika storskaliga språkmodeller testades — från den relativt lilla Flan-T5-large och modellen UL2 till de avancerade ChatGPT och GPT-4, samt de öppna modellerna i LLaMA 2-familjen och dess derivat Vicuna<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. För att generera attacker användes befintliga metoder från det adversariella NLP-området (såsom TextBugger, DeepWordBug, TextFooler m.fl.), anpassade för att modifiera prompter snarare än indata<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Korrektheten hos de erhållna "förvrängda" prompterna verifierades med automatiska och manuella metoder; enligt rapporten bevarar minst 85 % av de adversariella variationerna korrekt semantik och är begripliga för en människa<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Attackernas inverkan återspeglar således just modellens misslyckanden att uppfatta en omformulerad uppgift, snarare än en förlust av uppgiftens innebörd.

## Resultat och slutsatser

Försöken visade att moderna stora språkmodeller **inte är tillräckligt robusta mot små förändringar i frågeformuleringen**<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-abs-3)</sup>. För alla testade modeller observerades en betydande kvalitetsminskning i svaren under påverkan av de genererade attackerna<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-abs-3)</sup>. Även enkla fall — som ett stavfel i texten till ett matematiskt problem eller ersättning av ett nyckelord med dess synonym — ledde till att modellen gav fel svar, trots att den utan förvrängning löste uppgiften korrekt<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Författarnas övergripande slutsats: "moderna stora språkmodeller **är inte robusta** mot adversariella prompter"<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-abs-3)</sup>, det vill säga obetydliga avvikelser i phrasing kan systematiskt vilseleda dem.

Vid analys av olika typer av attacker visade det sig att förändringar på **ordnivå** har den mest destruktiva effekten på stora språkmodellers prestanda<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>. Ersättning av ord med synonymer eller obetydliga ordbildningsförvrängningar ledde till **den största kvalitetsminskningen** — i genomsnitt ca 33 % relativt det ursprungliga resultatet på samma uppgifter<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>. Attacker på **teckennivå** (stavfel, slumpmässiga tecken) orsakade i genomsnitt ca 20 % minskning av precisionen<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>. Kvalitativa förändringar eller tillägg av hela meningar till prompten hade däremot en mycket svagare effekt och störde knappt modellen<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. **Semantiska omformuleringar** (djupgående återgivning av förfrågan på ett annat sätt) visade sig vara jämförbara i skadlighet med enkla stavfel<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Dessa fakta understryker att stora språkmodeller är särskilt sårbara för subtila lexikala förändringar och fel i nyckelord<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Karakteristiskt är att grammatiska förvrängningar (stavfel) teoretiskt kan filtreras bort med standardverktyg för stavningskontroll, medan förändringar på ord- och betydelsenivå kräver att modellen besitter en välutvecklad semantisk förståelse, vilket nuvarande modeller ofta saknar<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>.

Analys av olika modellers prestanda visade en betydande spridning i deras robusthet<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. **GPT-4** och **UL2** uppvisade den bästa motståndskraften mot adversariella prompter<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Något mindre benägna att störas visade sig också Flan-T5-large och dialogmodellen ChatGPT<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Modellerna i LLaMA 2-familjen intog en mellanposition, medan **Vicuna** (13B) utmärkte sig som den mest sårbara mot alla typer av attacker<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Intressant nog visade sig **modellens storlek inte vara en avgörande faktor för robustheten**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>: den relativt lilla T5-large var i fråga om svarsstabilitet praktiskt taget likvärdig med den betydligt större modellen ChatGPT<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Författarna förmodar att **tränings- och fine-tuning-metoder** spelar en nyckelroll snarare än enbart skala<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Sålunda genomgick UL2 och T5-large utökad förträning på stora datakorpusar, medan ChatGPT tränades med Reinforcement Learning from Human Feedback (RLHF), vilket kan ha stärkt deras robusthet<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Vicuna däremot tränades på en jämförelsevis begränsad datamängd (som en öppen replik), vilket sannolikt bidrog till dess höga känslighet för formuleringsförändringar<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Dessa resultat indikerar att förbättrade fine-tuning-metoder kan öka modellernas tillförlitlighet mer effektivt än att bara öka deras storlek.

### Promptformatets inverkan

Sättet på vilket en förfrågan presenteras påverkar också svarets tillförlitlighet<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Det konstaterades att **prompter med exempel (few-shot) avsevärt ökar** modellens robusthet jämfört med enstegsanvisningar utan exempel (zero-shot)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Närvaron av flera demonstrationsexempel på uppgiften i prompten hjälper modellen att mer korrekt tolka uppgiften även vid förekomst av brusförändringar. Rollbaserade och beskrivande (task-oriented) prompter uppvisade en jämförbar nivå av robusthet generellt, även om deras effektivitet varierade från uppgift till uppgift<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Exempelvis var rollformatet något mer tillförlitligt för sentimentanalys och duplicering av meningar, medan explicita uppgiftsinstruktioner fungerade bättre för läsförståelse och översättning<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Dessa observationer kan tjäna som vägledning vid utformning av prompter: att lägga till utförliga exempel och rollkontext minskar sannolikheten för att modellen gör fel vid icke-standardiserade formuleringar.

### Överförbarhet av attacker mellan modeller

Överförbarheten (transfer) av attacker mellan modeller visade sig vara begränsad<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Adversariella prompter som specifikt utformats mot en modell är inte alltid lika effektiva mot en annan<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Det noterades exempelvis att "fälla"-prompter genererade för ChatGPT:s sårbarheter hade en mycket svagare effekt på GPT-4<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Den sistnämnda presterade bättre, troligtvis för att attackerna inte direkt överfördes till dess arkitektur — det som förvirrar en modell kanske inte har någon effekt på en mer avancerad modell med annan träning<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Vissa typer av enkla förvrängningar (t.ex. stavfel) hade dock en negativ effekt på flera modeller samtidigt, vilket tyder på liknande svagheter i deras språkliga grund.

### Praktiska rekommendationer

Genom PromptBench-arbetet identifierades även praktiska rekommendationer för användare och utvecklare av stora språkmodeller<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>. Den enkla slutsatsen: formuleringskonsekvens har betydelse<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>. Det är nödvändigt att **undvika stavfel och slarviga formuleringar i förfrågan**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>. Författarna visar att korrigering av även mindre fel (stavning, slumpmässig versalisering, extra mellanslag) avsevärt kan öka tillförlitligheten hos modellens svar<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>. Dessutom **påverkar valet av ord i instruktionen dess robusthet**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>. Analys av termfrekvenser i robusta kontra sårbara prompter visade att vissa ord förekommer oftare i "tillförlitliga" prompter, medan andra förekommer i sådana där modellen misslyckades<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>. Exempelvis ledde prompter som innehöll ord som "acting", "provided", "detection" o.s.v. mer sällan till fel, medan ord som "respond", "following" eller "examine" förekom i mer problematiska fall<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>. Detta indikerar att en viss stil och vokabulär i förfrågningar kan antingen mildra eller provocera fram modellsårbarheter. Generellt rekommenderas att formulera förfrågan **så tydligt, entydigt och i för modellen välbekanta termer som möjligt**, särskilt för verksamhetskritiska tillämpningar<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>.

En intressant bieffekt som forskarna noterade är inverkan av att lägga till meningslösa eller irrelevanta textfragment i förfrågan<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>. Det visade sig att **insättning av en slumpmässig teckensekvens** (t.ex. "LKF0FZxMZ4") i slutet eller mitten av en prompt kan distrahera modellens uppmärksamhet och **minska precisionen i dess svar**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>. Å andra sidan förbättrade tillägg av en neutral men grammatiskt korrekt fras (t.ex. "and true is true") i vissa fall tvärtom **svaret**, som om det fokuserade modellen på de meningsfulla delarna av frågan<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>. Detta fenomen understryker hur oförutsägbart stora språkmodeller reagerar på till synes obetydliga inmatningsdetaljer. Det vittnar också om modellernas komplexa inre uppbyggnad: de minsta kontextförändringarna kan antingen störa eller förbättra deras prestanda, beroende på hur modellens uppmärksamhet omfördelas.

## Betydelse och fortsatt utveckling

PromptRobust/PromptBench har bidragit väsentligt till förståelsen av stora språkmodellers tillförlitlighet<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>. Det föreslagna benchmarket och insamlade data är öppna för forskarsamhället: kod och uppsättningar av adversariella prompter finns tillgängliga i ett arkiv<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Detta gör det möjligt för andra forskare att testa nya modeller för robusthet mot frågevariationer och jämföra resultat<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-arxiv-main-1)</sup>. Nästa steg är att utveckla metoder för att skydda modeller mot sådana attacker — till exempel förbättrade träningsalgoritmer som tar hänsyn till möjliga stavfel och omformuleringar, eller inbyggda system för normalisering av inmatad text<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>. PromptBench betraktas redan som en grund för sådan forskning om att öka språkmodellers **robusthet** (robustness) mot verkliga inexakta indata<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)</sup>.

I slutändan demonstrerar arbetet av Zhu och kollegor vikten av att beakta prompt-robusthet vid implementering av stora språkmodeller i praktiska tillämpningar: modeller måste inte bara uppvisa hög precision på "rena" data, utan också bibehålla korrekthet vid obetydliga avvikelser i inmatningen, vare sig det rör sig om slumpmässiga användarfel eller avsiktliga attackerande påverkningar<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-towardsai-2)[\[4\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_note-cmu-realer-4)</sup>.

## Externa länkar

- Originalartikeln PromptBench (arXiv)
- PromptBench-arkivet på GitHub
- Artikeln "Prompt Robustness: How to Measure and How to Enhance" (Towards AI)

## Litteratur

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Noter

1.  <span id="cite_note-arxiv-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-main_1-35)</sup> «PromptBench: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-towardsai-2">↑ <sup>[2.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-16)</sup> <sup>[2.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-17)</sup> <sup>[2.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-18)</sup> <sup>[2.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-towardsai_2-19)</sup> «Prompt Robustness: How to Measure and How to Enhance». *Towards AI*. <a href="https://towardsai.net/p/l/prompt-robustness-how-to-measure-and-how-to-enhance" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-abs-3">↑ <sup>[3.0](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-abs_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-abs_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-abs_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-arxiv-abs_3-3)</sup> «PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-cmu-realer-4">[↑](https://systems-analysis.info/int/PromptRobust_(benchmark)_(SV)#cite_ref-cmu-realer_4-0) «Realer Toxicity Prompts (RTP-2.0): Multilingual and Adversarial Prompts for Evaluating Neural Toxic Degeneration in Large Language Models». *Language Technologies Institute - School of Computer Science - Carnegie Mellon University*. <a href="https://www.lti.cs.cmu.edu/research/research-articles/realer-toxicity-prompts.html" class="external autonumber" rel="nofollow">[4]</a></span>
