---
title: "PromptRobust (benchmark) (PL)"
source: "https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)"
wiki: "systems-analysis.info/int"
article: "PromptRobust_(benchmark)_(PL)"
language: "pl"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Polish"
revision_id: 5946
wiki_created_at: 2026-09-06T23:56:14Z
wiki_modified_at: 2026-09-06T23:56:14Z
downloaded_at: 2026-09-07T23:11:11Z
---

# PromptRobust (benchmark) (PL)

**PromptRobust** (znany również jako **PromptBench**) — to kompleksowy **benchmark** do oceny odporności dużych modeli językowych (LLM) na **adwersarialne modyfikacje zapytania** — niewielkie zniekształcenia sformułowania zadania, które nie zmieniają jego sensu<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>. Benchmark został opracowany w 2023 roku przez grupę badaczy (Kaijie Zhu i in.) z Microsoft Research Asia<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Powstanie PromptRobust wynikało z obserwacji, że współczesne duże modele językowe (LLM) są wrażliwe na szczegóły sformułowania: nawet nieznaczne zmiany (np. literówki lub parafrazy) mogą wyraźnie wpływać na odpowiedzi modeli<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>. Benchmark ma na celu ilościowe zmierzenie tej podatności oraz wspieranie opracowywania bardziej niezawodnych metod interakcji z LLM.

## Metodologia oceny

W ramach badania PromptBench zgromadzono korpus złożony z **4788 zmodyfikowanych podpowiedzi** (promptów), zachowujących pierwotny sens zadań<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-abs-3)</sup>. Te adwersarialne podpowiedzi zostały wygenerowane na czterech poziomach złożoności modyfikacji<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>:

- **Poziom znakowy**: Wprowadzanie literówek, zamiana lub przestawienie znaków (imituje przypadkowe błędy wprowadzania).
- **Poziom wyrazowy**: Zastępowanie niektórych słów synonimami, wstawianie słów „szumowych" lub inne drobne zmiany leksykalne.
- **Poziom zdaniowy**: Parafrazowanie struktury zdań, dodawanie lub przestawianie fragmentów frazy bez zmiany ogólnego tematu.
- **Poziom semantyczny**: Głębsze przeformułowanie zapytania przy zachowaniu jego zadania (np. alternatywne sformułowania tego samego pytania)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>.

Celem takich „ataków" jest sprawdzenie, jak nieznaczne odchylenia (np. przypadkowe literówki lub użycie synonimicznych sformułowań) wpływają na zdolność modelu do poprawnego wykonania zadania, przy czym samo zadanie pozostaje niezmienione<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Każda wygenerowana adwersarialna podpowiedź była stosowana do szeregu standardowych zadań NLP, w tym **analizy wydźwięku**, **wykrywania poprawności gramatycznej**, **wyszukiwania zdań duplikatów**, **wnioskowania logicznego** (NLI), **czytania ze zrozumieniem**, **tłumaczenia maszynowego** oraz **rozwiązywania zadań matematycznych**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Do eksperymentów wybrano 8 różnych typów zadań na 13 datasetach — od klasycznych zbiorów GLUE (np. SST-2 dla analizy wydźwięku, MNLI dla NLI) po wyspecjalizowane testy matematyczne i wielojęzyczne<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>.

Istotne jest, że badano odporność różnych **formatów promptu**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>:

- Bezpośrednie zapytania bez przykładów (**zero-shot**, tylko instrukcja).
- Zapytania z kilkoma przykładami (**few-shot**, gdy w podpowiedzi podano próbki rozwiązania).
- Podpowiedzi z rolą (**in-context roles**, np. „Jesteś systemem analizy wydźwięku, określ...").
- Podpowiedzi opisujące zadanie (**task-oriented**, bezpośredni opis zadania)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>.

Przetestowano również różne wielkoskalowe modele językowe — od stosunkowo niewielkiego Flan-T5-large i modelu UL2 po zaawansowane ChatGPT i GPT-4, a także otwarte modele z rodziny LLaMA 2 i pochodny od nich Vicuna<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Do generowania ataków wykorzystano istniejące metody z dziedziny adwersarialnego NLP (takie jak TextBugger, DeepWordBug, TextFooler i inne), zaadaptowane do modyfikacji podpowiedzi zamiast danych wejściowych<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Poprawność uzyskanych „zniekształconych" podpowiedzi była weryfikowana metodami automatycznymi i ręcznymi; zgodnie z raportem co najmniej 85% adwersarialnych wariantów zachowuje poprawną semantykę i jest zrozumiałych dla człowieka<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Tym samym wpływ ataków odzwierciedla wyłącznie błędy modelu w odbiorze przeformułowanego zadania, a nie utratę sensu samego zadania.

## Wyniki i wnioski

Testy wykazały, że współczesne LLM **nie są wystarczająco odporne na niewielkie zmiany sformułowania zapytania**<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-abs-3)</sup>. W przypadku wszystkich przetestowanych modeli zaobserwowano znaczący spadek jakości odpowiedzi pod wpływem wygenerowanych ataków<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-abs-3)</sup>. W szczególności nawet proste przypadki — takie jak literówka w treści zadania matematycznego lub zastąpienie jednego kluczowego słowa jego synonimem — powodowały, że model dawał błędny wynik, choć bez zniekształcenia radził sobie poprawnie<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Ogólny wniosek autorów brzmi: „współczesne duże modele językowe **nie są robustne** (odporne) na adwersarialne podpowiedzi"<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-abs-3)</sup>, tzn. nieznaczne odchylenia w phrasing mogą systematycznie wprowadzać je w błąd.

Przy analizie różnych rodzajów ataków okazało się, że najbardziej destrukcyjny wpływ na działanie LLM mają zmiany na **poziomie wyrazowym**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>. Zastępowanie słów synonimami lub nieznaczne słowotwórcze zniekształcenia prowadziły do **największego spadku jakości** — średnio o ≈33% względem oryginalnego wyniku na tych samych zadaniach<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>. Ataki na **poziomie znakowym** (literówki, losowe znaki) powodowały średnio ~20% spadek dokładności<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>. Jakościowa zmiana lub dodanie całych zdań do promptu miało natomiast znacznie słabszy efekt i prawie nie dezorientowało modelu<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. **Semantyczne parafrazy** (głębokie przeformułowanie zapytania w inny sposób) okazały się porównywalne pod względem szkodliwości z prostymi literówkami<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Fakty te podkreślają, że LLM są szczególnie podatne na subtelne zmiany leksykalne i błędy w słowach kluczowych<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Charakterystyczne jest, że zniekształcenia gramatyczne (literówki) można teoretycznie odfiltrować standardowymi narzędziami sprawdzania pisowni, podczas gdy zmiany na poziomie wyrazowym i semantycznym wymagają od modelu rozwiniętego rozumienia semantycznego, którego obecnym modelom często brakuje<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>.

Analiza wydajności różnych modeli wykazała znaczne zróżnicowanie ich robustności<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. **GPT-4** i **UL2** wykazały najlepszą odporność na adwersarialne podpowiedzi<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Nieco mniej podatne na błędy okazały się również model Flan-T5-large i model dialogowy ChatGPT<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Modele z rodziny LLaMA 2 zajęły pozycję pośrednią, natomiast **Vicuna** (13B) wyróżniła się jako najbardziej podatna na wszystkie rodzaje ataków<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Interesujące jest, że **rozmiar modelu nie okazał się decydującym czynnikiem robustności**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>: stosunkowo niewielki T5-large pod względem stabilności odpowiedzi prawie nie ustępował znacznie większemu modelowi ChatGPT<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Autorzy zakładają, że kluczową rolę odgrywają **metody uczenia i fine-tuningu** modeli, a nie tylko ich skala<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. I tak UL2 i T5-large przechodziły rozszerzone pretrenowanie na dużych korpusach danych, a ChatGPT był trenowany z użyciem uczenia ze wzmocnieniem na podstawie ludzkiej informacji zwrotnej (RLHF), co mogło wzmocnić ich odporność<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Natomiast Vicuna był trenowany na stosunkowo ograniczonym zbiorze danych (jako otwarta replika), co prawdopodobnie spowodowało jego wysoką wrażliwość na zmiany sformułowań<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Wyniki te wskazują, że poprawa metod fine-tuningu może zwiększyć niezawodność modeli bardziej niż samo zwiększanie ich rozmiarów.

### Wpływ formatu promptu

Sposób podania zapytania również wpływa na niezawodność odpowiedzi<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Ustalono, że **podpowiedzi z przykładami (few-shot) znacząco zwiększają odporność** modelu w porównaniu z jednostopniowymi instrukcjami bez przykładów (zero-shot)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Obecność kilku demonstracyjnych przykładów zadania w promptcie pomaga modelowi trafniej interpretować zadanie nawet przy obecności szumowych zmian. Podpowiedzi z rolą i opisowe (task-oriented) wykazały porównywalny poziom odporności ogólnie, choć ich skuteczność różniła się w zależności od zadania<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Na przykład w danych dotyczących analizy wydźwięku i duplikatów zdań format z rolą był nieco bardziej niezawodny, podczas gdy w zadaniach czytania ze zrozumieniem i tłumaczenia lepiej sprawdziły się jawne instrukcje zadania<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Spostrzeżenia te mogą służyć jako wskazówka przy projektowaniu promptów: dodanie rozbudowanych przykładów i kontekstu roli zmniejsza prawdopodobieństwo błędu modelu przy niestandardowych sformułowaniach.

### Przenoszalność ataków między modelami

Przenoszalność (transfer) ataków między modelami okazała się ograniczona<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Adwersarialne podpowiedzi specjalnie dobrane przeciwko jednemu modelowi nie zawsze są jednakowo skuteczne przeciwko innemu<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Odnotowano na przykład, że prompty-„pułapki" wygenerowane pod kątem podatności ChatGPT znacznie słabiej wpływają na GPT-4<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Ten ostatni radził sobie lepiej, prawdopodobnie dlatego że ataki nie przenosiły się bezpośrednio na jego architekturę — to, co dezorientuje jeden model, może nie działać na bardziej zaawansowany model z innym przygotowaniem<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Niemniej jednak niektóre rodzaje prostych zniekształceń (np. literówki) wywierały negatywny efekt na kilka modeli jednocześnie, co świadczy o podobnych słabościach w ich językowych podstawach.

### Praktyczne zalecenia

W toku prac nad PromptBench zidentyfikowano również praktyczne zalecenia dla użytkowników i twórców LLM<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>. Prosty wniosek: stabilność sformułowania ma znaczenie<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>. Należy **unikać literówek i niedbałych sformułowań w zapytaniu**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>. Autorzy pokazują, że poprawienie nawet drobnych błędów (pisownia, przypadkowa wielkość liter, zbędne spacje) może znacząco poprawić niezawodność odpowiedzi modelu<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>. Ponadto **dobór słów w instrukcji wpływa na jej odporność**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>. Analiza częstości terminów w odpornych vs. podatnych podpowiedziach wykazała, że niektóre słowa częściej pojawiają się w „niezawodnych" promptach, a inne — w tych, gdzie model popełniał błędy<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>. Na przykład podpowiedzi zawierające słowa „acting", „provided", „detection" itp. rzadziej prowadziły do błędów, natomiast słowa takie jak „respond", „following" czy „examine" występowały częściej w bardziej problematycznych przypadkach<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>. Wskazuje to, że określony styl i leksyka zapytań mogą łagodzić lub wręcz prowokować podatności modelu. Ogólnie zaleca się formułowanie zapytania **możliwie jasno, jednoznacznie i w terminach typowych dla modelu**, szczególnie w przypadku krytycznych zastosowań<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>.

Ciekawym efektem ubocznym odnotowanym przez badaczy jest wpływ dodawania bezsensownych lub nieistotnych fragmentów tekstu do zapytania<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>. Okazało się, że **wstawienie losowej sekwencji znaków** (np. „LKF0FZxMZ4") na końcu lub w środku podpowiedzi może odwrócić uwagę modelu i **obniżyć dokładność jego odpowiedzi**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>. Z drugiej strony dodanie neutralnej, ale gramatycznie poprawnej frazy (np. „and true is true" — „i prawdziwe jest prawdziwe") w niektórych przypadkach wręcz **poprawiało odpowiedź**, jakby skupiając model na istotnych częściach pytania<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>. To zjawisko podkreśla, jak nieprzewidywalnie LLM reagują na pozornie nieistotne szczegóły wejścia. Świadczy też o złożoności wewnętrznej budowy modeli: najmniejsze zmiany kontekstu mogą albo zakłócić, albo poprawić ich działanie, w zależności od tego, jak rozkłada się uwaga modelu.

## Znaczenie i dalszy rozwój

PromptRobust/PromptBench wniósł znaczący wkład w rozumienie niezawodności LLM<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>. Zaproponowany benchmark i zgromadzone dane są otwarte dla społeczności: kod i zbiory adwersarialnych podpowiedzi są dostępne w repozytorium<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Pozwala to innym badaczom testować nowe modele pod kątem odporności na warianty zapytań i porównywać wyniki<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-arxiv-main-1)</sup>. Kolejnym krokiem jest opracowanie metod ochrony modeli przed tego rodzaju atakami — na przykład ulepszone algorytmy uczenia uwzględniające możliwe literówki i parafrazy lub wbudowane systemy normalizacji mowy wejściowej<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>. PromptBench jest już postrzegany jako podstawa dla takich badań nad zwiększaniem **robustności** (robustness) modeli językowych wobec rzeczywistych niedokładnych danych wejściowych<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)</sup>.

Ostatecznie praca Zhu i współpracowników demonstruje znaczenie uwzględniania odporności na prompty przy wdrażaniu LLM w praktycznych zastosowaniach: modele muszą nie tylko wykazywać wysoką dokładność na „czystych" danych, ale i zachowywać poprawność przy nieznacznych odchyleniach w danych wejściowych — czy to przy przypadkowych błędach użytkownika, czy przy celowych atakach<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-towardsai-2)[\[4\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_note-cmu-realer-4)</sup>.

## Odnośniki

- Oryginalna praca PromptBench (arXiv)
- Repozytorium PromptBench na GitHub
- Artykuł „Prompt Robustness: How to Measure and How to Enhance" (Towards AI)

## Literatura

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Przypisy

1.  <span id="cite_note-arxiv-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-main_1-35)</sup> «PromptBench: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-towardsai-2">↑ <sup>[2.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-16)</sup> <sup>[2.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-17)</sup> <sup>[2.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-18)</sup> <sup>[2.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-towardsai_2-19)</sup> «Prompt Robustness: How to Measure and How to Enhance». *Towards AI*. <a href="https://towardsai.net/p/l/prompt-robustness-how-to-measure-and-how-to-enhance" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-abs-3">↑ <sup>[3.0](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-abs_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-abs_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-abs_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-arxiv-abs_3-3)</sup> «PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-cmu-realer-4">[↑](https://systems-analysis.info/int/PromptRobust_(benchmark)_(PL)#cite_ref-cmu-realer_4-0) «Realer Toxicity Prompts (RTP-2.0): Multilingual and Adversarial Prompts for Evaluating Neural Toxic Degeneration in Large Language Models». *Language Technologies Institute - School of Computer Science - Carnegie Mellon University*. <a href="https://www.lti.cs.cmu.edu/research/research-articles/realer-toxicity-prompts.html" class="external autonumber" rel="nofollow">[4]</a></span>
