---
title: "PromptRobust (benchmark) (TL)"
source: "https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)"
wiki: "systems-analysis.info/int"
article: "PromptRobust_(benchmark)_(TL)"
language: "tl"
categories:
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
  - "Category:Tagalog"
revision_id: 5951
wiki_created_at: 2026-09-06T23:56:19Z
wiki_modified_at: 2026-09-06T23:56:19Z
downloaded_at: 2026-09-07T23:11:13Z
---

# PromptRobust (benchmark) (TL)

**PromptRobust** (kilala rin bilang **PromptBench**) — ito ay isang komprehensibong **benchmark** para sa pagsusuri ng katatagan ng malalaking language model (LLM) laban sa **mga adversarial na pagbabago sa prompt** — maliliit na pagbabago sa pagbabalangkas ng gawain na hindi nagbabago ng kahulugan nito<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>. Ang benchmark ay binuo noong 2023 ng isang grupo ng mga mananaliksik (si Kaijie Zhu at iba pa) mula sa Microsoft Research Asia<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Ang paglabas ng PromptRobust ay dulot ng pagmamasid na ang mga modernong LLM ay sensitibo sa mga detalye ng pagbabalangkas: kahit ang maliliit na pagbabago (tulad ng mga typo o paraphrase) ay maaaring makabuluhang makaapekto sa mga sagot ng mga modelo<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>. Layunin ng benchmark na sukatin nang dami ang kahinaang ito at itaguyod ang pagbuo ng mas maaasahang mga paraan ng pakikipag-ugnayan sa mga LLM.

## Metodolohiya ng Pagsusuri

Sa loob ng pananaliksik ng PromptBench, nabuo ang isang corpus ng **4788 na binagong prompt**, na pinapanatili ang orihinal na kahulugan ng mga gawain<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-abs-3)</sup>. Ang mga adversarial na prompt na ito ay nabuo sa apat na antas ng kahirapan ng pagbabago<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>:

- **Antas ng karakter**: Paglalagay ng mga typo, pagpapalit o pagsasaayos ng mga karakter (ginagaya ang mga random na pagkakamali sa pag-input).
- **Antas ng salita**: Pagpapalit ng ilang salita ng mga kasingkahulugan, paglalagay ng mga "maingay" na salita o iba pang maliliit na pagbabago sa bokabularyo.
- **Antas ng pangungusap**: Pag-paraphrase ng estruktura ng mga pangungusap, pagdaragdag o pagsasaayos ng mga bahagi ng parirala nang hindi binabago ang pangkalahatang paksa.
- **Antas ng semantika**: Mas malalim na muling pagbabalangkas ng kahilingan na pinapanatili ang gawain nito (halimbawa, mga alternatibong paraan ng pagtatanong sa parehong tanong)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>.

Ang layunin ng mga ganitong "atake" ay suriin kung paano nakakaapekto ang maliliit na paglihis (hal., mga random na typo o paggamit ng mga kasingkahulugang pagbabalangkas) sa kakayahan ng modelo na maayos na isagawa ang gawain, kahit na ang mismong gawain ay hindi nagbago<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Ang bawat nabuong adversarial na prompt ay inilapat sa ilang karaniwang NLP na gawain, kabilang ang **pagsusuri ng damdamin**, **pagtukoy ng gramatikong kawastuhan**, **paghahanap ng mga duplicate na pangungusap**, **lohikal na hinuha** (NLI), **pagbabasa na may pag-unawa**, **makina na pagsasalin** at **paglutas ng mga mathematical na problema**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Para sa mga eksperimento, napili ang 8 iba't ibang uri ng gawain sa 13 dataset — mula sa mga klasikong set ng GLUE (hal., SST-2 para sa damdamin, MNLI para sa NLI) hanggang sa mga espesyalisadong mathematical at multilingual na pagsubok<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>.

Mahalaga ring sinuri ang katatagan ng iba't ibang **format ng prompt**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>:

- Mga direktang kahilingan nang walang mga halimbawa (**zero-shot**, tanging instruksyon lamang).
- Mga kahilingan na may ilang halimbawa (**few-shot**, kung saan ang mga sample na solusyon ay ibinibigay sa prompt).
- Mga role-based na prompt (**in-context roles**, halimbawa, "Ikaw ay isang sistema ng pagsusuri ng damdamin, tukuyin ang...").
- Mga prompt na naglalarawan ng gawain (**task-oriented**, direktang paglalarawan ng gawain)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>.

Nasubok din ang iba't ibang malalaking language model mula sa medyo maliit na Flan-T5-large at UL2 hanggang sa mga advanced na ChatGPT at GPT-4, pati na rin ang mga open na modelo ng pamilyang LLaMA 2 at ang Vicuna na nagmula rito<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Para sa pagbuo ng mga atake, ginamit ang mga umiiral na pamamaraan mula sa larangan ng adversarial NLP (tulad ng TextBugger, DeepWordBug, TextFooler at iba pa), na inangkop para sa pagbabago ng mga prompt sa halip na input data<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Ang kawastuhan ng mga nabuong "binagong" prompt ay napatunayan sa pamamagitan ng mga awtomatiko at manu-manong pamamaraan; ayon sa ulat, hindi bababa sa 85% ng mga adversarial na pagbabago ay pinapanatili ang tamang semantika at naiintindihan ng tao<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Kaya naman, ang epekto ng mga atake ay sumasalamin sa mismong mga pagpalya ng modelo sa pag-unawa sa muling binagong gawain, at hindi sa pagkawala ng kahulugan ng gawain mismo.

## Mga Resulta at Konklusyon

Ipinakita ng mga pagsubok na ang mga modernong LLM ay **hindi sapat na matibay laban sa maliliit na pagbabago sa pagbabalangkas ng kahilingan**<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-abs-3)</sup>. Para sa lahat ng nasubok na modelo, napansin ang makabuluhang pagbaba ng kalidad ng mga sagot sa ilalim ng impluwensya ng mga nabuong atake<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-abs-3)</sup>. Sa partikular, kahit ang mga simpleng kaso — tulad ng isang typo sa teksto ng isang mathematical na problema o pagpapalit ng isang susi na salita ng kasingkahulugan nito — ay nagdulot ng maling resulta mula sa modelo, kahit na nang walang pagbabago ay tamang nasasagot nito<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Ang pangkalahatang konklusyon ng mga may-akda: "ang mga modernong malalaking language model ay **hindi matibay** (hindi maaasahan) sa mga adversarial na prompt"<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-abs-3)</sup>, ibig sabihin, ang maliliit na paglihis sa phrasing ay maaaring sistematikong malinlang sa kanila.

Sa pagsusuri ng iba't ibang uri ng atake, nalaman na ang pinaka-mapaminsala sa gawain ng mga LLM ay ang mga pagbabago sa **antas ng salita**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>. Ang pagpapalit ng mga salita ng kasingkahulugan o maliliit na pagbabaluktot ng pagbuo ng salita ay nagdulot ng **pinakamataas na pagbaba ng kalidad** — sa average na ≈33% kaugnay ng orihinal na resulta sa parehong mga gawain<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>. Ang mga atake sa **antas ng karakter** (mga typo, mga random na karakter) ay nagdulot ng average na ~20% na pagbaba ng katumpakan<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>. Ang makalidad na pagbabago o pagdaragdag ng buong pangungusap sa prompt, sa kabaligtaran, ay may mas mahinang epekto, halos hindi nagpapalito sa modelo<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Ang mga **semantic na paraphrase** (malalim na muling pagkukuwento ng kahilingan sa ibang paraan) ay katumbas ng pagiging mapanira tulad ng simpleng mga typo<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Ang mga katotohanang ito ay nagbibigay-diin na ang mga LLM ay partikular na mahina sa mga banayad na leksikal na pagbabago at mga pagkakamali sa mga susi na salita<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Kapansin-pansin na ang mga grammatical na pagbabaluktot (mga typo) ay maaaring teoretikal na ma-filter ng mga karaniwang paraan ng pagsusuri ng spelling, samantalang ang mga pagbabago sa antas ng salita at kahulugan ay nangangailangan ng binuo na semantic na pag-unawa mula sa modelo, na madalas ay kulang sa mga kasalukuyang modelo<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>.

Ang pagsusuri ng pagganap ng iba't ibang modelo ay nagpakita ng malaking pagkakaiba-iba sa kanilang katatagan<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. **GPT-4** at **UL2** ay nagpakita ng pinakamataas na katatagan laban sa mga adversarial na prompt<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Medyo hindi rin masyadong madaling magpalya ang modelo na Flan-T5-large at ang dayalogong modelo na ChatGPT<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Ang mga modelo ng pamilyang LLaMA 2 ay nasa gitnang posisyon, samantalang ang **Vicuna** (13B) ay namukod-tangi bilang pinaka-mahina sa lahat ng uri ng atake<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Kapansin-pansin na ang **laki ng modelo ay hindi naging mapagpasyang salik ng katatagan**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>: ang medyo maliit na T5-large sa katatagan ng sagot ay halos hindi nagpababa kumpara sa mas malaking modelo na ChatGPT<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Iminumungkahi ng mga may-akda na ang **mga pamamaraan ng pagsasanay at fine-tuning** ng mga modelo, at hindi lamang ang sukat, ang gumaganap ng pangunahing papel<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Kaya, ang UL2 at T5-large ay sumailalim sa pinalawak na pre-training sa malalaking corpus ng data, at ang ChatGPT ay sinanay gamit ang reinforcement learning mula sa feedback ng tao (RLHF), na maaaring nagpalakas ng kanilang katatagan<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Sa kabaligtaran, ang Vicuna ay sinanay sa medyo limitadong set ng data (bilang isang open na replika), na malamang na nagdulot ng mataas na sensitivity nito sa pagbabago ng mga pagbabalangkas<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Ang mga resultang ito ay nagpapahiwatig na ang pagpapabuti ng mga pamamaraan ng fine-tuning ay maaaring mapataas ang maaasahan ng mga modelo nang higit pa kaysa sa simpleng pagpapalaki ng kanilang sukat.

### Impluwensya ng Format ng Prompt

Ang paraan ng pagpapahayag ng kahilingan ay nakakaapekto rin sa maaasahan ng sagot<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Natukoy na ang **mga prompt na may mga halimbawa (few-shot) ay makabuluhang nagpapataas ng katatagan** ng modelo kumpara sa mga isahang hakbang na instruksyon nang walang mga halimbawa (zero-shot)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Ang pagkakaroon ng ilang mga demonstrasyon na halimbawa ng gawain sa prompt ay tumutulong sa modelo na mas wastong bigyan-kahulugan ang gawain kahit may mga maingay na pagbabago. Ang mga role-based na prompt at mga naglalarawan (task-oriented) ay nagpakita ng katulad na antas ng katatagan sa kabuuan, kahit na ang kanilang bisa ay nagbago-bago mula sa gawain hanggang sa gawain<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Halimbawa, sa data ng pagsusuri ng damdamin at mga duplicate na pangungusap, ang role-based na format ay medyo mas maaasahan, samantalang sa mga gawain ng pagbabasa na may pag-unawa at pagsasalin ay mas epektibo ang mga malinaw na instruksyon ng gawain<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Ang mga obserbasyon na ito ay maaaring magsilbing gabay sa pagdidisenyo ng mga prompt: ang pagdaragdag ng detalyadong mga halimbawa at konteksto ng papel ay nagpapababa ng posibilidad ng pagkakamali ng modelo sa mga hindi karaniwang pagbabalangkas.

### Transferability ng mga Atake sa Pagitan ng mga Modelo

Ang transferability ng mga atake sa pagitan ng mga modelo ay naging limitado<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Ang mga adversarial na prompt na espesyal na inihanda laban sa isang modelo ay hindi palaging pantay-pantay na epektibo laban sa isa pa<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Kaya, napansin na ang mga prompt na "bitag" na nabuo para sa mga kahinaan ng ChatGPT ay mas mahinang nakakaapekto sa GPT-4<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Ang huli ay mas mahusay, malamang dahil ang mga atake ay hindi direktang nailipat sa arkitektura nito — ang nagpapalito sa isang modelo ay maaaring hindi gumana sa isang mas advanced na modelo na may ibang paghahanda<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Gayunpaman, ang ilang uri ng simpleng pagbabaluktot (halimbawa, mga typo) ay nagkaroon ng negatibong epekto sa ilang modelo nang sabay, na nagpapahiwatig ng magkaparehong mahihinang bahagi sa kanilang linguistikong pundasyon.

### Mga Praktikal na Rekomendasyon

Sa panahon ng gawain ng PromptBench, natukoy din ang mga praktikal na rekomendasyon para sa mga gumagamit at developer ng mga LLM<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>. Ang simpleng konklusyon: ang katatagan ng pagbabalangkas ay mahalaga<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>. Kinakailangan na **iwasan ang mga typo at pabaya na pagbabalangkas sa kahilingan**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>. Ipinapakita ng mga may-akda na ang pagwawasto ng kahit maliliit na pagkakamali (spelling, random na capitalization, labis na mga espasyo) ay maaaring makabuluhang mapataas ang maaasahan ng sagot ng modelo<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>. Bukod dito, **ang pagpili ng mga salita sa instruksyon ay nakakaapekto sa katatagan nito**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>. Ang pagsusuri ng dalas ng mga termino sa mga matibay kumpara sa mga mahinang prompt ay nagpakita na ang ilang mga salita ay mas madalas na naroroon sa mga "maaasahang" prompt, at ang iba ay sa mga nagpapalitolikohan sa modelo<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>. Halimbawa, ang mga prompt na naglalaman ng mga salitang "acting", "provided", "detection" at iba pa ay mas bihirang nagdulot ng mga pagpalya, samantalang ang mga salitang tulad ng "respond", "following" o "examine" ay naroroon sa mga mas problemadong kaso<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>. Nagpapahiwatig ito na ang isang partikular na estilo at bokabularyo ng mga kahilingan ay maaaring mapaginhawa o, sa kabaligtaran, mapukaw ang mga kahinaan ng modelo. Sa kabuuan, inirerekomenda na ibalangkas ang kahilingan nang **pinakamalinaw, maliwanag at sa mga pamilyar na termino para sa modelo**, lalo na para sa mga kritikal na aplikasyon<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>.

Isang kawili-wiling epektong nabanggit ng mga mananaliksik ay ang impluwensya ng pagdaragdag ng walang kabuluhan o hindi nauugnay na mga fragment ng teksto sa kahilingan<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>. Nalaman na ang **paglalagay ng random na pagkakasunud-sunod ng mga karakter** (hal., "LKF0FZxMZ4") sa dulo o gitna ng prompt ay maaaring abalahin ang atensyon ng modelo at **mapababa ang katumpakan ng sagot nito**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>. Sa kabilang banda, ang pagdaragdag ng neutral ngunit grammatically na tamang parirala (hal., "and true is true") sa ilang mga kaso ay sa kabaligtaran **nagpapabuti ng sagot**, na parang pinagtutuunan ng modelo ang mga makabuluhang bahagi ng tanong<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>. Ang penomenong ito ay nagbibigay-diin kung gaano ka-hindi mahulaan ang reaksyon ng mga LLM sa tila walang kabuluhang mga detalye ng input. Pinatutunayan din nito ang kumplikadong panloob na estruktura ng mga modelo: ang pinakamaliit na pagbabago ng konteksto ay maaaring sumira o mapabuti ang kanilang gawain, depende sa kung paano namamahagi ang atensyon ng modelo.

## Kahalagahan at Karagdagang Pag-unlad

Ang PromptRobust/PromptBench ay nagbigay ng malaking kontribusyon sa pag-unawa ng maaasahan ng mga LLM<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>. Ang iminungkahing benchmark at ang nakalap na data ay bukas para sa komunidad: ang code at mga set ng adversarial na prompt ay makukuha sa repository<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Nagbibigay-daan ito sa iba pang mga mananaliksik na sumubok ng mga bagong modelo sa katatagan sa mga pagbabago ng kahilingan at ikumpara ang mga resulta<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-arxiv-main-1)</sup>. Ang susunod na hakbang ay ang pagbuo ng mga pamamaraan ng proteksyon ng mga modelo laban sa mga ganitong atake — halimbawa, mga pinahusay na algorithm ng pagsasanay na isinasaalang-alang ang mga posibleng typo at paraphrase, o mga built-in na sistema ng normalisasyon ng input na pananalita<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>. Ang PromptBench ay isinasaalang-alang na bilang pundasyon para sa mga ganitong pananaliksik sa pagpapataas ng **katatagan** (robustness) ng mga language model sa totoong hindi tumpak na input data<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)</sup>.

Sa huli, ang gawain ni Zhu at mga kasamahan ay nagpapakita ng kahalagahan ng pagsasaalang-alang sa katatagan sa mga prompt kapag ipinapatupad ang mga LLM sa mga praktikal na aplikasyon: ang mga modelo ay dapat hindi lamang magpakita ng mataas na katumpakan sa "malinis" na data, kundi dapat din mapanatili ang kawastuhan sa maliliit na paglihis sa input, maging ito man ay mga random na pagkakamali ng gumagamit o mga sadyang malisyosong impluwensya<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-towardsai-2)[\[4\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_note-cmu-realer-4)</sup>.

## Mga Sanggunian

- Orihinal na artikulo ng PromptBench (arXiv)
- Repository ng PromptBench sa GitHub
- Artikulong "Prompt Robustness: How to Measure and How to Enhance" (Towards AI)

## Panitikan

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## Mga Tala

1.  <span id="cite_note-arxiv-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-main_1-35)</sup> «PromptBench: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[1]</a></span>
2.  <span id="cite_note-towardsai-2">↑ <sup>[2.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-16)</sup> <sup>[2.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-17)</sup> <sup>[2.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-18)</sup> <sup>[2.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-towardsai_2-19)</sup> «Prompt Robustness: How to Measure and How to Enhance». *Towards AI*. <a href="https://towardsai.net/p/l/prompt-robustness-how-to-measure-and-how-to-enhance" class="external autonumber" rel="nofollow">[2]</a></span>
3.  <span id="cite_note-arxiv-abs-3">↑ <sup>[3.0](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-abs_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-abs_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-abs_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-arxiv-abs_3-3)</sup> «PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[3]</a></span>
4.  <span id="cite_note-cmu-realer-4">[↑](https://systems-analysis.info/int/PromptRobust_(benchmark)_(TL)#cite_ref-cmu-realer_4-0) «Realer Toxicity Prompts (RTP-2.0): Multilingual and Adversarial Prompts for Evaluating Neural Toxic Degeneration in Large Language Models». *Language Technologies Institute - School of Computer Science - Carnegie Mellon University*. <a href="https://www.lti.cs.cmu.edu/research/research-articles/realer-toxicity-prompts.html" class="external autonumber" rel="nofollow">[4]</a></span>
