---
title: "PromptRobust (benchmark) (HI)"
source: "https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)"
wiki: "systems-analysis.info/int"
article: "PromptRobust_(benchmark)_(HI)"
language: "hi"
categories:
  - "Category:Hindi"
  - "Category:Large language models"
  - "Category:LLM benchmarks"
  - "Category:Machine learning"
revision_id: 5940
wiki_created_at: 2026-09-06T23:56:09Z
wiki_modified_at: 2026-09-06T23:56:09Z
downloaded_at: 2026-09-07T23:11:08Z
---

# PromptRobust (benchmark) (HI)

**PromptRobust** (जिसे **PromptBench** के नाम से भी जाना जाता है) — यह बड़े भाषाई मॉडलों (LLM) की **प्रश्न में किए गए प्रतिकूल परिवर्तनों** के प्रति मजबूती मापने का एक व्यापक **benchmark** है — यानी कार्य के शब्दों में ऐसे छोटे बदलाव जो उसके अर्थ को नहीं बदलते<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>। यह benchmark 2023 में Microsoft Research Asia के शोधकर्ताओं के एक समूह (Kaijie Zhu और अन्य) द्वारा विकसित किया गया था<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। PromptRobust के निर्माण का कारण यह अवलोकन था कि आधुनिक LLM शब्दों के विवरण के प्रति संवेदनशील होते हैं: यहाँ तक कि मामूली बदलाव (जैसे टाइपो या पुनः शब्दांकन) भी मॉडलों के उत्तरों को काफी प्रभावित कर सकते हैं<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>। यह benchmark इस कमज़ोरी को मात्रात्मक रूप से मापने और LLM के साथ अधिक विश्वसनीय संवाद विधियों के विकास को प्रोत्साहित करने के उद्देश्य से बनाया गया है।

## मूल्यांकन पद्धति

PromptBench शोध के अंतर्गत **4788 संशोधित prompts** का एक संग्रह तैयार किया गया, जो कार्यों के मूल अर्थ को बनाए रखते हैं<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-abs-3)</sup>। ये प्रतिकूल prompts चार स्तरों पर परिवर्तन की जटिलता के साथ उत्पन्न किए गए थे<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>:

- **वर्ण स्तर**: टाइपो डालना, वर्णों को बदलना या पुनर्व्यवस्थित करना (यादृच्छिक इनपुट त्रुटियों की नकल करता है)।
- **शब्द स्तर**: कुछ शब्दों को समानार्थी शब्दों से बदलना, "शोर" वाले शब्द या अन्य मामूली शाब्दिक परिवर्तन करना।
- **वाक्य स्तर**: समग्र विषय को बदले बिना वाक्यों की संरचना को पुनः शब्दांकित करना, वाक्यांश के भाग जोड़ना या पुनर्व्यवस्थित करना।
- **अर्थ स्तर**: प्रश्न को उसके कार्य को बनाए रखते हुए गहरे स्तर पर पुनः तैयार करना (जैसे, एक ही प्रश्न के वैकल्पिक शब्दांकन)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>।

इन "हमलों" का उद्देश्य यह जाँचना है कि मामूली विचलन (जैसे, यादृच्छिक टाइपो या समानार्थी शब्दों का उपयोग) मॉडल की कार्य को सही ढंग से पूरा करने की क्षमता को कैसे प्रभावित करते हैं, जबकि कार्य स्वयं नहीं बदला<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। प्रत्येक उत्पन्न प्रतिकूल prompt को कई मानक NLP कार्यों पर लागू किया गया, जिनमें **भाव विश्लेषण**, **व्याकरणिक शुद्धता की पहचान**, **दोहराए गए वाक्यों की खोज**, **तार्किक निष्कर्ष** (NLI), **पठन बोध**, **मशीनी अनुवाद** और **गणितीय समस्याओं का समाधान** शामिल हैं<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। प्रयोगों के लिए 13 datasets पर 8 विभिन्न प्रकार के कार्य चुने गए — क्लासिक GLUE संग्रह (जैसे भाव के लिए SST-2, NLI के लिए MNLI) से लेकर विशेष गणितीय और बहुभाषी परीक्षणों तक<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>।

यह महत्वपूर्ण है कि विभिन्न **prompt formats** की मजबूती भी जाँची गई<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>:

- बिना उदाहरणों के सीधे प्रश्न (**zero-shot**, केवल निर्देश)।
- कुछ उदाहरणों वाले प्रश्न (**few-shot**, जब prompt में समाधान के नमूने दिए गए हों)।
- भूमिका-आधारित prompts (**in-context roles**, जैसे "आप एक भाव विश्लेषण प्रणाली हैं, निर्धारित करें...")।
- कार्य का वर्णन करने वाले prompts (**task-oriented**, कार्य का सीधा विवरण)<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>।

इसके अलावा, अपेक्षाकृत छोटी Flan-T5-large और UL2 मॉडल से लेकर उन्नत ChatGPT और GPT-4 तक, तथा LLaMA 2 परिवार की खुली मॉडलों और उनसे व्युत्पन्न Vicuna सहित विभिन्न बड़े भाषाई मॉडलों का परीक्षण किया गया<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। हमलों के निर्माण के लिए प्रतिकूल NLP के क्षेत्र की मौजूदा विधियों (जैसे TextBugger, DeepWordBug, TextFooler आदि) का उपयोग किया गया, जिन्हें इनपुट डेटा के बजाय prompts में संशोधन के लिए अनुकूलित किया गया था<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। उत्पन्न "विकृत" prompts की शुद्धता को स्वचालित और मैन्युअल विधियों द्वारा जाँचा गया; रिपोर्ट के अनुसार, कम से कम 85% प्रतिकूल विविधताएँ सही अर्थ बनाए रखती हैं और मनुष्यों के लिए समझ में आती हैं<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। इस प्रकार, हमलों का प्रभाव मुख्य रूप से पुनः शब्दांकित कार्य को समझने में मॉडल की विफलता को दर्शाता है, न कि कार्य के अर्थ की हानि को।

## परिणाम और निष्कर्ष

परीक्षणों से पता चला कि आधुनिक LLM **प्रश्न के शब्दांकन में मामूली बदलावों के प्रति पर्याप्त रूप से मजबूत नहीं हैं**<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-abs-3)</sup>। सभी परीक्षित मॉडलों में उत्पन्न हमलों के प्रभाव में उत्तरों की गुणवत्ता में उल्लेखनीय गिरावट देखी गई<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-abs-3)</sup>। विशेष रूप से, यहाँ तक कि साधारण मामले — जैसे गणितीय समस्या के पाठ में टाइपो या किसी एक मुख्य शब्द को उसके समानार्थी से बदलना — इस बात का कारण बने कि मॉडल गलत परिणाम देता था, जबकि बिना विकृति के वह सही ढंग से कार्य करता था<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। लेखकों का सामान्य निष्कर्ष है: "आधुनिक बड़े भाषाई मॉडल प्रतिकूल prompts के प्रति **robust नहीं हैं**"<sup>[\[3\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-abs-3)</sup>, यानी शब्दांकन में मामूली विचलन उन्हें व्यवस्थित रूप से भ्रमित कर सकते हैं।

विभिन्न प्रकार के हमलों के विश्लेषण से पता चला कि LLM के कार्य पर सबसे अधिक विनाशकारी प्रभाव **शब्द स्तर** के परिवर्तनों का होता है<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>। शब्दों को समानार्थी से बदलना या मामूली शब्द-निर्माण विकृति **गुणवत्ता में सबसे अधिक गिरावट** का कारण बनी — उसी कार्य पर मूल परिणाम के सापेक्ष औसतन ≈33%<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>। **वर्ण स्तर** के हमले (टाइपो, यादृच्छिक वर्ण) औसतन ~20% सटीकता में कमी का कारण बने<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>। prompt में पूरे वाक्यों को गुणात्मक रूप से बदलना या जोड़ना, इसके विपरीत, बहुत कमज़ोर प्रभाव डाला, जो मॉडल को लगभग भ्रमित नहीं कर सका<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। **अर्थ-स्तरीय पुनः शब्दांकन** (प्रश्न को दूसरे तरीके से गहराई से फिर से कहना) साधारण टाइपो के समान हानिकारक साबित हुए<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। ये तथ्य रेखांकित करते हैं कि LLM विशेष रूप से सूक्ष्म शाब्दिक परिवर्तनों और मुख्य शब्दों में त्रुटियों के प्रति संवेदनशील हैं<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। यह उल्लेखनीय है कि व्याकरणिक विकृतियों (टाइपो) को सिद्धांत रूप में मानक वर्तनी जाँच उपकरणों द्वारा फ़िल्टर किया जा सकता है, जबकि शब्द और अर्थ स्तर पर परिवर्तनों के लिए मॉडल से उन्नत अर्थ-बोध की आवश्यकता होती है, जिसकी वर्तमान मॉडलों में अक्सर कमी होती है<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>।

विभिन्न मॉडलों के प्रदर्शन के विश्लेषण ने उनकी मजबूती में महत्वपूर्ण अंतर दिखाया<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। **GPT-4** और **UL2** ने प्रतिकूल prompts के प्रति सर्वोत्तम मजबूती प्रदर्शित की<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। Flan-T5-large मॉडल और संवाद मॉडल ChatGPT भी कुछ कम विफलता-प्रवण पाए गए<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। LLaMA 2 परिवार के मॉडल मध्यवर्ती स्थिति में रहे, जबकि **Vicuna** (13B) सभी प्रकार के हमलों के प्रति सबसे अधिक संवेदनशील के रूप में उभरा<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। रोचक बात यह है कि **मॉडल का आकार मजबूती का निर्णायक कारक नहीं निकला**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>: अपेक्षाकृत छोटी T5-large, उत्तर की स्थिरता के मामले में बड़ी ChatGPT मॉडल से लगभग पीछे नहीं रही<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। लेखकों का मानना है कि मुख्य भूमिका केवल पैमाने की नहीं, बल्कि **प्रशिक्षण और fine-tuning की विधियों** की होती है<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। UL2 और T5-large ने बड़े डेटा संग्रहों पर विस्तृत पूर्व-प्रशिक्षण (pre-training) लिया था, और ChatGPT को मानवीय प्रतिक्रिया से सुदृढीकरण सीखने (RLHF) के साथ प्रशिक्षित किया गया था, जिसने उनकी मजबूती को मज़बूत किया होगा<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। इसके विपरीत, Vicuna को अपेक्षाकृत सीमित dataset पर प्रशिक्षित किया गया था (एक खुली प्रतिलिपि के रूप में), जो संभवतः शब्दांकन परिवर्तनों के प्रति इसकी उच्च संवेदनशीलता का कारण बना<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। ये परिणाम संकेत देते हैं कि fine-tuning विधियों में सुधार केवल आकार बढ़ाने की तुलना में मॉडलों की विश्वसनीयता को अधिक प्रभावी ढंग से बढ़ा सकता है।

### Prompt format का प्रभाव

प्रश्न प्रस्तुत करने का तरीका भी उत्तर की विश्वसनीयता को प्रभावित करता है<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। यह पाया गया कि **उदाहरणों वाले prompts (few-shot) बिना उदाहरणों के एक-चरणीय निर्देशों (zero-shot) की तुलना में मॉडल की मजबूती को काफी बढ़ाते हैं**<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। prompt में कई प्रदर्शन उदाहरणों की उपस्थिति मॉडल को शोर-युक्त परिवर्तनों के बावजूद कार्य की सही व्याख्या करने में मदद करती है। भूमिका-आधारित और वर्णनात्मक (task-oriented) prompts ने समग्र रूप से तुलनीय मजबूती का स्तर दिखाया, हालाँकि उनकी प्रभावशीलता कार्य के अनुसार भिन्न रही<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। उदाहरण के लिए, भाव विश्लेषण और वाक्य दोहराव डेटा में भूमिका प्रारूप थोड़ा अधिक विश्वसनीय था, जबकि पठन बोध और अनुवाद कार्यों में स्पष्ट कार्य निर्देशों ने बेहतर काम किया<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। ये अवलोकन prompt डिज़ाइन में मार्गदर्शन के रूप में काम आ सकते हैं: विस्तृत उदाहरण और भूमिका संदर्भ जोड़ने से असामान्य शब्दांकन पर मॉडल की त्रुटि की संभावना कम होती है।

### मॉडलों के बीच हमलों की स्थानांतरणीयता

मॉडलों के बीच हमलों की स्थानांतरणीयता (transfer) सीमित पाई गई<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। एक मॉडल के विरुद्ध विशेष रूप से तैयार किए गए प्रतिकूल prompts दूसरे मॉडल के विरुद्ध हमेशा समान रूप से प्रभावी नहीं होते<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। उदाहरण के लिए, यह देखा गया कि ChatGPT की कमज़ोरियों के लिए उत्पन्न "जाल" prompts GPT-4 पर बहुत कम प्रभाव डालते हैं<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। बाद वाला बेहतर प्रदर्शन करता था, संभवतः इसलिए क्योंकि हमले सीधे उसकी architecture पर स्थानांतरित नहीं हुए — जो एक मॉडल को भ्रमित करता है, वह अलग प्रशिक्षण वाले अधिक उन्नत मॉडल पर काम नहीं कर सकता<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। फिर भी, कुछ प्रकार की सरल विकृतियाँ (जैसे टाइपो) एक साथ कई मॉडलों पर नकारात्मक प्रभाव डालती थीं, जो उनकी भाषाई नींव में समान कमज़ोर बिंदुओं की ओर संकेत करती हैं।

### व्यावहारिक सिफारिशें

PromptBench के कार्य के दौरान LLM के उपयोगकर्ताओं और डेवलपर्स के लिए व्यावहारिक सिफारिशें भी पहचानी गईं<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>। सरल निष्कर्ष यह है: शब्दांकन की स्थिरता मायने रखती है<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>। **प्रश्न में टाइपो और लापरवाह शब्दांकन से बचना आवश्यक है**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>। लेखक दिखाते हैं कि यहाँ तक कि छोटी त्रुटियों को सुधारना (वर्तनी, यादृच्छिक अक्षर-आकार, अतिरिक्त स्थान) मॉडल के उत्तर की विश्वसनीयता को काफी बढ़ा सकता है<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>। इसके अलावा, **निर्देश में शब्दों का चुनाव उसकी मजबूती को प्रभावित करता है**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>। मजबूत बनाम कमज़ोर prompts में शब्दों की आवृत्ति के विश्लेषण से पता चला कि कुछ शब्द "विश्वसनीय" prompts में अधिक बार मिलते हैं, जबकि अन्य उन मामलों में मिलते हैं जहाँ मॉडल विफल हो गया<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>। उदाहरण के लिए, "acting", "provided", "detection" जैसे शब्द वाले prompts कम विफलताओं का कारण बने, जबकि "respond", "following" या "examine" जैसे शब्द अधिक समस्याग्रस्त मामलों में पाए गए<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>। यह इंगित करता है कि प्रश्नों की एक निश्चित शैली और शब्दावली मॉडल की कमज़ोरियों को कम कर सकती है, या इसके विपरीत, उन्हें भड़का सकती है। सामान्यतः यह सिफारिश की जाती है कि प्रश्न को **अधिकतम स्पष्ट, असंदिग्ध और मॉडल के लिए परिचित शब्दों में** तैयार किया जाए, विशेष रूप से महत्वपूर्ण अनुप्रयोगों के लिए<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>।

शोधकर्ताओं द्वारा उल्लेखित एक रोचक दुष्प्रभाव है — प्रश्न में अर्थहीन या अप्रासंगिक पाठ के टुकड़े जोड़ने का प्रभाव<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>। यह पाया गया कि prompt के अंत या मध्य में **यादृच्छिक वर्णों की एक श्रृंखला** (जैसे "LKF0FZxMZ4") डालने से मॉडल का ध्यान भटक सकता है और **उसके उत्तर की सटीकता कम हो सकती है**<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>। दूसरी ओर, एक तटस्थ लेकिन व्याकरणिक रूप से सही वाक्यांश जोड़ना (जैसे "and true is true") कुछ मामलों में, इसके विपरीत, **उत्तर को बेहतर बनाता था**, जैसे कि मॉडल को प्रश्न के महत्वपूर्ण भागों पर केंद्रित करता हो<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>। यह घटना इस बात पर जोर देती है कि LLM इनपुट के प्रतीत होने वाले महत्वहीन विवरणों पर कितनी अप्रत्याशित रूप से प्रतिक्रिया करते हैं। यह मॉडलों की आंतरिक संरचना की जटिलता को भी दर्शाता है: संदर्भ में सबसे छोटे बदलाव उनके कार्य को या तो बाधित कर सकते हैं या सुधार सकते हैं, इस पर निर्भर करते हुए कि मॉडल का attention कैसे पुनर्वितरित होता है।

## महत्व और आगे का विकास

PromptRobust/PromptBench ने LLM की विश्वसनीयता की समझ में महत्वपूर्ण योगदान दिया है<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>। प्रस्तावित benchmark और संग्रहित डेटा समुदाय के लिए खुले हैं: कोड और प्रतिकूल prompts के संग्रह repository में उपलब्ध हैं<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। यह अन्य शोधकर्ताओं को नई मॉडलों को प्रश्न विविधताओं के प्रति मजबूती के लिए परीक्षण करने और परिणामों की तुलना करने की अनुमति देता है<sup>[\[1\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-arxiv-main-1)</sup>। अगला कदम ऐसे हमलों से मॉडलों की सुरक्षा के लिए विधियों का विकास करना है — उदाहरण के लिए, बेहतर प्रशिक्षण एल्गोरिदम जो संभावित टाइपो और पुनः शब्दांकन को ध्यान में रखते हैं, या इनपुट भाषण के सामान्यीकरण की अंतर्निहित प्रणालियाँ<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>। PromptBench को पहले से ही वास्तविक अशुद्ध इनपुट डेटा के प्रति भाषाई मॉडलों की **robustness** बढ़ाने पर ऐसे शोध के आधार के रूप में देखा जा रहा है<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)</sup>।

अंततः, Zhu और सहयोगियों का कार्य LLM को व्यावहारिक अनुप्रयोगों में लागू करते समय prompt के प्रति मजबूती को ध्यान में रखने के महत्व को प्रदर्शित करता है: मॉडलों को न केवल "स्वच्छ" डेटा पर उच्च सटीकता दिखानी चाहिए, बल्कि इनपुट में मामूली विचलन पर भी सही बने रहना चाहिए, चाहे वे उपयोगकर्ता की आकस्मिक त्रुटियाँ हों या जानबूझकर किए गए हमलावर प्रभाव<sup>[\[2\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-towardsai-2)[\[4\]](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_note-cmu-realer-4)</sup>।

## संदर्भ

- मूल PromptBench लेख (arXiv)
- GitHub पर PromptBench repository
- लेख "Prompt Robustness: How to Measure and How to Enhance" (Towards AI)

## साहित्य

- Liang, P. et al. (2022). *Holistic Evaluation of Language Models (HELM)*. arXiv:2211.09110.
- Chang, Y. et al. (2023). *A Survey on Evaluation of Large Language Models*. arXiv:2307.03109.
- Ni, S. et al. (2025). *A Survey on Large Language Model Benchmarks*. arXiv:2508.15361.
- Biderman, S. et al. (2024). *The Language Model Evaluation Harness (lm-eval): Guidance and Lessons Learned*. arXiv:2405.14782.
- Kiela, D. et al. (2021). *Dynabench: Rethinking Benchmarking in NLP*. arXiv:2104.14337.
- Ma, Z. et al. (2021). *Dynaboard: An Evaluation‑As‑A‑Service Platform for Holistic Next‑Generation Benchmarking*. arXiv:2106.06052.
- Goel, K. et al. (2021). *Robustness Gym: Unifying the NLP Evaluation Landscape*. arXiv:2101.04840.
- Xu, C. et al. (2024). *Benchmark Data Contamination of Large Language Models: A Survey*. arXiv:2406.04244.
- Liu, S. et al. (2025). *A Comprehensive Survey on Safety Evaluation of LLMs*. arXiv:2506.11094.
- Chiang, W.-L. et al. (2024). *Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference*. arXiv:2403.04132.
- Boubdir, M. et al. (2023). *Elo Uncovered: Robustness and Best Practices in Language Model Evaluation*. arXiv:2311.17295.
- Huang, L. et al. (2023). *A Survey on Hallucination in Large Language Models*. arXiv:2311.05232.

## टिप्पणियाँ

1.  <span id="cite_note-arxiv-main-1">↑ <sup>[1.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-0)</sup> <sup>[1.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-1)</sup> <sup>[1.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-2)</sup> <sup>[1.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-3)</sup> <sup>[1.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-4)</sup> <sup>[1.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-5)</sup> <sup>[1.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-6)</sup> <sup>[1.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-7)</sup> <sup>[1.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-8)</sup> <sup>[1.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-9)</sup> <sup>[1.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-10)</sup> <sup>[1.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-11)</sup> <sup>[1.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-12)</sup> <sup>[1.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-13)</sup> <sup>[1.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-14)</sup> <sup>[1.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-15)</sup> <sup>[1.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-16)</sup> <sup>[1.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-17)</sup> <sup>[1.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-18)</sup> <sup>[1.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-19)</sup> <sup>[1.20](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-20)</sup> <sup>[1.21](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-21)</sup> <sup>[1.22](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-22)</sup> <sup>[1.23](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-23)</sup> <sup>[1.24](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-24)</sup> <sup>[1.25](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-25)</sup> <sup>[1.26](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-26)</sup> <sup>[1.27](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-27)</sup> <sup>[1.28](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-28)</sup> <sup>[1.29](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-29)</sup> <sup>[1.30](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-30)</sup> <sup>[1.31](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-31)</sup> <sup>[1.32](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-32)</sup> <sup>[1.33](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-33)</sup> <sup>[1.34](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-34)</sup> <sup>[1.35](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-main_1-35)</sup> «PromptBench: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[१]</a></span>
2.  <span id="cite_note-towardsai-2">↑ <sup>[2.00](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-0)</sup> <sup>[2.01](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-1)</sup> <sup>[2.02](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-2)</sup> <sup>[2.03](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-3)</sup> <sup>[2.04](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-4)</sup> <sup>[2.05](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-5)</sup> <sup>[2.06](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-6)</sup> <sup>[2.07](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-7)</sup> <sup>[2.08](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-8)</sup> <sup>[2.09](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-9)</sup> <sup>[2.10](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-10)</sup> <sup>[2.11](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-11)</sup> <sup>[2.12](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-12)</sup> <sup>[2.13](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-13)</sup> <sup>[2.14](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-14)</sup> <sup>[2.15](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-15)</sup> <sup>[2.16](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-16)</sup> <sup>[2.17](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-17)</sup> <sup>[2.18](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-18)</sup> <sup>[2.19](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-towardsai_2-19)</sup> «Prompt Robustness: How to Measure and How to Enhance». *Towards AI*. <a href="https://towardsai.net/p/l/prompt-robustness-how-to-measure-and-how-to-enhance" class="external autonumber" rel="nofollow">[२]</a></span>
3.  <span id="cite_note-arxiv-abs-3">↑ <sup>[3.0](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-abs_3-0)</sup> <sup>[3.1](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-abs_3-1)</sup> <sup>[3.2](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-abs_3-2)</sup> <sup>[3.3](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-arxiv-abs_3-3)</sup> «PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts». *arXiv*. <a href="https://arxiv.org/abs/2306.04528" class="external autonumber" rel="nofollow">[३]</a></span>
4.  <span id="cite_note-cmu-realer-4">[↑](https://systems-analysis.info/int/PromptRobust_(benchmark)_(HI)#cite_ref-cmu-realer_4-0) «Realer Toxicity Prompts (RTP-2.0): Multilingual and Adversarial Prompts for Evaluating Neural Toxic Degeneration in Large Language Models». *Language Technologies Institute - School of Computer Science - Carnegie Mellon University*. <a href="https://www.lti.cs.cmu.edu/research/research-articles/realer-toxicity-prompts.html" class="external autonumber" rel="nofollow">[४]</a></span>
